Detector de parafraseamento — identifica cópia disfarçada
Um detector de parafraseamento identifica textos reescritos para ocultar a fonte. O Noplag detecta o nível leve disso hoje: edições que mantêm sequências de cinco palavras ainda geram correspondência, então trocas de sinônimos e pequenas mudanças de ordem são encontradas por impressões digitais winnowing e conferidas com busca web em tempo real. Reescrita profunda, frase a frase, é outro problema e ainda não detectamos — correspondência de quase duplicatas (v1.1) e correspondência semântica (v1.2) são as soluções previstas, e serão lançadas após validação pública.
Detectamos. Não ajudamos a burlar.
Um humanizer é uma ferramenta que reescreve textos, feitos por IA ou humanos, para escapar da detecção. Poderíamos criar uma. Não criamos. O objetivo deste produto é revelar cópias sem atribuição, não ajudar a ocultá-las. Para que a detecção seja útil, quem desenvolve detectores e quem faz humanizers não pode ser o mesmo fornecedor. Escolhemos nosso lado.
Quando mencionamos humanizers no relatório, é para informar que existem e podem ter sido usados antes do texto que você está verificando — não para vender esse tipo de ferramenta.
Quatro camadas. Duas disponíveis, duas em desenvolvimento.
A análise começa por correspondência exata, passa por quase duplicatas, depois equivalência semântica e, por fim, faz verificação cruzada na web aberta. Duas dessas camadas estão presentes na v1.0; as duas que tratam de paráfrases reais ainda estão em desenvolvimento, e preferimos informar isso com clareza.
Winnowing fingerprints — disponível
Correspondências exatas de trechos. Troca leve de sinônimos e pequenas mudanças de ordem, desde que mantenham sequências de cinco palavras.
Qualquer reordenação ou reescrita.
MinHash LSH — previsto para v1.1
Vai detectar reordenação de frases e embaralhamento de palavras. Ainda não detecta.
Sinônimos reais e reescritas semânticas, que serão tratadas na L3.
Sentence embeddings — previsto para v1.2
Vai detectar substituição de sinônimos e paráfrases semânticas. Ainda não detecta.
Reescritas distantes o suficiente da fonte para não restar sinal estatístico.
Verificação cruzada com a web em tempo real — disponível
Fontes identificadas após o snapshot do corpus.
Conteúdo com paywall ou não indexado.
O que detectamos hoje — por intensidade de paráfrase.
Este é o comportamento da v1.0, não uma previsão. Edições leves ainda deixam trechos de texto detectáveis; reescrita completa não deixa, e nenhum tipo de fingerprinting recupera esses trechos. Explicamos exatamente onde está esse limite em nosso artigo sobre as limitações reais da detecção literal: /blog/the-honest-limits-of-verbatim-detection.
Troca de sinônimos e pequenas mudanças na ordem. Parte da redação original permanece, permitindo a correspondência por fingerprint.
O gato sentou no tapete.
O felino sentou no tapete.
Reestruturação da frase, verbos alterados. Só é detectado quando um trecho intacto permanece. A correspondência de quase duplicatas (v1.1) foca neste nível.
O gato sentou no tapete.
No tapete, o gato se acomodou.
Reescrita completa do sentido, nova estrutura e vocabulário. Hoje recebe nota zero; a correspondência semântica (v1.2) foca neste nível.
O gato sentou no tapete.
Um pequeno mamífero posicionou-se sobre uma superfície de tecido.
Dez perguntas sobre detecção de paráfrases.
Principalmente sobre os limites da detecção. Somos claros sobre as limitações; quem precisa saber são as pessoas que vão agir com base no resultado.
- Qual a diferença entre detectar paráfrase e detectar plágio?
- Plágio é a categoria mais ampla — copiar texto sem atribuição. Detecção de paráfrase é o desafio específico de identificar plágio após o texto ter sido reescrito para ocultar a origem. O Noplag faz ambos em um único relatório; o pipeline de paráfrase entra em ação quando a camada L1 de correspondência exata não identifica nada.
- Por que paráfrases extensas são tão difíceis de detectar?
- A detecção funciona encontrando sinais estatísticos — sequências compartilhadas de palavras, depois estrutura e significado. Edições leves mantêm essas sequências, então são detectadas. Ao reescrever um trecho frase por frase, as sequências desaparecem: uma paráfrase completa resulta em zero no motor de impressão digital, que é o que o v1.0 faz. Isso é uma característica do método, não uma falha, e por isso correspondência quase idêntica (v1.1) e semântica (v1.2) são camadas separadas, não apenas ajustes de configuração. Explicamos isso no nosso post sobre os limites honestos da detecção literal: /blog/the-honest-limits-of-verbatim-detection.
- O Noplag oferece ferramenta para humanizar texto de IA?
- Não. Não fornecemos humanizador. O objetivo de um humanizador é burlar a detecção — isso vai contra nossa missão. Atuamos pelo lado da integridade; detectamos, não ajudamos a ocultar. Veja a posição explicada acima.
- Como isso se compara à ferramenta de paráfrase do Quillbot?
- O Quillbot reescreve texto para burlar a detecção. Nós detectamos texto reescrito para escapar da detecção. Estamos em lados opostos do mesmo problema. Se um texto do Quillbot aparecer na sua verificação, o relatório sinaliza 'possível uso de ferramenta de paráfrase' ao identificar a assinatura.
- O que é uma 'cascata de quatro camadas' e quais estão ativas?
- Quatro etapas de detecção, cada uma menos literal que a anterior. L1 identifica correspondências exatas e levemente editadas, e Layer W faz checagem cruzada com busca web em tempo real — ambas disponíveis no v1.0. L2 (correspondência quase idêntica) está no roteiro do v1.1 e L3 (correspondência semântica por embeddings de sentenças) no v1.2; nenhuma das duas está ativa hoje, nem disponível no repositório público. Portanto, o resumo honesto é: metade da cascata está ativa, e é a parte que lida com pequenas reescritas.
- E quanto ao uso de tradução reversa como técnica de paráfrase?
- Tradução reversa (inglês → espanhol → inglês) é um dos tipos mais difíceis de paráfrase — semanticamente equivalente, mas estruturalmente diferente. Onde mantém trechos do texto original, detectamos; onde reescreve totalmente, não detectamos hoje. É um alvo para a camada semântica no v1.2.
- O Noplag vai marcar paráfrase extensa como 'plágio'?
- Só se a confiança for suficiente. Abaixo do limiar, mostramos o trecho suspeito como 'correspondência de baixa confiança' e deixamos a decisão para o avaliador. Nunca declaramos unilateralmente que paráfrase é plágio — relatamos a probabilidade e o motivo.
- Posso ver como o Noplag avaliou um trecho?
- Sim. Cada correspondência no relatório tem link para a fonte e mostra qual camada de detecção foi acionada. Você pode replicar a pontuação offline pelo motor open source — veja /open-source-plagiarism-checker.
- O Noplag detecta paráfrase em outros idiomas além do inglês?
- A detecção está calibrada para inglês, espanhol, português, polonês e ucraniano no lançamento, com mais idiomas sendo incluídos. Outros idiomas retornam resultados marcados como 'baixo recurso — interpretar com cautela extra.'
- O detector de paráfrase é gratuito?
- Sim, no plano gratuito — 2.500 palavras por verificação, sem cadastro. Os planos Pro e Premium aumentam o limite; o algoritmo de detecção é o mesmo em todos os planos.
Encontre plágio por paráfrase — gratuito, até 2.500 palavras.
Hoje conseguimos identificar pequenas alterações de texto, mas deixamos claro que reescritas profundas só serão detectadas quando as camadas semânticas estiverem disponíveis. Faça uma verificação no seu próprio texto e veja exatamente o que o motor encontrou.
Detecte plágio por paráfrase