Detector de plágio para conteúdo duplicado online
Encontre conteúdo duplicado na web ativa, nas suas próprias pastas e na biblioteca de conteúdo da sua equipe. Reconhecimento canônico — distingue sindicação legítima de cópias raspadas. Gratuito até 2.500 palavras; escaneamento por pasta só no Pro.
Quatro tipos de duplicados. Tratamentos e soluções diferentes.
A maioria dos "verificadores de plágio" só pega cópias exatas. Classificamos cada correspondência em uma das quatro categorias. Assim, você decide o que ignorar (citação legítima), o que canonizar (sindicação) e o que reescrever (raspado ou reescrito).
Correspondência palavra por palavra
Sequências idênticas de 30+ caracteres. Inclui trechos copiados e colados, artigos sindicais republicados, páginas raspadas.
Levemente reformulado
Formato da frase mantido, sinônimos trocados ou adjetivos embaralhados. É o “spin” clássico. Identifica o que Copyscape não vê por projeto.
Paráfrase agressiva
Paráfrase no nível de frase, com cláusulas trocadas de lugar, tempos verbais modificados, enchimento adicionado. Comum em ferramentas de reescrita por IA e agências de conteúdo terceirizado.
Recorrente entre páginas
O mesmo aviso, bio de autor ou descrição do produto em centenas de suas páginas — a verdadeira preocupação do Google sobre conteúdo duplicado.
Não é só “copiar de outro site”.
As regras reais do Google (da Search Central): três padrões acionam tratamento de duplicidade, e a maioria refere-se às suas páginas, não a concorrentes que raspam.
Cópias entre domínios sem canônico
Mesmo artigo em vários sites sem rel=canonical apontando para o original. Inclui sindicação distribuída incorretamente, concorrentes raspando sem declarar, e duplicidade acidental quando um autor publica em dois veículos.
Mesmo conteúdo em várias URLs no seu site
/produto/foo e /produto/foo?utm_source=email e /produto/foo/ com barra. Navegação facetada (filtros que geram páginas idênticas), versões para impressão sem canônico, URLs separadas para mobile/desktop. O Google agrupa e mantém só uma.
Texto padrão fingindo ser conteúdo
Página de categoria e-commerce com 5 parágrafos idênticos em 1200 SKUs. Página de locais com o mesmo texto sobre experiência da equipe em 47 cidades. Conteúdo raso duplicado — a Atualização de Conteúdo Útil do Google sinaliza isso fortemente.
Seis equipes usam semanalmente.
Mesma ferramenta, seis fluxos de trabalho diferentes — de revisão pré-publicação por blogueiro solo ao QA de agência com artigos terceirizados.
Post de blog antes de publicar
Analise o rascunho na web antes de publicar. Identifica reaproveitamento acidental de frases de posts antigos (auto-canibalização), artigos de concorrentes lidos durante a pesquisa e deslizes de reescritor IA.
Detecção de scraping por concorrentes
Cole seu artigo, veja quem mais publicou. Útil para documentação DMCA — cada correspondência traz a URL, trechos correspondentes e um snapshot datado para salvar como evidência.
Higiene da biblioteca de conteúdo
Escaneamento por pasta — Pro. Envie toda a biblioteca da equipe para uma pasta; a ferramenta sinaliza duplicidades entre documentos — mesmo parágrafo em três artigos, texto padrão que deveria ser modelo.
Auditoria de sindicação
Você sindica um artigo para Medium, LinkedIn e Substack. Todos apontam rel=canonical para sua URL de origem? A ferramenta busca, checa a tag canonical e informa quais versões repúblicadas vazam SEO.
QA de redator terceirizado
Entrega do freelancer em uma tela. Analise antes de pagar. Identifica o padrão comum de copiar-para-reescrever, assinatura de IA e citações sem referência.
Proveniência do conteúdo IA
Assistentes de IA colhem texto real da web na consulta de contexto. A ferramenta mostra esses trechos para que você decida: citar, reescrever ou remover o parágrafo. Reduz risco de Conteúdo Útil.
Coloque sua biblioteca. Veja o que se sobrepõe.
Função Pro. Escolha uma pasta de artigos publicados; a engine constrói uma matriz de similaridade entre cada par. Ordenável por sobreposição, clique direto nos intervalos problemáticos.
- 150M+páginas indexadas
- 30datualização do corpus
- 94%taxa de detecção canônica
- 4níveis de classificação de duplicidade
- 2014indexação Common Crawl
Três coisas que plugins e suítes SEO não pegam.
Somente correspondência exata (Copyscape padrão). Frase reescrita passa como "única" — conteúdo reescrito passa sem problemas. Útil para cópias de área de transferência; inútil para QA de conteúdo.
Noplag: classificação em 4 níveis (Exato / Quase-dup / Reescrito / Padrão) com dicas de intenção — resultado acionável, não só um botão de igual ou diferente.
Uni ferramenta de 'unicidade' ao seu pacote de R$ 99-499/mês. Limitado a correspondência superficial de n-gramas; sem Common Crawl; sem varredura entre documentos por pasta.
Noplag: gratuito e avulso (2.500 palavras). Pro (R$ 23/mês) traz matriz por pasta e indexação web total — sem atrelar a uma suíte SEO de R$ 400.
Caixa preta. Não mostra QUAL fonte bateu, só uma porcentagem de similaridade. Normalmente limita a 1.000 palavras. A maioria não atualiza o índice — compara com a web de 2021.
Noplag: cada correspondência mostra URL da fonte + canônico + trechos + data da amostra. Apache 2.0 — veja o algoritmo de correspondência.
Um artigo republicado com rel=canonical não é “conteúdo duplicado”. Mas tratamos assim.
Quando um artigo aparece em vários URLs, a questão para SEO não é "são idênticos?" — e sim se todos declaram o mesmo canônico. Se seu post convidado no Medium aponta rel=canonical para sua URL de origem, o Google agrupa, atribui ranqueamento à origem e trata o resto como sindicação legítima. Se não aponta, você concorre com seu próprio conteúdo. A ferramenta busca cada resultado, lê a tag <link rel="canonical"> e rotula: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK ou SCRAPED.
O que uma liderança de conteúdo pergunta antes de integrar.
Como cobre a web, comparado a Copyscape ou SEMrush?
150M+ páginas indexadas de Common Crawl + domínios SEO relevantes de alto tráfego, atualizado cada 30 dias. Mais amplo que o índice exato do Copyscape (~120M, focado em boilerplate), mais restrito que o rastreamento total do Google, mas com cobertura documentada e atualização publicada. O Pro permite sua própria pasta privada.
Como funciona a detecção canônica na prática?
Para cada página correspondente, a engine busca a URL fonte (cache ou ao vivo), lê o <head> e extrai rel=canonical. Rótulos: ORIGIN (aponta para si), SYND-OK (aponta para outra página controlada por você), LEAK (canônico ausente/em outro local na sua própria distribuição), ou SCRAPED (sem canônico + domínio não-distribuição). A classificação é exibida junto a cada resultado. Assim, o número de duplicados é preciso.
Detecta conteúdo IA reutilizado de fontes?
Sim — assistentes de escrita por IA pegam texto real de páginas durante lookup, e esses trechos aparecem como Quase-dup ou Reescrito. Mostramos a URL fonte para você decidir: citar, reescrever ou remover. Detecção de texto IA (outro sinal) é uma ferramenta separada: está no roteiro, não disponível ainda — e aqui só o escaneamento de duplicidade é foco.
Qual o maior documento que posso escanear?
2.500 palavras no grátis, 50.000 no Premium, 250.000+ no Enterprise (ou sem limite no self-host). No Pro, cada pasta suporta até 2.000 documentos; matriz par a par computada em menos de 5 minutos nesse volume.
Acha concorrentes que copiaram meu conteúdo?
Se a cópia raspada estiver no índice (ou seja, em site público e rastreável), sim — a URL aparece na lista com snapshot datado. O snapshot é prova para DMCA: datado, hash de conteúdo, intervalos destacados. Não protocolamos DMCA automaticamente (é decisão legal), só fornecemos a documentação.
Posso excluir minha rede de sindicação do escaneamento?
No Pro — adicione uma lista de domínios controlados (medium.com/@você, linkedin.com/in/você, substack.com/p/você). Correspondências permitidas são marcadas SYND-OK e não contam na sua pontuação. Ela mostra “duplicação inesperada”, não “toda duplicação”.
Como a varredura por pasta lida com biblioteca de 500 artigos?
A recuperação é O(n log n) por par — fingerprints filtram pares por hash de 60 bits, aí o alinhamento roda só nos candidatos. 500 artigos → 124.750 pares em cerca de 4 min num box de 4 núcleos. Matriz exportada como CSV para pipeline posterior.
O mecanismo é realmente open source?
Sim — github.com/NoplagLabs/noplag-engine, Apache 2.0. O chunker, fingerprinter, lógica de recuperação em cascata, alinhamento e classificação de duplicatas estão todos no repositório. A camada em nuvem inclui o corpus + Common Crawl + espelho da Wikipedia; na self-host, você traz o seu próprio. Verifique o algoritmo antes de confiar no score de similaridade.
Como é a API para integração em pipelines de conteúdo?
Endpoint REST em /v1/checks (SDKs para Python e Node). Envie um documento, receba um relatório de duplicidade de forma síncrona em até 8 segundos; acima disso, retorno via webhook. Útil para verificações de CI antes da publicação — bloqueie o merge se o % de similaridade exceder o limite da equipe. Referência completa em /docs/developers/api.
E conteúdo atrás de paywall ou login?
Só rastreamos o que é público — Common Crawl, páginas do sitemap, domínios permitidos no robots. Conteúdo paywall (ex: NYT, FT, periódicos acadêmicos fechados) não entra no índice; a engine não retorna esses trechos, mesmo se houver frase igual no seu texto. Para papers, os índices OpenAlex / CORE cobrem o universo open-access — outra base.
Escaneie um rascunho. Ou sua biblioteca.
O gratuito cobre 2.500 palavras contra 150M+ páginas. Pro (R$ 23/mês) ativa escaneamento por pares na biblioteca publicada. Apache 2.0 aberto se quiser corpora própria.