WEB150M+ páginas · reconhecimento canônico

Detector de plágio para conteúdo duplicado online

Encontre conteúdo duplicado na web ativa, nas suas próprias pastas e na biblioteca de conteúdo da sua equipe. Reconhecimento canônico — distingue sindicação legítima de cópias raspadas. Gratuito até 2.500 palavras; escaneamento por pasta só no Pro.

0 / 1,500 words
Web + Common Crawl indexadoDetecção de quase-duplicados + conteúdo reescritoEscaneamento de biblioteca por pasta
TIPOS DE DUPLICIDADE

Quatro tipos de duplicados. Tratamentos e soluções diferentes.

A maioria dos "verificadores de plágio" só pega cópias exatas. Classificamos cada correspondência em uma das quatro categorias. Assim, você decide o que ignorar (citação legítima), o que canonizar (sindicação) e o que reescrever (raspado ou reescrito).

01 · EXATO

Correspondência palavra por palavra

Sequências idênticas de 30+ caracteres. Inclui trechos copiados e colados, artigos sindicais republicados, páginas raspadas.

Ajuste: canonizar, reescrever ou aceitar (se for seu conteúdo sindicado).
02 · QUASE-DUP

Levemente reformulado

Formato da frase mantido, sinônimos trocados ou adjetivos embaralhados. É o “spin” clássico. Identifica o que Copyscape não vê por projeto.

Ajuste: reescrita completa — a ideia central precisa ser sua.
03 · REESCRITO

Paráfrase agressiva

Paráfrase no nível de frase, com cláusulas trocadas de lugar, tempos verbais modificados, enchimento adicionado. Comum em ferramentas de reescrita por IA e agências de conteúdo terceirizado.

Ajuste: verifique a intenção. É paráfrase do redator ou cópia oculta?
04 · PADRÃO

Recorrente entre páginas

O mesmo aviso, bio de autor ou descrição do produto em centenas de suas páginas — a verdadeira preocupação do Google sobre conteúdo duplicado.

Ajuste: extraia para um modelo compartilhado; não deixe o Google indexar 800 vezes.
O QUE O GOOGLE CONTA COMO DUPLICADO

Não é só “copiar de outro site”.

As regras reais do Google (da Search Central): três padrões acionam tratamento de duplicidade, e a maioria refere-se às suas páginas, não a concorrentes que raspam.

01

Cópias entre domínios sem canônico

Mesmo artigo em vários sites sem rel=canonical apontando para o original. Inclui sindicação distribuída incorretamente, concorrentes raspando sem declarar, e duplicidade acidental quando um autor publica em dois veículos.

02

Mesmo conteúdo em várias URLs no seu site

/produto/foo e /produto/foo?utm_source=email e /produto/foo/ com barra. Navegação facetada (filtros que geram páginas idênticas), versões para impressão sem canônico, URLs separadas para mobile/desktop. O Google agrupa e mantém só uma.

03

Texto padrão fingindo ser conteúdo

Página de categoria e-commerce com 5 parágrafos idênticos em 1200 SKUs. Página de locais com o mesmo texto sobre experiência da equipe em 47 cidades. Conteúdo raso duplicado — a Atualização de Conteúdo Útil do Google sinaliza isso fortemente.

CASOS DE USO EM SEO

Seis equipes usam semanalmente.

Mesma ferramenta, seis fluxos de trabalho diferentes — de revisão pré-publicação por blogueiro solo ao QA de agência com artigos terceirizados.

Post de blog antes de publicar

Analise o rascunho na web antes de publicar. Identifica reaproveitamento acidental de frases de posts antigos (auto-canibalização), artigos de concorrentes lidos durante a pesquisa e deslizes de reescritor IA.

Detecção de scraping por concorrentes

Cole seu artigo, veja quem mais publicou. Útil para documentação DMCA — cada correspondência traz a URL, trechos correspondentes e um snapshot datado para salvar como evidência.

Higiene da biblioteca de conteúdo

Escaneamento por pasta — Pro. Envie toda a biblioteca da equipe para uma pasta; a ferramenta sinaliza duplicidades entre documentos — mesmo parágrafo em três artigos, texto padrão que deveria ser modelo.

Auditoria de sindicação

Você sindica um artigo para Medium, LinkedIn e Substack. Todos apontam rel=canonical para sua URL de origem? A ferramenta busca, checa a tag canonical e informa quais versões repúblicadas vazam SEO.

QA de redator terceirizado

Entrega do freelancer em uma tela. Analise antes de pagar. Identifica o padrão comum de copiar-para-reescrever, assinatura de IA e citações sem referência.

Proveniência do conteúdo IA

Assistentes de IA colhem texto real da web na consulta de contexto. A ferramenta mostra esses trechos para que você decida: citar, reescrever ou remover o parágrafo. Reduz risco de Conteúdo Útil.

ESCANEAMENTO POR PASTA

Coloque sua biblioteca. Veja o que se sobrepõe.

Função Pro. Escolha uma pasta de artigos publicados; a engine constrói uma matriz de similaridade entre cada par. Ordenável por sobreposição, clique direto nos intervalos problemáticos.

PASTA / blog-2026-q16 artigos · matriz de similaridade par a par
3 sobreposições > 10%Exportar matriz
ARTIGOA1A2A3A4A5A6
A1 — Cinco modelos de precificação SaaS·4%3%38%6%2%
A2 — Como escrever preços SaaS4%·5%12%7%3%
A3 — Guia de preços Product-led3%5%·8%6%4%
A4 — Manual de preços SaaS38%12%8%·9%5%
A5 — Escolhendo o preço SaaS6%7%6%9%·4%
A6 — Precificação SaaS para fundadores2%3%4%5%4%·
Clique em qualquer célula para ver intervalos sobrepostos entre os dois artigos
  • 150M+páginas indexadas
  • 30datualização do corpus
  • 94%taxa de detecção canônica
  • 4níveis de classificação de duplicidade
  • 2014indexação Common Crawl
VS FERRAMENTAS DUPLICADAS BÁSICAS

Três coisas que plugins e suítes SEO não pegam.

FERRAMENTAS ESTILO COPYSCAPE

Somente correspondência exata (Copyscape padrão). Frase reescrita passa como "única" — conteúdo reescrito passa sem problemas. Útil para cópias de área de transferência; inútil para QA de conteúdo.

Noplag: classificação em 4 níveis (Exato / Quase-dup / Reescrito / Padrão) com dicas de intenção — resultado acionável, não só um botão de igual ou diferente.

SUÍTES DE SEO

Uni ferramenta de 'unicidade' ao seu pacote de R$ 99-499/mês. Limitado a correspondência superficial de n-gramas; sem Common Crawl; sem varredura entre documentos por pasta.

Noplag: gratuito e avulso (2.500 palavras). Pro (R$ 23/mês) traz matriz por pasta e indexação web total — sem atrelar a uma suíte SEO de R$ 400.

VERIFICADORES ONLINE GRATUITOS

Caixa preta. Não mostra QUAL fonte bateu, só uma porcentagem de similaridade. Normalmente limita a 1.000 palavras. A maioria não atualiza o índice — compara com a web de 2021.

Noplag: cada correspondência mostra URL da fonte + canônico + trechos + data da amostra. Apache 2.0 — veja o algoritmo de correspondência.

DETECÇÃO CANÔNICA

Um artigo republicado com rel=canonical não é “conteúdo duplicado”. Mas tratamos assim.

Quando um artigo aparece em vários URLs, a questão para SEO não é "são idênticos?" — e sim se todos declaram o mesmo canônico. Se seu post convidado no Medium aponta rel=canonical para sua URL de origem, o Google agrupa, atribui ranqueamento à origem e trata o resto como sindicação legítima. Se não aponta, você concorre com seu próprio conteúdo. A ferramenta busca cada resultado, lê a tag <link rel="canonical"> e rotula: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK ou SCRAPED.

Leia como funciona o canônico
PERGUNTAS FREQUENTES

O que uma liderança de conteúdo pergunta antes de integrar.

Como cobre a web, comparado a Copyscape ou SEMrush?

150M+ páginas indexadas de Common Crawl + domínios SEO relevantes de alto tráfego, atualizado cada 30 dias. Mais amplo que o índice exato do Copyscape (~120M, focado em boilerplate), mais restrito que o rastreamento total do Google, mas com cobertura documentada e atualização publicada. O Pro permite sua própria pasta privada.

Como funciona a detecção canônica na prática?

Para cada página correspondente, a engine busca a URL fonte (cache ou ao vivo), lê o <head> e extrai rel=canonical. Rótulos: ORIGIN (aponta para si), SYND-OK (aponta para outra página controlada por você), LEAK (canônico ausente/em outro local na sua própria distribuição), ou SCRAPED (sem canônico + domínio não-distribuição). A classificação é exibida junto a cada resultado. Assim, o número de duplicados é preciso.

Detecta conteúdo IA reutilizado de fontes?

Sim — assistentes de escrita por IA pegam texto real de páginas durante lookup, e esses trechos aparecem como Quase-dup ou Reescrito. Mostramos a URL fonte para você decidir: citar, reescrever ou remover. Detecção de texto IA (outro sinal) é uma ferramenta separada: está no roteiro, não disponível ainda — e aqui só o escaneamento de duplicidade é foco.

Qual o maior documento que posso escanear?

2.500 palavras no grátis, 50.000 no Premium, 250.000+ no Enterprise (ou sem limite no self-host). No Pro, cada pasta suporta até 2.000 documentos; matriz par a par computada em menos de 5 minutos nesse volume.

Acha concorrentes que copiaram meu conteúdo?

Se a cópia raspada estiver no índice (ou seja, em site público e rastreável), sim — a URL aparece na lista com snapshot datado. O snapshot é prova para DMCA: datado, hash de conteúdo, intervalos destacados. Não protocolamos DMCA automaticamente (é decisão legal), só fornecemos a documentação.

Posso excluir minha rede de sindicação do escaneamento?

No Pro — adicione uma lista de domínios controlados (medium.com/@você, linkedin.com/in/você, substack.com/p/você). Correspondências permitidas são marcadas SYND-OK e não contam na sua pontuação. Ela mostra “duplicação inesperada”, não “toda duplicação”.

Como a varredura por pasta lida com biblioteca de 500 artigos?

A recuperação é O(n log n) por par — fingerprints filtram pares por hash de 60 bits, aí o alinhamento roda só nos candidatos. 500 artigos → 124.750 pares em cerca de 4 min num box de 4 núcleos. Matriz exportada como CSV para pipeline posterior.

O mecanismo é realmente open source?

Sim — github.com/NoplagLabs/noplag-engine, Apache 2.0. O chunker, fingerprinter, lógica de recuperação em cascata, alinhamento e classificação de duplicatas estão todos no repositório. A camada em nuvem inclui o corpus + Common Crawl + espelho da Wikipedia; na self-host, você traz o seu próprio. Verifique o algoritmo antes de confiar no score de similaridade.

Como é a API para integração em pipelines de conteúdo?

Endpoint REST em /v1/checks (SDKs para Python e Node). Envie um documento, receba um relatório de duplicidade de forma síncrona em até 8 segundos; acima disso, retorno via webhook. Útil para verificações de CI antes da publicação — bloqueie o merge se o % de similaridade exceder o limite da equipe. Referência completa em /docs/developers/api.

E conteúdo atrás de paywall ou login?

Só rastreamos o que é público — Common Crawl, páginas do sitemap, domínios permitidos no robots. Conteúdo paywall (ex: NYT, FT, periódicos acadêmicos fechados) não entra no índice; a engine não retorna esses trechos, mesmo se houver frase igual no seu texto. Para papers, os índices OpenAlex / CORE cobrem o universo open-access — outra base.

Escaneie um rascunho. Ou sua biblioteca.

O gratuito cobre 2.500 palavras contra 150M+ páginas. Pro (R$ 23/mês) ativa escaneamento por pares na biblioteca publicada. Apache 2.0 aberto se quiser corpora própria.

Detector de plágio para conteúdo duplicado online gratuito