Detector de plágio para editoras pré-publicação e auditoria
Checagem pré-publicação para envios de freelancers, auditoria de sindicação para conteúdo republicado e uma REST API para integrar ao seu CMS. O motor de detecção é Apache 2.0 — transparente antes da adoção, não depois.
Quatro setores. Um fluxo.
Avalie uma pauta freelance antes da atribuição
10 minutos por envio, antes do orçamento de edição ser comprometido.
- Cole uma sugestão de pauta/rascunho, veja versões já publicadas
- Probabilidade de IA por parágrafo (em breve), sensível a ESL
- Evite idas e vindas sobre “isso é original?”
Execute a fila do dia antes de publicar
Escaneamento em lote dos artigos do dia antes de entrar na fila do CMS.
- Visualização da fila ordenada por similaridade + score de IA
- Limiares por seção (opinião, notícia, crítica)
- Trilha de auditoria por repórter para setor de padrões
Analise um envio contestado
Leia o algoritmo, depois leia os intervalos encontrados.
- Reprodutibilidade X-Engine-Commit
- Substitua o veredito com justificativa documentada
- Apache 2.0 — defensável na revisão de erratas
Audite os parceiros que republicam seu conteúdo
Acompanhe a saúde do canonical-tag na rede de sindicação.
- Detecção sensível a canonical (ORIGIN / SYND OK / LEAK)
- Relatório semanal de diferenças por parceiro
- Pacote de evidências para DMCA mediante solicitação
Três etapas antes do artigo entrar na fila de publicação do CMS.
Integrado ao seu fluxo editorial via API, rodando como passagem em lote antes de publicar ou pontual no painel. Mesmo motor, mesmo formato de relatório, se encaixa onde fizer sentido.
01 · Recebimento
Envio chega à fila do CMS — arraste e solte o .docx/.gdoc/ou cole, ou o CMS envia via webhook. Autor + seção + editor atribuído vão junto para o log da auditoria.
02 · Escanear + classificar
A cascata roda contra web aberta + Common Crawl + (opcional) seu próprio acervo. A classificação de citações separa citações diretas (com crédito) de paráfrases não citadas. Probabilidade de IA por parágrafo em breve, sensível a ESL. Mediana de 42s por artigo.
03 · Decidir + publicar
Editor vê: similaridade do título, detalhamento por categoria, lista de fontes ordenável (score de IA ajustado por ESL em breve). Três ações: publicar, retornar com comentários, ou escalar para setor de padrões. Decisão registrada com engine commit + snapshot do corpus.
Quatro CMS. Um contrato REST.
Conecte Noplag ao CMS já usado por seus repórteres. A interface da API é a mesma — o que muda é a integração (hooks WordPress, ações Ghost, eventos Drupal ou seus webhooks).
Plugin oficial do WordPress.org Plugins Directory. Compatível com Gutenberg.
- Meta-box pré-publicação em todos os tipos de post
- Destaque em nível de bloco no editor
- Log de auditoria pela WP REST API
Integração webhook + Admin API. Compatível com conteúdo para membros.
- Webhook pré-publicação ao salvar rascunho
- Política de escaneamento por tipo de conteúdo
- Pronto para auto-hospedagem (Noplag e Ghost self-host)
Módulo contrib do drupal.org. Anexação via Field API.
- Campo de plágio por tipo de conteúdo
- Integração ao fluxo de moderação de conteúdo
- Configuração multi-site suportada
Webhooks + OpenAPI 3.0. Para headless CMS, sistemas próprios ou outros casos.
- POST /v1/checks de qualquer hook do CMS
- Callbacks webhook com HMAC
- SDKs Python + Node direto do OpenAPI spec
Fila de publicação do dia. Ordenável, com auditoria.
Cada linha exibe repórter, seção, similaridade, score de IA e acesso ao relatório destacado. Ordenável. Aprove em lote os artigos seguros, escale o resto.
Veja quem está republicando seu conteúdo — e se o canonical tag aponta para seu site.
Acompanhe sua rede de distribuição
Adicione os domínios para os quais você faz sindicação (Medium, LinkedIn, Substack, seus parceiros) numa allowlist. Relatórios semanais mostram quais parceiros mantêm o rel=canonical apontando para você (crédito ORIGIN), quais omitem (vazamento de SEO) e quais republicam sem permissão (SCRAPED).
Faltou sua assinatura em algum blog?
Scans mensais de diferenças na web aberta mostram domínios não autorizados publicando trechos dos seus artigos. A correspondência traz snapshot com data — prova para DMCA datada no dia de publicação do plágio. Não entramos com DMCAs (isso é jurídico); fornecemos a documentação.
Duplicação interna nas suas próprias páginas
Escaneamento por pasta: coloque seu acervo publicado numa pasta; o motor monta uma matriz de similaridade entre todos os pares. Identifica 47 páginas de cidades com o mesmo parágrafo padrão — risco de Helpful-Content-Update a ser mapeado antes do Google.
Três políticas que seu setor de padrões vai querer antes da contratação.
Primeiro — artigos enviados nunca são usados para treinar modelos. Nem nossos, nem de terceiros. O texto enviado é registrado por impressão digital, indexado no seu tenant e excluído após 30 dias, salvo retenção explícita. Segundo — a análise de AI (em breve, está no roadmap) será por parágrafo, não por artigo, e identificada com o commit do engine e o timestamp do snapshot do corpus. Uma marcação contestada por AI será reproduzida meses depois com o mesmo commit. Não há re-treinamento silencioso. Terceiro — Apache 2.0 permite que sua equipe de engenharia clone github.com/NoplagLabs/noplag-engine, rode em sua própria infraestrutura, audite o fluxo de dados e verifique todo o processo de exclusão de dados. A maioria das análises de compra institucional de software antiplágio trava nessas três questões; buscamos respondê-las de forma direta.
Leia o guia do setor de padrõesO que o setor de padrões realmente pergunta antes da contratação.
- Nossos artigos vão treinar seu modelo de IA?
- Não. Artigos enviados só recebem fingerprint (winnowing hashes) e ficam indexados na sua base isolada. O texto em si é excluído após 30 dias, salvo opção direta por retenção. O modelo de IA — Binoculars-based (Hans et al. 2024), em breve — virá treinado só em corpus público; nunca inclui conteúdo do cliente. Está explícito no DPA.
- Como o veredito por parágrafo sobrevive a disputas com repórter?
- A detecção de AI estará disponível em breve — está no roadmap da v1.2, não estará ativa no lançamento. Quando for lançada, cada parágrafo sinalizado trará o commit do engine e o snapshot do corpus. Reexecutando o mesmo parágrafo nesse commit, o resultado será idêntico. O algoritmo está aberto em github.com/NoplagLabs/noplag-engine (Apache 2.0), com indicação do limiar de perplexidade e documentação do ajuste para ESL. Não oferecemos modo “confie na pontuação”.
- E freelancers em mercados com banda limitada?
- A detecção está calibrada para inglês, espanhol, português, polonês e ucraniano no lançamento, com mais idiomas previstos. A qualidade da detecção é avaliada com base no PAN-PC-11; a avaliação por idioma está no roadmap. O veredito de AI ajustado para ESL sinaliza textos de não nativos de inglês como ESL ADJ, e não como LIKELY-AI, quando a assinatura lexical indicar.
- Posso auto-hospedar na estrutura do meu newsroom?
- Sim — motor Apache 2.0 + Docker. Roda todo dentro da sua rede. Use seu próprio Postgres + Redis; nada de envios sai da VPC. Útil para redações com alto requisito de sigilo/confidencialidade antes da publicação.
- Integra com nosso CMS?
- WordPress (plugin oficial), Ghost (Admin API + webhooks), Drupal (módulo contrib). Para outros casos — CMS customizado, headless, interno — a REST + OpenAPI 3.0 dá à equipe o necessário para criar o hook pré-publicação em menos de um dia. SDKs Python e Node já no spec.
- Como funciona a auditoria de sindicação?
- Adicione domínios de distribuição numa allowlist (medium.com/@você, parceiros). Relatórios semanais mostram status do canonical-tag: ORIGIN (aponta para você), SYND OK (aponta de parceiro), LEAK (canonical ausente ou aponta para outro — divide SEO), ou SCRAPED (cópia literal, sem canonical, domínio não autorizado). SCRAPED traz snapshot datado para prova DMCA.
- Como funciona a precificação para uma redação com 30 repórteres?
- Premium a $79/mês: 5.000 palavras/checagem, 5.000 artigos/mês, API + integrações CMS completas. Operações de alto volume (10.000+ artigos/mês), Enterprise faz preço por corpus + infra dedicada. Não cobramos por usuário/repórter; escalam por volume.
- E op-eds, sindicação e trechos de livros, onde o 'reuso' é esperado?
- Limiar por seção no Pro+ — defina sensibilidade diferente para notícia, opinião, resenha, trecho sindicado. Opinião citando discurso deveria ter limiar distinto de artigo que repete fraseado de concorrente. A classificação de citações separa uso legítimo de citação do reuso acidental.
- Vai atrasar minha fila de publicação?
- Mediana de 47 segundos por artigo com 1.500–4.000 palavras. O hook do CMS é assíncrono — dispara ao salvar, o editor vê o parecer ao revisar. Long-form (+8.000 palavras) leva ~90s, pode rodar como job pré-publicação, não hook síncrono.
- Posso adicionar meu acervo como corpus privado?
- Sim — para Enterprise. Importe em lote seu conteúdo antigo num corpus privado, assim o motor checa cada envio contra seu próprio acervo. Identifica auto-reuso (vezes legítimo, vezes não) e reaproveitamento proposital sob assinatura diferente.
Rode um rascunho na fila. Veja o artigo na prática.
Arraste um Word, um Google Doc ou artigo exportado do CMS. Em 47 segundos, relatório parágrafo a parágrafo. Grátis até 2.500 palavras; Pro para volume; Enterprise para corpus + infra dedicada.