NEWSROOMFluxo editorial · API para CMS · auditoria de sindicação

Detector de plágio para editoras pré-publicação e auditoria

Checagem pré-publicação para envios de freelancers, auditoria de sindicação para conteúdo republicado e uma REST API para integrar ao seu CMS. O motor de detecção é Apache 2.0 — transparente antes da adoção, não depois.

Fluxo pré-publicaçãoAuditoria de sindicaçãoREST API pronta para CMS
PARA QUEM APROVA PUBLICAÇÕES

Quatro setores. Um fluxo.

EDITOR

Avalie uma pauta freelance antes da atribuição

10 minutos por envio, antes do orçamento de edição ser comprometido.

  • Cole uma sugestão de pauta/rascunho, veja versões já publicadas
  • Probabilidade de IA por parágrafo (em breve), sensível a ESL
  • Evite idas e vindas sobre “isso é original?”
EDITOR GERAL

Execute a fila do dia antes de publicar

Escaneamento em lote dos artigos do dia antes de entrar na fila do CMS.

  • Visualização da fila ordenada por similaridade + score de IA
  • Limiares por seção (opinião, notícia, crítica)
  • Trilha de auditoria por repórter para setor de padrões
SETOR DE PADRÕES

Analise um envio contestado

Leia o algoritmo, depois leia os intervalos encontrados.

  • Reprodutibilidade X-Engine-Commit
  • Substitua o veredito com justificativa documentada
  • Apache 2.0 — defensável na revisão de erratas
SINDICAÇÃO

Audite os parceiros que republicam seu conteúdo

Acompanhe a saúde do canonical-tag na rede de sindicação.

  • Detecção sensível a canonical (ORIGIN / SYND OK / LEAK)
  • Relatório semanal de diferenças por parceiro
  • Pacote de evidências para DMCA mediante solicitação
FLUXO PRÉ-PUBLICAÇÃO

Três etapas antes do artigo entrar na fila de publicação do CMS.

Integrado ao seu fluxo editorial via API, rodando como passagem em lote antes de publicar ou pontual no painel. Mesmo motor, mesmo formato de relatório, se encaixa onde fizer sentido.

01

01 · Recebimento

Envio chega à fila do CMS — arraste e solte o .docx/.gdoc/ou cole, ou o CMS envia via webhook. Autor + seção + editor atribuído vão junto para o log da auditoria.

02

02 · Escanear + classificar

A cascata roda contra web aberta + Common Crawl + (opcional) seu próprio acervo. A classificação de citações separa citações diretas (com crédito) de paráfrases não citadas. Probabilidade de IA por parágrafo em breve, sensível a ESL. Mediana de 42s por artigo.

03

03 · Decidir + publicar

Editor vê: similaridade do título, detalhamento por categoria, lista de fontes ordenável (score de IA ajustado por ESL em breve). Três ações: publicar, retornar com comentários, ou escalar para setor de padrões. Decisão registrada com engine commit + snapshot do corpus.

INTEGRAÇÕES COM CMS

Quatro CMS. Um contrato REST.

Conecte Noplag ao CMS já usado por seus repórteres. A interface da API é a mesma — o que muda é a integração (hooks WordPress, ações Ghost, eventos Drupal ou seus webhooks).

WordPress5.5+

Plugin oficial do WordPress.org Plugins Directory. Compatível com Gutenberg.

  • Meta-box pré-publicação em todos os tipos de post
  • Destaque em nível de bloco no editor
  • Log de auditoria pela WP REST API
Ghost4.0+

Integração webhook + Admin API. Compatível com conteúdo para membros.

  • Webhook pré-publicação ao salvar rascunho
  • Política de escaneamento por tipo de conteúdo
  • Pronto para auto-hospedagem (Noplag e Ghost self-host)
Drupal9+ / 10

Módulo contrib do drupal.org. Anexação via Field API.

  • Campo de plágio por tipo de conteúdo
  • Integração ao fluxo de moderação de conteúdo
  • Configuração multi-site suportada
CustomizadoREST

Webhooks + OpenAPI 3.0. Para headless CMS, sistemas próprios ou outros casos.

  • POST /v1/checks de qualquer hook do CMS
  • Callbacks webhook com HMAC
  • SDKs Python + Node direto do OpenAPI spec
VISÃO EDITORIAL

Fila de publicação do dia. Ordenável, com auditoria.

Cada linha exibe repórter, seção, similaridade, score de IA e acesso ao relatório destacado. Ordenável. Aprove em lote os artigos seguros, escale o resto.

FILA DE PUBLICAÇÃO · Terça, 21 de maio7 artigos pendentes · 2 escalados
Seção: TodasPublicar em lote OK
ARTIGOREPÓRTERSEÇÃOSIMILARIDADEIA %PARECERAÇÃO
Câmara aprova nova lei de zoneamento no centrorascunho · 1.840 palavrasMarisol ChenLOCAL6%0.04OKPublicar
Por dentro da reconstrução: lições do fiasco do 1º trirascunho · 1.840 palavrasTobias ReinhartTECNOLOGIA12%0.08OKPublicar
Como a IA mudou nossa redação em 18 mesesrascunho · 1.840 palavrasPriya AnandOPINIÃO38%0.62AGUARDARRevisar
Romances modernistas e a questão da vozrascunho · 1.840 palavrasSara BeltranCULTURA22%0.18OKPublicar
Confronto orçamentário no Senado Estadual — e agora?rascunho · 1.840 palavrasMarcus AdekunlePOLÍTICA67%0.41ESCALARRevisar
Refugiados do clima: uma atualização após cinco anosrascunho · 1.840 palavrasYuki HiranoREPORTAGEM14%0.06OKPublicar
Balanço das gigantes tech: quem superou, quem ficou atrásrascunho · 1.840 palavrasDiego MoralesNEGÓCIOS51%0.28AGUARDARRevisar
7 de 7 exibidos · ordenado por seção e momento de enviolog de auditoria: 47 decisões hoje · 2 escalados
47stempo mediano de checagem por artigo
4integrações CMS
RESTOpenAPI 3.0 · pronto para auto-hospedagem
0submissões treinadas (política)
5idiomas de detecção, ampliando
AUDITORIA DE SINDICAÇÃO

Veja quem está republicando seu conteúdo — e se o canonical tag aponta para seu site.

01 · SAÚDE DO CANONICAL

Acompanhe sua rede de distribuição

Adicione os domínios para os quais você faz sindicação (Medium, LinkedIn, Substack, seus parceiros) numa allowlist. Relatórios semanais mostram quais parceiros mantêm o rel=canonical apontando para você (crédito ORIGIN), quais omitem (vazamento de SEO) e quais republicam sem permissão (SCRAPED).

Identifique o repost LinkedIn que perdeu o canonical porque a plataforma removeu.
02 · DETECÇÃO DE SCRAPERS

Faltou sua assinatura em algum blog?

Scans mensais de diferenças na web aberta mostram domínios não autorizados publicando trechos dos seus artigos. A correspondência traz snapshot com data — prova para DMCA datada no dia de publicação do plágio. Não entramos com DMCAs (isso é jurídico); fornecemos a documentação.

Exporte o pacote de evidências em PDF para o jurídico.
03 · AUDITORIA DE TEXTO PADRÃO

Duplicação interna nas suas próprias páginas

Escaneamento por pasta: coloque seu acervo publicado numa pasta; o motor monta uma matriz de similaridade entre todos os pares. Identifica 47 páginas de cidades com o mesmo parágrafo padrão — risco de Helpful-Content-Update a ser mapeado antes do Google.

Rode semanalmente; exporte a matriz em CSV.
PRINCÍPIOS EDITORIAIS

Três políticas que seu setor de padrões vai querer antes da contratação.

Primeiro — artigos enviados nunca são usados para treinar modelos. Nem nossos, nem de terceiros. O texto enviado é registrado por impressão digital, indexado no seu tenant e excluído após 30 dias, salvo retenção explícita. Segundo — a análise de AI (em breve, está no roadmap) será por parágrafo, não por artigo, e identificada com o commit do engine e o timestamp do snapshot do corpus. Uma marcação contestada por AI será reproduzida meses depois com o mesmo commit. Não há re-treinamento silencioso. Terceiro — Apache 2.0 permite que sua equipe de engenharia clone github.com/NoplagLabs/noplag-engine, rode em sua própria infraestrutura, audite o fluxo de dados e verifique todo o processo de exclusão de dados. A maioria das análises de compra institucional de software antiplágio trava nessas três questões; buscamos respondê-las de forma direta.

Leia o guia do setor de padrões
PERGUNTAS DO NEWSROOM
Q1O motor aprende com nossos artigos? — Não. Conteúdo submetido só recebe fingerprint; nunca entra no treino.
Q2Podemos auto-hospedar? — Sim. Apache 2.0 + Docker. Roda todo em sua rede.
Q3E quanto à residência de dados na UE? — Pro+ provisionado em api.eu.noplag.com. GDPR por padrão.
Q4Relatórios reprodutíveis? — Cada checagem carimba X-Engine-Commit e snapshot do corpus. Reproduz meses depois.
Q5Preço em grandes volumes? — Cobrança por volume de artigo no Pro; contratos Enterprise em licença corpus + infra dedicada.
Q6Atribuição de fonte? — Todo trecho encontrado traz URL de origem, canonical, data do snapshot, engine commit.
PERGUNTAS FREQUENTES

O que o setor de padrões realmente pergunta antes da contratação.

Nossos artigos vão treinar seu modelo de IA?
Não. Artigos enviados só recebem fingerprint (winnowing hashes) e ficam indexados na sua base isolada. O texto em si é excluído após 30 dias, salvo opção direta por retenção. O modelo de IA — Binoculars-based (Hans et al. 2024), em breve — virá treinado só em corpus público; nunca inclui conteúdo do cliente. Está explícito no DPA.
Como o veredito por parágrafo sobrevive a disputas com repórter?
A detecção de AI estará disponível em breve — está no roadmap da v1.2, não estará ativa no lançamento. Quando for lançada, cada parágrafo sinalizado trará o commit do engine e o snapshot do corpus. Reexecutando o mesmo parágrafo nesse commit, o resultado será idêntico. O algoritmo está aberto em github.com/NoplagLabs/noplag-engine (Apache 2.0), com indicação do limiar de perplexidade e documentação do ajuste para ESL. Não oferecemos modo “confie na pontuação”.
E freelancers em mercados com banda limitada?
A detecção está calibrada para inglês, espanhol, português, polonês e ucraniano no lançamento, com mais idiomas previstos. A qualidade da detecção é avaliada com base no PAN-PC-11; a avaliação por idioma está no roadmap. O veredito de AI ajustado para ESL sinaliza textos de não nativos de inglês como ESL ADJ, e não como LIKELY-AI, quando a assinatura lexical indicar.
Posso auto-hospedar na estrutura do meu newsroom?
Sim — motor Apache 2.0 + Docker. Roda todo dentro da sua rede. Use seu próprio Postgres + Redis; nada de envios sai da VPC. Útil para redações com alto requisito de sigilo/confidencialidade antes da publicação.
Integra com nosso CMS?
WordPress (plugin oficial), Ghost (Admin API + webhooks), Drupal (módulo contrib). Para outros casos — CMS customizado, headless, interno — a REST + OpenAPI 3.0 dá à equipe o necessário para criar o hook pré-publicação em menos de um dia. SDKs Python e Node já no spec.
Como funciona a auditoria de sindicação?
Adicione domínios de distribuição numa allowlist (medium.com/@você, parceiros). Relatórios semanais mostram status do canonical-tag: ORIGIN (aponta para você), SYND OK (aponta de parceiro), LEAK (canonical ausente ou aponta para outro — divide SEO), ou SCRAPED (cópia literal, sem canonical, domínio não autorizado). SCRAPED traz snapshot datado para prova DMCA.
Como funciona a precificação para uma redação com 30 repórteres?
Premium a $79/mês: 5.000 palavras/checagem, 5.000 artigos/mês, API + integrações CMS completas. Operações de alto volume (10.000+ artigos/mês), Enterprise faz preço por corpus + infra dedicada. Não cobramos por usuário/repórter; escalam por volume.
E op-eds, sindicação e trechos de livros, onde o 'reuso' é esperado?
Limiar por seção no Pro+ — defina sensibilidade diferente para notícia, opinião, resenha, trecho sindicado. Opinião citando discurso deveria ter limiar distinto de artigo que repete fraseado de concorrente. A classificação de citações separa uso legítimo de citação do reuso acidental.
Vai atrasar minha fila de publicação?
Mediana de 47 segundos por artigo com 1.500–4.000 palavras. O hook do CMS é assíncrono — dispara ao salvar, o editor vê o parecer ao revisar. Long-form (+8.000 palavras) leva ~90s, pode rodar como job pré-publicação, não hook síncrono.
Posso adicionar meu acervo como corpus privado?
Sim — para Enterprise. Importe em lote seu conteúdo antigo num corpus privado, assim o motor checa cada envio contra seu próprio acervo. Identifica auto-reuso (vezes legítimo, vezes não) e reaproveitamento proposital sob assinatura diferente.

Rode um rascunho na fila. Veja o artigo na prática.

Arraste um Word, um Google Doc ou artigo exportado do CMS. Em 47 segundos, relatório parágrafo a parágrafo. Grátis até 2.500 palavras; Pro para volume; Enterprise para corpus + infra dedicada.

Detector de plágio para editoras pré-publicação e auditoria