Detector de plágio para jornalistas pré-publicação
Autoavaliação antes do editor ver. Detecta paráfrases e trechos de press release; detecção de IA em breve. Também: rastreie quem está republicando sua assinatura. Gratuito até 2.500 palavras. API REST para integração com CMS da redação, se desejar.
Quatro fluxos de trabalho de repórter. Uma autoavaliação.
Envios diários sob prazo apertado
Seu editor verá em seguida — garanta que está limpo antes.
- Autoavaliação de 30 segundos em uma pauta de 900 palavras
- Press releases sinalizados automaticamente
- Sobreposição com texto de agência antes de publicar
Longos com pesquisa reaproveitada
Reportagens de 5.000 palavras usam entrevistas e reportagens anteriores.
- Autocitação: seus textos anteriores marcados como SELF-CITE
- Classificação de citações (citação direta vs paráfrase)
- Ciente de embargos: compara apenas com materiais liberados
Meses de documentação em uma matéria
Detecta deslizes sem atribuição ao longo do rascunho.
- Checagem de atribuição por parágrafo
- Varre pasta de fontes armazenadas
- Snapshot DMCA quando sua pauta é republicada
Envios para vários veículos, sem QA interno
Você é o editor; a autoavaliação é sua única checagem antes do envio.
- Checagem no celular (em campo)
- Autoreciclagem entre veículos sinalizada com lista de permissão
- Gratuito cobre tipicamente 2.500 palavras por envio
Três etapas antes do botão enviar.
Integrado à sua rotina pelo API ou pontual no painel. Mesmo motor. Mesmo relatório. Os mesmos 47 segundos.
01 · Checar o rascunho
Cole ou envie o texto. Adicione lista de permissão (textos antigos, lista de sindicação de agência). O motor identifica paráfrases acidentais do seu próprio trabalho (legítimo) separadamente de paráfrases de terceiros (não).
02 · Verificar as fontes
O relatório mostra cada trecho identificado com URL da fonte, status de canonical-tag, data do snapshot. Trechos de press release marcados como REPRINT (algumas redações permitem citação literal, outras não). Classificação de IA por parágrafo com ajuste para ESL em breve.
03 · Decida antes de enviar
Veja a classificação: citações com atribuição (fora do score), paráfrase com citação (peso baixo), paráfrase sem citação (a corrigir). Assim que a detecção de IA for lançada, parágrafos marcados como IA vão exigir revisão ou nota conforme política do veículo. Feito, envie. O relatório anexa ao envio como trilha de auditoria.
Seis itens em cada parágrafo antes do envio.
Cada categoria aparece ao lado do trecho identificado. Configurável para exigir atribuição conforme política do veículo. O critério: seria aprovado por mesa de padrões?
01 · CITAÇÃO DIRETA
Aspas + atribuição na mesma frase. Conta como citação, excluída do score de similaridade. Detectada na pasta de transcrições se você enviar as entrevistas.
02 · PRESS RELEASE
Trecho literal comparado ao release público. Marcado como REPRINT. Alguns veículos permitem cópia de release com atribuição; outros (a maioria nos EUA) exigem reescrita. Ajuste por veículo nas Configurações.
03 · TEXTO DE AGÊNCIA
Compara com feeds AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA (Premium + assinatura de corpus de agência). Geralmente pode-se reescrever sob licença; o motor valida a origem para saber o que é licenciado vs o que foi copiado.
04 · EMBARGO
Adicione material sob embargo a escopo temporário. Sensível a embargos: conteúdo classificado como EMBARGO-OK até a data, depois volta ao padrão. Útil para cobertura científica, onde embargos são rotina.
05 · GERADO POR IA (EM BREVE)
Probabilidade de IA por parágrafo, com ajuste para ESL, no roteiro. Feito para triagem de freelancers — textos de IA já são comuns e precisam ser pegos antes da revisão. Metodologia aberta (Binoculars, Hans et al. 2024).
06 · SEU PRÓPRIO TEXTO
Lista de permissão por byline: seus textos anteriores, URL de portfólio, Substack, Medium. Autoreciclagem marcada como SELF-CITE — comum ao puxar material de reportagens antigas. Não aumenta a similaridade; mas sempre marcada para revisão.
O que você verá após 47 segundos em um envio de 1.500 palavras.
Classificação por parágrafo com URLs de fonte, status de atribuição, clique até o trecho original. Defensável numa reunião de padrões; reprodutível pelo hash do relatório.
Três passos caso sua reportagem saia com byline de outro.
Cadastre sua byline como consulta vigiada
Cole seu texto publicado (ou lista deles) na lista de vigilância. Varredura diária identifica domínios não-permitidos publicando trechos do seu texto — cópia literal, reescrita leve, versões geradas por IA. Notificação inclui URL, parágrafos identificados e data da coleta.
Snapshot HTML datado e hasheado (nível DMCA)
Cada cópia flagrada recebe snapshot HTML da página do copiador, datado e hasheado para integridade. Combine com data do seu original (CMS, tweet, Wayback Machine) para garantir prioridade.
Byline legítima em sindicação
Se você republica via Medium, LinkedIn, Substack ou parceiros, o motor verifica se o canonical aponta para o original. ORIGIN: crédito SEO é seu; LEAK: sindicação divide ranking. Problema típico com LinkedIn: removem canonical por padrão.
Duas situações que jornalistas exigem, mas ferramentas acadêmicas ignoram.
A maioria dos verificadores de plágio não foi feita para redação. Marcam texto de agência como plágio, embora todo jornal use sob licença — um falso positivo que gera ruído. Ignoram roubo de byline porque só verificam o que é enviado, não o que está sendo republicado. A assinatura do corpus de agência da Noplag (AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA) classifica material de agência como AGÊNCIA e não PLÁGIO. O monitoramento de byline observa a web para republicações. Ambos vêm desativados por padrão — são recursos pensados no jornalismo, uma camada extra para além da checagem padrão.
Leia o guia de classificação de agênciasAs perguntas reais dos repórteres.
- Meu rascunho será armazenado ou usado para treinar modelos?
- Não. Rascunhos são impressos digitais (hashes, não reversíveis) e ficam em banco isolado por cliente. O texto é apagado após 30 dias, salvo se optar por reter. Modelos de detecção (baseados em Binoculars) são treinados em corpus público; não usamos rascunhos de repórteres para treino. Isso está explícito no DPA.
- Como funciona a classificação de texto de agência?
- Premium com assinatura de corpus de agência (AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA). Coincidências literais dos feeds são marcadas como AGÊNCIA — não PLÁGIO — porque todo jornal usa sob licença. Configure política por veículo: alguns permitem reprodução ilimitada de agências, outros exigem atribuição. Classificação ao lado de cada trecho.
- O que ocorre com press releases?
- Comparado com índice público de press releases (PR Newswire, Business Wire, EurekAlert, PRWeb). Marcado como REPRINT. Alguns veículos permitem transcrição literal com atribuição; outros (a maioria nos EUA) exigem reescrita. Ajuste a política nas Configurações; o relatório indica o que sua política exige.
- Como será a detecção de IA em textos de freelancers?
- Detecção de AI será lançada em breve (no roadmap da v1.2). Quando disponível, fornecerá uma estimativa de probabilidade de AI por parágrafo, com veredito ajustado para ESL — voltado para redações que avaliam propostas de freelancers, já que submissões geradas por AI estão cada vez mais frequentes. O ajuste para ESL é relevante porque padrões de escrita de não nativos em inglês se sobrepõem a sinais de AI (Stanford 2023 encontrou 61,3% de FPR em detectores ingênuos); nossa calibração busca reduzir esse índice de forma significativa, com a taxa residual publicada quando a funcionalidade passar pela avaliação.
- Posso monitorar minhas bylines contra copiadores?
- Premium inclui vigilância de byline. Adicione seus textos publicados; varredura diária identifica domínios não permitidos publicando trechos. Cada flag acompanha snapshot HTML hasheado e datado — prova DMCA. Não protocolamos DMCA (é decisão jurídica); só fornecemos o material.
- Como lidar com embargo?
- Inclua materiais sob embargo em escopo temporário com a data. Coincidências são marcadas como EMBARGO-OK até a data, depois volta ao padrão. Útil para jornalismo científico (NIH/EurekAlert rotineiros) e de políticas (transcrições de audiências do Congresso sob embargo).
- Funciona para reportagem em outros idiomas?
- A detecção está calibrada para inglês, espanhol, português, polonês e ucraniano no lançamento, com mais idiomas previstos. A qualidade da detecção é avaliada com base no PAN-PC-11; a avaliação por idioma está no roadmap. Útil para correspondentes internacionais que enviam textos em vários idiomas.
- Como é a API para CMS de redação?
- REST + especificação OpenAPI 3.0. SDKs em Python e Node gerados a partir da especificação. Webhooks para verificações assíncronas em textos longos. POST /v1/checks a partir do hook do seu CMS em save_draft; o relatório é anexado ao artigo como metadados de auditoria. Exemplos de integração com WordPress, Ghost e Drupal em github.com/NoplagLabs/noplag-engine.
- E se eu for freelancer sem redação?
- Gratuito cobre 2.500 palavras por check, ilimitado, sem cadastro. Compatível com celular (dá pra checar do campo). Premium a $79/mês inclui corpus de agência, monitoramento de byline e recursos em pasta. Self-host é Apache 2.0 grátis se quiser rodar tudo local.
- E se a fonte da citação for identificada como gerada por IA?
- Quando disponível, a detecção de IA por parágrafo destaca o trecho suspeito com ajuste para ESL. Se uma citação atribuída a uma fonte for IA-provável, isso é um alerta editorial — pode ser a fonte usando IA, pode ser paráfrase de texto de IA, pode ser falso positivo. O veredito é sinal para checar direto com a fonte; não implica desqualificação automática.
Cheque antes que o editor o faça.
Envie o texto proposto. Relatório por parágrafo em 47 segundos: citações, agência, autocitação, IA em breve. Gratuito até 2.500 palavras. Premium para corpus de agência e monitoramento de byline.