Detector de plágio acadêmico com reconhecimento de citação
Detecção de plágio feita para a escrita acadêmica — verifica mais de 700M de trabalhos em OpenAlex, CORE, arXiv, PubMed Central e Crossref. Classificação por citação. Motor Apache 2.0 auditável por qualquer equipe de TI institucional.
Cinco fontes. 700M+ trabalhos. Tudo acesso aberto ou DOI registrado.
Sem conteúdo de assinatura paga — usamos apenas índices de acesso aberto. Cobertura maior de pesquisas pós-Plan-S; menor para catálogos antigos de periódicos pagos.
OpenAlex
250M+ trabalhosÍndice acadêmico aberto — substitui o antigo Microsoft Academic Graph. Inclui artigos, anais de conferências, conjuntos de dados e livros de todas as áreas.
CORE
290M+ artigosMaior agregador mundial de pesquisa de acesso aberto. Indexação de texto completo de mais de 11.000 repositórios. Forte em produção europeia e britânica.
arXiv
2,4M+ preprintsFísica, matemática, computação, biologia quantitativa, estatística, economia. Permite conferir contra a versão que seu revisor viu no arXiv.
PubMed Central
10M+ artigosArquivo aberto de biomedicina e ciências da vida. Indexação de texto completo e metadados. Inclui pesquisa submetida ao NIH e espelhos de periódicos.
Três fluxos. Um produto.
Se estiver preparando um artigo, defendendo um capítulo de tese ou finalizando uma proposta de financiamento — o verificador se adequa à etapa, não o contrário.
01 · Pré-submissão de artigo
Execute o artigo no universo de acesso aberto antes que o periódico o faça. iThenticate / Crossref Similarity Check fará a verificação na submissão — você quer saber o que o editor verá, antes dele. Pro plano fixo permite iterar em rascunhos sem gastar créditos por documento.
02 · Capítulo de dissertação / tese
Cheque por capítulo ou cole a tese inteira. Autocitação entre capítulos é sinalizada mas classificada à parte (legítimo em teses). Referências excluídas automaticamente da pontuação. Histórico de versões permite comparar janeiro com maio — veja o que mudou, o que ficou mais limpo e o que é novo.
03 · Proposta de financiamento / revisão de literatura
Modelos repetitivos de financiamentos anteriores não devem aparecer como plágio. Revisão bibliográfica bem citada também não. O modelo classifica reciclagem legítima (seu próprio trabalho, citado) separado de cópia acidental. A pontuação reflete só o que é realmente um problema.
Seis categorias. Cada trecho encontrado em uma.
Um relatório de 28% em revisão de literatura altamente citada é diferente de 28% em paráfrase sem citação. A classificação faz a diferença.
01 · Citação direta (citada)
Aspas + citação entre parênteses OU rodapé. Contabilizado como esperado; excluído da pontuação. Vários estilos de citação reconhecidos automaticamente (MLA / APA / Chicago / Harvard / Vancouver / IEEE).
02 · Citação em bloco
Trecho indentado (40+ palavras) com citação ao final. Contabilizado como esperado. Padrão de indentação 1,27cm à esquerda + citação é reconhecido; falta de indentação sinaliza formatação incorreta.
03 · Paráfrase (citada)
Semelhança de frase com atribuição em algum ponto do parágrafo. Peso reduzido. Aceita atribuições como “Smith (2023) argumenta...” antes da paráfrase.
04 · Conhecimento comum
Expressões presentes em 2.000+ fontes (“Água ferve a 100°C”, definições técnicas padrão, fórmulas muito conhecidas). Excluído da pontuação. Limite ajustável para áreas com vocabulário denso.
05 · Bibliografia
Lista de referências detectada por título e formato. Excluída totalmente da pontuação. Referências não são originais — apontá-las aumenta a pontuação sem motivo.
06 · Paráfrase sem atribuição
Semelhança de frase sem citação próxima, sem aspas, sem formatação de citação em bloco. É essa categoria que pesa no resultado final. Tem peso total; as outras não.
Classificação por trecho. URL da fonte. Auditável do início ao fim.
Cada trecho encontrado inclui DOI/URL da fonte, categoria de classificação, data do snapshot do corpus e commit do motor. Defensável em comitê, reunião de integridade ou auditoria de TI.
O modernismo é menos um movimento coeso do que uma constelação de rejeições — do realismo, do progresso, da unidade do eu... (Eysteinsson, 1990, p.117).
doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990A ênfase de Eliot na impessoalidade reformula o lírico como construção em vez de expressão confessional.
Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…O romance surge de uma visão de mundo fundamentalmente burguesa formada no século XVIII.
openalex.org/W12345678 · Watt (1957) — correspondência não citadaO fluxo de consciência de Joyce deve muito à psicologia da duração interior de William James.
James, W. (1890). The Principles of Psychology, ch.IX (mencionado na lista de referências)A própria tese de doutorado do autor, capítulo 1, já publicada.
ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · autocitação, sem atribuição neste parágrafoTodas as referências — Eysteinsson, Eliot, Joyce, James, Watt e mais 32 autores.
Seção Bibliografia, p. 38–41- 700M+trabalhos acadêmicos indexados
- 6estilos de citação reconhecidos
- 5idiomas calibrados no lançamento
- 3%viés residual ESL (documentado)
- Apache2.0 · Revisável por CEI
Três aspectos que um verificador caixa-preta não resiste numa audiência docente.
Refaça a checagem com o mesmo artigo e a mesma versão
Cada relatório inclui X-Engine-Commit e timestamp do corpus. Meses depois, pode-se refazer a análise com a mesma versão do motor — mesmo texto, mesmo algoritmo, mesmo resultado. Checadores fechados podem recalibrar sem aviso, e a pontuação de janeiro não se repete em maio.
Fonte Apache 2.0 no GitHub — leve para a reunião
Quando a detecção de IA chegar (em breve, já no roadmap v1.2) e um aluno contestar o resultado, será possível apontar o commit do motor, o trecho do código que produziu o laudo, e a documentação de calibração para ESL. Não só uma tela de resposta do suporte.
Liang et al. 2023 documentaram; mitigação prevista no roadmap
Em 2023, Stanford mediu 61,3% de FPR em redações TOEFL usando detectores ingênuos. Quando a detecção de AI do Noplag for lançada (em breve, no roadmap da v1.2), o resultado incluirá uma faixa ajustada para ESL quando a assinatura lexical indicar inglês não nativo. O erro residual será documentado, não será declarado como zero. Caminho de override registrado com commit do engine e motivo.
Um motor Apache 2.0 que o TI da instituição pode revisar de verdade antes da assinatura.
A maioria das análises institucionais de compra de software de plágio emperra nas mesmas questões: para onde vai o texto submetido, qual o algoritmo de comparação, quem acessa os dados, caminho do direito ao esquecimento e como comprova a precisão. Com fornecedor fechado, isso se resolve em ligação comercial. Com Apache 2.0, o TI pode clonar o repositório, rodar o motor em VM isolada, auditar dados, verificar o direito ao esquecimento e reproduzir as métricas F1 em seu próprio corpus. Não falamos em revisão menos rigorosa — mas sim numa análise que o TI consegue de fato concluir. Por isso instituições que rejeitavam outros fornecedores estão contratando esse.
Leia o guia de compraAs perguntas que os acadêmicos realmente fazem.
Isso substitui iThenticate para pré-submissão de artigo?
Na maioria dos casos, não — se o periódico exigir iThenticate (Elsevier, Springer, Wiley, IEEE), será rodado de qualquer forma. O que o Noplag substitui é a verificação iterativa nos rascunhos antes dessa submissão. iThenticate a US$125/documento encarece muito após a 4ª revisão; Pro fixo não. Veja a comparação completa em noplag.com/vs-ithenticate.
E as dissertações ProQuest? Vocês não têm?
Correto — essa lacuna existe. O banco ProQuest é proprietário, pago e não incluído no OpenAlex/CORE. Cobrimos os ~700M de trabalhos de acesso aberto, que é mais amplo que ProQuest para pesquisas pós-Plan-S (a maioria dos periódicos grandes 2018+); mais estreito para dissertações pagas antigas. Se checar dissertações de doutorado dos EUA for prioritário, iThenticate é a ferramenta indicada para isso.
Como o motor lida com estilos de citação além dos principais?
MLA, APA, Chicago / Turabian, Harvard, Vancouver e IEEE são reconhecidos do formato da bibliografia. Para estilos menos comuns (ACS, AMA, ASA, Bluebook, Oxford), o motor ainda classifica por aspas e padrões de parênteses próximos ao texto, mas o validador específico entra no roadmap v1.2. Usuários self-host podem acrescentar estilos no módulo alignment/.
Qual a taxa de falso positivo em revisão altamente citada?
Menor do que se espera, porque intervalos citados são excluídos do resultado principal. Apuramos cerca de 3,4% de falso positivo no subconjunto PAN-PC-11 (com muito trecho legítimo citado). Concorrentes fechados, que não classificam citações, relatam 12-18% no mesmo corpus.
Posso excluir minhas próprias publicações anteriores?
No plano Pro — configure uma lista de permissão (seu ORCID, DOIs, URL institucional). Trechos correspondentes serão marcados como AUTOCITAÇÃO e não contam na pontuação. Útil para quem insere trabalhos já publicados em propostas; auto-reciclagem com citação não é plágio.
Como é a cobertura de idiomas na prática?
A detecção está calibrada para inglês, espanhol, português, polonês e ucraniano no lançamento, com mais idiomas previstos. A qualidade da detecção é avaliada com base no PAN-PC-11; a avaliação por idioma está no roadmap. O desempenho é mais consistente nos idiomas europeus com histórico de validação mais longo; novos idiomas são lançados conforme a calibração evolui.
O que significa “Apache 2.0” para compras institucionais?
Sua equipe de TI / DPO / IRB pode clonar github.com/NoplagLabs/noplag-engine, rodar o engine em um sandbox, auditar o fluxo de dados, verificar se o direito ao apagamento funciona de ponta a ponta e reproduzir nossos resultados publicados usando seu próprio corpus de teste. Sem assinar nada, sem NDA, sem depender do nosso marketing. Para instituições cujo processo de compras exige esse nível de análise, isso resolve.
O detector de IA vai funcionar com texto Claude-3, Gemini ou só GPT?
A detecção de AI estará disponível em breve — está no roadmap da v1.2, não disponível no lançamento. A abordagem é Binoculars (Hans et al. 2024), agnóstica ao modelo: não treina para cada LLM, compara a perplexidade de um modelo de referência pequeno com o texto testado, o que generaliza. Os índices de acurácia serão publicados quando a funcionalidade passar pela avaliação, não antes, usando conteúdo de múltiplos LLMs (em vez de ~70% no Claude-3 para detectores treinados em GPT). O artigo metodológico documenta as limitações; não as ocultamos.
E se meu orientador contestar um trecho indicado?
Cada trecho marcado inclui DOI da fonte, data do corpus, commit do motor e motivo da classificação. Refaça a checagem com o mesmo commit e o resultado será idêntico. Leve o relatório para a reunião; caminhos das citações são clicáveis. Não há modo “confie na pontuação” aqui — isso é coisa de caixa-preta.
E sobre rodar localmente para pesquisa médica / clínica com HIPAA?
Apache 2.0 + Docker — roda 100% local. Use PostgreSQL + Redis no seu próprio ambiente; nada sai da VPC. Útil para textos clínicos, casos pacientes ou qualquer pesquisa pré-publicação que não pode sair para a nuvem externa. No institucional, o corpus pode ser entregue para indexação.
Cheque um capítulo contra 700M+ trabalhos acadêmicos.
Envie capítulo de dissertação, proposta de financiamento ou rascunho de artigo. O relatório mostra o que já era esperado, o que precisa de citação e o que é seu. Grátis até 2.500 palavras. Apache 2.0 caso seu CEI queira analisar o algoritmo antes.