ACADÊMICO700M+ trabalhos acadêmicos · Apache 2.0

Detector de plágio acadêmico com reconhecimento de citação

Detecção de plágio feita para a escrita acadêmica — verifica mais de 700M de trabalhos em OpenAlex, CORE, arXiv, PubMed Central e Crossref. Classificação por citação. Motor Apache 2.0 auditável por qualquer equipe de TI institucional.

0 / 1,500 words
700M+ trabalhos acadêmicosClassificação por citaçãoApache 2.0 · auditável pela instituição
O CORPUS CIENTÍFICO

Cinco fontes. 700M+ trabalhos. Tudo acesso aberto ou DOI registrado.

Sem conteúdo de assinatura paga — usamos apenas índices de acesso aberto. Cobertura maior de pesquisas pós-Plan-S; menor para catálogos antigos de periódicos pagos.

01 · ÍNDICEmensal

OpenAlex

250M+ trabalhos

Índice acadêmico aberto — substitui o antigo Microsoft Academic Graph. Inclui artigos, anais de conferências, conjuntos de dados e livros de todas as áreas.

02 · ACESSO ABERTOsemanal

CORE

290M+ artigos

Maior agregador mundial de pesquisa de acesso aberto. Indexação de texto completo de mais de 11.000 repositórios. Forte em produção europeia e britânica.

03 · PREPRINTdiário

arXiv

2,4M+ preprints

Física, matemática, computação, biologia quantitativa, estatística, economia. Permite conferir contra a versão que seu revisor viu no arXiv.

04 · BIOMEDsemanal

PubMed Central

10M+ artigos

Arquivo aberto de biomedicina e ciências da vida. Indexação de texto completo e metadados. Inclui pesquisa submetida ao NIH e espelhos de periódicos.

Crossref · 150M+ trabalhos registrados por DOI · usado para resolução canônica e travessia de grafo de citação
FLUXOS ACADÊMICOS

Três fluxos. Um produto.

Se estiver preparando um artigo, defendendo um capítulo de tese ou finalizando uma proposta de financiamento — o verificador se adequa à etapa, não o contrário.

01

01 · Pré-submissão de artigo

Execute o artigo no universo de acesso aberto antes que o periódico o faça. iThenticate / Crossref Similarity Check fará a verificação na submissão — você quer saber o que o editor verá, antes dele. Pro plano fixo permite iterar em rascunhos sem gastar créditos por documento.

02

02 · Capítulo de dissertação / tese

Cheque por capítulo ou cole a tese inteira. Autocitação entre capítulos é sinalizada mas classificada à parte (legítimo em teses). Referências excluídas automaticamente da pontuação. Histórico de versões permite comparar janeiro com maio — veja o que mudou, o que ficou mais limpo e o que é novo.

03

03 · Proposta de financiamento / revisão de literatura

Modelos repetitivos de financiamentos anteriores não devem aparecer como plágio. Revisão bibliográfica bem citada também não. O modelo classifica reciclagem legítima (seu próprio trabalho, citado) separado de cópia acidental. A pontuação reflete só o que é realmente um problema.

CLASSIFICAÇÃO POR CITAÇÃO

Seis categorias. Cada trecho encontrado em uma.

Um relatório de 28% em revisão de literatura altamente citada é diferente de 28% em paráfrase sem citação. A classificação faz a diferença.

01 · Citação direta (citada)

Aspas + citação entre parênteses OU rodapé. Contabilizado como esperado; excluído da pontuação. Vários estilos de citação reconhecidos automaticamente (MLA / APA / Chicago / Harvard / Vancouver / IEEE).

02 · Citação em bloco

Trecho indentado (40+ palavras) com citação ao final. Contabilizado como esperado. Padrão de indentação 1,27cm à esquerda + citação é reconhecido; falta de indentação sinaliza formatação incorreta.

03 · Paráfrase (citada)

Semelhança de frase com atribuição em algum ponto do parágrafo. Peso reduzido. Aceita atribuições como “Smith (2023) argumenta...” antes da paráfrase.

04 · Conhecimento comum

Expressões presentes em 2.000+ fontes (“Água ferve a 100°C”, definições técnicas padrão, fórmulas muito conhecidas). Excluído da pontuação. Limite ajustável para áreas com vocabulário denso.

05 · Bibliografia

Lista de referências detectada por título e formato. Excluída totalmente da pontuação. Referências não são originais — apontá-las aumenta a pontuação sem motivo.

06 · Paráfrase sem atribuição

Semelhança de frase sem citação próxima, sem aspas, sem formatação de citação em bloco. É essa categoria que pesa no resultado final. Tem peso total; as outras não.

O RELATÓRIO CIENTÍFICO

Classificação por trecho. URL da fonte. Auditável do início ao fim.

Cada trecho encontrado inclui DOI/URL da fonte, categoria de classificação, data do snapshot do corpus e commit do motor. Defensável em comitê, reunião de integridade ou auditoria de TI.

RELATÓRIO · 4.217 palavras · 47 trechos classificadosO Romance Modernista: Uma Reavaliação · Capítulo 3
Destaque · 8,2%Motor · v0.4.2
#TRECHO ENCONTRADO · FONTECLASSIFICAÇÃO
12

O modernismo é menos um movimento coeso do que uma constelação de rejeições — do realismo, do progresso, da unidade do eu... (Eysteinsson, 1990, p.117).

doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990
CITADO · CITADO
18

A ênfase de Eliot na impessoalidade reformula o lírico como construção em vez de expressão confessional.

Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…
PARÁFRASE · CITADO
23

O romance surge de uma visão de mundo fundamentalmente burguesa formada no século XVIII.

openalex.org/W12345678 · Watt (1957) — correspondência não citada
SEM CITAÇÃO
31

O fluxo de consciência de Joyce deve muito à psicologia da duração interior de William James.

James, W. (1890). The Principles of Psychology, ch.IX (mencionado na lista de referências)
PARÁFRASE · CITADO
34

A própria tese de doutorado do autor, capítulo 1, já publicada.

ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · autocitação, sem atribuição neste parágrafo
AUTOCITAÇÃO
41

Todas as referências — Eysteinsson, Eliot, Joyce, James, Watt e mais 32 autores.

Seção Bibliografia, p. 38–41
REFERÊNCIAS · EXCLUÍDO
Destaque 8,2% = soma de paráfrase sem citação + peso de autocitação; trechos citados e referências excluídos.
  • 700M+trabalhos acadêmicos indexados
  • 6estilos de citação reconhecidos
  • 5idiomas calibrados no lançamento
  • 3%viés residual ESL (documentado)
  • Apache2.0 · Revisável por CEI
DEFENSÁVEL EM PARECER

Três aspectos que um verificador caixa-preta não resiste numa audiência docente.

01 · PONTUAÇÃO REPRODUZÍVEL

Refaça a checagem com o mesmo artigo e a mesma versão

Cada relatório inclui X-Engine-Commit e timestamp do corpus. Meses depois, pode-se refazer a análise com a mesma versão do motor — mesmo texto, mesmo algoritmo, mesmo resultado. Checadores fechados podem recalibrar sem aviso, e a pontuação de janeiro não se repete em maio.

Reprodutibilidade é o mínimo para integridade acadêmica.
02 · ALGORITMO AUDITÁVEL

Fonte Apache 2.0 no GitHub — leve para a reunião

Quando a detecção de IA chegar (em breve, já no roadmap v1.2) e um aluno contestar o resultado, será possível apontar o commit do motor, o trecho do código que produziu o laudo, e a documentação de calibração para ESL. Não só uma tela de resposta do suporte.

github.com/NoplagLabs/noplag-engine — público, indexado pelo Google Scholar.
03 · VEREDITO ESL-AWARE

Liang et al. 2023 documentaram; mitigação prevista no roadmap

Em 2023, Stanford mediu 61,3% de FPR em redações TOEFL usando detectores ingênuos. Quando a detecção de AI do Noplag for lançada (em breve, no roadmap da v1.2), o resultado incluirá uma faixa ajustada para ESL quando a assinatura lexical indicar inglês não nativo. O erro residual será documentado, não será declarado como zero. Caminho de override registrado com commit do engine e motivo.

/docs/developers/benchmarks — metodologia e resultados do PAN-PC-11.
COMPRA INSTITUCIONAL

Um motor Apache 2.0 que o TI da instituição pode revisar de verdade antes da assinatura.

A maioria das análises institucionais de compra de software de plágio emperra nas mesmas questões: para onde vai o texto submetido, qual o algoritmo de comparação, quem acessa os dados, caminho do direito ao esquecimento e como comprova a precisão. Com fornecedor fechado, isso se resolve em ligação comercial. Com Apache 2.0, o TI pode clonar o repositório, rodar o motor em VM isolada, auditar dados, verificar o direito ao esquecimento e reproduzir as métricas F1 em seu próprio corpus. Não falamos em revisão menos rigorosa — mas sim numa análise que o TI consegue de fato concluir. Por isso instituições que rejeitavam outros fornecedores estão contratando esse.

Leia o guia de compra
FAQ

As perguntas que os acadêmicos realmente fazem.

Isso substitui iThenticate para pré-submissão de artigo?

Na maioria dos casos, não — se o periódico exigir iThenticate (Elsevier, Springer, Wiley, IEEE), será rodado de qualquer forma. O que o Noplag substitui é a verificação iterativa nos rascunhos antes dessa submissão. iThenticate a US$125/documento encarece muito após a 4ª revisão; Pro fixo não. Veja a comparação completa em noplag.com/vs-ithenticate.

E as dissertações ProQuest? Vocês não têm?

Correto — essa lacuna existe. O banco ProQuest é proprietário, pago e não incluído no OpenAlex/CORE. Cobrimos os ~700M de trabalhos de acesso aberto, que é mais amplo que ProQuest para pesquisas pós-Plan-S (a maioria dos periódicos grandes 2018+); mais estreito para dissertações pagas antigas. Se checar dissertações de doutorado dos EUA for prioritário, iThenticate é a ferramenta indicada para isso.

Como o motor lida com estilos de citação além dos principais?

MLA, APA, Chicago / Turabian, Harvard, Vancouver e IEEE são reconhecidos do formato da bibliografia. Para estilos menos comuns (ACS, AMA, ASA, Bluebook, Oxford), o motor ainda classifica por aspas e padrões de parênteses próximos ao texto, mas o validador específico entra no roadmap v1.2. Usuários self-host podem acrescentar estilos no módulo alignment/.

Qual a taxa de falso positivo em revisão altamente citada?

Menor do que se espera, porque intervalos citados são excluídos do resultado principal. Apuramos cerca de 3,4% de falso positivo no subconjunto PAN-PC-11 (com muito trecho legítimo citado). Concorrentes fechados, que não classificam citações, relatam 12-18% no mesmo corpus.

Posso excluir minhas próprias publicações anteriores?

No plano Pro — configure uma lista de permissão (seu ORCID, DOIs, URL institucional). Trechos correspondentes serão marcados como AUTOCITAÇÃO e não contam na pontuação. Útil para quem insere trabalhos já publicados em propostas; auto-reciclagem com citação não é plágio.

Como é a cobertura de idiomas na prática?

A detecção está calibrada para inglês, espanhol, português, polonês e ucraniano no lançamento, com mais idiomas previstos. A qualidade da detecção é avaliada com base no PAN-PC-11; a avaliação por idioma está no roadmap. O desempenho é mais consistente nos idiomas europeus com histórico de validação mais longo; novos idiomas são lançados conforme a calibração evolui.

O que significa “Apache 2.0” para compras institucionais?

Sua equipe de TI / DPO / IRB pode clonar github.com/NoplagLabs/noplag-engine, rodar o engine em um sandbox, auditar o fluxo de dados, verificar se o direito ao apagamento funciona de ponta a ponta e reproduzir nossos resultados publicados usando seu próprio corpus de teste. Sem assinar nada, sem NDA, sem depender do nosso marketing. Para instituições cujo processo de compras exige esse nível de análise, isso resolve.

O detector de IA vai funcionar com texto Claude-3, Gemini ou só GPT?

A detecção de AI estará disponível em breve — está no roadmap da v1.2, não disponível no lançamento. A abordagem é Binoculars (Hans et al. 2024), agnóstica ao modelo: não treina para cada LLM, compara a perplexidade de um modelo de referência pequeno com o texto testado, o que generaliza. Os índices de acurácia serão publicados quando a funcionalidade passar pela avaliação, não antes, usando conteúdo de múltiplos LLMs (em vez de ~70% no Claude-3 para detectores treinados em GPT). O artigo metodológico documenta as limitações; não as ocultamos.

E se meu orientador contestar um trecho indicado?

Cada trecho marcado inclui DOI da fonte, data do corpus, commit do motor e motivo da classificação. Refaça a checagem com o mesmo commit e o resultado será idêntico. Leve o relatório para a reunião; caminhos das citações são clicáveis. Não há modo “confie na pontuação” aqui — isso é coisa de caixa-preta.

E sobre rodar localmente para pesquisa médica / clínica com HIPAA?

Apache 2.0 + Docker — roda 100% local. Use PostgreSQL + Redis no seu próprio ambiente; nada sai da VPC. Útil para textos clínicos, casos pacientes ou qualquer pesquisa pré-publicação que não pode sair para a nuvem externa. No institucional, o corpus pode ser entregue para indexação.

Cheque um capítulo contra 700M+ trabalhos acadêmicos.

Envie capítulo de dissertação, proposta de financiamento ou rascunho de artigo. O relatório mostra o que já era esperado, o que precisa de citação e o que é seu. Grátis até 2.500 palavras. Apache 2.0 caso seu CEI queira analisar o algoritmo antes.

Detector de plágio acadêmico com reconhecimento de citação