Estatísticas de Plágio
Metodologia

Como calculamos estes números.

Cada valor apresentado neste site corresponde ao coeficiente de retratação por plágio: o número de retratações de publicações por plágio atribuídas a um país, instituição ou área, dividido pelo total de publicações desse mesmo grupo. Esta página documenta exatamente como cada número é produzido, o grau de confiança atribuído e os vieses que devem ser considerados ao citá-lo.

Etapa 1

Como contamos

O numerador é obtido a partir do banco de dados Retraction Watch (hospedado pela Crossref, cerca de 70.000 registros). Consideramos apenas registros cujo motivo apresenta o código estrito plagiarism of/in — uma constatação explícita de plágio, excluindo sinais menos claros como "eufemismos para plágio" ou duplicação. Em 2015–2024, isso corresponde a 1,879 registros distintos.

O cruzamento relevante

A atribuição por instituição e área é feita pelo cruzamento do DOI do artigo via OpenAlex — nunca pelo campo de afiliação em texto livre do Retraction Watch. O OpenAlex já resolve as afiliações de cada trabalho para identificadores ROR canônicos e classifica a área, de modo que a consulta pelo DOI retorna a instituição e área corretas. Resolver a afiliação a partir do texto livre geralmente prioriza o departamento e associa fragmentos à instituição errada — uma atribuição incorreta que explicitamente evitamos.

Cerca de 91% dos registros de plágio possuem DOI; aproximadamente 90% destes são associados a uma instituição ROR, então cerca de quatro em cada cinco registros são atribuídos a uma instituição canônica.

FontesRetraction Watch (eventos de retratação + motivos), OpenAlex (publicações, afiliações, áreas), Crossref (metadados de DOI), ROR (identidade institucional). Todas gratuitas e com licença aberta.
DenominadorContagens de publicações do OpenAlex para a mesma entidade e período. Contagens por país utilizam o país de afiliação do autor; contagens por instituição utilizam o identificador ROR.
Etapa 2

Como normalizamos

Contagens absolutas podem ser enganosas: sistemas de pesquisa com alta produção acumulam mais retratações simplesmente porque publicam mais. Pela contagem absoluta, China lidera com 564; pela taxa, está em 7.0 por 100 mil. Por isso, reportamos taxas, e o sistema foi projetado para não classificar entidades por contagem absoluta.

Taxa por 100.000 publicaçõesO principal indicador para cada entidade. Permite comparação entre entidades de tamanhos muito diferentes.
Intervalos de confiança de Wilson a 95%Cada taxa possui um intervalo. Numeradores pequenos produzem intervalos amplos — um sinal para interpretar a taxa com cautela, e não como uma estimativa pontual.
Janelas móveis, não anos isoladosRetratações costumam ocorrer anos após o artigo original, então um único ano é insuficiente para análise. A unidade padrão é uma janela de múltiplos anos.
Limite mínimo de volumeEntidades com menos de 100.000 publicações na janela são omitidas — um número baixo de publicações torna a taxa estatisticamente irrelevante.
Etapa 3

Qualidade da fonte, em cada número

Cada estatística é identificada conforme seu método de produção, permitindo avaliar sua confiabilidade antes de citar.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Leia isto primeiro

Vieses e limitações conhecidos

Medimos plágio detectado, não plágio cometidoEstas são retratações que foram identificadas e registradas. A diferença entre as taxas detectadas e as reais existe e não é mensurada; nunca apresentamos estes números como taxas totais de plágio.
Viés de indexação para o inglêsRetraction Watch e OpenAlex têm super-representação de periódicos em inglês. Um país com fiscalização rigorosa pode detectar (e, portanto, registrar) mais casos, sem necessariamente cometer mais.
Cobertura desigualA cobertura das fontes varia por região; omitimos entidades cuja cobertura é insuficiente para sustentar um coeficiente confiável.
O denominador inclui todas as publicações (por enquanto)O denominador atual considera todas as publicações do OpenAlex, não apenas artigos de periódicos, o que subestima levemente os coeficientes. Um denominador restrito apenas a artigos está previsto como aprimoramento futuro.
Para pesquisadores

Reproduza você mesmo

Todo o fluxo consiste em duas chamadas HTTP gratuitas, sem chave, mais um join. Sem chaves de API, sem níveis pagos.

# 1. Base de dados Retraction Watch (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. Publicações do OpenAlex por país, 2015–2024 (o denominador)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Mantenha apenas registros com motivo estrito de 'plágio de/em', atribua via DOI,
#    divida pelo número de publicações, ×100.000. Intervalo de Wilson para o intervalo de confiança.

A implementação de referência está no pipeline stats/ do projeto.

Citar e reutilizar

Os dados são publicados sob CC-BY 4.0 — livre para reutilização, inclusive comercial, com atribuição a Noplag Plagiarism Statistics.

Voltar aos dados
Como calculamos as estatísticas de plágio — metodologia