Estadísticas de plagio
Metodología

Cómo calculamos estas cifras.

Cada cifra en este sitio es un coeficiente de retractación por plagio: cuántas retractaciones por plagio acumula un país, institución o disciplina, dividido por la cantidad de publicaciones correspondientes. Esta página documenta exactamente cómo se produce cada cifra, el nivel de confianza asignado y los sesgos a considerar al citarla.

Paso 1

Cómo contamos

El numerador proviene de la base de datos de Retraction Watch (alojada por Crossref, ~70 000 registros). Solo se conservan los registros cuya razón corresponde estrictamente al código plagiarism of/in: un hallazgo explícito de plagio, no señales indirectas como “eufemismos de plagio” o duplicación. En 2015–2024 eso representa 1,879 registros distintos.

El cruce relevante

La asignación de institución y disciplina se realiza a través del DOI del artículo mediante OpenAlex, nunca utilizando el campo de afiliación en texto libre de Retraction Watch. OpenAlex ya ha resuelto las afiliaciones de cada trabajo a identificadores ROR canónicos y ha etiquetado su disciplina, por lo que una consulta por DOI devuelve la institución y el área correctas. Resolver la cadena de afiliación en texto libre, en cambio, prioriza el departamento y asocia fragmentos con la institución incorrecta, lo que genera atribuciones erróneas que prohibimos expresamente.

Aproximadamente el 91% de los registros de plagio tienen DOI; cerca del 90% de esos se vinculan a una institución ROR, por lo que alrededor de cuatro de cada cinco registros se atribuyen a una institución canónica.

FuentesRetraction Watch (eventos de retractación y motivos), OpenAlex (publicaciones, afiliaciones, disciplinas), Crossref (metadatos de DOI), ROR (identidad institucional). Todos de acceso libre y con licencias abiertas.
DenominadorConteos de publicaciones de OpenAlex para la misma entidad y periodo. Los conteos por país se basan en el país de afiliación del autor; los de institución, en el identificador ROR.
Paso 2

Cómo normalizamos

Los recuentos absolutos pueden inducir a error: los sistemas de investigación con mayor producción acumulan más retractaciones simplemente porque publican más. Por recuento absoluto, China lidera con 564; por tasa, se sitúa en 7.0 por 100 000. Por ello, informamos tasas, y el sistema está diseñado para que no pueda clasificar entidades por recuento absoluto.

Tasa por 100 000 publicacionesEl indicador principal para cada entidad. Permite la comparación entre entidades de tamaños muy diferentes.
Intervalos de confianza de Wilson al 95%Cada tasa incluye un intervalo. Numeradores pequeños producen intervalos amplios, lo que indica que la tasa debe interpretarse con cautela y no como una estimación puntual.
Ventanas móviles, no años individualesLas retractaciones suelen producirse años después del artículo original, por lo que un solo año es insuficiente para graficar. La unidad por defecto es una ventana de varios años.
Umbral mínimo de volumenSe omiten las entidades con menos de 100 000 publicaciones en la ventana, ya que un volumen tan bajo convierte la tasa en ruido estadístico.
Paso 3

Calidad de la fuente, en cada cifra

Cada estadística está etiquetada según su método de obtención, para que pueda valorarla antes de citarla.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Lea esto primero

Sesgos y limitaciones conocidos

Medimos el plagio detectado, no el cometidoEstas son retractaciones que fueron identificadas y registradas. Existe una diferencia real y no medida entre las tasas detectadas y las reales; nunca presentamos estas cifras como tasas totales de plagio.
Sesgo de indexación hacia publicaciones en inglésRetraction Watch y OpenAlex sobre-representan revistas en inglés. Un país con mayor control puede detectar (y por tanto registrar) más casos, sin que ello implique necesariamente una mayor incidencia.
Cobertura desigualLa cobertura de fuentes varía según la región; omitimos las entidades cuya cobertura es insuficiente para calcular una tasa fundamentada.
El denominador incluye todas las obras (por ahora)El denominador actual considera todas las obras de OpenAlex, no solo los artículos de revistas, lo que subestima levemente las tasas. Se prevé ajustar el denominador para incluir únicamente artículos.
Para investigadores

Reprodúzcalo usted mismo

Todo el proceso consiste en dos llamadas HTTP gratuitas, sin clave, más una unión. Sin claves de API ni niveles de pago.

# 1. Base de datos de Retraction Watch (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. Publicaciones de OpenAlex por país, 2015–2024 (el denominador)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Conservar los registros con motivo estricto de 'plagio de/en', atribuir mediante DOI,
#    dividir por publicaciones, ×100 000. Intervalo de Wilson para el IC.

La implementación de referencia se encuentra en la canalización stats/ del proyecto.

Cite y reutilice

Los datos se publican bajo CC-BY 4.0: libres para reutilizar, incluso con fines comerciales, siempre que se atribuya a Noplag Plagiarism Statistics.

Volver a los datos
Cómo calculamos las estadísticas de plagio — metodología