Estadísticas de plagio
Fuentes de datos

Origen de los datos.

Todas las fuentes son gratuitas y cuentan con licencias abiertas. El punto indica cómo se genera cada cifra: si se calcula a partir de registros primarios o se compila de fuentes seleccionadas. El detalle completo del cálculo está en la página de metodología.

Tier 1 — high-authority datasets (the rate data)

Retraction events + categorized reasons (the plagiarism numerator).

Free, Crossref-hosted

Monthly snapshots

Publications, ROR-resolved affiliations, disciplines (denominators + the DOI join).

Free, CC0

Real-time

DOI metadata linking retractions to works.

Free API

Continuous

Canonical institution identifiers (the disambiguation backbone).

Free, CC0

Tier 2 — curated sources (the case data + signal)
Weekly

Notable plagiarism cases (Category:Plagiarism controversies, scientific misconduct).

Free, CC-BY-SA

Daily

Global news-volume index + recent coverage (current-events signal).

Free, DOC 2.0 API

Se evaluaron registros judiciales (CourtListener) y documentos corporativos (SEC EDGAR), pero no se incluyeron: las coincidencias de texto completo son demasiado imprecisas para atribuirlas de forma fiable. La jurisprudencia de la UE y los informes nacionales de mala conducta (UK QAA, DFG de Alemania) son fuentes manuales previstas en la hoja de ruta.
Fuentes de datos y calidad — Estadísticas de plagio