Statistiques sur le plagiat
Sources de données

Origine des chiffres.

Chaque source est gratuite et sous licence ouverte. Le point indique la méthode de production de la donnée — comptage à partir des enregistrements primaires ou compilation à partir de sources sélectionnées. Le calcul complet est détaillé sur la page de méthodologie.

Tier 1 — high-authority datasets (the rate data)

Retraction events + categorized reasons (the plagiarism numerator).

Free, Crossref-hosted

Monthly snapshots

Publications, ROR-resolved affiliations, disciplines (denominators + the DOI join).

Free, CC0

Real-time

DOI metadata linking retractions to works.

Free API

Continuous

Canonical institution identifiers (the disambiguation backbone).

Free, CC0

Tier 2 — curated sources (the case data + signal)
Weekly

Notable plagiarism cases (Category:Plagiarism controversies, scientific misconduct).

Free, CC-BY-SA

Daily

Global news-volume index + recent coverage (current-events signal).

Free, DOC 2.0 API

Les décisions de justice (CourtListener) et les documents d’entreprise (SEC EDGAR) ont été évalués mais non retenus : les correspondances en texte intégral sont trop bruitées pour permettre une attribution fiable. La jurisprudence de l’UE et les rapports nationaux sur les manquements à l’intégrité scientifique (UK QAA, DFG allemand) sont des sources manuelles prévues dans la feuille de route.
Sources de données et qualité — Statistiques sur le plagiat