Statistika plagiátorství
Zdroje dat

Odkud pocházejí uvedená čísla.

Každý zdroj je volně dostupný a otevřeně licencovaný. Tečka označuje způsob vzniku údaje — zda je spočítán z primárních záznamů, nebo sestaven z kurátorovaných zdrojů. Kompletní výpočet je uveden na stránce metodiky.

Tier 1 — high-authority datasets (the rate data)

Retraction events + categorized reasons (the plagiarism numerator).

Free, Crossref-hosted

Monthly snapshots

Publications, ROR-resolved affiliations, disciplines (denominators + the DOI join).

Free, CC0

Real-time

DOI metadata linking retractions to works.

Free API

Continuous

Canonical institution identifiers (the disambiguation backbone).

Free, CC0

Tier 2 — curated sources (the case data + signal)
Weekly

Notable plagiarism cases (Category:Plagiarism controversies, scientific misconduct).

Free, CC-BY-SA

Daily

Global news-volume index + recent coverage (current-events signal).

Free, DOC 2.0 API

Soudní záznamy (CourtListener) a firemní podání (SEC EDGAR) byly zhodnoceny, ale nezařazeny: jejich plnotextové shody jsou příliš šumové na spolehlivé přiřazení. Evropská judikatura a národní zprávy o pochybeních (UK QAA, německá DFG) jsou manuální zdroje plánované do budoucna.
Zdroje dat a jejich kvalita — Statistika plagiátorství