Plagiato statistika
Duomenų šaltiniai

Iš kur gaunami šie skaičiai.

Visi šaltiniai yra nemokami ir turi atvirą licenciją. Taškas žymi, kaip skaičius apskaičiuotas — ar suskaičiuota pagal pirminius įrašus, ar sudaryta iš kuruotų šaltinių. Išsamus skaičiavimo aprašymas pateiktas metodologijos puslapyje.

Tier 1 — high-authority datasets (the rate data)

Retraction events + categorized reasons (the plagiarism numerator).

Free, Crossref-hosted

Monthly snapshots

Publications, ROR-resolved affiliations, disciplines (denominators + the DOI join).

Free, CC0

Real-time

DOI metadata linking retractions to works.

Free API

Continuous

Canonical institution identifiers (the disambiguation backbone).

Free, CC0

Tier 2 — curated sources (the case data + signal)
Weekly

Notable plagiarism cases (Category:Plagiarism controversies, scientific misconduct).

Free, CC-BY-SA

Daily

Global news-volume index + recent coverage (current-events signal).

Free, DOC 2.0 API

Teismo įrašai (CourtListener) ir įmonių dokumentai (SEC EDGAR) buvo įvertinti, bet neįtraukti: jų pilno teksto atitikmenys per daug triukšmingi, kad būtų galima patikimai priskirti. ES teismų praktika ir nacionalinės pažeidimų ataskaitos (JK QAA, Vokietijos DFG) yra rankiniai šaltiniai, numatyti ateityje.
Duomenų šaltiniai ir kokybė — Plagiato statistika