Plagiaadistatistika
Andmeallikad

Kust andmed pärinevad.

Kõik allikad on tasuta ja avatud lähtekoodiga litsentsiga. Punkt näitab, kas näitaja on arvutatud esmastest andmetest või koondatud kureeritud allikatest. Täielik arvutusmeetod on kirjeldatudmetoodika lehel.

Tier 1 — high-authority datasets (the rate data)

Retraction events + categorized reasons (the plagiarism numerator).

Free, Crossref-hosted

Monthly snapshots

Publications, ROR-resolved affiliations, disciplines (denominators + the DOI join).

Free, CC0

Real-time

DOI metadata linking retractions to works.

Free API

Continuous

Canonical institution identifiers (the disambiguation backbone).

Free, CC0

Tier 2 — curated sources (the case data + signal)
Weekly

Notable plagiarism cases (Category:Plagiarism controversies, scientific misconduct).

Free, CC-BY-SA

Daily

Global news-volume index + recent coverage (current-events signal).

Free, DOC 2.0 API

Kohtudokumente (CourtListener) ja ettevõtete aruandeid (SEC EDGAR) hinnati, kuid neid ei kaasatud: nende täisteksti kattuvused on liiga mürarikkad, et neid usaldusväärselt omistada. ELi kohtupraktika ja riiklikud rikkumisaruanded (UK QAA, Saksamaa DFG) on käsitsi töödeldavad allikad, mis on plaanis lisada.
Andmeallikad ja andmete usaldusväärsus — Plagiaadistatistika