Statystyki plagiatów
Źródła danych

Skąd pochodzą prezentowane dane.

Każde źródło jest bezpłatne i objęte otwartą licencją. Kolor kropki wskazuje sposób pozyskania danych — czy liczba pochodzi z rejestrów pierwotnych, czy została zestawiona na podstawie opracowanych źródeł. Szczegółowy opis obliczeń znajduje się na stronie metodologii.

Tier 1 — high-authority datasets (the rate data)

Retraction events + categorized reasons (the plagiarism numerator).

Free, Crossref-hosted

Monthly snapshots

Publications, ROR-resolved affiliations, disciplines (denominators + the DOI join).

Free, CC0

Real-time

DOI metadata linking retractions to works.

Free API

Continuous

Canonical institution identifiers (the disambiguation backbone).

Free, CC0

Tier 2 — curated sources (the case data + signal)
Weekly

Notable plagiarism cases (Category:Plagiarism controversies, scientific misconduct).

Free, CC-BY-SA

Daily

Global news-volume index + recent coverage (current-events signal).

Free, DOC 2.0 API

Akta sądowe (CourtListener) i dokumenty korporacyjne (SEC EDGAR) zostały przeanalizowane, ale nie uwzględniono ich: dopasowania pełnotekstowe są zbyt obarczone szumem, by można było je wiarygodnie przypisać. Orzecznictwo UE i krajowe raporty o nierzetelnościach naukowych (UK QAA, niemiecki DFG) to ręcznie opracowywane źródła planowane do wdrożenia.
Źródła danych i ich wiarygodność — Statystyki plagiatów