Plagiatsstatistiken
Datenquellen

Herkunft der Zahlen.

Jede Quelle ist frei zugänglich und offen lizenziert. Der Punkt zeigt an, wie eine Kennzahl ermittelt wurde — direkt aus Primärdaten gezählt oder aus kuratierten Quellen zusammengetragen. Die vollständige Berechnung ist auf der Methodik-Seite.

Tier 1 — high-authority datasets (the rate data)

Retraction events + categorized reasons (the plagiarism numerator).

Free, Crossref-hosted

Monthly snapshots

Publications, ROR-resolved affiliations, disciplines (denominators + the DOI join).

Free, CC0

Real-time

DOI metadata linking retractions to works.

Free API

Continuous

Canonical institution identifiers (the disambiguation backbone).

Free, CC0

Tier 2 — curated sources (the case data + signal)
Weekly

Notable plagiarism cases (Category:Plagiarism controversies, scientific misconduct).

Free, CC-BY-SA

Daily

Global news-volume index + recent coverage (current-events signal).

Free, DOC 2.0 API

Gerichtsakten (CourtListener) und Unternehmensmeldungen (SEC EDGAR) wurden geprüft, aber nicht aufgenommen: Ihre Volltext-Übereinstimmungen sind zu unspezifisch, um sie zuverlässig zuzuordnen. EU-Rechtsprechung und nationale Berichte zu wissenschaftlichem Fehlverhalten (UK QAA, Deutsche DFG) sind als manuelle Quellen geplant.
Datenquellen & Datenqualität — Plagiatsstatistiken