Wie wir diese Zahlen berechnen.
Jede Kennzahl auf dieser Seite ist eine Plagiatsrückzugsrate: Wie viele Rückzüge wegen Plagiats einer Staat, Institution oder Fachrichtung verzeichnet hat, geteilt durch die Anzahl der von ihr veröffentlichten Publikationen. Diese Seite dokumentiert im Detail, wie jede Zahl berechnet wird, welches Konfidenzniveau wir ihr zuweisen und welche Verzerrungen Sie beim Zitieren berücksichtigen sollten.
Wie wir zählen
Der Zähler stammt aus der Retraction Watch-Datenbank (gehostet von Crossref, ca. 70 000 Einträge). Es werden nur Datensätze berücksichtigt, deren Grund den strikten Code plagiarism of/in trägt – also ein expliziter Plagiatsbefund, keine weicheren Hinweise wie „Euphemismen für Plagiat“ oder Duplikate. Im Zeitraum 2015–2024 sind das 1,879 eindeutige Einträge.
Die Zuordnung von Institution und Fachgebiet erfolgt über die DOI der Publikation mittels OpenAlex – niemals über das Freitext-Affiliationsfeld von Retraction Watch. OpenAlex hat die Zugehörigkeiten jeder Publikation bereits auf kanonische ROR-Kennungen abgebildet und das Fachgebiet zugeordnet, sodass eine DOI-Abfrage die korrekte Institution und das richtige Fachgebiet liefert. Die Auflösung des Freitext-Affiliationsfelds hingegen beginnt mit der Abteilung und ordnet Textfragmente häufig der falschen Institution zu – eine fehlerhafte Zuordnung, die wir ausdrücklich ausschließen.
Etwa 91 % der Plagiatsdatensätze enthalten eine DOI; rund 90 % davon lassen sich einer ROR-Institution zuordnen, sodass etwa vier von fünf Datensätzen einer kanonischen Institution zugewiesen werden können.
Unsere Normalisierungsmethode
Rohzahlen führen in die Irre: Forschungsstandorte mit hoher Publikationsleistung verzeichnen mehr Rücknahmen, weil sie mehr veröffentlichen. Nach Rohzahl liegt China mit 564 vorn; nach Rate beträgt der Wert 7.0 pro 100 000. Wir berichten daher normierte Raten, und das System ist so konzipiert, dass es keine Rangfolge nach absoluten Zahlen zulässt.
Quellenqualität bei jeder Zahl
Jede Kennzahl ist mit ihrer Erhebungsmethode gekennzeichnet, damit Sie sie vor einer Zitierung bewerten können.
Direct measurement
Counted from primary records (Retraction Watch).
Curated aggregate
Compiled from multiple primary sources.
Modeled / inferred
Statistical extrapolation with stated confidence.
Survey-based
Self-reported, with sampling limitations.
Bekannte Verzerrungen und Einschränkungen
Selbst reproduzieren
Der gesamte Ablauf besteht aus zwei kostenlosen HTTP-Anfragen ohne API-Schlüssel sowie einem Join. Keine API-Keys, keine kostenpflichtigen Stufen.
# 1. Retraction Watch-Datenbank (~65MB CSV) curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \ -o retraction_watch.csv # 2. OpenAlex-Publikationen nach Land, 2015–2024 (der Nenner) curl "https://api.openalex.org/works?filter=publication_year:2015-2024\ &group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com" # 3. Datensätze mit eindeutigem Grund 'Plagiat von/in' behalten, Zuordnung über DOI, # durch Publikationen teilen, ×100 000. Wilson-Intervall für das Konfidenzintervall.
Die Referenzimplementierung befindet sich in der stats/-Pipeline des Projekts.