Plagiatsstatistiken
Methodik

Wie wir diese Zahlen berechnen.

Jede Kennzahl auf dieser Seite ist eine Plagiatsrückzugsrate: Wie viele Rückzüge wegen Plagiats einer Staat, Institution oder Fachrichtung verzeichnet hat, geteilt durch die Anzahl der von ihr veröffentlichten Publikationen. Diese Seite dokumentiert im Detail, wie jede Zahl berechnet wird, welches Konfidenzniveau wir ihr zuweisen und welche Verzerrungen Sie beim Zitieren berücksichtigen sollten.

Schritt 1

Wie wir zählen

Der Zähler stammt aus der Retraction Watch-Datenbank (gehostet von Crossref, ca. 70 000 Einträge). Es werden nur Datensätze berücksichtigt, deren Grund den strikten Code plagiarism of/in trägt – also ein expliziter Plagiatsbefund, keine weicheren Hinweise wie „Euphemismen für Plagiat“ oder Duplikate. Im Zeitraum 2015–2024 sind das 1,879 eindeutige Einträge.

Die entscheidende Verknüpfung

Die Zuordnung von Institution und Fachgebiet erfolgt über die DOI der Publikation mittels OpenAlex – niemals über das Freitext-Affiliationsfeld von Retraction Watch. OpenAlex hat die Zugehörigkeiten jeder Publikation bereits auf kanonische ROR-Kennungen abgebildet und das Fachgebiet zugeordnet, sodass eine DOI-Abfrage die korrekte Institution und das richtige Fachgebiet liefert. Die Auflösung des Freitext-Affiliationsfelds hingegen beginnt mit der Abteilung und ordnet Textfragmente häufig der falschen Institution zu – eine fehlerhafte Zuordnung, die wir ausdrücklich ausschließen.

Etwa 91 % der Plagiatsdatensätze enthalten eine DOI; rund 90 % davon lassen sich einer ROR-Institution zuordnen, sodass etwa vier von fünf Datensätzen einer kanonischen Institution zugewiesen werden können.

QuellenRetraction Watch (Rückzugsereignisse und -gründe), OpenAlex (Publikationen, Zugehörigkeiten, Fachgebiete), Crossref (DOI-Metadaten), ROR (Institutionenidentität). Alle frei und offen lizenziert.
NennerOpenAlex-Publikationszahlen für dieselbe Entität und denselben Zeitraum. Für Länderzählungen wird das Land der Autorenaffiliation verwendet; für Institutionen die ROR-Kennung.
Schritt 2

Unsere Normalisierungsmethode

Rohzahlen führen in die Irre: Forschungsstandorte mit hoher Publikationsleistung verzeichnen mehr Rücknahmen, weil sie mehr veröffentlichen. Nach Rohzahl liegt China mit 564 vorn; nach Rate beträgt der Wert 7.0 pro 100 000. Wir berichten daher normierte Raten, und das System ist so konzipiert, dass es keine Rangfolge nach absoluten Zahlen zulässt.

Rate pro 100 000 PublikationenDie zentrale Kennzahl für jede Einheit. Vergleichbar über Einheiten sehr unterschiedlicher Größe hinweg.
Wilson-Konfidenzintervall (95 %)Jede Rate wird mit einem Intervall angegeben. Kleine Zähler führen zu breiten Intervallen – ein Hinweis, die Rate vorsichtig und nicht als Punktwert zu interpretieren.
Gleitende Zeitfenster, keine EinzeljahreZwischen Rücknahme und Originalpublikation liegen oft Jahre, daher sind Einzeljahre zu wenig aussagekräftig. Die Standardauswertung erfolgt über mehrjährige Zeitfenster.
MindestvolumenEinheiten mit weniger als 100 000 Publikationen im Zeitfenster werden nicht ausgewiesen – zu wenige Publikationen machen die Rate statistisch unzuverlässig.
Schritt 3

Quellenqualität bei jeder Zahl

Jede Kennzahl ist mit ihrer Erhebungsmethode gekennzeichnet, damit Sie sie vor einer Zitierung bewerten können.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Bitte zuerst lesen

Bekannte Verzerrungen und Einschränkungen

Wir messen nachgewiesenes, nicht begangenes PlagiatErfasst werden nur Rücknahmen, die entdeckt und dokumentiert wurden. Die Differenz zwischen nachgewiesenen und tatsächlichen Raten ist real und unbekannt; wir stellen diese Zahlen nie als Gesamtplagiatsraten dar.
Bias durch englischsprachige IndexierungRetraction Watch und OpenAlex erfassen englischsprachige Zeitschriften überproportional. Länder mit strenger Kontrolle entdecken (und dokumentieren) möglicherweise mehr Fälle, ohne tatsächlich mehr zu verursachen.
Uneinheitliche AbdeckungDie Abdeckung der Quellen variiert je nach Region; wir lassen Einheiten aus, deren Abdeckung zu gering ist, um eine belastbare Rate anzugeben.
Nenner sind alle Publikationen (vorläufig)Der aktuelle Nenner umfasst alle OpenAlex-Publikationen, nicht nur Zeitschriftenartikel, was die Raten geringfügig unterschätzt. Eine künftige Verfeinerung sieht einen Nenner vor, der ausschließlich Artikel umfasst.
Für Forschende

Selbst reproduzieren

Der gesamte Ablauf besteht aus zwei kostenlosen HTTP-Anfragen ohne API-Schlüssel sowie einem Join. Keine API-Keys, keine kostenpflichtigen Stufen.

# 1. Retraction Watch-Datenbank (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. OpenAlex-Publikationen nach Land, 2015–2024 (der Nenner)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Datensätze mit eindeutigem Grund 'Plagiat von/in' behalten, Zuordnung über DOI,
#    durch Publikationen teilen, ×100 000. Wilson-Intervall für das Konfidenzintervall.

Die Referenzimplementierung befindet sich in der stats/-Pipeline des Projekts.

Zitieren & wiederverwenden

Die Daten werden unter CC-BY 4.0 veröffentlicht — freie Nachnutzung, auch kommerziell, mit Namensnennung von Noplag Plagiarism Statistics.

Zurück zu den Daten
Wie wir Plagiatsstatistiken berechnen — Methodik