Plagiaatstatistieken
Methodologie

Hoe wij deze cijfers berekenen.

Elke waarde op deze site is een plagiaatretractiecoëfficiënt: het aantal retracties wegens plagiaat dat een land, instelling of vakgebied heeft opgelopen, gedeeld door het aantal publicaties. Op deze pagina wordt precies beschreven hoe elk cijfer tot stand komt, welke mate van betrouwbaarheid wij eraan toekennen en met welke vertekeningen u rekening moet houden bij het citeren.

Stap 1

Hoe wij tellen

De teller is afkomstig uit de Retraction Watch-database (gehost door Crossref, circa 70 000 records). We nemen alleen records op waarvan de reden de strikte code plagiarism of/in bevat — een expliciete vaststelling van plagiaat, niet mildere signalen zoals "eufemismen voor plagiaat" of duplicatie. Over 2015–2024 zijn dat 1,879 unieke records.

De relevante koppeling

Toewijzing aan instelling en vakgebied gebeurt via koppeling op het DOI van het artikel met OpenAlex — nooit op het vrije-tekst-affiliatieveld van Retraction Watch. OpenAlex heeft voor elk werk de affiliaties reeds gekoppeld aan canonieke ROR-identificatoren en het vakgebied getagd, zodat een DOI-zoekopdracht de juiste instelling en discipline oplevert. Vrije-tekst-affiliaties leiden doorgaans met de afdeling en matchen fragmenten aan de verkeerde instelling — een foutieve toewijzing die wij expliciet uitsluiten.

Ongeveer 91% van de plagiaatrecords bevat een DOI; circa 90% daarvan is gekoppeld aan een ROR-instelling, dus ongeveer vier op de vijf records zijn toe te wijzen aan een canonieke instelling.

BronnenRetraction Watch (retractie-incidenten + redenen), OpenAlex (publicaties, affiliaties, vakgebieden), Crossref (DOI-metadata), ROR (instellingsidentiteit). Allemaal vrij beschikbaar en met open licentie.
NoemerOpenAlex-publicatietellingen voor dezelfde entiteit en periode. Landentellingen zijn gebaseerd op het land van de auteursaffiliatie; instellingstellingen gebruiken de ROR-identificator.
Stap 2

Hoe we normaliseren

Ruwe aantallen zijn misleidend: onderzoeksstelsels met hoge output kennen meer retracties, simpelweg omdat ze meer publiceren. Op basis van ruwe aantallen voert China de lijst aan met 564; op basis van de genormaliseerde ratio is dat 7.0 per 100k. Daarom rapporteren wij ratios, en het systeem is zo ingericht dat het niet mogelijk is om entiteiten te rangschikken op absolute aantallen.

Ratio per 100.000 publicatiesDe kernmaat voor elke entiteit. Vergelijkbaar tussen entiteiten van sterk uiteenlopende omvang.
Wilson 95%-betrouwbaarheidsintervallenElke ratio heeft een betrouwbaarheidsinterval. Kleine tellers geven brede intervallen — een signaal om de ratio voorzichtig te interpreteren en niet als een puntinschatting.
Rollende vensters, geen losse jarenRetracties volgen vaak pas jaren na de oorspronkelijke publicatie, waardoor één jaar te weinig data oplevert voor analyse. De standaardperiode is daarom een meerjarig venster.
Ondergrens voor volumeEntiteiten met minder dan 100.000 publicaties in het venster worden niet getoond — te weinig publicaties maken de ratio statistisch onbetrouwbaar.
Stap 3

Bronkwaliteit bij elk cijfer

Elke statistiek is voorzien van informatie over de wijze van totstandkoming, zodat u deze kunt beoordelen voordat u citeert.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Lees dit eerst

Bekende vertekeningen en beperkingen

Wij meten gedetecteerd plagiaat, niet gepleegd plagiaatDit betreft retracties die zijn opgespoord en geregistreerd. Het verschil tussen gedetecteerde en werkelijke ratios bestaat en is onbekend; wij presenteren deze cijfers nooit als totale plagiaatratio's.
Vertekening door Engelstalige indexeringRetraction Watch en OpenAlex geven een oververtegenwoordiging van Engelstalige tijdschriften. In een land met strenge controle wordt mogelijk meer gedetecteerd (en dus geregistreerd), maar dat betekent niet noodzakelijk dat er meer wordt gepleegd.
Ongelijke dekkingDe dekking van bronnen verschilt per regio; we laten entiteiten weg waarvan de dekking te beperkt is om een betrouwbare ratio te berekenen.
Noemer omvat alle publicaties (voorlopig)De huidige noemer telt alle OpenAlex-publicaties, niet alleen tijdschriftartikelen, waardoor de ratio's licht worden onderschat. Een striktere noemer met alleen artikelen is gepland als verbetering.
Voor onderzoekers

Zelf reproduceren

De volledige workflow bestaat uit twee gratis HTTP-aanroepen zonder API-sleutels, plus een join. Geen API-sleutels, geen betaalde niveaus.

# 1. Retraction Watch-database (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. OpenAlex-publicaties per land, 2015–2024 (de noemer)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Behoud alleen records met een strikte 'plagiaat van/in'-reden, koppel via DOI,
#    deel door het aantal publicaties, ×100.000. Wilson-interval voor het betrouwbaarheidsinterval.

De referentie-implementatie bevindt zich in de stats/-pipeline van het project.

Citeren & hergebruiken

De gegevens zijn gepubliceerd onder CC-BY 4.0 — vrij te hergebruiken, ook commercieel, mits naamsvermelding van Noplag Plagiarism Statistics.

Terug naar de gegevens
Hoe wij plagiaatstatistieken berekenen — methodologie