Plagiatstatistik
Metodik

Hur vi beräknar dessa siffror.

Varje siffra på denna sida är en rektraktionskoefficient för plagiat: hur många rektraktioner för plagiat ett land, en institution eller ett ämnesområde har fått, dividerat med antalet publikationer. Denna sida dokumenterar exakt hur varje siffra tas fram, vilken statistisk säkerhet vi anger, samt de bias du bör beakta vid citering.

Steg 1

Så här räknar vi

Täljaren hämtas från Retraction Watch-databasen (hostad av Crossref, cirka 70 000 poster). Vi behåller endast poster där orsaken har den strikta koden plagiarism of/in — ett explicit plagiatbeslut, inte mjukare signaler som "eufemismer för plagiat" eller dubbletter. Under 2015–2024 är det 1,879 unika poster.

Den avgörande kopplingen

Kopplingen till institution och ämnesområde görs på artikelns DOI via OpenAlex — aldrig på Retraction Watchs fritextfält för tillhörighet. OpenAlex har redan kopplat varje publikation till kanoniska ROR-identiteter och ämnesklassificerat den, så en DOI-sökning ger korrekt institution och ämnesområde. Att istället tolka fritextfältet leder ofta till att avdelning anges först och fragment matchas mot fel institution — en felattribuering vi uttryckligen undviker.

Cirka 91 % av plagiatposterna har en DOI; cirka 90 % av dessa kopplas till en ROR-institution, så ungefär fyra av fem poster kan tillskrivas en kanonisk institution.

KällorRetraction Watch (rektraktionshändelser och orsaker), OpenAlex (publikationer, tillhörigheter, ämnesområden), Crossref (DOI-metadata), ROR (institutionsidentitet). Alla är fria och öppet licensierade.
NämnareOpenAlex-publikationsantal för samma enhet och tidsperiod. Landsdata baseras på författarens tillhörighetsland; institutionsdata på ROR-identitet.
Steg 2

Så här normaliserar vi

Råa antal är missvisande: forskningssystem med hög produktion får fler indragningar enbart för att de publicerar mer. Med råa antal leder China med 564; räknat som andel ligger det på 7.0 per 100k. Vi redovisar därför normaliserade tal, och systemet är utformat så att det inte går att rangordna enheter efter absoluta antal.

Andel per 100 000 publikationerHuvudmåttet för varje enhet. Jämförbart mellan enheter av mycket olika storlek.
Wilson 95 % konfidensintervallVarje andel har ett intervall. Små täljare ger breda intervall — en signal att tolka andelen försiktigt snarare än som en punktuppskattning.
Rullande fönster, inte enskilda årIndragningar sker ofta flera år efter ursprunglig publikation, så ett enskilt år ger för få datapunkter. Standard är därför ett flerårsintervall.
VolymgränsEnheter med färre än 100 000 publikationer under perioden utelämnas — för få publikationer gör andelen till statistiskt brus.
Steg 3

Källkvalitet anges för varje siffra

Varje statistikpunkt är märkt med hur den tagits fram, så att du kan bedöma den innan du citerar.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Läs detta först

Kända bias och begränsningar

Vi mäter upptäckt plagiat, inte begånget plagiatDetta gäller indragningar som har upptäckts och registrerats. Skillnaden mellan upptäckta och faktiska nivåer är verklig men okänd; vi presenterar aldrig dessa siffror som totala plagiatnivåer.
Bias mot engelskspråkig indexeringRetraction Watch och OpenAlex överrepresenterar engelskspråkiga tidskrifter. Ett land med stark kontroll kan upptäcka (och därmed registrera) fler fall, men behöver inte ha högre faktisk förekomst.
Ojämn täckningKälltäckningen varierar mellan regioner; vi utelämnar enheter vars täckning är för begränsad för att möjliggöra en försvarbar kvot.
Nämnaren är alla publikationer (tills vidare)Den nuvarande nämnaren omfattar alla OpenAlex-publikationer, inte enbart tidskriftsartiklar, vilket innebär att kvoterna underskattas något. En mer avgränsad nämnare med endast artiklar planeras som förbättring.
För forskare

Återskapa själv

Hela processen består av två kostnadsfria HTTP-anrop utan API-nycklar och en sammanslagning. Inga API-nycklar, inga betalnivåer.

# 1. Retraction Watch-databasen (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. OpenAlex-publikationer per land, 2015–2024 (nämnaren)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Behåll poster med strikt 'plagiarism of/in'-orsak, koppla via DOI,
#    dividera med antal publikationer, ×100 000. Wilson-intervall för konfidensintervallet.

Referensimplementeringen finns i projektets stats/-pipeline.

Citera och återanvänd

Data publiceras under CC-BY 4.0 — fri att återanvända, även kommersiellt, med angivande av källa till Noplag Plagiarism Statistics.

Tillbaka till data
Hur vi beräknar plagiatstatistik — metodik