Kuidas me neid arve arvutame.
Kõik sellel lehel esitatud näitajad on plagiaadi tõttu tagasivõtmiste koefitsiendid: mitu plagiaadijuhtumi tõttu tagasivõetud publikatsiooni on riigil, asutusel või teadusvaldkonnal, jagatuna nende sama perioodi publikatsioonide koguarvuga. Sellel lehel on dokumenteeritud, kuidas iga näitaja on arvutatud, millise usaldusväärsuse me sellele omistame ning milliste kallutatustega tuleb arvu tsiteerimisel arvestada.
Kuidas me loendame
Loenduri andmed pärinevad Retraction Watch'i andmebaasist (hostitud Crossrefis, umbes 70 000 kirjet). Arvesse lähevad ainult need kirjed, mille põhjuseks on rangelt märgitud plagiarism of/in — selge plagiaadileid, mitte leebemad viited nagu „plagiaadi eufemismid” või dubleerimine. Perioodil 2015–2024 on see 1,879 unikaalset kirjet.
Asutuse ja teadusvaldkonna omistamine toimub artikli DOI kaudu OpenAlexi andmestikus — mitte kunagi Retraction Watch'i vabatest tekstiväljadest. OpenAlex on juba sidunud iga töö asutused ametlike ROR identifikaatoritega ja märgistanud teadusvaldkonna, seega DOI päring tagastab õige asutuse ja valdkonna. Vabatekstilise asutusevälja lahendamine viib sageli osakonna tasemele ja võib viia vale asutuse omistamiseni — sellist ekslikku omistamist me välistame.
Ligikaudu 91% plagiaadikirjetest sisaldab DOI-d; neist umbes 90% on seotud ROR asutusega, seega umbes neli viiest kirjest on seotud ametliku asutusega.
Kuidas me normaliseerime
Toorandmete põhjal tehtud võrdlused on eksitavad: suurema teadusväljundiga süsteemides on tagasikutsumisi rohkem lihtsalt seetõttu, et avaldatakse rohkem. Toorandmete järgi juhib China 564 juhtumiga; normaliseeritud määra järgi on see 7.0 100 000 publikatsiooni kohta. Seetõttu esitame tulemused määradena ning süsteem on üles ehitatud nii, et ei saa järjestada üksusi absoluutarvu alusel.
Allika usaldusväärsus iga näitaja juures
Iga statistika on märgistatud teabega selle koostamise kohta, et saaksite enne viitamist hinnata selle usaldusväärsust.
Direct measurement
Counted from primary records (Retraction Watch).
Curated aggregate
Compiled from multiple primary sources.
Modeled / inferred
Statistical extrapolation with stated confidence.
Survey-based
Self-reported, with sampling limitations.
Teadaolevad kallutatused ja piirangud
Reprodutseeri ise
Kogu töövoog koosneb kahest tasuta, võtmeta HTTP-päringust ja liitmisest. API võtmeid ega tasulisi tasemeid pole.
# 1. Retraction Watch andmebaas (~65MB CSV) curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \ -o retraction_watch.csv # 2. OpenAlexi publikatsioonid riikide lõikes, 2015–2024 (nimetaja) curl "https://api.openalex.org/works?filter=publication_year:2015-2024\ &group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com" # 3. Jäta alles kirjed, mille põhjus on rangelt 'plagiaat', seosta DOI kaudu, # jaga publikatsioonide arvuga, korruta 100 000-ga. Wilsoni intervall usaldusvahemikuks.
Viite-implementatsioon asub projekti stats/ töövoos.