Plagiaadistatistika
Metoodika

Kuidas me neid arve arvutame.

Kõik sellel lehel esitatud näitajad on plagiaadi tõttu tagasivõtmiste koefitsiendid: mitu plagiaadijuhtumi tõttu tagasivõetud publikatsiooni on riigil, asutusel või teadusvaldkonnal, jagatuna nende sama perioodi publikatsioonide koguarvuga. Sellel lehel on dokumenteeritud, kuidas iga näitaja on arvutatud, millise usaldusväärsuse me sellele omistame ning milliste kallutatustega tuleb arvu tsiteerimisel arvestada.

Samm 1

Kuidas me loendame

Loenduri andmed pärinevad Retraction Watch'i andmebaasist (hostitud Crossrefis, umbes 70 000 kirjet). Arvesse lähevad ainult need kirjed, mille põhjuseks on rangelt märgitud plagiarism of/in — selge plagiaadileid, mitte leebemad viited nagu „plagiaadi eufemismid” või dubleerimine. Perioodil 2015–2024 on see 1,879 unikaalset kirjet.

Oluline ühendamine

Asutuse ja teadusvaldkonna omistamine toimub artikli DOI kaudu OpenAlexi andmestikus — mitte kunagi Retraction Watch'i vabatest tekstiväljadest. OpenAlex on juba sidunud iga töö asutused ametlike ROR identifikaatoritega ja märgistanud teadusvaldkonna, seega DOI päring tagastab õige asutuse ja valdkonna. Vabatekstilise asutusevälja lahendamine viib sageli osakonna tasemele ja võib viia vale asutuse omistamiseni — sellist ekslikku omistamist me välistame.

Ligikaudu 91% plagiaadikirjetest sisaldab DOI-d; neist umbes 90% on seotud ROR asutusega, seega umbes neli viiest kirjest on seotud ametliku asutusega.

AllikadRetraction Watch (tagasivõtmiste sündmused ja põhjused), OpenAlex (publikatsioonid, asutused, teadusvaldkonnad), Crossref (DOI metaandmed), ROR (asutuse identiteet). Kõik andmed on tasuta ja avatud litsentsiga.
NimetajaOpenAlexi publikatsioonide arvud sama üksuse ja perioodi kohta. Riikide puhul kasutatakse autorite asutuste riiki; asutuste puhul ROR identifikaatorit.
Samm 2

Kuidas me normaliseerime

Toorandmete põhjal tehtud võrdlused on eksitavad: suurema teadusväljundiga süsteemides on tagasikutsumisi rohkem lihtsalt seetõttu, et avaldatakse rohkem. Toorandmete järgi juhib China 564 juhtumiga; normaliseeritud määra järgi on see 7.0 100 000 publikatsiooni kohta. Seetõttu esitame tulemused määradena ning süsteem on üles ehitatud nii, et ei saa järjestada üksusi absoluutarvu alusel.

Määr 100 000 publikatsiooni kohtaIga üksuse põhinäitaja. Võimaldab võrrelda väga erineva suurusega üksusi.
Wilsoni 95% usaldusvahemikudIga määraga kaasneb usaldusvahemik. Väikese loenduri korral on vahemik lai — see on signaal, et määra tuleks käsitleda ettevaatlikult, mitte punktihinnanguna.
Liikuvad aknad, mitte üksikud aastadTagasikutsumised järgivad algupärast artiklit aastatepikkuse viitega, mistõttu üks aasta on graafiku jaoks liiga hõre. Vaikimisi kasutatakse mitmeaastast ajavahemikku.
Mahtude alampiirÜksused, millel on vahemikus alla 100 000 publikatsiooni, jäetakse välja — liiga väike publikatsioonide arv muudab määra statistiliselt ebausaldusväärseks.
Samm 3

Allika usaldusväärsus iga näitaja juures

Iga statistika on märgistatud teabega selle koostamise kohta, et saaksite enne viitamist hinnata selle usaldusväärsust.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Lugege see esmalt läbi

Teadaolevad kallutatused ja piirangud

Mõõdame tuvastatud plagiaati, mitte toimepandud plagiaatiNeed on tagasikutsumised, mis on avastatud ja registreeritud. Tuvastatud ja tegelike määrade vahe on reaalne ja mõõtmata; me ei esita neid andmeid kunagi kui kogu plagiaadi määra.
Inglise keele kallutatus indekseerimiselRetraction Watch ja OpenAlex kajastavad ülemäära ingliskeelseid ajakirju. Riik, kus järelevalve on tugev, võib tuvastada (ja seega registreerida) rohkem juhtumeid, kuid see ei tähenda, et neid ka rohkem toime pannakse.
Ebaühtlane katvusAllikate katvus erineb piirkonniti; jätame välja üksused, mille katvus on liiga napp, et võimaldada usaldusväärset määra.
Nimetaja on kõik tööd (praegu)Praegune nimetaja hõlmab kõiki OpenAlexi töid, mitte ainult ajakirjaartikleid, mistõttu määrad on veidi alahinnatud. Kitsam ainult artiklite põhine nimetaja on plaanitud täpsustus.
Teadlastele

Reprodutseeri ise

Kogu töövoog koosneb kahest tasuta, võtmeta HTTP-päringust ja liitmisest. API võtmeid ega tasulisi tasemeid pole.

# 1. Retraction Watch andmebaas (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. OpenAlexi publikatsioonid riikide lõikes, 2015–2024 (nimetaja)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Jäta alles kirjed, mille põhjus on rangelt 'plagiaat', seosta DOI kaudu,
#    jaga publikatsioonide arvuga, korruta 100 000-ga. Wilsoni intervall usaldusvahemikuks.

Viite-implementatsioon asub projekti stats/ töövoos.

Viita ja taaskasuta

Andmed on avaldatud CC-BY 4.0 litsentsi alusel — vaba taaskasutus, sh äriliselt, viitega Noplag Plagiarism Statisticsile.

Tagasi andmete juurde
Kuidas me arvutame plagiaadistatistikat — metoodika