Plagiato statistika
Metodologija

Kaip apskaičiuojame šiuos rodiklius.

Kiekvienas šioje svetainėje pateikiamas rodiklis yra publikacijų atšaukimų dėl plagiato koeficientas: kiek atšaukimų dėl plagiato teko šaliai, institucijai ar mokslo krypčiai, padalinta iš jų paskelbtų publikacijų skaičiaus. Šiame puslapyje detaliai aprašoma, kaip tiksliai gaunamas kiekvienas skaičius, kokį pasikliautinumo lygį jam priskiriame ir kokius šališkumus būtina įvertinti cituojant šiuos duomenis.

1 žingsnis

Kaip skaičiuojame

Skaitiklis gaunamas iš Retraction Watch duomenų bazės (talpinama Crossref, apie 70 000 įrašų). Paliekami tik tie įrašai, kurių priežastis pažymėta griežtu kodu plagiarism of/in — tai aiškus plagiato nustatymas, o ne švelnesni signalai, tokie kaip „plagiato eufemizmai“ ar dubliavimas. Per 2015–2024 laikotarpį tai sudaro 1,879 unikalių įrašų.

Svarbus susiejimas

Institucijos ir mokslo krypties priskyrimas vykdomas pagal publikacijos DOI per OpenAlex — niekada pagal Retraction Watch laisvo teksto afiliacijos lauką. OpenAlex jau yra susiejęs kiekvienos publikacijos afiliacijas su standartizuotais ROR identifikatoriais ir priskyręs mokslo kryptį, todėl DOI užklausa grąžina teisingą instituciją ir sritį. Laisvo teksto afiliacijos eilutės analizė dažnai veda prie departamento pavadinimo ir fragmentų priskyrimo neteisingai institucijai — tokį klaidingą priskyrimą aiškiai draudžiame.

Apie 91 % plagiato įrašų turi DOI; iš jų apie 90 % susiejami su ROR institucija, tad maždaug keturi iš penkių įrašų priskiriami standartizuotai institucijai.

ŠaltiniaiRetraction Watch (atšaukimo įvykiai ir priežastys), OpenAlex (publikacijos, afiliacijos, mokslo kryptys), Crossref (DOI metaduomenys), ROR (institucijų identifikacija). Visi šaltiniai yra laisvai prieinami ir atvirai licencijuoti.
VardiklisOpenAlex publikacijų skaičius tai pačiai esybei ir laikotarpiui. Šalių skaičiavimuose naudojama autorių afiliacijos šalis; institucijų — ROR identifikatorius.
2 žingsnis

Kaip normalizuojame duomenis

Pirminiai skaičiai klaidina: didelės publikacijų apimties mokslo sistemos sukaupia daugiau publikacijų atšaukimų vien dėl to, kad išleidžia daugiau straipsnių. Pagal pirminį skaičių China pirmauja su 564; pagal koeficientą jis siekia 7.0 100 tūkst. publikacijų. Todėl pateikiame koeficientus, o sistema sukurta taip, kad negalima reitinguoti pagal absoliutų skaičių.

Koeficientas 100 000 publikacijųPagrindinis kiekvieno subjekto rodiklis. Leidžia palyginti labai skirtingo dydžio subjektus.
Wilson 95 % pasikliautinasis intervalasKiekvienas koeficientas turi intervalą. Maži skaitikliai lemia plačius intervalus — tai signalas koeficientą vertinti atsargiai, o ne kaip taškinį įvertį.
Slenkantys laikotarpiai, o ne pavieniai metaiPublikacijų atšaukimai dažnai atsilieka nuo pirminio straipsnio keleriais metais, todėl vienerių metų duomenų nepakanka analizei. Numatytoji analizės trukmė — kelių metų laikotarpis.
Mažiausia apimtisSubjektai, kurių laikotarpio publikacijų skaičius nesiekia 100 000, neįtraukiami — per mažas publikacijų skaičius lemia statistinį triukšmą.
3 žingsnis

Šaltinio patikimumas prie kiekvieno skaičiaus

Kiekvienas statistinis rodiklis pažymėtas, kaip jis buvo apskaičiuotas, kad galėtumėte įvertinti jo patikimumą prieš cituodami.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Pirmiausia perskaitykite

Žinomi šališkumai ir ribotumai

Matavome aptiktą, o ne padarytą plagiatąTai yra užfiksuoti ir įrašyti publikacijų atšaukimai dėl plagiato. Tarpas tarp aptikto ir tikrojo koeficiento egzistuoja ir nėra išmatuotas; šių skaičių niekada nepateikiame kaip bendro plagiato lygio.
Anglų kalbos indeksavimo šališkumasRetraction Watch ir OpenAlex duomenyse dominuoja angliakalbiai žurnalai. Šalis, kurioje vykdoma griežta priežiūra, gali aptikti (ir užfiksuoti) daugiau atvejų, bet tai nereiškia, kad jų įvyksta daugiau.
Netolygus aprėptisŠaltinių aprėptis skiriasi pagal regionus; neįtraukiame subjektų, kurių aprėptis per menka, kad būtų galima apskaičiuoti pagrįstą rodiklį.
Dalyba iš visų publikacijų (kol kas)Šiuo metu vardiklyje skaičiuojamos visos OpenAlex publikacijos, ne tik žurnalo straipsniai, todėl rodikliai šiek tiek nuvertinami. Tik žurnalo straipsnių pagrindu apskaičiuojamas vardiklis yra planuojamas patikslinimas.
Tyrėjams

Atkurkite patys

Visa duomenų apdorojimo grandinė – tai du nemokami HTTP užklausimai be raktų ir sujungimas. Nereikia API raktų, nėra mokamų planų.

# 1. Retraction Watch duomenų bazė (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. OpenAlex publikacijos pagal šalį, 2015–2024 m. (vardiklis)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Palikite tik įrašus su griežta „plagiarism of/in“ priežastimi, susiekite pagal DOI,
#    padalykite iš publikacijų skaičiaus, padauginkite iš 100 000. Wilson intervalas pasikliautinio intervalo skaičiavimui.

Pavyzdinė realizacija pateikta projekto stats/ duomenų apdorojimo grandinėje.

Cituokite ir naudokite pakartotinai

Duomenys publikuojami pagal CC-BY 4.0 – laisvai naudojami, įskaitant komercinį panaudojimą, nurodant Noplag Plagiarism Statistics kaip šaltinį.

Grįžti prie duomenų
Kaip skaičiuojame plagiato statistiką — metodologija