Kaip apskaičiuojame šiuos rodiklius.
Kiekvienas šioje svetainėje pateikiamas rodiklis yra publikacijų atšaukimų dėl plagiato koeficientas: kiek atšaukimų dėl plagiato teko šaliai, institucijai ar mokslo krypčiai, padalinta iš jų paskelbtų publikacijų skaičiaus. Šiame puslapyje detaliai aprašoma, kaip tiksliai gaunamas kiekvienas skaičius, kokį pasikliautinumo lygį jam priskiriame ir kokius šališkumus būtina įvertinti cituojant šiuos duomenis.
Kaip skaičiuojame
Skaitiklis gaunamas iš Retraction Watch duomenų bazės (talpinama Crossref, apie 70 000 įrašų). Paliekami tik tie įrašai, kurių priežastis pažymėta griežtu kodu plagiarism of/in — tai aiškus plagiato nustatymas, o ne švelnesni signalai, tokie kaip „plagiato eufemizmai“ ar dubliavimas. Per 2015–2024 laikotarpį tai sudaro 1,879 unikalių įrašų.
Institucijos ir mokslo krypties priskyrimas vykdomas pagal publikacijos DOI per OpenAlex — niekada pagal Retraction Watch laisvo teksto afiliacijos lauką. OpenAlex jau yra susiejęs kiekvienos publikacijos afiliacijas su standartizuotais ROR identifikatoriais ir priskyręs mokslo kryptį, todėl DOI užklausa grąžina teisingą instituciją ir sritį. Laisvo teksto afiliacijos eilutės analizė dažnai veda prie departamento pavadinimo ir fragmentų priskyrimo neteisingai institucijai — tokį klaidingą priskyrimą aiškiai draudžiame.
Apie 91 % plagiato įrašų turi DOI; iš jų apie 90 % susiejami su ROR institucija, tad maždaug keturi iš penkių įrašų priskiriami standartizuotai institucijai.
Kaip normalizuojame duomenis
Pirminiai skaičiai klaidina: didelės publikacijų apimties mokslo sistemos sukaupia daugiau publikacijų atšaukimų vien dėl to, kad išleidžia daugiau straipsnių. Pagal pirminį skaičių China pirmauja su 564; pagal koeficientą jis siekia 7.0 100 tūkst. publikacijų. Todėl pateikiame koeficientus, o sistema sukurta taip, kad negalima reitinguoti pagal absoliutų skaičių.
Šaltinio patikimumas prie kiekvieno skaičiaus
Kiekvienas statistinis rodiklis pažymėtas, kaip jis buvo apskaičiuotas, kad galėtumėte įvertinti jo patikimumą prieš cituodami.
Direct measurement
Counted from primary records (Retraction Watch).
Curated aggregate
Compiled from multiple primary sources.
Modeled / inferred
Statistical extrapolation with stated confidence.
Survey-based
Self-reported, with sampling limitations.
Žinomi šališkumai ir ribotumai
Atkurkite patys
Visa duomenų apdorojimo grandinė – tai du nemokami HTTP užklausimai be raktų ir sujungimas. Nereikia API raktų, nėra mokamų planų.
# 1. Retraction Watch duomenų bazė (~65MB CSV) curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \ -o retraction_watch.csv # 2. OpenAlex publikacijos pagal šalį, 2015–2024 m. (vardiklis) curl "https://api.openalex.org/works?filter=publication_year:2015-2024\ &group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com" # 3. Palikite tik įrašus su griežta „plagiarism of/in“ priežastimi, susiekite pagal DOI, # padalykite iš publikacijų skaičiaus, padauginkite iš 100 000. Wilson intervalas pasikliautinio intervalo skaičiavimui.
Pavyzdinė realizacija pateikta projekto stats/ duomenų apdorojimo grandinėje.