Plaģiātisma statistika
Metodoloģija

Kā mēs iegūstam šos rādītājus.

Katrs šajā vietnē norādītais rādītājs ir publikāciju atsaukšanas koeficients plaģiātisma dēļ: cik daudz publikāciju atsaukumu plaģiātisma dēļ ir reģistrēts valstī, institūcijā vai zinātnes nozarē, dalīts ar attiecīgajā periodā publicēto darbu skaitu. Šajā lapā ir detalizēti aprakstīts, kā tiek iegūts katrs rādītājs, kādu uzticamības pakāpi tam piešķiram un kādi aizspriedumi jāņem vērā, atsaucoties uz šiem datiem.

1. solis

Kā mēs skaitām

Skaitītājs tiek iegūts no Retraction Watch datubāzes (hostē Crossref, aptuveni 70 000 ierakstu). Tiek atlasīti tikai tie ieraksti, kuru iemesls ir ar stingro kodu plagiarism of/in — tas nozīmē nepārprotamu plaģiātisma konstatējumu, nevis netiešus signālus, piemēram, "plaģiātisma eifēmismi" vai dublēšanos. 2015–2024 periodā tas ir 1,879 unikālu ierakstu.

Svarīgā savietošana

Institūciju un zinātnes nozaru piesaiste notiek pēc publikācijas DOI izmantojot OpenAlex — nekad pēc Retraction Watch brīvā teksta afilācijas lauka. OpenAlex jau ir piesaistījis katra darba afilācijas atbilstošajiem ROR identifikatoriem un norādījis zinātnes nozari, tāpēc DOI meklēšana atgriež korektu institūciju un nozari. Ja izmantotu brīvā teksta afilāciju, tā bieži sākas ar nodaļu un fragmentāri piesaista nepareizai institūcijai — šādu kļūdainu piesaisti mēs apzināti nepieļaujam.

Aptuveni 91% plaģiātisma ierakstu ir DOI; apmēram 90% no tiem ir piesaistīti ROR institūcijai, tātad aptuveni četri no pieciem ierakstiem ir piesaistīti kanoniskai institūcijai.

Datu avotiRetraction Watch (atsaukšanas gadījumi un iemesli), OpenAlex (publikācijas, afilācijas, zinātnes nozares), Crossref (DOI metadati), ROR (institūciju identifikācija). Visi dati ir brīvi pieejami un ar atvērtu licenci.
SaucejsOpenAlex publikāciju skaits attiecīgajai vienībai un periodam. Valstu rādītāji izmanto autoru afilācijas valsti; institūciju rādītāji — ROR identifikatoru.
2. solis

Kā tiek veikta normalizācija

Neapstrādāti skaitļi var maldināt: valstīs ar lielāku zinātnisko izstrādņu apjomu ir vairāk atsaukumu vienkārši tāpēc, ka tiek publicēts vairāk. Pēc absolūtā skaita līderis ir China ar 564; pēc rādītāja tas ir 7.0 uz 100 000 publikācijām. Tāpēc mēs ziņojam par rādītājiem, un sistēma ir izveidota tā, lai nevarētu sakārtot vienības pēc absolūtā skaita.

Rādītājs uz 100 000 publikācijāmGalvenais rādītājs katrai vienībai. Salīdzināms starp dažāda lieluma vienībām.
Wilson 95% uzticamības intervāliKatram rādītājam ir savs intervāls. Mazs skaitītājs rada plašus intervālus — tas norāda, ka rādītājs jāinterpretē piesardzīgi, nevis kā precīzu vērtību.
Slīdošie logi, nevis atsevišķi gadiAtsaukumi parasti notiek vairākus gadus pēc sākotnējās publikācijas, tāpēc viens gads ir pārāk īss periods analīzei. Noklusējuma vienība ir vairāku gadu periods.
Apjoma slieksnisVienības ar mazāk nekā 100 000 publikācijām attiecīgajā periodā netiek iekļautas — pārāk mazs publikāciju skaits padara rādītāju statistiski nenozīmīgu.
3. solis

Datu avota kvalitāte pie katra skaitļa

Katra statistika ir apzīmēta ar tās iegūšanas metodi, lai jūs varētu izvērtēt to pirms citēšanas.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Iesakām izlasīt vispirms

Zināmie aizspriedumi un ierobežojumi

Mēs mēram atklāto plaģiātu, nevis izdarīto plaģiātuŠie ir atsaukumi, kas ir konstatēti un reģistrēti. Pastāv reāla un nemērāma atšķirība starp atklāto un faktisko rādītāju; mēs nekad neuzdodam šos skaitļus par kopējo plaģiāta līmeni.
Angļu valodas indeksācijas aizspriedumsRetraction Watch un OpenAlex pārsvarā aptver angļu valodā izdotus žurnālus. Valstīs ar stingrāku uzraudzību var tikt atklāts (un tādējādi reģistrēts) vairāk gadījumu, kas nenozīmē, ka to notiek vairāk.
Nepilnīga pārklājuma aptvereAtsauču avotu pārklājums atšķiras pa reģioniem; mēs izslēdzam vienības, kuru pārklājums ir pārāk nepietiekams, lai aprēķinātu ticamu rādītāju.
Saucejs šobrīd ir visas publikācijas (pagaidām)Pašreizējais saucējs ietver visas OpenAlex publikācijas, ne tikai zinātniskos rakstus, tādējādi rādītāji ir nedaudz zemi. Precīzāks, tikai rakstiem balstīts saucējs ir plānots kā uzlabojums.
Pētniekiem

Atkārtojiet pats

Visa datu apstrādes ķēde sastāv no diviem bezmaksas, atslēgu neprasošiem HTTP pieprasījumiem un datu savienošanas. Nav API atslēgu, nav maksas līmeņu.

# 1. Retraction Watch datubāze (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. OpenAlex publikācijas pēc valstīm, 2015–2024 (saucējs)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Saglabājiet tikai ierakstus ar precīzu 'plagiarism of/in' iemeslu, sasaistiet pēc DOI,
#    daliet ar publikāciju skaitu, ×100 000. Wilson intervāls ticamības intervālam.

Atsauces ieviešana atrodas projekta stats/ datu apstrādes ķēdē.

Citēt un atkārtoti izmantot

Dati publicēti saskaņā ar CC-BY 4.0 licenci — brīvi izmantojami, arī komerciāli, norādot atsauci uz Noplag Plagiarism Statistics.

Atpakaļ uz datiem
Kā mēs aprēķinām plaģiātisma statistiku — metodoloģija