Statistiky plagiátorství
Metodika

Jak tato čísla počítáme.

Každý údaj na tomto webu představuje koeficient stažení publikací z důvodu plagiátorství: kolik stažení kvůli plagiátorství připadá na daný stát, instituci nebo obor, děleno počtem jejich publikací. Tato stránka přesně popisuje, jak je každé číslo vypočteno, jakou mu přisuzujeme spolehlivost a jaká zkreslení je třeba při citování zohlednit.

Krok 1

Jak počítáme

Čitatel pochází z databáze Retraction Watch (hostované Crossref, přibližně 70 000 záznamů). Zahrnujeme pouze záznamy, jejichž důvod nese striktní kód plagiarism of/in — tedy explicitní zjištění plagiátorství, nikoli mírnější signály jako „eufemismy pro plagiátorství“ nebo duplikace. V období 2015–2024 jde o 1,879 unikátních záznamů.

Důležité propojení

Přiřazení instituce a oboru probíhá podle DOI článku přes OpenAlex — nikdy podle volného textu afiliace v Retraction Watch. OpenAlex již přiřadil každé práci afiliace ke kanonickým identifikátorům ROR a označil její obor, takže vyhledání podle DOI vrací správnou instituci i obor. Řešení pouze na základě volného textu afiliace vede často k přiřazení podle katedry a chybnému spojení s institucí — což znamená nesprávné přiřazení, které výslovně vylučujeme.

Přibližně 91 % záznamů o plagiátorství obsahuje DOI; asi 90 % z nich lze přiřadit ke konkrétní instituci podle ROR, takže zhruba čtyři z pěti záznamů jsou přiřazeny ke kanonické instituci.

ZdrojeRetraction Watch (události stažení + důvody), OpenAlex (publikace, afiliace, obory), Crossref (metadata DOI), ROR (identita instituce). Vše volně dostupné a s otevřenou licencí.
JmenovatelPočty publikací podle OpenAlex pro stejný subjekt a časové období. Počty za státy vycházejí ze země afiliace autora; počty za instituce podle identifikátoru ROR.
Krok 2

Jak normalizujeme

Surové počty mohou zkreslovat: výzkumné systémy s vyšším výstupem mají více stažení článků jednoduše proto, že více publikují. Podle absolutního počtu vede China s 564; podle míry je to 7.0 na 100 tisíc. Proto uvádíme míry a systém je navržen tak, že nelze řadit subjekty podle absolutního počtu.

Míra na 100 000 publikacíHlavní metrika pro každou entitu. Umožňuje srovnání mezi subjekty velmi rozdílné velikosti.
Wilsonovy 95% intervaly spolehlivostiKaždá míra má svůj interval spolehlivosti. Malé čitatele vedou k širokým intervalům — to je signál, že je třeba hodnotu interpretovat opatrně, nikoli jako bodový odhad.
Posuvná časová okna, ne jednotlivé rokyStažení publikací následuje po původním článku často až po letech, proto je jeden rok příliš krátký na smysluplné zobrazení. Základní jednotkou je víceroleté časové okno.
Objemová hraniceEntity s méně než 100 000 publikacemi v daném okně nejsou zahrnuty — příliš malý počet publikací znamená, že míra je statisticky nevýznamná.
Krok 3

Kvalita zdroje u každého čísla

Každý údaj je označen způsobem svého vzniku, abyste jej mohli zohlednit při citování.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Nejprve si přečtěte toto

Známé zkreslení a omezení

Měříme zjištěný, ne spáchaný plagiátJde o stažení publikací, která byla odhalena a zaznamenána. Rozdíl mezi zjištěnou a skutečnou mírou je reálný a neměřený; tato čísla nikdy neprezentujeme jako celkové míry plagiátorství.
Zkreslení ve prospěch anglicky psaných časopisůRetraction Watch a OpenAlex nadměrně zastupují časopisy v angličtině. Země s důslednějším dohledem může zjistit (a tedy zaznamenat) více případů, což ale neznamená, že jich více spáchá.
Nerovnoměrné pokrytíPokrytí zdrojů se liší podle regionu; subjekty s příliš nízkým pokrytím, které neumožňuje vypočítat obhajitelný koeficient, vynecháváme.
Jmenovatelem jsou všechna díla (prozatím)Současný jmenovatel zahrnuje všechna díla v OpenAlex, nejen vědecké články, což mírně podhodnocuje koeficienty. Přesnější jmenovatel zahrnující pouze články je plánovaným vylepšením.
Pro výzkumníky

Replikujte sami

Celý postup tvoří dva bezplatné HTTP dotazy bez klíče a jedno spojení. Není potřeba API klíč ani placené úrovně.

# 1. Databáze Retraction Watch (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. Publikace OpenAlex podle země, 2015–2024 (jmenovatel)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Zachovejte záznamy s přesným důvodem 'plagiarism of/in', přiřaďte podle DOI,
#    vydělte počtem publikací, ×100 000. Pro interval spolehlivosti použijte Wilsonův interval.

Referenční implementace je součástí pipeline v projektu stats/.

Citace a opětovné využití

Data jsou zveřejněna pod licencí CC-BY 4.0 — volně k opětovnému použití, včetně komerčního, s uvedením zdroje Noplag Plagiarism Statistics.

Zpět k datům
Jak počítáme statistiky plagiátorství — metodika