Jak tato čísla počítáme.
Každý údaj na tomto webu představuje koeficient stažení publikací z důvodu plagiátorství: kolik stažení kvůli plagiátorství připadá na daný stát, instituci nebo obor, děleno počtem jejich publikací. Tato stránka přesně popisuje, jak je každé číslo vypočteno, jakou mu přisuzujeme spolehlivost a jaká zkreslení je třeba při citování zohlednit.
Jak počítáme
Čitatel pochází z databáze Retraction Watch (hostované Crossref, přibližně 70 000 záznamů). Zahrnujeme pouze záznamy, jejichž důvod nese striktní kód plagiarism of/in — tedy explicitní zjištění plagiátorství, nikoli mírnější signály jako „eufemismy pro plagiátorství“ nebo duplikace. V období 2015–2024 jde o 1,879 unikátních záznamů.
Přiřazení instituce a oboru probíhá podle DOI článku přes OpenAlex — nikdy podle volného textu afiliace v Retraction Watch. OpenAlex již přiřadil každé práci afiliace ke kanonickým identifikátorům ROR a označil její obor, takže vyhledání podle DOI vrací správnou instituci i obor. Řešení pouze na základě volného textu afiliace vede často k přiřazení podle katedry a chybnému spojení s institucí — což znamená nesprávné přiřazení, které výslovně vylučujeme.
Přibližně 91 % záznamů o plagiátorství obsahuje DOI; asi 90 % z nich lze přiřadit ke konkrétní instituci podle ROR, takže zhruba čtyři z pěti záznamů jsou přiřazeny ke kanonické instituci.
Jak normalizujeme
Surové počty mohou zkreslovat: výzkumné systémy s vyšším výstupem mají více stažení článků jednoduše proto, že více publikují. Podle absolutního počtu vede China s 564; podle míry je to 7.0 na 100 tisíc. Proto uvádíme míry a systém je navržen tak, že nelze řadit subjekty podle absolutního počtu.
Kvalita zdroje u každého čísla
Každý údaj je označen způsobem svého vzniku, abyste jej mohli zohlednit při citování.
Direct measurement
Counted from primary records (Retraction Watch).
Curated aggregate
Compiled from multiple primary sources.
Modeled / inferred
Statistical extrapolation with stated confidence.
Survey-based
Self-reported, with sampling limitations.
Známé zkreslení a omezení
Replikujte sami
Celý postup tvoří dva bezplatné HTTP dotazy bez klíče a jedno spojení. Není potřeba API klíč ani placené úrovně.
# 1. Databáze Retraction Watch (~65MB CSV) curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \ -o retraction_watch.csv # 2. Publikace OpenAlex podle země, 2015–2024 (jmenovatel) curl "https://api.openalex.org/works?filter=publication_year:2015-2024\ &group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com" # 3. Zachovejte záznamy s přesným důvodem 'plagiarism of/in', přiřaďte podle DOI, # vydělte počtem publikací, ×100 000. Pro interval spolehlivosti použijte Wilsonův interval.
Referenční implementace je součástí pipeline v projektu stats/.