Як ми обчислюємо ці показники.
Кожен показник на цьому сайті — це коефіцієнт відкликання публікацій через плагіат: скільки відкликань за плагіат припадає на країну, установу чи галузь, поділене на кількість опублікованих робіт. На цій сторінці докладно описано, як отримано кожне число, рівень статистичної впевненості та упередження, які слід враховувати при цитуванні.
Як ми рахуємо
Чисельник формується з бази даних Retraction Watch (розміщено на Crossref, близько 70 000 записів). Ми залишаємо лише ті записи, де причиною вказано суворий код plagiarism of/in — тобто явний висновок про плагіат, а не м’якші сигнали на кшталт «евфемізмів плагіату» чи дублювання. За 2015–2024 це 1,879 унікальних записів.
Прив’язка до установи та галузі здійснюється за DOI статті через OpenAlex — ніколи не за текстовим полем афіліації Retraction Watch. OpenAlex вже зіставив афіліації кожної роботи з канонічними ідентифікаторами ROR і визначив галузь, тому пошук за DOI повертає коректну установу та галузь. Обробка текстового поля афіліації натомість часто веде з назви кафедри й співставляє фрагменти з хибною установою — таку помилкову атрибуцію ми принципово виключаємо.
Близько 91% записів про плагіат містять DOI; приблизно 90% з них співставляються з установою ROR, тобто близько чотирьох з п’яти записів мають канонічну атрибуцію до установи.
Як ми нормалізуємо дані
Сирі підрахунки вводять в оману: системи з високою науковою продуктивністю накопичують більше відкликань публікацій просто тому, що публікують більше. За абсолютною кількістю лідирує China із 564; за коефіцієнтом — 7.0 на 100 тис. Тому ми наводимо саме коефіцієнти, і система побудована так, що не може ранжувати за абсолютною кількістю.
Якість джерела для кожного показника
Кожна статистика містить позначку про спосіб її отримання, щоб ви могли оцінити її перед цитуванням.
Direct measurement
Counted from primary records (Retraction Watch).
Curated aggregate
Compiled from multiple primary sources.
Modeled / inferred
Statistical extrapolation with stated confidence.
Survey-based
Self-reported, with sampling limitations.
Відомі упередження та обмеження
Відтворіть самостійно
Весь процес — це дві безкоштовні HTTP-запити без ключів і об’єднання. Жодних API-ключів, платних рівнів немає.
# 1. База даних Retraction Watch (~65MB CSV) curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \ -o retraction_watch.csv # 2. Публікації OpenAlex за країнами, 2015–2024 (знаменник) curl "https://api.openalex.org/works?filter=publication_year:2015-2024\ &group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com" # 3. Залишити записи лише з чіткою причиною 'плагіат у/з', зіставити за DOI, # поділити на кількість публікацій, ×100 000. Для довірчого інтервалу — інтервал Вілсона.
Референсна реалізація знаходиться у пайплайні проєкту stats/.