noplagApache 2.0
Статистика плагіату
Методологія

Як ми обчислюємо ці показники.

Кожен показник на цьому сайті — це коефіцієнт відкликання публікацій через плагіат: скільки відкликань за плагіат припадає на країну, установу чи галузь, поділене на кількість опублікованих робіт. На цій сторінці докладно описано, як отримано кожне число, рівень статистичної впевненості та упередження, які слід враховувати при цитуванні.

Крок 1

Як ми рахуємо

Чисельник формується з бази даних Retraction Watch (розміщено на Crossref, близько 70 000 записів). Ми залишаємо лише ті записи, де причиною вказано суворий код plagiarism of/in — тобто явний висновок про плагіат, а не м’якші сигнали на кшталт «евфемізмів плагіату» чи дублювання. За 2015–2024 це 1,879 унікальних записів.

Ключове зведення

Прив’язка до установи та галузі здійснюється за DOI статті через OpenAlex — ніколи не за текстовим полем афіліації Retraction Watch. OpenAlex вже зіставив афіліації кожної роботи з канонічними ідентифікаторами ROR і визначив галузь, тому пошук за DOI повертає коректну установу та галузь. Обробка текстового поля афіліації натомість часто веде з назви кафедри й співставляє фрагменти з хибною установою — таку помилкову атрибуцію ми принципово виключаємо.

Близько 91% записів про плагіат містять DOI; приблизно 90% з них співставляються з установою ROR, тобто близько чотирьох з п’яти записів мають канонічну атрибуцію до установи.

ДжерелаRetraction Watch (події відкликання + причини), OpenAlex (публікації, афіліації, галузі), Crossref (метадані DOI), ROR (ідентифікація установ). Усі — відкриті та з вільними ліцензіями.
ЗнаменникКількість публікацій за OpenAlex для тієї ж сутності та періоду. Для країн використовується країна афіліації автора; для установ — ідентифікатор ROR.
Крок 2

Як ми нормалізуємо дані

Сирі підрахунки вводять в оману: системи з високою науковою продуктивністю накопичують більше відкликань публікацій просто тому, що публікують більше. За абсолютною кількістю лідирує China із 564; за коефіцієнтом — 7.0 на 100 тис. Тому ми наводимо саме коефіцієнти, і система побудована так, що не може ранжувати за абсолютною кількістю.

Коефіцієнт на 100 000 публікаційОсновний показник для кожної сутності. Дозволяє порівнювати між сутностями дуже різного масштабу.
95% довірчі інтервали ВілсонаКожен коефіцієнт супроводжується інтервалом. Малі чисельники дають широкі інтервали — це сигнал сприймати коефіцієнт обережно, а не як точкову оцінку.
Рухомі вікна, а не окремі рокиВідкликання публікацій часто відстають від дати виходу статті на кілька років, тому дані за один рік надто розріджені для аналізу. За замовчуванням використовується багаторічне вікно.
Поріг обсягуСутності з менш ніж 100 000 публікацій у вікні не враховуються — надто мала кількість публікацій робить коефіцієнт статистичним шумом.
Крок 3

Якість джерела для кожного показника

Кожна статистика містить позначку про спосіб її отримання, щоб ви могли оцінити її перед цитуванням.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Спочатку ознайомтеся з цим

Відомі упередження та обмеження

Ми вимірюємо виявлений плагіат, а не фактично вчиненийЦе відкликання публікацій, які були виявлені та зафіксовані. Розрив між виявленими та реальними коефіцієнтами існує і не вимірюється; ми ніколи не подаємо ці дані як загальні коефіцієнти плагіату.
Упередження щодо англомовної індексаціїRetraction Watch та OpenAlex переважно охоплюють англомовні журнали. Країна з ефективним контролем може виявляти (і, відповідно, фіксувати) більше випадків, але це не означає, що їх вчиняють більше.
Нерівномірне охопленняОхоплення джерел залежить від регіону; ми не включаємо суб’єкти, для яких охоплення недостатнє для обґрунтованого розрахунку коефіцієнта.
Знаменник — усі праці (поки що)Поточний знаменник враховує всі праці з OpenAlex, а не лише журнальні статті, що дещо занижує коефіцієнти. Удосконалення з обмеженням лише до статей заплановано.
Для дослідників

Відтворіть самостійно

Весь процес — це дві безкоштовні HTTP-запити без ключів і об’єднання. Жодних API-ключів, платних рівнів немає.

# 1. База даних Retraction Watch (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. Публікації OpenAlex за країнами, 2015–2024 (знаменник)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Залишити записи лише з чіткою причиною 'плагіат у/з', зіставити за DOI,
#    поділити на кількість публікацій, ×100 000. Для довірчого інтервалу — інтервал Вілсона.

Референсна реалізація знаходиться у пайплайні проєкту stats/.

Цитування та повторне використання

Дані опубліковано за ліцензією CC-BY 4.0 — вільні для повторного використання, зокрема комерційного, із зазначенням авторства Noplag Plagiarism Statistics.

Повернутися до даних
Як ми обчислюємо статистику плагіату — методологія