Statystyki plagiatów
Metodologia

Jak obliczamy te wartości.

Każda liczba na tej stronie to współczynnik wycofań publikacji z powodu plagiatu: ile wycofań za plagiat przypada na dany kraj, instytucję lub dziedzinę, podzielone przez liczbę opublikowanych prac. Na tej stronie szczegółowo opisujemy sposób wyliczania każdej wartości, poziom ufności oraz potencjalne źródła błędów, które należy uwzględnić przy cytowaniu tych danych.

Krok 1

Jak liczymy

Licznik pochodzi z bazy Retraction Watch (hostowanej przez Crossref, ok. 70 000 rekordów). Uwzględniamy wyłącznie rekordy, których powód wycofania ma ścisły kod plagiarism of/in — czyli jednoznaczne stwierdzenie plagiatu, bez łagodniejszych sygnałów typu „eufemizmy plagiatu” czy duplikacja. W okresie 2015–2024 to 1,879 unikalnych rekordów.

Kluczowe połączenie

Przypisanie do instytucji i dziedziny odbywa się na podstawie DOI artykułu przez OpenAlex — nigdy na podstawie pola afiliacji w wolnym tekście z Retraction Watch. OpenAlex przypisał już każdej publikacji afiliacje do kanonicznych identyfikatorów ROR i oznaczył dziedzinę, więc wyszukiwanie po DOI zwraca poprawną instytucję i dziedzinę. Rozwiązywanie afiliacji z wolnego tekstu prowadzi do przypisania do wydziału i błędnego dopasowania fragmentów do niewłaściwej instytucji — takiej błędnej atrybucji wyraźnie zabrania się.

Około 91% rekordów plagiatów posiada DOI; około 90% z nich przypisuje się do instytucji ROR, więc mniej więcej cztery na pięć rekordów mają przypisanie do kanonicznej instytucji.

ŹródłaRetraction Watch (zdarzenia wycofań + powody), OpenAlex (publikacje, afiliacje, dziedziny), Crossref (metadane DOI), ROR (identyfikacja instytucji). Wszystkie źródła są bezpłatne i posiadają otwarte licencje.
MianownikLiczby publikacji z OpenAlex dla tej samej jednostki i okresu. Dla krajów liczone według kraju afiliacji autora; dla instytucji według identyfikatora ROR.
Krok 2

Jak normalizujemy

Surowe liczby są mylące: systemy naukowe o wysokiej produktywności mają więcej retrakcji, ponieważ publikują więcej. Według liczby bezwzględnej China prowadzi z wynikiem 564; według współczynnika to 7.0 na 100 tys. publikacji. Dlatego raportujemy współczynniki, a system został zaprojektowany tak, by nie mógł klasyfikować jednostek według liczby bezwzględnej.

Współczynnik na 100 000 publikacjiGłówny wskaźnik dla każdej jednostki. Porównywalny między jednostkami o bardzo różnej wielkości.
Przedziały ufności Wilsona 95%Każdy współczynnik ma swój przedział ufności. Małe liczniki powodują szerokie przedziały — to sygnał, by traktować współczynnik ostrożnie, a nie jako punktowe oszacowanie.
Okna kroczące, nie pojedyncze lataRetrakcje następują po publikacji artykułu z kilkuletnim opóźnieniem, więc pojedynczy rok to zbyt mała próba do analizy. Domyślną jednostką jest wieloletnie okno czasowe.
Próg liczby publikacjiJednostki z liczbą publikacji poniżej 100 000 w oknie czasowym są pomijane — zbyt mała liczba publikacji powoduje, że współczynnik jest statystycznym szumem.
Krok 3

Jakość źródła przy każdej liczbie

Każda statystyka jest oznaczona informacją o sposobie jej pozyskania, aby można było ocenić jej wiarygodność przed cytowaniem.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Przeczytaj najpierw

Znane ograniczenia i stronniczości

Mierzymy wykryty plagiat, nie popełniony plagiatTo są retrakcje, które zostały wykryte i zarejestrowane. Różnica między wykrytym a rzeczywistym współczynnikiem jest realna i niezmierzona; nigdy nie przedstawiamy tych danych jako całkowitych współczynników plagiatu.
Stronniczość indeksowania na język angielskiRetraction Watch i OpenAlex nadreprezentują czasopisma anglojęzyczne. Kraj z silnym nadzorem może wykrywać (a więc rejestrować) więcej przypadków, co nie oznacza, że popełnia ich więcej.
Nierównomierny zakres danychZakres źródeł różni się w zależności od regionu; pomijamy jednostki, dla których zakres danych jest zbyt ograniczony, by wyliczyć wiarygodny współczynnik.
Mianownik obejmuje wszystkie prace (na razie)Obecnie mianownik obejmuje wszystkie prace z OpenAlex, nie tylko artykuły naukowe, co nieznacznie zaniża współczynniki. W przyszłości planowane jest zawężenie do samych artykułów.
Dla badaczy

Odtwórz samodzielnie

Cały proces to dwa bezpłatne wywołania HTTP bez kluczy oraz jedno łączenie danych. Bez kluczy API, bez płatnych poziomów dostępu.

# 1. Baza Retraction Watch (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. Publikacje OpenAlex według kraju, 2015–2024 (mianownik)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Zachowaj rekordy z jednoznacznym powodem 'plagiat w/z', przypisz po DOI,
#    podziel przez liczbę publikacji, ×100 000. Przedział ufności Wilsona.

Referencyjna implementacja znajduje się w projekcie, w pipeline stats/.

Cytowanie i ponowne wykorzystanie

Dane są udostępnione na licencji CC-BY 4.0 — można je swobodnie wykorzystywać, także komercyjnie, z podaniem źródła: Noplag Plagiarism Statistics.

Powrót do danych
Jak obliczamy statystyki plagiatów — metodologia