noplagApache 2.0
Statistik Plagiarisme
Metodologi

Cara kami menghitung angka-angka ini.

Setiap angka di situs ini adalah koefisien pencabutan publikasi karena plagiarisme: berapa banyak pencabutan publikasi akibat plagiarisme yang terjadi pada suatu negara, institusi, atau bidang ilmu, dibagi dengan jumlah publikasi yang dihasilkan. Halaman ini mendokumentasikan secara rinci bagaimana setiap angka dihitung, tingkat kepercayaan yang kami lampirkan, serta bias yang perlu Anda perhatikan saat mengutipnya.

Langkah 1

Cara kami menghitung

Pembilang diambil dari Retraction Watch database (di-host oleh Crossref, sekitar 70.000 data). Kami hanya mempertahankan data dengan alasan pencabutan yang memuat kode ketat plagiarism of/in — temuan plagiarisme yang eksplisit, bukan indikasi ringan seperti “eufemisme plagiarisme” atau duplikasi. Dalam 2015–2024 terdapat 1,879 data unik.

Penggabungan yang relevan

Atribusi institusi dan bidang ilmu dilakukan dengan menggabungkan DOI artikel melalui OpenAlex — tidak pernah menggunakan kolom afiliasi teks bebas milik Retraction Watch. OpenAlex telah memetakan afiliasi setiap karya ke pengenal ROR yang baku dan menandai bidang ilmunya, sehingga pencarian DOI akan mengembalikan institusi dan bidang yang benar. Jika menggunakan afiliasi teks bebas, hasilnya sering kali hanya nama departemen dan dapat mencocokkan fragmen ke institusi yang salah — atribusi keliru yang secara eksplisit kami larang.

Sekitar 91% data plagiarisme memiliki DOI; sekitar 90% dari jumlah tersebut terhubung ke institusi ROR, sehingga kira-kira empat dari lima data dapat diatribusikan ke institusi baku.

Sumber dataRetraction Watch (peristiwa pencabutan + alasan), OpenAlex (publikasi, afiliasi, bidang ilmu), Crossref (metadata DOI), ROR (identitas institusi). Seluruhnya bebas dan berlisensi terbuka.
PenyebutJumlah publikasi OpenAlex untuk entitas dan periode waktu yang sama. Penghitungan per negara menggunakan negara afiliasi penulis; penghitungan per institusi menggunakan pengenal ROR.
Langkah 2

Cara kami melakukan normalisasi

Jumlah mentah dapat menyesatkan: sistem riset dengan output tinggi akan memiliki lebih banyak pencabutan publikasi hanya karena mereka menerbitkan lebih banyak. Berdasarkan jumlah mentah, China memimpin dengan 564; berdasarkan rasio, posisinya adalah 7.0 per 100 ribu. Oleh karena itu, kami melaporkan rasio, dan sistem ini dirancang agar tidak dapat mengurutkan entitas berdasarkan jumlah absolut.

Rasio per 100.000 publikasiMetode utama untuk setiap entitas. Dapat dibandingkan lintas entitas dengan ukuran sangat berbeda.
Interval kepercayaan Wilson 95%Setiap rasio disertai interval kepercayaan. Pembilang yang kecil menghasilkan interval yang lebar — ini menandakan agar rasio dibaca dengan hati-hati, bukan sebagai estimasi titik tunggal.
Jendela waktu bergulir, bukan tahun tunggalPencabutan publikasi biasanya terjadi beberapa tahun setelah artikel asli, sehingga satu tahun terlalu sedikit untuk divisualisasikan. Satuan default adalah jendela multi-tahun.
Ambang volumeEntitas dengan kurang dari 100.000 publikasi dalam jendela waktu tidak ditampilkan — jumlah publikasi yang terlalu sedikit membuat rasio menjadi derau statistik.
Langkah 3

Kualitas sumber pada setiap angka

Setiap statistik diberi label metode produksinya, sehingga Anda dapat mempertimbangkannya sebelum mengutip.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Baca ini terlebih dahulu

Bias & batasan yang diketahui

Kami mengukur plagiarisme yang terdeteksi, bukan plagiarisme yang dilakukanIni adalah pencabutan publikasi yang teridentifikasi dan tercatat. Kesenjangan antara tingkat terdeteksi dan tingkat aktual memang ada dan tidak terukur; kami tidak pernah menyajikan angka ini sebagai tingkat plagiarisme total.
Bias pengindeksan jurnal berbahasa InggrisRetraction Watch dan OpenAlex cenderung mewakili jurnal berbahasa Inggris secara berlebihan. Negara dengan pengawasan ketat mungkin mendeteksi (dan mencatat) lebih banyak, namun tidak berarti melakukan lebih banyak pelanggaran.
Cakupan tidak merataCakupan sumber bervariasi menurut wilayah; kami mengecualikan entitas dengan cakupan yang terlalu tipis untuk menghasilkan angka rasio yang dapat dipertanggungjawabkan.
Penyebut mencakup semua karya (sementara ini)Penyebut saat ini menghitung semua karya di OpenAlex, bukan hanya artikel jurnal, sehingga rasio sedikit tereduksi. Penyempurnaan dengan penyebut khusus artikel jurnal direncanakan.
Untuk peneliti

Reproduksi sendiri

Seluruh alur kerja hanya membutuhkan dua permintaan HTTP gratis tanpa kunci API, ditambah satu proses penggabungan. Tidak ada kunci API, tidak ada tingkatan berbayar.

# 1. Basis data Retraction Watch (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. Publikasi OpenAlex berdasarkan negara, 2015–2024 (penyebut)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Pilih data dengan alasan tegas 'plagiarisme terhadap/dalam', atribusikan melalui DOI,
#    bagi dengan jumlah publikasi, ×100.000. Gunakan interval Wilson untuk interval kepercayaan.

Implementasi referensi tersedia di pipeline stats/ proyek.

Sitasi & penggunaan ulang

Data dipublikasikan di bawah lisensi CC-BY 4.0 — bebas digunakan ulang, termasuk untuk tujuan komersial, dengan atribusi kepada Noplag Plagiarism Statistics.

Kembali ke data
Cara kami menghitung statistik plagiarisme — metodologi