Cách chúng tôi tính toán các số liệu này.
Mỗi số liệu trên trang này là một tỷ lệ rút bài do đạo văn: số lượng bài báo bị rút vì đạo văn mà một quốc gia, cơ sở nghiên cứu hoặc lĩnh vực ghi nhận, chia cho tổng số bài báo mà đối tượng đó đã công bố. Trang này trình bày chi tiết cách từng số liệu được tạo ra, mức độ tin cậy đi kèm và các sai lệch cần lưu ý khi trích dẫn.
Cách chúng tôi đếm
Tử số lấy từ cơ sở dữ liệu Retraction Watch (được Crossref lưu trữ, khoảng 70 000 bản ghi). Chúng tôi chỉ giữ các bản ghi có lý do mang mã plagiarism of/in — tức là xác định rõ ràng hành vi đạo văn, không bao gồm các dấu hiệu nhẹ hơn như “nói giảm nói tránh về đạo văn” hoặc trùng lặp. Trong 2015–2024 có 1,879 bản ghi riêng biệt.
Việc gán tổ chức và ngành nghiên cứu được liên kết dựa trên DOI của bài báo thông qua OpenAlex — không bao giờ dựa trên trường thông tin liên kết tự do văn bản của Retraction Watch. OpenAlex đã chuẩn hóa thông tin liên kết của từng công trình thành các định danh ROR chuẩn và gắn nhãn ngành nghiên cứu, nên tra cứu DOI sẽ trả về đúng tổ chức và lĩnh vực. Nếu thay vào đó giải quyết chuỗi liên kết tự do văn bản, hệ thống sẽ ưu tiên tên khoa/phòng ban và có thể ghép nhầm các đoạn thông tin với tổ chức không chính xác — đây là việc gán sai mà chúng tôi nghiêm cấm.
Khoảng 91% bản ghi đạo văn có DOI; khoảng 90% trong số đó xác định được cơ sở nghiên cứu ROR, tức là khoảng bốn trên năm bản ghi được gán cho một cơ sở nghiên cứu chuẩn hóa.
Cách chúng tôi chuẩn hóa
Số lượng tuyệt đối gây hiểu nhầm: các hệ thống nghiên cứu có sản lượng cao sẽ có nhiều bài bị thu hồi hơn chỉ vì họ xuất bản nhiều hơn. Nếu tính theo số lượng tuyệt đối, China dẫn đầu với 564; nhưng nếu tính theo tỷ lệ thì là 7.0 trên 100k. Vì vậy, chúng tôi báo cáo theo tỷ lệ, và hệ thống được thiết kế để không thể xếp hạng các đơn vị theo số lượng tuyệt đối.
Chất lượng nguồn dữ liệu, với từng con số
Mỗi thống kê đều được gắn nhãn về cách thức tạo ra, giúp bạn cân nhắc trước khi trích dẫn.
Direct measurement
Counted from primary records (Retraction Watch).
Curated aggregate
Compiled from multiple primary sources.
Modeled / inferred
Statistical extrapolation with stated confidence.
Survey-based
Self-reported, with sampling limitations.
Các thiên lệch & giới hạn đã biết
Tự tái lập kết quả
Toàn bộ quy trình gồm hai lệnh HTTP miễn phí, không cần khóa API, cộng với thao tác nối dữ liệu. Không yêu cầu khóa API, không có gói trả phí.
# 1. Cơ sở dữ liệu Retraction Watch (~65MB CSV) curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \ -o retraction_watch.csv # 2. Xuất bản phẩm OpenAlex theo quốc gia, 2015–2024 (mẫu số) curl "https://api.openalex.org/works?filter=publication_year:2015-2024\ &group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com" # 3. Giữ lại các bản ghi có lý do rõ ràng là 'đạo văn', liên kết qua DOI, # chia cho số xuất bản phẩm, nhân 100 000. Khoảng tin cậy Wilson cho CI.
Triển khai tham chiếu nằm trong pipeline stats/ của dự án.