noplagApache 2.0
Thống kê đạo văn
Phương pháp luận

Cách chúng tôi tính toán các số liệu này.

Mỗi số liệu trên trang này là một tỷ lệ rút bài do đạo văn: số lượng bài báo bị rút vì đạo văn mà một quốc gia, cơ sở nghiên cứu hoặc lĩnh vực ghi nhận, chia cho tổng số bài báo mà đối tượng đó đã công bố. Trang này trình bày chi tiết cách từng số liệu được tạo ra, mức độ tin cậy đi kèm và các sai lệch cần lưu ý khi trích dẫn.

Bước 1

Cách chúng tôi đếm

Tử số lấy từ cơ sở dữ liệu Retraction Watch (được Crossref lưu trữ, khoảng 70 000 bản ghi). Chúng tôi chỉ giữ các bản ghi có lý do mang mã plagiarism of/in — tức là xác định rõ ràng hành vi đạo văn, không bao gồm các dấu hiệu nhẹ hơn như “nói giảm nói tránh về đạo văn” hoặc trùng lặp. Trong 2015–2024 có 1,879 bản ghi riêng biệt.

Liên kết quan trọng

Việc gán tổ chức và ngành nghiên cứu được liên kết dựa trên DOI của bài báo thông qua OpenAlex — không bao giờ dựa trên trường thông tin liên kết tự do văn bản của Retraction Watch. OpenAlex đã chuẩn hóa thông tin liên kết của từng công trình thành các định danh ROR chuẩn và gắn nhãn ngành nghiên cứu, nên tra cứu DOI sẽ trả về đúng tổ chức và lĩnh vực. Nếu thay vào đó giải quyết chuỗi liên kết tự do văn bản, hệ thống sẽ ưu tiên tên khoa/phòng ban và có thể ghép nhầm các đoạn thông tin với tổ chức không chính xác — đây là việc gán sai mà chúng tôi nghiêm cấm.

Khoảng 91% bản ghi đạo văn có DOI; khoảng 90% trong số đó xác định được cơ sở nghiên cứu ROR, tức là khoảng bốn trên năm bản ghi được gán cho một cơ sở nghiên cứu chuẩn hóa.

Nguồn dữ liệuRetraction Watch (sự kiện rút bài + lý do), OpenAlex (bài báo, liên kết, lĩnh vực), Crossref (siêu dữ liệu DOI), ROR (định danh cơ sở nghiên cứu). Tất cả đều miễn phí và có giấy phép mở.
Mẫu sốSố lượng bài báo từ OpenAlex cho cùng đối tượng và khoảng thời gian. Thống kê theo quốc gia dựa trên quốc gia liên kết tác giả; thống kê theo cơ sở dựa trên định danh ROR.
Bước 2

Cách chúng tôi chuẩn hóa

Số lượng tuyệt đối gây hiểu nhầm: các hệ thống nghiên cứu có sản lượng cao sẽ có nhiều bài bị thu hồi hơn chỉ vì họ xuất bản nhiều hơn. Nếu tính theo số lượng tuyệt đối, China dẫn đầu với 564; nhưng nếu tính theo tỷ lệ thì là 7.0 trên 100k. Vì vậy, chúng tôi báo cáo theo tỷ lệ, và hệ thống được thiết kế để không thể xếp hạng các đơn vị theo số lượng tuyệt đối.

Tỷ lệ trên 100 000 bài báo khoa họcChỉ số chính cho mỗi đơn vị. Có thể so sánh giữa các đơn vị có quy mô rất khác nhau.
Khoảng tin cậy Wilson 95%Mỗi tỷ lệ đều có một khoảng tin cậy. Mẫu số nhỏ sẽ cho khoảng tin cậy rộng — đây là dấu hiệu cần đọc tỷ lệ một cách thận trọng, không nên coi là giá trị điểm.
Cửa sổ trượt nhiều năm, không phải từng năm riêng lẻViệc thu hồi bài báo thường xảy ra sau nhiều năm kể từ khi bài gốc được xuất bản, nên số liệu từng năm riêng lẻ quá ít để phân tích. Đơn vị mặc định là một khoảng thời gian nhiều năm.
Ngưỡng tối thiểu về số lượngCác đơn vị có dưới 100 000 bài báo trong khoảng thời gian xét sẽ bị loại bỏ — số lượng quá ít khiến tỷ lệ trở thành nhiễu thống kê.
Bước 3

Chất lượng nguồn dữ liệu, với từng con số

Mỗi thống kê đều được gắn nhãn về cách thức tạo ra, giúp bạn cân nhắc trước khi trích dẫn.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Đọc phần này trước

Các thiên lệch & giới hạn đã biết

Chúng tôi đo lường đạo văn được phát hiện, không phải đạo văn thực tế đã xảy raĐây là các trường hợp thu hồi bài do đạo văn đã được phát hiện và ghi nhận. Khoảng cách giữa tỷ lệ phát hiện và tỷ lệ thực tế là có thật và chưa đo lường được; chúng tôi không bao giờ trình bày các số liệu này như là tỷ lệ đạo văn tổng thể.
Thiên lệch do chỉ mục hóa các tạp chí tiếng AnhRetraction Watch và OpenAlex có xu hướng bao phủ quá nhiều tạp chí tiếng Anh. Một quốc gia có kiểm soát chặt chẽ có thể phát hiện (và ghi nhận) nhiều trường hợp hơn, nhưng không nhất thiết là có nhiều vi phạm hơn.
Phạm vi bao phủ không đồng đềuPhạm vi bao phủ nguồn dữ liệu khác nhau theo khu vực; chúng tôi loại bỏ các đơn vị có phạm vi bao phủ quá hạn chế để không thể tính toán hệ số một cách hợp lý.
Mẫu số hiện tại là tất cả các xuất bản phẩm (tạm thời)Mẫu số hiện tại tính tất cả các xuất bản phẩm trong OpenAlex, không chỉ bài báo khoa học, dẫn đến hệ số hơi thấp hơn thực tế. Việc thu hẹp mẫu số chỉ còn bài báo khoa học là một cải tiến dự kiến.
Dành cho nhà nghiên cứu

Tự tái lập kết quả

Toàn bộ quy trình gồm hai lệnh HTTP miễn phí, không cần khóa API, cộng với thao tác nối dữ liệu. Không yêu cầu khóa API, không có gói trả phí.

# 1. Cơ sở dữ liệu Retraction Watch (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. Xuất bản phẩm OpenAlex theo quốc gia, 2015–2024 (mẫu số)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Giữ lại các bản ghi có lý do rõ ràng là 'đạo văn', liên kết qua DOI,
#    chia cho số xuất bản phẩm, nhân 100 000. Khoảng tin cậy Wilson cho CI.

Triển khai tham chiếu nằm trong pipeline stats/ của dự án.

Trích dẫn & tái sử dụng

Dữ liệu được công bố theo CC-BY 4.0 — tự do tái sử dụng, kể cả cho mục đích thương mại, với điều kiện ghi nhận nguồn Noplag Plagiarism Statistics.

Quay lại dữ liệu
Cách chúng tôi tính toán thống kê đạo văn — phương pháp luận