Kiểm tra đạo văn cho nhà nghiên cứu trước khi nộp bài
Kiểm tra bản thảo trước nộp với 700 triệu+ tác phẩm học thuật. My Folders theo dõi xuất bản trước đây của quý vị để tự trích dẫn hợp lệ không tăng điểm. Endpoint lưu trú EU cho nghiên cứu chưa công bố nhạy cảm. Engine Apache 2.0 — có thể rà soát IRB.
Bốn vai trò nghiên cứu. Một quy trình tự kiểm tra.
Kiểm bản luận án trước khi nộp
Lặp lại giữa các chương. Theo dõi tự trích dẫn qua các bản nháp.
- Kiểm tra theo chương + lịch sử phiên bản
- Danh sách cho phép tự trích dẫn (ORCID + danh sách DOI của quý vị)
- Tài liệu tham khảo tự động loại bỏ
Kiểm bản thảo trước khi gửi tạp chí
iThenticate kiểm tra khi nộp; chúng tôi chạy trước đó.
- Chỉ số học thuật truy cập mở 700 triệu+
- Phân loại trích dẫn (trích dẫn vs diễn đạt lại không trích)
- Pro trả phí cố định · lặp không tính theo lần
Đánh giá tổng quan + đề xuất tài trợ
Tái sử dụng văn bản đề tài cũ là bình thường — đánh dấu chúng.
- Nhận diện xuất bản và tài trợ trước đây của quý vị
- Danh sách cho phép đồng tác giả (công trình trước của cộng sự)
- Xuất báo cáo phân loại PDF cho cộng sự
Đảm bảo chất lượng trước công bố toàn bộ lab
Phát hiện vấn đề ở tất cả bản nộp của phòng lab trong một hàng đợi.
- Folder cho mỗi dự án + cho từng postdoc
- Lưu trú EU cho dữ liệu chính/nhạy cảm
- Engine Apache 2.0 — phòng thủ trước IRB
Ba bước trước khi bản thảo lên cổng tạp chí.
Chạy lặp lại. Bắt các đoạn tự trích dẫn để không làm tăng điểm iThenticate / Crossref khi nộp. Nhận định phát hiện AI sẽ sớm có, để quý vị xem trước trước khi reviewer 2 nhắc tới.
01 · Nháp + danh sách cho phép
Tải lên nháp chương / bản thảo. Thêm ORCID + danh sách DOI của quý vị (danh sách cho phép) — xuất bản trước gắn nhãn SELF-CITE, không báo đạo văn. DOI đồng tác giả thêm nếu có hợp tác; engine nhận diện tái sử dụng học thuật hợp lệ.
02 · Chạy theo tầng
L1 winnowing → kiểm tra trực tiếp trên web hiện tại, L2 MinHash (v1.1) và L3 vector embeddings (v1.2) sẽ ra mắt sau. Phát hiện sao chép nguyên văn và gần nguyên văn; khả năng phát hiện diễn đạt lại sẽ có ở L2 và L3. Phân loại trích dẫn giúp tách biệt nội dung trích dẫn khỏi phần diễn đạt lại không trích dẫn. Hỗ trợ đa ngôn ngữ, với hiệu chuẩn phát hiện cho tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Ba Lan và Ukraina khi ra mắt; sẽ bổ sung thêm ngôn ngữ. Thời gian trung vị cho mỗi bản thảo: 47 giây.
03 · Xem lại + lặp lại
Báo cáo đánh dấu đoạn theo nhóm: SELF-CITE (riêng, mong đợi), CITED (trích dẫn rõ ràng, mong đợi), CITED-PARA (diễn đạt lại có trích, điểm thấp), UNCITED-PARA (cần chú ý), và AI-LIKELY (dải hiệu chỉnh ESL) sắp có. Có thể lặp lại — mã engine + snapshot corpus đóng dấu trên mọi báo cáo.
Sáu loại tái sử dụng học thuật hợp pháp — không loại nào nên tăng điểm quý vị.
Các trình kiểm tra hộp đen đánh dấu tất cả trùng lặp là đạo văn. Nhà nghiên cứu tái sử dụng văn bản hợp lệ thường xuyên. Đây là cách bộ phân loại xử lý.
01 · CHÍNH CÔNG TRÌNH TRƯỚC ĐÂY
Danh sách cho phép ORCID + DOI. Bài quý vị đã xuất bản trước đây sẽ gắn SELF-CITE khi phát hiện — không báo đạo văn. Thường gặp ở tổng quan ("như tôi lập luận trong Chen 2023…") và đề xuất khi xây dựng trên công trình xuất bản.
02 · ĐỒNG TÁC GIẢ
Thêm ORCID đồng tác giả vào danh sách cho phép. Bài đồng tác giả gắn CO-CITE. Có ích khi bản thảo dựa trên bài viết cùng viết với cộng sự — đoạn phương pháp chung dùng lại hợp lệ.
03 · VĂN BẢN THỪA KẾ PHÒNG LAB
Thư mục PI, corpus dùng chung: đoạn phương pháp chuẩn, quy trình lab, tuyên bố đạo đức dùng lặp ở các ấn phẩm lab. Gắn LAB-CITE và loại khỏi điểm. Boilerplate duyệt IRB không cần viết lại ở mọi bài.
04 · PRE-PRINT ĐANG CẤM ĐĂNG
arXiv / bioRxiv pre-print của chính quý vị cho bản thảo này. Bộ phân loại nhận diện chuyển dịch từ pre-print sang bản tạp chí và gắn là PREPRINT-SELF. Không tính vào điểm. Nếu tạp chí cấm pre-print, có thể cấu hình nghiêm ngặt hơn.
05 · TRÍCH DẪN RÚT LẠI
Tích hợp Crossref Retraction Watch đánh dấu đoạn trùng khớp chứa trích dẫn bài đã bị rút. Không thay đổi điểm — nhưng quý vị sẽ biết trước khi nộp. Bắt lỗi kiểu “tôi trích dẫn bài vừa bị rút tháng trước” sớm hơn reviewer 2.
06 · IRB / NHẠY CẢM
Endpoint lưu trú EU (api.eu.noplag.com) giữ bản thảo trong hạ tầng EU. Có thể tự triển khai engine hoàn toàn trong mạng nội bộ cho bản thảo HIPAA / GDPR / dữ liệu bệnh nhân. Apache 2.0 + Docker; không có lưu lượng ra ngoài VPC quý vị.
Tổ chức theo dự án. Dấu vết kiểm tra theo ngày.
Nhóm bản thảo theo dự án, năm lab, hoặc chu kỳ tài trợ. Chạy lại bản nháp trên chính engine commit cũ về sau — báo cáo có thể lặp lại sau nhiều tháng.
Ba yếu tố kiểm tra tiền công bố nhạy cảm cần.
Bản thảo không rời hạ tầng EU
Pro+ triển khai tới api.eu.noplag.com. Đặt tại các trung tâm dữ liệu Hetzner ở EU (Falkenstein + Helsinki). File gửi, fingerprint store và báo cáo đều ở EU. Mặc định tuân thủ GDPR; có DPA khi yêu cầu.
Chạy engine trong nội bộ tổ chức quý vị
Apache 2.0 + Docker compose. Toàn bộ pipeline phát hiện chạy hoàn toàn trên hạ tầng của quý vị. Tự cung cấp Postgres + Redis; chúng tôi cung cấp corpus dạng gói lập chỉ mục cho Enterprise. Không có lưu lượng rời khỏi VPC. Đúng cho dữ liệu thử nghiệm lâm sàng, case bệnh nhân, nghiên cứu dữ liệu gốc nhạy cảm/thương mại.
Xóa mọi dấu vân tay chúng tôi lưu của quý vị
Một cú nhấp trong Cài đặt. Trong 24h, mọi fingerprint, báo cáo, mục danh sách cho phép và metadata về tài khoản quý vị được xóa. Tuân thủ Điều 17 GDPR. Người dùng tự triển khai có quyền truy cập database; người dùng cloud có endpoint API xóa, đã ghi rõ.
Engine Apache 2.0 quý vị có thể để IRB kiểm trước duyệt.
Hầu hết kiểm tra phần mềm đạo văn tổ chức đều vướng các câu hỏi: bản thảo lưu ở đâu sau khi nộp, thuật toán đối sánh làm gì, dữ liệu bệnh nhân/nhạy cảm có rời hệ thống không, xóa dấu vân tay thế nào, có thể tái lập độ chính xác đã công bố không. Các bên đóng thường trả lời trên cuộc gọi bán hàng. Với Apache 2.0, IRB của quý vị có thể clone repo, chạy engine trên sandbox, kiểm tra luồng dữ liệu, xác minh đường xóa vân tay hoạt động đầu-cuối, và kiểm tra lại điểm F1 từng ngôn ngữ trên bộ test của họ. Chúng tôi không nói kiểm tra này nhanh hơn — mà nói IRB của quý vị có thể kết thúc kiểm tra. Đó là lý do các văn phòng dữ liệu nghiên cứu từng từ chối nhà cung cấp đạo văn mới nay ký dùng cái này.
Đọc hướng dẫn kiểm IRBNhững câu hỏi văn phòng nghiên cứu thực sự hỏi.
- Vì sao điểm trùng lặp thay đổi khi tôi thêm ORCID + danh sách DOI?
- Vì engine phân loại lại từng đoạn khớp công trình trong danh sách cho phép là SELF-CITE thay vì UNCITED-PARA. Các đoạn không biến mất — chỉ gắn nhãn khác. SELF-CITE gần như không tính vào điểm tổng. Ví dụ: luận án của quý vị trích pre-print mình hai lần và một bài của đồng tác giả, ba đoạn đó chuyển từ “tính điểm” sang “tái sử dụng học thuật hợp lệ”.
- Engine có huấn luyện trên bản thảo đã nộp không?
- Không. Chỉ sinh dấu vân tay (chỉ hash winnowing — dạng không thể đảo ngược) và lưu vào database riêng từng tenant. Văn bản xóa sau 30 ngày trừ khi bật lưu lâu hơn. Bộ phát hiện AI dùng Binoculars — sẽ có — huấn luyện sẵn trên corpus công khai; chúng tôi không thêm bản thảo người dùng vào bộ huấn luyện. Ghi rõ trong DPA.
- Pre-print arXiv / bioRxiv của tôi thì sao?
- Nếu quý vị thêm DOI pre-print vào danh sách cho phép, đoạn trùng nó sẽ gắn PREPRINT-SELF và không tính vào điểm trùng lặp. Engine nhận diện chuyện bản tạp chí nối tiếp pre-print là hợp lệ. Khác: Với các tạp chí cấm pre-print có thể chỉnh danh sách cho phép nghiêm hơn — nhưng đa số tạp chí lớn (Nature, Cell, NEJM, PLOS) chấp nhận pre-print và nhãn SELF này phù hợp chính sách.
- AI sẽ xử ESL đồng tác giả thế nào?
- AI detection sẽ sớm có mặt — nằm trong lộ trình v1.2. Khi triển khai, hệ thống sẽ hiệu chuẩn theo từng ngôn ngữ với kết quả điều chỉnh cho người dùng ESL. Nếu chữ ký từ vựng cho thấy tiếng Anh không phải bản ngữ (phổ biến trong hợp tác đa quốc gia), kết quả sẽ được gắn nhãn ESL ADJ cùng sai số còn lại đã được ghi nhận, thay vì khẳng định không có sai sót. Nghiên cứu của Liang et al. 2023 ghi nhận FPR 61,3% trên bài luận TOEFL với bộ phát hiện đơn giản; chúng tôi công bố phương pháp giảm thiểu tại /docs/developers/benchmarks. Đồng tác giả ESL không bị gắn cờ sai lệch.
- Có thể chạy engine trên cụm Slurm để check batch không?
- Có — Apache 2.0 + Docker. Chạy container engine trên các node tính toán của cụm; nạp dữ liệu từ hệ thống tệp dùng chung; xuất báo cáo dạng JSON đến nơi pipeline của bạn đọc. Phù hợp để kiểm tra hàng loạt kết quả phòng thí nghiệm trong một năm với bản snapshot corpus mới nhất. Có ví dụ script Slurm sbatch tại github.com/NoplagLabs/noplag-engine.
- Manuscript dữ liệu bệnh nhân/clinic thì sao?
- Tự triển khai trong VPC. Không có lưu lượng rời mạng. Engine không cần internet khi kiểm theo corpus lập chỉ mục (sẽ không có tầng kiểm web sống — phần đó tùy chọn). Triển khai hợp HIPAA nếu hạ tầng đúng; IT tổ chức chạy như dịch vụ nội bộ khác.
- Khác gì iThenticate ở bước nộp?
- iThenticate kiểm khi nộp và biên tập viên sẽ thấy — quý vị không lặp lại được. Noplag là tự kiểm trước khi nộp. Quy trình cascade so sánh tốt với nội dung truy cập mở (rộng hơn iThenticate sau Plan-S); hẹp hơn với tài liệu thuê/mua mà iThenticate được cấp phép. Xử lý tự trích dẫn là cái đa số nghiên cứu cần nhưng iThenticate làm chưa tốt.
- Có tích hợp với phần mềm quản lý tài liệu (Zotero / Mendeley / EndNote) không?
- Ingestion danh sách cho phép hỗ trợ BibTeX, RIS và trực tiếp từ ORCID API. Tải lên thư viện Zotero hoặc dán ORCID; danh sách cho phép sẽ lấy hết DOI của quý vị trong vài giây. Sync thời gian thực Mendeley + EndNote lên kế hoạch v1.2; hiện là lộ trình xuất file.
- Độ bao phủ đa ngôn ngữ cho tạp chí ngoài tiếng Anh thế nào?
- Hệ thống được hiệu chuẩn phát hiện cho tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Ba Lan và Ukraina khi ra mắt; sẽ bổ sung thêm ngôn ngữ. Hiệu quả nhất với các ngôn ngữ châu Âu (lịch sử hiệu chuẩn lâu dài). Chất lượng phát hiện được đánh giá trên PAN-PC-11; đánh giá theo từng ngôn ngữ nằm trong lộ trình. Đặc biệt phù hợp cho môi trường học thuật châu Âu và Nam Mỹ.
- Nếu bài tôi trích dẫn bị rút sau khi nộp thì sao?
- Tích hợp Crossref Retraction Watch sẽ đánh dấu mỗi lần kiểm lại bản thảo quý vị. Nếu đã nộp, quý vị nên báo biên tập viên (một số tạp chí yêu cầu xử lý rõ ràng khi bị rút sau nộp). Không đổi điểm trùng lặp, nhưng quý vị biết trước reviewer 2.
Chạy thử một chương qua quy trình. Xem chi tiết tự trích dẫn.
Tải vào bản thảo, một chương luận án, hoặc tổng quan đề tài. Thêm ORCID. Xem đoạn nào SELF-CITE, CITED, UNCITED-PARA, AI-LIKELY sắp có. Miễn phí tới 2.500 từ. Pro+ lưu trú EU bảo vệ bản nháp nhạy cảm.