RESEARCHTiền nộp · Nhận diện tự trích dẫn · Lưu trú EU · Có thể rà soát IRB

Kiểm tra đạo văn cho nhà nghiên cứu trước khi nộp bài

Kiểm tra bản thảo trước nộp với 700 triệu+ tác phẩm học thuật. My Folders theo dõi xuất bản trước đây của quý vị để tự trích dẫn hợp lệ không tăng điểm. Endpoint lưu trú EU cho nghiên cứu chưa công bố nhạy cảm. Engine Apache 2.0 — có thể rà soát IRB.

700 triệu+ tác phẩm học thuậtDanh sách cho phép tự trích dẫnLưu trú EU · Có thể rà soát IRB
DÙ QUÝ VỊ Ở GIAI ĐOẠN NÀO TRONG QUY TRÌNH

Bốn vai trò nghiên cứu. Một quy trình tự kiểm tra.

TIẾN SĨ / NGHIÊN CỨU SINH

Kiểm bản luận án trước khi nộp

Lặp lại giữa các chương. Theo dõi tự trích dẫn qua các bản nháp.

  • Kiểm tra theo chương + lịch sử phiên bản
  • Danh sách cho phép tự trích dẫn (ORCID + danh sách DOI của quý vị)
  • Tài liệu tham khảo tự động loại bỏ
SAU TIẾN SĨ

Kiểm bản thảo trước khi gửi tạp chí

iThenticate kiểm tra khi nộp; chúng tôi chạy trước đó.

  • Chỉ số học thuật truy cập mở 700 triệu+
  • Phân loại trích dẫn (trích dẫn vs diễn đạt lại không trích)
  • Pro trả phí cố định · lặp không tính theo lần
VIẾT ĐỀ ÁN

Đánh giá tổng quan + đề xuất tài trợ

Tái sử dụng văn bản đề tài cũ là bình thường — đánh dấu chúng.

  • Nhận diện xuất bản và tài trợ trước đây của quý vị
  • Danh sách cho phép đồng tác giả (công trình trước của cộng sự)
  • Xuất báo cáo phân loại PDF cho cộng sự
TRƯỞNG NHÓM LAB

Đảm bảo chất lượng trước công bố toàn bộ lab

Phát hiện vấn đề ở tất cả bản nộp của phòng lab trong một hàng đợi.

  • Folder cho mỗi dự án + cho từng postdoc
  • Lưu trú EU cho dữ liệu chính/nhạy cảm
  • Engine Apache 2.0 — phòng thủ trước IRB
QUY TRÌNH TIỀN NỘP

Ba bước trước khi bản thảo lên cổng tạp chí.

Chạy lặp lại. Bắt các đoạn tự trích dẫn để không làm tăng điểm iThenticate / Crossref khi nộp. Nhận định phát hiện AI sẽ sớm có, để quý vị xem trước trước khi reviewer 2 nhắc tới.

01

01 · Nháp + danh sách cho phép

Tải lên nháp chương / bản thảo. Thêm ORCID + danh sách DOI của quý vị (danh sách cho phép) — xuất bản trước gắn nhãn SELF-CITE, không báo đạo văn. DOI đồng tác giả thêm nếu có hợp tác; engine nhận diện tái sử dụng học thuật hợp lệ.

02

02 · Chạy theo tầng

L1 winnowing → kiểm tra trực tiếp trên web hiện tại, L2 MinHash (v1.1) và L3 vector embeddings (v1.2) sẽ ra mắt sau. Phát hiện sao chép nguyên văn và gần nguyên văn; khả năng phát hiện diễn đạt lại sẽ có ở L2 và L3. Phân loại trích dẫn giúp tách biệt nội dung trích dẫn khỏi phần diễn đạt lại không trích dẫn. Hỗ trợ đa ngôn ngữ, với hiệu chuẩn phát hiện cho tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Ba Lan và Ukraina khi ra mắt; sẽ bổ sung thêm ngôn ngữ. Thời gian trung vị cho mỗi bản thảo: 47 giây.

03

03 · Xem lại + lặp lại

Báo cáo đánh dấu đoạn theo nhóm: SELF-CITE (riêng, mong đợi), CITED (trích dẫn rõ ràng, mong đợi), CITED-PARA (diễn đạt lại có trích, điểm thấp), UNCITED-PARA (cần chú ý), và AI-LIKELY (dải hiệu chỉnh ESL) sắp có. Có thể lặp lại — mã engine + snapshot corpus đóng dấu trên mọi báo cáo.

XỬ LÝ TỰ TRÍCH DẪN

Sáu loại tái sử dụng học thuật hợp pháp — không loại nào nên tăng điểm quý vị.

Các trình kiểm tra hộp đen đánh dấu tất cả trùng lặp là đạo văn. Nhà nghiên cứu tái sử dụng văn bản hợp lệ thường xuyên. Đây là cách bộ phân loại xử lý.

01 · CHÍNH CÔNG TRÌNH TRƯỚC ĐÂY

Danh sách cho phép ORCID + DOI. Bài quý vị đã xuất bản trước đây sẽ gắn SELF-CITE khi phát hiện — không báo đạo văn. Thường gặp ở tổng quan ("như tôi lập luận trong Chen 2023…") và đề xuất khi xây dựng trên công trình xuất bản.

02 · ĐỒNG TÁC GIẢ

Thêm ORCID đồng tác giả vào danh sách cho phép. Bài đồng tác giả gắn CO-CITE. Có ích khi bản thảo dựa trên bài viết cùng viết với cộng sự — đoạn phương pháp chung dùng lại hợp lệ.

03 · VĂN BẢN THỪA KẾ PHÒNG LAB

Thư mục PI, corpus dùng chung: đoạn phương pháp chuẩn, quy trình lab, tuyên bố đạo đức dùng lặp ở các ấn phẩm lab. Gắn LAB-CITE và loại khỏi điểm. Boilerplate duyệt IRB không cần viết lại ở mọi bài.

04 · PRE-PRINT ĐANG CẤM ĐĂNG

arXiv / bioRxiv pre-print của chính quý vị cho bản thảo này. Bộ phân loại nhận diện chuyển dịch từ pre-print sang bản tạp chí và gắn là PREPRINT-SELF. Không tính vào điểm. Nếu tạp chí cấm pre-print, có thể cấu hình nghiêm ngặt hơn.

05 · TRÍCH DẪN RÚT LẠI

Tích hợp Crossref Retraction Watch đánh dấu đoạn trùng khớp chứa trích dẫn bài đã bị rút. Không thay đổi điểm — nhưng quý vị sẽ biết trước khi nộp. Bắt lỗi kiểu “tôi trích dẫn bài vừa bị rút tháng trước” sớm hơn reviewer 2.

06 · IRB / NHẠY CẢM

Endpoint lưu trú EU (api.eu.noplag.com) giữ bản thảo trong hạ tầng EU. Có thể tự triển khai engine hoàn toàn trong mạng nội bộ cho bản thảo HIPAA / GDPR / dữ liệu bệnh nhân. Apache 2.0 + Docker; không có lưu lượng ra ngoài VPC quý vị.

MY FOLDERS · LAB VIEW

Tổ chức theo dự án. Dấu vết kiểm tra theo ngày.

Nhóm bản thảo theo dự án, năm lab, hoặc chu kỳ tài trợ. Chạy lại bản nháp trên chính engine commit cũ về sau — báo cáo có thể lặp lại sau nhiều tháng.

MY FOLDERS · Lab Dr. Hirano · CompBio24 bản thảo · 6 dự án
LƯU TRÚ EUTạo folder mới
FOLDERTÀI LIỆUHOẠT ĐỘNG GẦN NHẤTKHU VỰC
Dự án: nhóm biểu hiện PD-L18 bản thảokiểm nháp v3 · 2h trướcEU
Dự án: rà soát an toàn sinh học tổng hợp5 bản thảosẵn sàng nộp · hôm quaEU
Tài trợ: gia hạn NIH R01 năm 33 bản thảokiểm tổng quan v2 · 2 ngày trướcEU
Thừa kế phòng lab: phương pháp + văn bản đạo đức4 tài liệu · chia sẻcập nhật danh sách cho phép lab · 1 tuần trướcEU
Pre-print: đang chờ arXiv2 bản thảogắn PREPRINT-SELF · 1 tuần trướcEU
Lưu trữ (2022–2024)12 bàibộ tham chiếu tự trích dẫnEU
Tất cả folder lưu trú EU · mã hóa khi lưu · engine commit có thể rà soát IRB trên mọi báo cáotái lập: engine v0.4.2 đang chạy
700M+tác phẩm học thuật đã lập chỉ mục
5ngôn ngữ phát hiện khi ra mắt, đang mở rộng
EUđiểm lưu trú endpoint khả dụng
Apache2.0 · engine có thể rà soát IRB
Crossref+ tích hợp Retraction Watch
BẢO VỆ DỮ LIỆU

Ba yếu tố kiểm tra tiền công bố nhạy cảm cần.

01 · LƯU TRÚ EU

Bản thảo không rời hạ tầng EU

Pro+ triển khai tới api.eu.noplag.com. Đặt tại các trung tâm dữ liệu Hetzner ở EU (Falkenstein + Helsinki). File gửi, fingerprint store và báo cáo đều ở EU. Mặc định tuân thủ GDPR; có DPA khi yêu cầu.

Hữu ích cho hợp tác với đối tác EU theo yêu cầu bảo vệ dữ liệu Horizon Europe.
02 · TỰ TRIỂN KHAI

Chạy engine trong nội bộ tổ chức quý vị

Apache 2.0 + Docker compose. Toàn bộ pipeline phát hiện chạy hoàn toàn trên hạ tầng của quý vị. Tự cung cấp Postgres + Redis; chúng tôi cung cấp corpus dạng gói lập chỉ mục cho Enterprise. Không có lưu lượng rời khỏi VPC. Đúng cho dữ liệu thử nghiệm lâm sàng, case bệnh nhân, nghiên cứu dữ liệu gốc nhạy cảm/thương mại.

Kết hợp tốt với cụm Slurm và xác thực tổ chức sẵn (SAML, LDAP, OIDC).
03 · QUYỀN XÓA DẤU VÂN TAY

Xóa mọi dấu vân tay chúng tôi lưu của quý vị

Một cú nhấp trong Cài đặt. Trong 24h, mọi fingerprint, báo cáo, mục danh sách cho phép và metadata về tài khoản quý vị được xóa. Tuân thủ Điều 17 GDPR. Người dùng tự triển khai có quyền truy cập database; người dùng cloud có endpoint API xóa, đã ghi rõ.

Nhật ký xóa giữ lại để kiểm tra tuân thủ.
CÓ THỂ RÀ SOÁT IRB

Engine Apache 2.0 quý vị có thể để IRB kiểm trước duyệt.

Hầu hết kiểm tra phần mềm đạo văn tổ chức đều vướng các câu hỏi: bản thảo lưu ở đâu sau khi nộp, thuật toán đối sánh làm gì, dữ liệu bệnh nhân/nhạy cảm có rời hệ thống không, xóa dấu vân tay thế nào, có thể tái lập độ chính xác đã công bố không. Các bên đóng thường trả lời trên cuộc gọi bán hàng. Với Apache 2.0, IRB của quý vị có thể clone repo, chạy engine trên sandbox, kiểm tra luồng dữ liệu, xác minh đường xóa vân tay hoạt động đầu-cuối, và kiểm tra lại điểm F1 từng ngôn ngữ trên bộ test của họ. Chúng tôi không nói kiểm tra này nhanh hơn — mà nói IRB của quý vị có thể kết thúc kiểm tra. Đó là lý do các văn phòng dữ liệu nghiên cứu từng từ chối nhà cung cấp đạo văn mới nay ký dùng cái này.

Đọc hướng dẫn kiểm IRB
CÂU HỎI IRB, ĐÃ TRẢ LỜI
Q1Bản thảo đi đâu? — Postgres cách ly tenant tại EU nếu quý vị dùng endpoint lưu trú EU. Văn bản gốc xóa sau 30 ngày trừ khi bật lưu lâu hơn.
Q2Huấn luyện dựa trên bản nộp? — Không. Bản thảo nộp vào chỉ để sinh dấu vân tay (winnowing hash — không thể phục hồi). Văn bản xóa sau 30 ngày trừ khi bật lưu lâu hơn. Nêu rõ trong DPA.
Q3Dữ liệu bệnh nhân/nhạy cảm? — Tự triển khai engine hoàn toàn trong mạng quý vị. Không lưu lượng rời khỏi VPC. Triển khai tương thích HIPAA.
Q4Xem xét thuật toán? — Apache 2.0 tại github.com/NoplagLabs/noplag-engine. Dễ đọc, kiểm tra và tái tạo.
Q5Truy cập nhiều tổ chức? — Quản lý truy cập theo vai trò từng tenant. Có nhật ký kiểm tra cho mỗi lần đọc. Hoặc tự triển khai để dữ liệu không phải rời tổ chức quý vị.
Q6Xóa dấu vân tay? — Một cú nhấp trong Cài đặt. Hoàn thành 24h. Tuân thủ GDPR Điều 17. Lưu nhật ký kiểm tra.
FAQ

Những câu hỏi văn phòng nghiên cứu thực sự hỏi.

Vì sao điểm trùng lặp thay đổi khi tôi thêm ORCID + danh sách DOI?
Vì engine phân loại lại từng đoạn khớp công trình trong danh sách cho phép là SELF-CITE thay vì UNCITED-PARA. Các đoạn không biến mất — chỉ gắn nhãn khác. SELF-CITE gần như không tính vào điểm tổng. Ví dụ: luận án của quý vị trích pre-print mình hai lần và một bài của đồng tác giả, ba đoạn đó chuyển từ “tính điểm” sang “tái sử dụng học thuật hợp lệ”.
Engine có huấn luyện trên bản thảo đã nộp không?
Không. Chỉ sinh dấu vân tay (chỉ hash winnowing — dạng không thể đảo ngược) và lưu vào database riêng từng tenant. Văn bản xóa sau 30 ngày trừ khi bật lưu lâu hơn. Bộ phát hiện AI dùng Binoculars — sẽ có — huấn luyện sẵn trên corpus công khai; chúng tôi không thêm bản thảo người dùng vào bộ huấn luyện. Ghi rõ trong DPA.
Pre-print arXiv / bioRxiv của tôi thì sao?
Nếu quý vị thêm DOI pre-print vào danh sách cho phép, đoạn trùng nó sẽ gắn PREPRINT-SELF và không tính vào điểm trùng lặp. Engine nhận diện chuyện bản tạp chí nối tiếp pre-print là hợp lệ. Khác: Với các tạp chí cấm pre-print có thể chỉnh danh sách cho phép nghiêm hơn — nhưng đa số tạp chí lớn (Nature, Cell, NEJM, PLOS) chấp nhận pre-print và nhãn SELF này phù hợp chính sách.
AI sẽ xử ESL đồng tác giả thế nào?
AI detection sẽ sớm có mặt — nằm trong lộ trình v1.2. Khi triển khai, hệ thống sẽ hiệu chuẩn theo từng ngôn ngữ với kết quả điều chỉnh cho người dùng ESL. Nếu chữ ký từ vựng cho thấy tiếng Anh không phải bản ngữ (phổ biến trong hợp tác đa quốc gia), kết quả sẽ được gắn nhãn ESL ADJ cùng sai số còn lại đã được ghi nhận, thay vì khẳng định không có sai sót. Nghiên cứu của Liang et al. 2023 ghi nhận FPR 61,3% trên bài luận TOEFL với bộ phát hiện đơn giản; chúng tôi công bố phương pháp giảm thiểu tại /docs/developers/benchmarks. Đồng tác giả ESL không bị gắn cờ sai lệch.
Có thể chạy engine trên cụm Slurm để check batch không?
Có — Apache 2.0 + Docker. Chạy container engine trên các node tính toán của cụm; nạp dữ liệu từ hệ thống tệp dùng chung; xuất báo cáo dạng JSON đến nơi pipeline của bạn đọc. Phù hợp để kiểm tra hàng loạt kết quả phòng thí nghiệm trong một năm với bản snapshot corpus mới nhất. Có ví dụ script Slurm sbatch tại github.com/NoplagLabs/noplag-engine.
Manuscript dữ liệu bệnh nhân/clinic thì sao?
Tự triển khai trong VPC. Không có lưu lượng rời mạng. Engine không cần internet khi kiểm theo corpus lập chỉ mục (sẽ không có tầng kiểm web sống — phần đó tùy chọn). Triển khai hợp HIPAA nếu hạ tầng đúng; IT tổ chức chạy như dịch vụ nội bộ khác.
Khác gì iThenticate ở bước nộp?
iThenticate kiểm khi nộp và biên tập viên sẽ thấy — quý vị không lặp lại được. Noplag là tự kiểm trước khi nộp. Quy trình cascade so sánh tốt với nội dung truy cập mở (rộng hơn iThenticate sau Plan-S); hẹp hơn với tài liệu thuê/mua mà iThenticate được cấp phép. Xử lý tự trích dẫn là cái đa số nghiên cứu cần nhưng iThenticate làm chưa tốt.
Có tích hợp với phần mềm quản lý tài liệu (Zotero / Mendeley / EndNote) không?
Ingestion danh sách cho phép hỗ trợ BibTeX, RIS và trực tiếp từ ORCID API. Tải lên thư viện Zotero hoặc dán ORCID; danh sách cho phép sẽ lấy hết DOI của quý vị trong vài giây. Sync thời gian thực Mendeley + EndNote lên kế hoạch v1.2; hiện là lộ trình xuất file.
Độ bao phủ đa ngôn ngữ cho tạp chí ngoài tiếng Anh thế nào?
Hệ thống được hiệu chuẩn phát hiện cho tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Ba Lan và Ukraina khi ra mắt; sẽ bổ sung thêm ngôn ngữ. Hiệu quả nhất với các ngôn ngữ châu Âu (lịch sử hiệu chuẩn lâu dài). Chất lượng phát hiện được đánh giá trên PAN-PC-11; đánh giá theo từng ngôn ngữ nằm trong lộ trình. Đặc biệt phù hợp cho môi trường học thuật châu Âu và Nam Mỹ.
Nếu bài tôi trích dẫn bị rút sau khi nộp thì sao?
Tích hợp Crossref Retraction Watch sẽ đánh dấu mỗi lần kiểm lại bản thảo quý vị. Nếu đã nộp, quý vị nên báo biên tập viên (một số tạp chí yêu cầu xử lý rõ ràng khi bị rút sau nộp). Không đổi điểm trùng lặp, nhưng quý vị biết trước reviewer 2.

Chạy thử một chương qua quy trình. Xem chi tiết tự trích dẫn.

Tải vào bản thảo, một chương luận án, hoặc tổng quan đề tài. Thêm ORCID. Xem đoạn nào SELF-CITE, CITED, UNCITED-PARA, AI-LIKELY sắp có. Miễn phí tới 2.500 từ. Pro+ lưu trú EU bảo vệ bản nháp nhạy cảm.

Kiểm tra đạo văn cho nhà nghiên cứu trước khi nộp bài