Kiểm tra đạo văn học thuật có nhận diện trích dẫn
Phát hiện đạo văn cho nghiên cứu — kiểm tra so với hơn 700 triệu tác phẩm học thuật từ OpenAlex, CORE, arXiv, PubMed Central và Crossref. Phân loại nhận diện trích dẫn. Động cơ Apache 2.0 có thể kiểm toán bởi bộ phận CNTT học thuật.
Năm nguồn. 700 triệu tác phẩm. Đều truy cập mở hoặc có DOI.
Không nội dung bị tính phí — Sie chỉ kiểm tra qua các chỉ mục truy cập mở. Phạm vi rộng cho nghiên cứu sau Plan-S; hẹp cho tạp chí có bản quyền lâu năm.
OpenAlex
250M+ tác phẩmChỉ mục học thuật mở — thay thế cho Microsoft Academic Graph cũ. Bao gồm bài tạp chí, bài hội thảo, bộ dữ liệu, sách mọi chuyên ngành.
CORE
290M+ bài báoTrình tổng hợp nghiên cứu truy cập mở lớn nhất. Chỉ mục toàn văn từ hơn 11.000 kho lưu trữ. Mạnh về xuất bản khoa học châu Âu + Anh.
arXiv
2.4M+ preprintsVật lý, toán, khoa học máy tính, sinh học định lượng, thống kê, kinh tế. Đối chiếu với phiên bản mà Sie hoặc người duyệt vừa xem trên arXiv.
PubMed Central
10M+ bài báoKho lưu trữ truy cập mở ngành y sinh / khoa học sự sống. Chỉ mục toàn văn + metadata. Nguyên cứu do NIH nộp và cập nhật bản tạp chí.
Ba quy trình. Một sản phẩm.
Chuẩn bị bài báo, bảo vệ luận văn hay hoàn thiện đề xuất quỹ — trình kiểm tra phù hợp với giai đoạn của Sie, không bắt Sie đổi ngược.
01 · Kiểm tra trước nộp tạp chí
Kiểm tra bản thảo trước khi gửi — tương tự quy trình tạp chí sẽ làm. iThenticate / Crossref Similarity Check kiểm tra lại khi nộp — Sie muốn thấy trước biên tập viên. Gói Pro trả phí cố định cho phép kiểm tra nhiều bản nháp mà không lo tốn phí theo tài liệu.
02 · Luận văn / chương luận án
Chia theo chương hoặc dán toàn bộ luận văn. Tự trích dẫn giữa các chương được nhận diện mà phân loại riêng (phù hợp luận văn dài). Danh mục tài liệu loại khỏi điểm số. So sánh lịch sử phiên bản giữa các lần chỉnh sửa — nhận ra phần Sie chỉnh, phần sạch lên, phần mới thêm.
03 · Đề xuất quỹ / tổng quan tài liệu
Phần mẫu từ các đề xuất trước đồng tác giả với Sie sẽ không bị đánh dấu là đạo văn. Tổng quan tài liệu có trích dẫn cũng không bị đánh dấu. Mô hình phân loại nhận diện việc tái sử dụng hợp lệ (tác phẩm cũ của Sie, có trích dẫn) khác với sao chép nhầm lẫn. Điểm số phản ánh phần thực sự có vấn đề, không tính phần lặp không tránh khỏi.
Sáu loại. Mỗi đoạn đối chiếu thuộc một loại.
Báo cáo 28% tương đồng với tổng quan giàu trích dẫn sẽ khác với 28% trên phần diễn giải không trích dẫn. Khác biệt nằm ở phân loại.
01 · Trích dẫn trực tiếp (có trích dẫn)
Có dấu ngoặc kép + trích dẫn trong ngoặc hoặc chú thích cuối trang. Được tính đúng dự kiến; loại khỏi điểm tương đồng. Tự động nhận diện nhiều kiểu trích dẫn (MLA / APA / Chicago / Harvard / Vancouver / IEEE).
02 · Trích dẫn khối
Đoạn văn lùi đầu dòng 40+ từ có trích dẫn phía sau. Được tính như dự kiến. Nhận diện lề trái 0.5 inch + trích dẫn; thiếu lùi đầu dòng sẽ được gắn cờ định dạng không chuẩn.
03 · Diễn giải (có trích dẫn)
Khớp cấu trúc câu kèm trích dẫn ở lân cận đoạn. Tính giảm điểm. Phân loại chấp nhận kiểu “Smith (2023) cho rằng...” là trích dẫn hợp lệ trước đoạn diễn giải.
04 · Kiến thức phổ biến
Cụm xuất hiện ở ≥2.000 nguồn độc lập (“Nước sôi ở 100°C”, định nghĩa kỹ thuật cơ bản, công thức quen). Loại khỏi điểm tương đồng. Điều chỉnh ngưỡng cho ngành nhiều thuật ngữ.
05 · Tài liệu tham khảo
Mục lục tham khảo tự phát hiện theo tiêu đề + định dạng. Loại hoàn toàn khỏi điểm số. Tham khảo không cần sáng tạo — đánh dấu chúng làm tăng điểm vô lý.
06 · Diễn giải chép lại không trích dẫn
Trùng cấu trúc câu, không trích dẫn quanh đoạn, không ngoặc kép, không theo định dạng trích dẫn khối. Đây là loại tạo nên điểm tương đồng chính. Tính toàn bộ; các loại khác thì không.
Phân loại từng đoạn. Nguồn gốc từng đoạn. Kiểm toán từ đầu đến cuối.
Mỗi đoạn đối chiếu đều kèm theo DOI / URL nguồn, loại phân loại, thời điểm snapshot corpus, và commit động cơ. Yên tâm trình bày ở họp peer-review, hội đồng đạo đức hoặc kiểm duyệt CNTT.
Chủ nghĩa hiện đại ít là một phong trào thống nhất mà phần lớn là từ chối — từ chối chủ nghĩa hiện thực, tiến bộ, cái tôi hợp nhất... (Eysteinsson, 1990, tr.117).
doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990Việc Eliot nhấn mạnh tính phi cá nhân định vị lại thể thơ trữ tình như sản phẩm cấu trúc thay vì chỉ là sự tuôn trào cảm xúc.
Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…Tiểu thuyết hình thành từ thế giới quan tư sản xuất hiện ở thế kỷ XVIII.
openalex.org/W12345678 · Watt (1957) — khớp không trích dẫnDòng ý thức của Joyce chịu ảnh hưởng lớn từ tâm lý học về thời gian bên trong của William James.
James, W. (1890). The Principles of Psychology, ch.IX (được nhắc đến trong danh mục trích dẫn)Chương 1 của luận án tiến sĩ đã xuất bản trước đó của tác giả.
ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · tự trích dẫn, không dẫn rõ đoạn nàyMọi tài liệu tham khảo — Eysteinsson, Eliot, Joyce, James, Watt và 32 người nữa.
Phần Tài liệu tham khảo, tr. 38–41- 700M+tác phẩm học thuật đã chỉ mục
- 6kiểu trích dẫn tự động nhận diện
- 5ngôn ngữ được hiệu chỉnh khi ra mắt
- 3%sai lệch ESL còn lại (đã ghi nhận)
- Apache2.0 · kiểm duyệt IRB
Ba điều trình kiểm tra hộp đen không vượt nổi hội đồng khoa.
Chạy lại bài cũ trên đúng mã động cơ cũ
Mỗi báo cáo đều lưu X-Engine-Commit và thời điểm snapshot corpus. Tháng sau Sie có thể kiểm lại bản thảo giống bản kiểm tra trước, cùng động cơ, cùng thuật toán, cùng kết quả. Đối thủ đóng mã có thể thay đổi mô hình mà điểm số tháng 1 sẽ khác tháng 5.
Apache 2.0 mã nguồn mở trên GitHub — trình bày tại hội đồng
Khi phát hiện AI được triển khai (sắp tới, trên lộ trình v1.2) và sinh viên bị tranh luận ở hội đồng đạo đức, Sie có thể chỉ dòng commit, trỏ tới dòng mã cụ thể tạo ra quyết định, chỉ ra tài liệu hiệu chỉnh ESL từng ngôn ngữ. Không phải chỉ là ảnh chụp email hỗ trợ.
Liang và cộng sự 2023 đã ghi nhận; biện pháp giảm thiểu đang nằm trong lộ trình
Nghiên cứu Stanford 2023 ghi nhận tỷ lệ dương tính giả 61,3% trên bài luận TOEFL đối với các bộ phát hiện đơn giản. Khi tính năng phát hiện AI của Noplag được triển khai (sắp ra mắt, lộ trình v1.2), kết quả sẽ kèm theo thang điều chỉnh cho người dùng tiếng Anh không bản ngữ nếu dấu hiệu từ vựng cho thấy điều đó. Sai số còn lại sẽ được ghi nhận rõ, không tuyên bố bằng 0. Đường dẫn ghi đè được lưu lại cùng commit của engine và lý do.
Động cơ Apache 2.0 mà CNTT Sie thực sự kiểm tra trước khi ký.
Đa phần đánh giá mua sắm phần mềm đạo văn đều mắc cùng vướng: tài liệu đi đâu sau khi nộp, thuật toán khớp như nào, ai truy cập dữ liệu, xóa dữ liệu ra sao, có xác minh được độ chính xác không. Với nhà cung cấp đóng mã, việc này trả lời qua cuộc gọi bán hàng. Với Apache 2.0, CNTT của Sie có thể clone repo, chạy thử động cơ trên máy ảo riêng, kiểm thử dòng dữ liệu, xác thực xóa dữ liệu tận gốc, và tái nghiệm số F1 công khai trên tập thử riêng. Sie không mua sắm phần mềm dễ hơn — Sie cần mua sắm phần mềm mà đội CNTT thực sự kiểm thử hết được. Đó là lý do các trường từng từ chối thêm phần mềm đạo văn lại ký cái này.
Đọc hướng dẫn mua sắmCác câu hỏi giới học thuật thực sự hỏi.
Có thay cho iThenticate để kiểm tra bài báo trước nộp không?
Đa số trường hợp thì không — nếu tạp chí Sie cần bắt buộc iThenticate (Elsevier, Springer, Wiley, IEEE), họ vẫn sẽ kiểm tra khi Sie nộp. Noplag thay thế cho việc tự kiểm tra nhiều lần qua các bản nháp. iThenticate giá $125/tài liệu rất nặng nếu sửa lần 4; Pro trả phí cố định thì không. Xem so sánh đầy đủ với iThenticate ở noplag.com/vs-ithenticate.
Còn luận án ProQuest? Sie không có những tài liệu đó?
Đúng — thiếu sót này là thực tế. Cơ sở dữ liệu luận án ProQuest là độc quyền, bị khóa phí, không thuộc OpenAlex/CORE. Sie bao phủ ~700M tác phẩm truy cập mở, rộng hơn ProQuest cho nghiên cứu sau Plan-S (hầu như mọi tạp chí lớn từ 2018); nhưng thiếu luận án bản quyền cũ. Nếu kiểm tra chéo với luận án tiến sĩ Mỹ là nhu cầu chính, iThenticate phù hợp hơn với công việc đó.
Xử lý những kiểu trích dẫn ngoài sáu chuẩn lớn ra sao?
MLA, APA, Chicago/Turabian, Harvard, Vancouver, IEEE được tự động nhận từ định dạng tài liệu tham khảo. Với các kiểu hiếm hơn (ACS, AMA, ASA, Bluebook, Oxford), động cơ vẫn nhận đoạn dựa trên ngoặc kép + mẫu ngoặc lân cận, nhưng validator riêng cho từng kiểu sẽ có trên lộ trình v1.2. Người tự host có thể bổ sung kiểu mới trong module alignment/.
Tỷ lệ báo động nhầm trên tổng quan tài liệu nhiều trích dẫn là bao nhiêu?
Thấp hơn mức reviewer kỳ vọng cho phần diễn giải không trích dẫn, vì mô hình phân loại loại trừ mọi đoạn có trích dẫn hợp lệ khỏi điểm số. Sie đo được ~3,4% tỷ lệ báo động nhầm trên tập PAN-PC-11 cho văn học thuật (phần lớn là trích dẫn thật). Đối thủ đóng mã không loại trừ ra báo cáo 12–18% trên cùng dữ liệu.
Có loại trừ được chính tác phẩm trước của tôi không?
Gói Pro — thêm allowlist tự trích dẫn (ORCID của Sie, DOI cũ, URL kho trường). Đối chiếu với tài liệu trong allowlist sẽ đánh dấu là TỰ-TRÍCH và không tính điểm. Phù hợp nếu đề xuất tài trợ Sie dựa vào công trình đã công bố; tái sử dụng hợp lệ không là đạo văn.
Bao phủ đa ngôn ngữ thực sự ra sao?
Phát hiện được hiệu chỉnh cho tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Ba Lan và Ukraina khi ra mắt, các ngôn ngữ khác sẽ bổ sung dần. Chất lượng phát hiện được đánh giá trên PAN-PC-11; đánh giá riêng từng ngôn ngữ nằm trong lộ trình phát triển. Hiệu quả cao nhất với các ngôn ngữ châu Âu có lịch sử kiểm chứng lâu dài; các ngôn ngữ mới sẽ cập nhật khi hiệu chỉnh hoàn thiện.
Apache 2.0 có nghĩa gì cho mua sắm tổ chức?
Bộ phận IT / DPO / IRB của bạn có thể sao chép github.com/NoplagLabs/noplag-engine, chạy engine trong môi trường sandbox, kiểm tra luồng dữ liệu, xác minh chức năng xóa dữ liệu từ đầu đến cuối, và đối chiếu số liệu benchmark đã công bố với tập văn bản kiểm thử riêng. Không cần ký kết, không NDA, không phải tin vào quảng cáo của chúng tôi. Với các tổ chức yêu cầu quy trình thẩm định sâu, đây là giải pháp đáp ứng.
Bộ dò AI hỗ trợ Claude-3 + Gemini hay chỉ GPT?
Tính năng phát hiện AI sẽ sớm ra mắt — nằm trong lộ trình v1.2, chưa có khi phát hành ban đầu. Phương pháp sử dụng Binoculars (Hans et al. 2024), không phụ thuộc mô hình: không huấn luyện riêng cho từng LLM, mà so sánh perplexity của một mô hình tham chiếu nhỏ với văn bản kiểm tra, giúp tổng quát hóa. Số liệu độ chính xác sẽ công bố sau khi tính năng vượt qua đánh giá, không công bố trước, trên dữ liệu hỗn hợp từ nhiều LLM (so với khoảng 70% trên Claude-3 đối với các bộ phát hiện huấn luyện bằng GPT). Bài báo phương pháp mô tả rõ các trường hợp lỗi; chúng tôi không che giấu.
Nếu người hướng dẫn phản bác điểm báo động thì sao?
Mỗi đoạn bị đánh dấu đều đi kèm DOI nguồn, thời điểm snapshot corpus, phiên bản động cơ, và lý do phân loại. Kiểm lại với cùng commit động cơ thì kết quả lặp đúng. In báo cáo mang đi họp; đường dẫn trích dẫn xem được. Không có chế độ “tin điểm số” — các công cụ hộp đen mới có kiểu đó.
Tự host dành cho nghiên cứu y khoa / lâm sàng hoặc HIPAA thì sao?
Apache 2.0 + Docker — chạy toàn bộ trong mạng nội bộ. Kết hợp với PostgreSQL + Redis tại hạ tầng Sie; không có lưu lượng nào rời VPC. Phù hợp với bản nháp lâm sàng, ca bệnh, mọi nghiên cứu trước công bố không thể đưa lên đám mây bên ngoài. Khách hàng tổ chức nhận cả cơ sở dữ liệu corpus để tự index.
Chạy một chương so với hơn 700 triệu tác phẩm học thuật.
Dán chương luận án, đề xuất quỹ hoặc bản thảo Sie vào đây. Báo cáo nhận diện trích dẫn phân biệt phần hợp lệ, cần trích dẫn, và của chính Sie. Miễn phí tới 2.500 từ. Apache 2.0 khi IRB yêu cầu kiểm tra thuật toán trước.