Công cụ phát hiện diễn đạt lại — phát hiện sao chép được ngụy trang
Công cụ phát hiện diễn đạt lại xác định văn bản đã được thay đổi từ ngữ nhằm che giấu nguồn gốc. Noplag hiện nhận diện được các trường hợp chỉnh sửa nhẹ: các đoạn giữ nguyên chuỗi 5 từ vẫn bị phát hiện, nên việc thay từ đồng nghĩa hoặc đảo trật tự nhỏ sẽ được nhận diện bằng dấu vân tay winnowing và kiểm tra lại qua tìm kiếm web trực tiếp. Việc viết lại toàn bộ từng câu là vấn đề khác và hiện chưa phát hiện được — tính năng so khớp gần trùng (v1.1) và so khớp ngữ nghĩa (v1.2) sẽ giải quyết, và sẽ ra mắt khi hoàn thành đánh giá công khai.
Chúng tôi phát hiện. Không hỗ trợ né tránh.
Humanizer là công cụ viết lại văn bản do AI hoặc con người tạo ra nhằm vượt qua phát hiện. Chúng tôi có thể phát triển, nhưng không làm. Sản phẩm này nhằm phát hiện sao chép không trích dẫn, không phải giúp che giấu. Nếu muốn phát hiện có ý nghĩa, nhà cung cấp công cụ phát hiện và nhà phát triển humanizer không thể là cùng một bên. Chúng tôi đã chọn lập trường.
Khi đề cập đến humanizer trong báo cáo, chúng tôi chỉ nhằm thông báo rằng công cụ này tồn tại và có thể đã được dùng trước đó với văn bản bạn kiểm tra — không phải để bán cho bạn.
Bốn lớp. Hai lớp đã có, hai lớp đang phát triển.
Quy trình kiểm tra thu hẹp dần từ đối sánh chính xác, qua phát hiện gần trùng lặp, đến tương đương về ngữ nghĩa, rồi so sánh với web mở. Hai lớp đầu có trong v1.0; hai lớp xử lý phát hiện diễn đạt lại thực sự vẫn đang phát triển, và chúng tôi muốn nói rõ điều này thay vì ngụ ý khác.
Dấu vân tay winnowing — đã có
Đối sánh chính xác các đoạn con. Thay thế từ đồng nghĩa đơn giản và đảo vị trí nhỏ nhưng vẫn giữ nguyên chuỗi 5 từ.
Bất kỳ trường hợp nào bị đảo trật tự hoặc diễn đạt lại.
MinHash LSH — lộ trình v1.1
Sẽ phát hiện đảo vị trí câu và xáo trộn từ trong câu. Hiện tại chưa phát hiện được.
Thay thế từ đồng nghĩa thực sự và viết lại ngữ nghĩa, đây là nhiệm vụ của L3.
Sentence embeddings — lộ trình v1.2
Sẽ phát hiện thay thế từ đồng nghĩa và diễn đạt lại ngữ nghĩa. Hiện tại chưa phát hiện được.
Diễn đạt lại đủ khác biệt so với nguồn gốc khiến không còn tín hiệu thống kê nào.
Đối chiếu trực tiếp với web — đã triển khai
Nguồn xuất hiện sau thời điểm chụp nhanh tập dữ liệu đối chiếu.
Nội dung bị giới hạn truy cập hoặc chưa được lập chỉ mục.
Những gì hệ thống phát hiện hiện nay — theo mức độ diễn đạt lại.
Đây là hành vi của v1.0, không phải dự báo. Chỉnh sửa nhẹ vẫn để lại đoạn văn bản có thể đối chiếu; viết lại kỹ lưỡng thì không, và không phương pháp nhận dạng dấu vết nào phục hồi được. Chúng tôi đã phân tích ranh giới này trong bài viết về giới hạn thực tế của phát hiện sao chép nguyên văn: /blog/the-honest-limits-of-verbatim-detection.
Thay thế từ đồng nghĩa và thay đổi thứ tự nhỏ. Vẫn còn đủ nguyên văn để đối chiếu dấu vết.
Con mèo ngồi trên tấm thảm.
Con vật họ mèo ngồi trên tấm thảm.
Cấu trúc lại câu, thay đổi động từ. Chỉ phát hiện được nếu còn đoạn nguyên văn. Đối chiếu gần trùng (v1.1) nhắm đến mức này.
Con mèo ngồi trên tấm thảm.
Trên tấm thảm, con mèo đã ngồi xuống.
Viết lại hoàn toàn về nghĩa, cấu trúc và từ vựng mới. Hiện tại không phát hiện được; đối chiếu ngữ nghĩa (v1.2) sẽ xử lý mức này.
Con mèo ngồi trên tấm thảm.
Một động vật có vú nhỏ đã tự đặt mình lên bề mặt vải.
Mười câu hỏi về phát hiện đạo văn diễn đạt lại.
Chủ yếu về những giới hạn của phát hiện. Chúng tôi nêu rõ ràng mức tối thiểu; những người cần biết là những người sẽ dựa vào điểm số để quyết định.
- Phát hiện diễn đạt lại khác gì so với phát hiện đạo văn?
- Đạo văn là phạm vi rộng hơn — sao chép văn bản mà không trích dẫn nguồn. Phát hiện diễn đạt lại là bài toán cụ thể nhằm phát hiện đạo văn khi văn bản đã được viết lại để che giấu nguồn gốc. Noplag thực hiện cả hai trong cùng một báo cáo; quy trình phát hiện diễn đạt lại sẽ được kích hoạt khi lớp so khớp chính xác L1 không phát hiện ra trùng khớp.
- Vì sao việc phát hiện diễn đạt lại sâu lại khó đến vậy?
- Phát hiện dựa trên các tín hiệu thống kê — các cụm từ giống nhau, sau đó là cấu trúc và ý nghĩa tương đồng. Chỉnh sửa nhẹ vẫn giữ nguyên các cụm này nên dễ bị phát hiện. Nếu viết lại từng câu, các cụm trùng lặp sẽ biến mất hoàn toàn: một đoạn diễn đạt lại kỹ lưỡng sẽ cho điểm số bằng 0 với các công cụ so khớp dấu vân tay, như v1.0. Đây là đặc điểm của phương pháp, không phải lỗi, và đó là lý do so khớp gần trùng (v1.1) và so khớp ngữ nghĩa (v1.2) là các lớp riêng biệt chứ không phải chỉ là điều chỉnh tham số. Chúng tôi đã phân tích chi tiết trong bài viết về giới hạn thực tế của phát hiện trùng khớp nguyên văn: /blog/the-honest-limits-of-verbatim-detection.
- Noplag có cung cấp công cụ làm cho văn bản AI giống người không?
- Không. Chúng tôi không phát triển công cụ làm giống người. Công cụ này nhằm qua mặt hệ thống phát hiện — đi ngược lại mục tiêu của chúng tôi. Chúng tôi đứng về phía minh bạch; chỉ phát hiện, không hỗ trợ che giấu. Xem thêm quan điểm ở phần trên.
- So với công cụ diễn đạt lại của Quillbot thì sao?
- Quillbot viết lại văn bản để tránh bị phát hiện. Chúng tôi phát hiện văn bản đã được viết lại nhằm qua mặt kiểm tra. Hai bên giải quyết hai phía đối lập của cùng một vấn đề. Nếu văn bản từ Quillbot xuất hiện trong kiểm tra, báo cáo sẽ cảnh báo 'có thể sử dụng công cụ diễn đạt lại' khi nhận diện được dấu hiệu.
- 'Bốn lớp kiểm tra liên tiếp' là gì và hiện có bao nhiêu lớp đang hoạt động?
- Bốn lượt kiểm tra, mỗi lượt giảm dần mức độ chính xác. L1 lọc các trùng khớp nguyên văn và chỉnh sửa nhẹ, Layer W kiểm tra chéo với tìm kiếm web trực tiếp — cả hai đều có trong v1.0. L2 (so khớp gần trùng) nằm trong lộ trình v1.1 và L3 (so khớp ngữ nghĩa qua embedding câu) ở v1.2; cả hai chưa hoạt động và chưa có trong kho mã công khai. Tóm lại: một nửa quy trình đã hoạt động, và đó là phần xử lý các trường hợp diễn đạt lại nhẹ.
- Còn kỹ thuật dịch ngược để diễn đạt lại thì sao?
- Dịch ngược (ví dụ: Anh → Tây Ban Nha → Anh) là một trong những kiểu diễn đạt lại khó phát hiện nhất — ý nghĩa giữ nguyên nhưng cấu trúc thay đổi hoàn toàn. Nếu vẫn còn cụm từ gốc, hệ thống sẽ phát hiện; nếu viết lại hoàn toàn, hiện tại chưa phát hiện được. Đây là mục tiêu của lớp ngữ nghĩa trong v1.2.
- Noplag có đánh dấu diễn đạt lại sâu là 'đạo văn' không?
- Chỉ khi mức độ tin cậy đủ cao. Nếu dưới ngưỡng, chúng tôi hiển thị đoạn nghi vấn với nhãn 'trùng khớp mức tin cậy thấp' để người kiểm tra tự đánh giá. Chúng tôi không tự động kết luận đạo văn diễn đạt lại — chỉ báo cáo xác suất và lý do.
- Tôi có thể xem cách Noplag chấm điểm một đoạn văn không?
- Có. Mỗi trùng khớp trong báo cáo đều liên kết đến URL nguồn và hiển thị lớp kiểm tra đã phát hiện ra. Bạn có thể tự kiểm tra lại điểm số bằng engine mã nguồn mở — xem tại /open-source-plagiarism-checker.
- Noplag có phát hiện diễn đạt lại ở các ngôn ngữ ngoài tiếng Anh không?
- Hệ thống được hiệu chỉnh cho tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Ba Lan và Ukraina khi ra mắt, sẽ bổ sung thêm ngôn ngữ khác. Các ngôn ngữ khác sẽ trả về kết quả với cảnh báo 'nguồn dữ liệu hạn chế — cần đánh giá cẩn trọng hơn'.
- Công cụ phát hiện diễn đạt lại có miễn phí không?
- Có ở gói miễn phí — tối đa 2.500 từ mỗi lần kiểm tra, không cần đăng ký. Gói Pro và Premium nâng giới hạn; thuật toán phát hiện nền tảng giống nhau ở mọi gói.
Phát hiện đạo văn diễn đạt lại — miễn phí, tối đa 2.500 từ.
Hiện tại chúng tôi phát hiện được các trường hợp diễn đạt lại nhẹ và công khai rằng việc phát hiện viết lại toàn diện sẽ chưa khả thi cho đến khi các lớp ngữ nghĩa được phát triển. Hãy tự kiểm tra văn bản của bạn và xem chính xác những gì engine phát hiện.
Phát hiện đạo văn diễn đạt lại