Kiểm tra đạo văn cho nhà xuất bản
Kiểm tra trước với bản gửi từ freelancer, đánh giá lại cho các bài tái bản, và REST API nhóm kỹ thuật có thể kết nối thẳng vào CMS. Công cụ sử dụng Apache 2.0 — có thể đọc trước khi quyết định dùng, không phải sau.
Bốn vị trí. Một quy trình.
Xem xét đề xuất freelancer trước khi giao bài
10 phút cho mỗi bản gửi, trước khi chi ngân sách chỉnh sửa.
- Dán bản nháp/clip, xem các phiên bản đã xuất bản trước đó
- Phán đoán khả năng AI từng đoạn (sắp có), nhận diện tiếng Anh không bản ngữ
- Giảm trao đổi qua lại về tính nguyên bản
Quét hàng ngày trước giờ đăng
Quét hàng loạt các bài hôm nay trước khi chuyển vào hàng đợi xuất bản của CMS.
- Giao diện hàng đợi sắp xếp theo mức độ giống + điểm AI
- Ngưỡng kiểm duyệt theo từng mục (bình luận, tin tức, đánh giá)
- Theo dõi kiểm duyệt theo phóng viên cho bàn tiêu chuẩn
Điều tra một bài bị tranh luận
Đọc thuật toán, rồi đọc các đoạn phù hợp.
- Khả năng tái hiện kiểm tra nhờ X-Engine-Commit
- Đảo ngược kết quả với lý do kèm minh chứng
- Apache 2.0 — bảo vệ tại vòng duyệt chỉnh sửa
Đánh giá đối tác tái phát hành nội dung
Theo dõi sức khỏe thẻ canonical trong mạng lưới phát hành.
- Kiểm tra đạo văn nhận diện canonical (ORIGIN / SYND OK / LEAK)
- Báo cáo so sánh hàng tuần theo đối tác
- Bằng chứng đủ tiêu chuẩn DMCA khi yêu cầu
Ba bước trước khi bài vào hàng đợi xuất bản CMS.
Tích hợp trong quy trình biên tập qua API, chạy hàng loạt trước khi đăng, hoặc kiểm tra lẻ qua giao diện. Cùng một công cụ, cùng một định dạng báo cáo, phù hợp tùy cách tích hợp.
01 · Nạp bài
Bản gửi vào hàng đợi CMS — kéo-thả file .docx / .gdoc / dán nội dung, hoặc CMS đẩy qua webhook. Dữ liệu tác giả + mục + biên tập viên đi cùng để vào nhật ký kiểm tra.
02 · Quét + phân loại
Thuật toán quét web mở + Common Crawl + (tùy chọn) kho riêng nội dung cũ của bạn. Phân loại trích dẫn tách rõ trích dẫn có dẫn nguồn khỏi diễn giải không chú thích. Điểm khả năng AI từng đoạn sẽ có sớm, nhận diện tiếng Anh không bản ngữ. Trung bình 42 giây mỗi bài.
03 · Quyết định + xuất bản
Biên tập viên thấy: tiêu đề tương đồng, phân loại chi tiết, danh sách nguồn có thể sắp xếp (AI-score và cảnh báo tiếng Anh không bản ngữ sẽ sớm có). Ba lựa chọn: xuất bản, trả lại có ghi chú, chuyển lên bàn tiêu chuẩn. Quyết định được nhật ký kèm engine commit + snapshot kho dữ liệu.
Bốn giao diện CMS. Một REST contract.
Kết nối Noplag với CMS phóng viên đang dùng. API giống nhau — chỉ khác lớp tích hợp (WordPress hooks, Ghost actions, Drupal events, hoặc webhooks riêng).
Plugin chính thức từ WordPress.org. Tương thích Gutenberg.
- Hộp meta kiểm duyệt trên mọi loại bài
- Bôi sáng cấp đoạn trong trình soạn thảo
- Nhật ký kiểm tra qua WP REST API
Tích hợp webhook + Admin API. Hỗ trợ nội dung thành viên.
- Webhook kiểm tra trước bắn khi lưu nháp
- Chính sách quét theo tag từng loại bài
- Tối ưu cho tự host (Noplag tự host + Ghost tự host)
Module đóng góp cộng đồng từ drupal.org. Đính kèm dùng Field-API.
- Trường kiểm tra đạo văn theo từng loại nội dung
- Liên kết với quy trình kiểm duyệt Content Moderation
- Hỗ trợ cấu hình cho nhiều site
Webhooks + OpenAPI 3.0 spec. Dùng cho các CMS không giao diện, hệ thống nội bộ, hoặc dạng khác.
- POST /v1/checks từ bất kỳ hook CMS nào
- Webhook callback ký HMAC
- SDK cho Python + Node build từ OpenAPI spec
Hàng đợi xuất bản hôm nay. Sắp xếp, nhật ký kiểm tra.
Hàng dọc từng bài có tên phóng viên, mục, mức giống, điểm AI, và liên kết tới báo cáo bôi sáng. Có thể sắp xếp lại. Duyệt hàng loạt bài an toàn, chuyển lại bài còn nghi vấn.
Xem ai đang tái bản nội dung của bạn — và canonical có đúng nguồn không.
Theo dõi mạng lưới phân phối
Thêm các domain bạn phát hành cùng (Medium, LinkedIn, Substack, đối tác của bạn) vào danh sách cho phép. Báo cáo crawl hàng tuần chỉ ra bên nào để rel=canonical về trang gốc (ORIGIN credit), bên nào thiếu (SEO leak), bên nào tái bản không phép (SCRAPED).
Blog nào thiếu tên tác giả bạn?
Quét định kỳ so sánh tên miền ngoài danh sách, phát hiện trang đăng lại từng đoạn bài của bạn. Đối chiếu kèm snapshot ngày xuất hiện — chứng cứ DMCA đủ ngày. Chúng tôi không gửi DMCA (đó là quyết định pháp lý); chúng tôi chỉ cung cấp tài liệu.
Lặp lại nội dung nội bộ trên web bạn
Quét ngang thư mục: đưa corpus toàn bài xuất bản vào một thư mục; công cụ xây ma trận tương đồng từng cặp. Phát hiện 47 trang thành phố cùng đoạn giới thiệu — đây là nguy cơ Helpful-Content-Update cần biết trước Google.
Ba chính sách phòng tiêu chuẩn hỏi trước khi ký hợp đồng.
Thứ nhất — bài viết gửi lên không bao giờ được dùng để huấn luyện mô hình. Không dùng cho mô hình của chúng tôi, cũng không dùng cho mô hình của bên nào khác. Văn bản gửi lên sẽ được tạo dấu vân tay, lập chỉ mục trong không gian riêng của bạn, và xóa sau 30 ngày trừ khi bạn chọn lưu lại. Thứ hai — kết quả AI (sắp ra mắt, đã có trong lộ trình) sẽ đánh giá theo từng đoạn, không phải toàn bài, và ghi nhãn với commit của engine cùng thời điểm chụp snapshot của corpus. Nếu có tranh chấp về cờ AI, bạn có thể kiểm tra lại sau nhiều tháng với cùng commit đó. Không có việc tự động huấn luyện lại mà không thông báo. Thứ ba — Apache 2.0 cho phép đội kỹ thuật của bạn sao chép github.com/NoplagLabs/noplag-engine, triển khai trên hạ tầng của chính bạn, kiểm tra luồng dữ liệu và xác minh toàn bộ quy trình xóa dữ liệu theo yêu cầu. Phần lớn các đánh giá mua sắm phần mềm kiểm tra đạo văn tại các tổ chức đều vướng ở ba câu hỏi này; chúng tôi cố gắng trả lời rõ ràng ngay từ đầu.
Đọc hướng dẫn bàn tiêu chuẩnCác câu tiêu chuẩn phòng tiêu chuẩn luôn hỏi khi mua.
- Bài viết của chúng tôi có bị dùng huấn luyện AI không?
- Không. Các bài gửi chỉ được fingerprint (chỉ lưu winnowing hash), lưu trong cơ sở dữ liệu riêng biệt từng vùng. Bản gốc xóa sau 30 ngày, trừ khi chọn giữ lại. Mô hình AI phát hiện — Binoculars-based (Hans et al. 2024), chuẩn bị phát hành — chỉ huấn luyện trên bộ công khai; không bao giờ thêm nội dung khách hàng. Thể hiện rõ trong DPA.
- Kết quả AI từng đoạn giải quyết tranh luận ra sao?
- Chức năng phát hiện AI sẽ ra mắt sớm — nằm trong lộ trình v1.2, chưa có khi phát hành ban đầu. Khi triển khai, mỗi đoạn bị gắn cờ sẽ ghi lại commit của engine và thời điểm snapshot của corpus. Kiểm tra lại cùng đoạn văn với commit đó sẽ cho kết quả giống hệt. Thuật toán được công khai tại github.com/NoplagLabs/noplag-engine (Apache 2.0), chỉ rõ ngưỡng perplexity, có tài liệu về hiệu chỉnh cho người dùng tiếng Anh không bản ngữ. Chúng tôi không có chế độ “tin vào điểm số”.
- Freelancer ở vùng mạng yếu có gặp khó không?
- Phát hiện được hiệu chỉnh cho tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Ba Lan và Ukraina ngay khi ra mắt; sẽ bổ sung thêm ngôn ngữ khác. Chất lượng phát hiện được đánh giá trên PAN-PC-11; đánh giá riêng cho từng ngôn ngữ nằm trong lộ trình. Kết quả AI đã hiệu chỉnh cho người dùng tiếng Anh không bản ngữ sẽ gắn cờ là ESL ADJ thay vì LIKELY-AI nếu dấu hiệu từ vựng cho thấy điều đó.
- Có tự host trong nội bộ tòa soạn được không?
- Có — engine Apache 2.0 + Docker. Chạy hoàn toàn trong mạng nội bộ. Kết hợp Postgres + Redis sẵn trong hạ tầng của bạn; không có bản gửi nào ra khỏi VPC. Phù hợp với tòa soạn yêu cầu bảo vệ nguồn tin và bảo mật trước khi xuất bản.
- Có tích hợp với CMS của chúng tôi?
- WordPress (plugin chính thức), Ghost (Admin API + webhook), Drupal (module cộng đồng). Với CMS dạng khác — tùy chỉnh, headless, nội bộ — REST + OpenAPI 3.0 spec đủ cho nhóm kỹ thuật xây hook kiểm tra trong một ngày. SDK Python và Node build từ spec.
- Tính năng đánh giá lại phát hành làm gì?
- Thêm domain phân phối vào danh sách (medium.com/@you, domain đối tác của bạn). Crawl hàng tuần xem canonical: ORIGIN (trỏ về bạn), SYND OK (từ đối tác vẫn trỏ về bạn), LEAK (thiếu canonical hoặc trỏ nơi khác — split SEO), SCRAPED (bản sao đúng nguyên văn, không canonical, ngoài danh sách). Trường hợp SCRAPED đi kèm snapshot ngày để làm chứng cứ DMCA.
- Giá thế nào với phòng tin 30 phóng viên?
- Gói Premium $79/tháng: 5.000 từ/lượt, 5.000 bài/tháng, API & CMS tích hợp. Hoạt động quy mô lớn (10.000+ bài/tháng) dùng gói Enterprise, giá theo corpus + hạ tầng riêng. Không tính phí từng phóng viên; chỉ tính theo sản lượng.
- Bài bình luận, trích xuất sách nơi 'tái sử dụng' hợp lý thì sao?
- Pro+ cho phép đặt ngưỡng riêng từng mục — ví dụ mục thời sự, bình luận, trích xuất sách. Một bài bình luận trích dẫn nguyên văn bài phát biểu không nên áp cùng mức với bài copy từ đối thủ. Phân loại nhận diện trích dẫn sẽ tách rõ trích dẫn có nguồn khỏi nhầm lẫn tái sử dụng.
- Có làm chậm quy trình xuất bản không?
- Trung vị 47 giây mỗi bài kiểm tra 1.500–4.000 từ. Hook CMS chạy bất đồng bộ — kiểm tra khi lưu nháp, biên tập viên xem kết quả xong là xong sửa bài. Dạng dài (>8.000 từ) mất ~90 giây, nên kiểm tra trước xuất bản thay vì đồng bộ.
- Có thêm kho lưu trữ riêng làm nguồn kiểm tra được không?
- Có — Enterprise tier. Nạp hàng loạt nội dung lưu trữ vào corpus riêng tư, mỗi bài mới sẽ kiểm tra đối chiếu với kho cũ của bạn. Phát hiện phóng viên tái sử dụng (có khi hợp lý, có khi không), hoặc dùng lại nội dung cũ dưới tên tác giả mới.
Thử gửi bản nháp qua hàng đợi. Xem từng bài riêng lẻ.
Dán file Word, Google Doc, hoặc bài xuất từ CMS. Nhận báo cáo từng đoạn trong 47 giây. Miễn phí đến 2.500 từ; Pro cho số lượng; Enterprise cho kho lưu trữ và hạ tầng riêng.