NEWSROOMQuy trình biên tập · API cho CMS · đánh giá lại nội dung phát hành

Kiểm tra đạo văn cho nhà xuất bản

Kiểm tra trước với bản gửi từ freelancer, đánh giá lại cho các bài tái bản, và REST API nhóm kỹ thuật có thể kết nối thẳng vào CMS. Công cụ sử dụng Apache 2.0 — có thể đọc trước khi quyết định dùng, không phải sau.

Quy trình kiểm duyệt trước xuất bảnĐánh giá lại nguồn bài phát hànhREST API kết nối sẵn với CMS
DÀNH CHO NGƯỜI PHÊ DUYỆT XUẤT BẢN

Bốn vị trí. Một quy trình.

BIÊN TẬP VIÊN

Xem xét đề xuất freelancer trước khi giao bài

10 phút cho mỗi bản gửi, trước khi chi ngân sách chỉnh sửa.

  • Dán bản nháp/clip, xem các phiên bản đã xuất bản trước đó
  • Phán đoán khả năng AI từng đoạn (sắp có), nhận diện tiếng Anh không bản ngữ
  • Giảm trao đổi qua lại về tính nguyên bản
THƯ KÝ TOÀ SOẠN

Quét hàng ngày trước giờ đăng

Quét hàng loạt các bài hôm nay trước khi chuyển vào hàng đợi xuất bản của CMS.

  • Giao diện hàng đợi sắp xếp theo mức độ giống + điểm AI
  • Ngưỡng kiểm duyệt theo từng mục (bình luận, tin tức, đánh giá)
  • Theo dõi kiểm duyệt theo phóng viên cho bàn tiêu chuẩn
BÀN TIÊU CHUẨN

Điều tra một bài bị tranh luận

Đọc thuật toán, rồi đọc các đoạn phù hợp.

  • Khả năng tái hiện kiểm tra nhờ X-Engine-Commit
  • Đảo ngược kết quả với lý do kèm minh chứng
  • Apache 2.0 — bảo vệ tại vòng duyệt chỉnh sửa
PHÁT HÀNH

Đánh giá đối tác tái phát hành nội dung

Theo dõi sức khỏe thẻ canonical trong mạng lưới phát hành.

  • Kiểm tra đạo văn nhận diện canonical (ORIGIN / SYND OK / LEAK)
  • Báo cáo so sánh hàng tuần theo đối tác
  • Bằng chứng đủ tiêu chuẩn DMCA khi yêu cầu
QUY TRÌNH KIỂM DUYỆT TRƯỚC

Ba bước trước khi bài vào hàng đợi xuất bản CMS.

Tích hợp trong quy trình biên tập qua API, chạy hàng loạt trước khi đăng, hoặc kiểm tra lẻ qua giao diện. Cùng một công cụ, cùng một định dạng báo cáo, phù hợp tùy cách tích hợp.

01

01 · Nạp bài

Bản gửi vào hàng đợi CMS — kéo-thả file .docx / .gdoc / dán nội dung, hoặc CMS đẩy qua webhook. Dữ liệu tác giả + mục + biên tập viên đi cùng để vào nhật ký kiểm tra.

02

02 · Quét + phân loại

Thuật toán quét web mở + Common Crawl + (tùy chọn) kho riêng nội dung cũ của bạn. Phân loại trích dẫn tách rõ trích dẫn có dẫn nguồn khỏi diễn giải không chú thích. Điểm khả năng AI từng đoạn sẽ có sớm, nhận diện tiếng Anh không bản ngữ. Trung bình 42 giây mỗi bài.

03

03 · Quyết định + xuất bản

Biên tập viên thấy: tiêu đề tương đồng, phân loại chi tiết, danh sách nguồn có thể sắp xếp (AI-score và cảnh báo tiếng Anh không bản ngữ sẽ sớm có). Ba lựa chọn: xuất bản, trả lại có ghi chú, chuyển lên bàn tiêu chuẩn. Quyết định được nhật ký kèm engine commit + snapshot kho dữ liệu.

TÍCH HỢP CMS

Bốn giao diện CMS. Một REST contract.

Kết nối Noplag với CMS phóng viên đang dùng. API giống nhau — chỉ khác lớp tích hợp (WordPress hooks, Ghost actions, Drupal events, hoặc webhooks riêng).

WordPress5.5+

Plugin chính thức từ WordPress.org. Tương thích Gutenberg.

  • Hộp meta kiểm duyệt trên mọi loại bài
  • Bôi sáng cấp đoạn trong trình soạn thảo
  • Nhật ký kiểm tra qua WP REST API
Ghost4.0+

Tích hợp webhook + Admin API. Hỗ trợ nội dung thành viên.

  • Webhook kiểm tra trước bắn khi lưu nháp
  • Chính sách quét theo tag từng loại bài
  • Tối ưu cho tự host (Noplag tự host + Ghost tự host)
Drupal9+ / 10

Module đóng góp cộng đồng từ drupal.org. Đính kèm dùng Field-API.

  • Trường kiểm tra đạo văn theo từng loại nội dung
  • Liên kết với quy trình kiểm duyệt Content Moderation
  • Hỗ trợ cấu hình cho nhiều site
Tùy chỉnhREST

Webhooks + OpenAPI 3.0 spec. Dùng cho các CMS không giao diện, hệ thống nội bộ, hoặc dạng khác.

  • POST /v1/checks từ bất kỳ hook CMS nào
  • Webhook callback ký HMAC
  • SDK cho Python + Node build từ OpenAPI spec
GÓC NHÌN BIÊN TẬP

Hàng đợi xuất bản hôm nay. Sắp xếp, nhật ký kiểm tra.

Hàng dọc từng bài có tên phóng viên, mục, mức giống, điểm AI, và liên kết tới báo cáo bôi sáng. Có thể sắp xếp lại. Duyệt hàng loạt bài an toàn, chuyển lại bài còn nghi vấn.

HÀNG ĐỢI XUẤT BẢN · Thứ ba, 21/057 bài chờ xuất bản · 2 bài chuyển bàn trên
Mục: Tất cảXuất bản hàng loạt OK
BÀI VIẾTPHÓNG VIÊNMỤCTƯƠNG ĐỒNGAI %KẾT QUẢTHAO TÁC
Hội đồng thông qua luật phân khu mới cho trung tâmnháp · 1.840 từMarisol ChenĐỊA PHƯƠNG6%0.04OKXuất bản
Bên trong khôi phục: bài học sau thảm họa Q1nháp · 1.840 từTobias ReinhartCÔNG NGHỆ12%0.08OKXuất bản
AI đã thay đổi phòng tin tức thế nào trong 18 thángnháp · 1.840 từPriya AnandÝ KIẾN38%0.62TẠM GIỮXem lại
Tiểu thuyết hiện đại và câu hỏi về giọng kểnháp · 1.840 từSara BeltranVĂN HÓA22%0.18OKXuất bản
Đối đầu ngân sách Thượng viện Bang — chuyện gì tiếp theonháp · 1.840 từMarcus AdekunleCHÍNH TRỊ67%0.41CHUYỂN BÀN TRÊNXem lại
Người di cư vì khí hậu: theo sát 5 năm saunháp · 1.840 từYuki HiranoCHỦ ĐỀ14%0.06OKXuất bản
Lợi nhuận công nghệ: ai vượt, ai hụtnháp · 1.840 từDiego MoralesKINH DOANH51%0.28TẠM GIỮXem lại
Hiển thị 7/7 · sắp xếp theo mục, thời gian gửinhật ký: 47 quyết định hôm nay · 2 bài chuyển bàn trên
47sthời gian kiểm tra trung vị mỗi bài
4tích hợp CMS
RESTOpenAPI 3.0 · sẵn sàng tự host
0số bản gửi dùng huấn luyện (theo chính sách)
5ngôn ngữ phát hiện, đang mở rộng
ĐÁNH GIÁ PHÁT HÀNH

Xem ai đang tái bản nội dung của bạn — và canonical có đúng nguồn không.

01 · SỨC KHỎE CANONICAL

Theo dõi mạng lưới phân phối

Thêm các domain bạn phát hành cùng (Medium, LinkedIn, Substack, đối tác của bạn) vào danh sách cho phép. Báo cáo crawl hàng tuần chỉ ra bên nào để rel=canonical về trang gốc (ORIGIN credit), bên nào thiếu (SEO leak), bên nào tái bản không phép (SCRAPED).

Phát hiện bài từ LinkedIn bị mất canonical vì nền tảng xóa thẻ này.
02 · PHÁT HIỆN SCRAPER

Blog nào thiếu tên tác giả bạn?

Quét định kỳ so sánh tên miền ngoài danh sách, phát hiện trang đăng lại từng đoạn bài của bạn. Đối chiếu kèm snapshot ngày xuất hiện — chứng cứ DMCA đủ ngày. Chúng tôi không gửi DMCA (đó là quyết định pháp lý); chúng tôi chỉ cung cấp tài liệu.

Xuất báo cáo chứng cứ thành PDF cho bộ phận pháp lý.
03 · ĐÁNH GIÁ ĐOẠN BOILERPLATE

Lặp lại nội dung nội bộ trên web bạn

Quét ngang thư mục: đưa corpus toàn bài xuất bản vào một thư mục; công cụ xây ma trận tương đồng từng cặp. Phát hiện 47 trang thành phố cùng đoạn giới thiệu — đây là nguy cơ Helpful-Content-Update cần biết trước Google.

Chạy hàng tuần; xuất ma trận CSV.
NGUYÊN TẮC BIÊN TẬP

Ba chính sách phòng tiêu chuẩn hỏi trước khi ký hợp đồng.

Thứ nhất — bài viết gửi lên không bao giờ được dùng để huấn luyện mô hình. Không dùng cho mô hình của chúng tôi, cũng không dùng cho mô hình của bên nào khác. Văn bản gửi lên sẽ được tạo dấu vân tay, lập chỉ mục trong không gian riêng của bạn, và xóa sau 30 ngày trừ khi bạn chọn lưu lại. Thứ hai — kết quả AI (sắp ra mắt, đã có trong lộ trình) sẽ đánh giá theo từng đoạn, không phải toàn bài, và ghi nhãn với commit của engine cùng thời điểm chụp snapshot của corpus. Nếu có tranh chấp về cờ AI, bạn có thể kiểm tra lại sau nhiều tháng với cùng commit đó. Không có việc tự động huấn luyện lại mà không thông báo. Thứ ba — Apache 2.0 cho phép đội kỹ thuật của bạn sao chép github.com/NoplagLabs/noplag-engine, triển khai trên hạ tầng của chính bạn, kiểm tra luồng dữ liệu và xác minh toàn bộ quy trình xóa dữ liệu theo yêu cầu. Phần lớn các đánh giá mua sắm phần mềm kiểm tra đạo văn tại các tổ chức đều vướng ở ba câu hỏi này; chúng tôi cố gắng trả lời rõ ràng ngay từ đầu.

Đọc hướng dẫn bàn tiêu chuẩn
Q&A PHÒNG BIÊN TẬP
Q1Công cụ có học từ bài của chúng tôi không? — Không. Bản gửi chỉ fingerprint; không dùng huấn luyện.
Q2Có tự host được không? — Có. Apache 2.0 + Docker. Chạy hoàn toàn trong hạ tầng của bạn.
Q3Dữ liệu lưu tại EU được không? — Pro+ trên api.eu.noplag.com. Mặc định theo GDPR.
Q4Có báo cáo tái kiểm tra được không? — Mỗi kiểm tra đóng dấu X-Engine-Commit và snapshot kho dữ liệu. Kiểm lại giống nhau sau nhiều tháng.
Q5Giá theo lô số lượng lớn? — Pro đoạn tính giá theo từng bài, Hợp đồng Enterprise giá theo corpus + hạ tầng riêng.
Q6Trích dẫn nguồn như thế nào? — Mỗi đoạn trùng kèm URL nguồn, thẻ canonical, ngày snapshot, engine commit.
FAQ

Các câu tiêu chuẩn phòng tiêu chuẩn luôn hỏi khi mua.

Bài viết của chúng tôi có bị dùng huấn luyện AI không?
Không. Các bài gửi chỉ được fingerprint (chỉ lưu winnowing hash), lưu trong cơ sở dữ liệu riêng biệt từng vùng. Bản gốc xóa sau 30 ngày, trừ khi chọn giữ lại. Mô hình AI phát hiện — Binoculars-based (Hans et al. 2024), chuẩn bị phát hành — chỉ huấn luyện trên bộ công khai; không bao giờ thêm nội dung khách hàng. Thể hiện rõ trong DPA.
Kết quả AI từng đoạn giải quyết tranh luận ra sao?
Chức năng phát hiện AI sẽ ra mắt sớm — nằm trong lộ trình v1.2, chưa có khi phát hành ban đầu. Khi triển khai, mỗi đoạn bị gắn cờ sẽ ghi lại commit của engine và thời điểm snapshot của corpus. Kiểm tra lại cùng đoạn văn với commit đó sẽ cho kết quả giống hệt. Thuật toán được công khai tại github.com/NoplagLabs/noplag-engine (Apache 2.0), chỉ rõ ngưỡng perplexity, có tài liệu về hiệu chỉnh cho người dùng tiếng Anh không bản ngữ. Chúng tôi không có chế độ “tin vào điểm số”.
Freelancer ở vùng mạng yếu có gặp khó không?
Phát hiện được hiệu chỉnh cho tiếng Anh, Tây Ban Nha, Bồ Đào Nha, Ba Lan và Ukraina ngay khi ra mắt; sẽ bổ sung thêm ngôn ngữ khác. Chất lượng phát hiện được đánh giá trên PAN-PC-11; đánh giá riêng cho từng ngôn ngữ nằm trong lộ trình. Kết quả AI đã hiệu chỉnh cho người dùng tiếng Anh không bản ngữ sẽ gắn cờ là ESL ADJ thay vì LIKELY-AI nếu dấu hiệu từ vựng cho thấy điều đó.
Có tự host trong nội bộ tòa soạn được không?
Có — engine Apache 2.0 + Docker. Chạy hoàn toàn trong mạng nội bộ. Kết hợp Postgres + Redis sẵn trong hạ tầng của bạn; không có bản gửi nào ra khỏi VPC. Phù hợp với tòa soạn yêu cầu bảo vệ nguồn tin và bảo mật trước khi xuất bản.
Có tích hợp với CMS của chúng tôi?
WordPress (plugin chính thức), Ghost (Admin API + webhook), Drupal (module cộng đồng). Với CMS dạng khác — tùy chỉnh, headless, nội bộ — REST + OpenAPI 3.0 spec đủ cho nhóm kỹ thuật xây hook kiểm tra trong một ngày. SDK Python và Node build từ spec.
Tính năng đánh giá lại phát hành làm gì?
Thêm domain phân phối vào danh sách (medium.com/@you, domain đối tác của bạn). Crawl hàng tuần xem canonical: ORIGIN (trỏ về bạn), SYND OK (từ đối tác vẫn trỏ về bạn), LEAK (thiếu canonical hoặc trỏ nơi khác — split SEO), SCRAPED (bản sao đúng nguyên văn, không canonical, ngoài danh sách). Trường hợp SCRAPED đi kèm snapshot ngày để làm chứng cứ DMCA.
Giá thế nào với phòng tin 30 phóng viên?
Gói Premium $79/tháng: 5.000 từ/lượt, 5.000 bài/tháng, API & CMS tích hợp. Hoạt động quy mô lớn (10.000+ bài/tháng) dùng gói Enterprise, giá theo corpus + hạ tầng riêng. Không tính phí từng phóng viên; chỉ tính theo sản lượng.
Bài bình luận, trích xuất sách nơi 'tái sử dụng' hợp lý thì sao?
Pro+ cho phép đặt ngưỡng riêng từng mục — ví dụ mục thời sự, bình luận, trích xuất sách. Một bài bình luận trích dẫn nguyên văn bài phát biểu không nên áp cùng mức với bài copy từ đối thủ. Phân loại nhận diện trích dẫn sẽ tách rõ trích dẫn có nguồn khỏi nhầm lẫn tái sử dụng.
Có làm chậm quy trình xuất bản không?
Trung vị 47 giây mỗi bài kiểm tra 1.500–4.000 từ. Hook CMS chạy bất đồng bộ — kiểm tra khi lưu nháp, biên tập viên xem kết quả xong là xong sửa bài. Dạng dài (>8.000 từ) mất ~90 giây, nên kiểm tra trước xuất bản thay vì đồng bộ.
Có thêm kho lưu trữ riêng làm nguồn kiểm tra được không?
Có — Enterprise tier. Nạp hàng loạt nội dung lưu trữ vào corpus riêng tư, mỗi bài mới sẽ kiểm tra đối chiếu với kho cũ của bạn. Phát hiện phóng viên tái sử dụng (có khi hợp lý, có khi không), hoặc dùng lại nội dung cũ dưới tên tác giả mới.

Thử gửi bản nháp qua hàng đợi. Xem từng bài riêng lẻ.

Dán file Word, Google Doc, hoặc bài xuất từ CMS. Nhận báo cáo từng đoạn trong 47 giây. Miễn phí đến 2.500 từ; Pro cho số lượng; Enterprise cho kho lưu trữ và hạ tầng riêng.

Kiểm tra đạo văn cho nhà xuất bản trước xuất bản