Kiểm tra đạo văn phát hiện nội dung trùng lặp trực tuyến
Tìm nội dung trùng lặp trên web, thư mục riêng, và thư viện của nhóm. Nhận biết canonical — phân biệt cấp phép đăng lại hợp lệ với bản sao bị lấy trộm. Miễn phí tới 2.500 từ; quét thư mục ở bản Pro.
Bốn loại trùng lặp. Cách xử lý khác nhau.
Hầu hết công cụ chỉ bắt trùng lặp y nguyên. Chúng tôi phân loại từng phát hiện vào 1 trong 4 nhóm để bạn biết nên bỏ qua (trích dẫn hợp lệ), hợp chuẩn hóa (syndication), hay phải biên tập lại (bản bị lấy hoặc spin).
Trùng từng chữ
Chuỗi ký tự giống hệt từ 30 ký tự trở lên. Bao gồm văn bản dán, bài viết syndication đăng y nguyên, trang bị scrape.
Điều chỉnh nhẹ
Cấu trúc câu giữ nguyên, thay từ đồng nghĩa hoặc đảo lại tính từ. Đặc trưng của bản spin. Phát hiện cái Copyscape không bắt được.
Diễn đạt lại mạnh
Paraphrase tầm câu, đảo mệnh đề, chuyển thì, thêm lấp chỗ trống. Thường do công cụ AI rewriter hoặc bên gia công nội dung tạo ra.
Lặp lại trên nhiều trang
Cảnh báo, tiểu sử tác giả, mô tả sản phẩm giống hệt trên hàng trăm trang — đây mới là vấn đề trùng lặp Google thực sự quan tâm.
Không chỉ là “dán lại từ site khác”.
Đúng theo tài liệu Search Central của Google: ba kiểu trùng lặp bị xử lý — hầu hết là từ chính site bạn, không phải bị cạnh tranh lấy trộm.
Copy liên domain không có canonical
Bài giống hệt xuất hiện ở nhiều site mà không có rel=canonical trỏ về bản gốc. Bao gồm syndication làm sai, bị đối thủ scrape, trùng lặp do tác giả tự đăng lên hai nền tảng.
Cùng nội dung dưới nhiều URL trong site
/product/foo và /product/foo?utm_source=email và /product/foo/ có dấu /. Các kiểu nav bộ lọc sinh ra trang giống hệt, bản in không canonical, URL tách riêng mobile/desktop. Google sẽ nhóm lại, chọn một trang, loại phần còn lại.
Boilerplate giả dạng nội dung
Trang danh mục thương mại điện tử có 5 đoạn mô tả giống hệt cho 1.200 SKU. Trang địa điểm dán 1 câu “Nhóm chúng tôi có 20 năm kinh nghiệm” trên 47 trang thành phố. Nội dung mỏng — rủi ro bị Google Helpful Content Update gắn cờ.
Sáu nhóm dùng kiểm tra này hàng tuần.
Một công cụ, sáu quy trình khác nhau — từ blogger tự soát nháp đến agency QA cho bài thuê ngoài.
Bài blog trước xuất bản
Soát lại nháp với web trước khi đăng. Bắt lỗi tái sử dụng cụm từ từ chính bài cũ, bài đổi thủ đã đọc khi nghiên cứu, và lỗi do AI rewriter.
Phát hiện bị lấy trộm
Dán bài, xem ai đang đăng lại. Có URL nguồn, đoạn trùng, và snapshot đóng dấu giờ để lưu làm bằng chứng DMCA.
Kiểm soát thư viện nội dung
Bản Pro quét thư mục. Kéo cả thư viện nhóm vào, công cụ đánh dấu các đoạn lặp lại giữa bài, boilerplate cần chuyển sang template chung.
Kiểm tra syndication
Bạn syndicate bài lên Medium, LinkedIn, Substack. Đã đúng canonical về bản gốc chưa? Công cụ quét, kiểm tra tag canonical, báo rõ bản nào đang làm sai.
QA cho bài thuê ngoài
Dán bản nộp của freelancer trước khi trả tiền. Phát hiện pattern lấy-trộm-sau-spin, vết AI rewriter, và trích dẫn thiếu nguồn rõ.
Truy xuất nguồn AI-content
AI lấy văn bản từ web ngoài khi lookup. Công cụ hiển thị đoạn bị dùng lại để bạn quyết: ghi nguồn, chỉnh sửa hoặc bỏ hẳn câu đó. Giảm rủi ro bị Google Helpful-Content-Update.
Kéo thư viện vào. Xem bài nào trùng với bài nào.
Chức năng Pro. Chọn thư mục bài viết; engine xây ma trận tương đồng giữa từng cặp. Sắp xếp theo mức trùng, nhấn để xem phần trùng.
- 150M+đã lập chỉ mục
- 30dtần suất làm mới dữ liệu
- 94%tỷ lệ phát hiện canonical
- 4các tầng phân loại trùng
- 2014lập chỉ mục Common Crawl
Ba điều mà kiểm tra trùng trên browser và bộ SEO không phát hiện.
Chỉ trùng y nguyên (Copyscape chuẩn). Một câu viết lại qua mặt hoàn toàn — và bản spin cũng qua được. Hữu ích cho kiểm tra paste; vô dụng cho QA nội dung.
Noplag: phân loại 4 tầng (Y nguyên / Gần giống / Spin / Boilerplate) kèm gợi ý mục đích — hành động rõ, không chỉ gắn cờ đơn giản.
Tính năng check trùng đi kèm gói $99-499/tháng. Chỉ soát n-gram cấp bề mặt; không truy cập Common Crawl; không quét đa tài liệu theo thư mục.
Noplag: bản Free độc lập (2.500 từ). Pro ($23/tháng) thêm kiểm tra thư mục và đủ 250 triệu+ web — không bắt buộc phải mua cả gói SEO.
Hộp đen. Không biết nguồn trùng nào, chỉ hiện số tương đồng. Giới hạn 1.000 từ. Đa phần không cập nhật chỉ mục — kiểm tra dựa trên snapshot web 2021.
Noplag: từng trùng đều có URL nguồn + canonical + đoạn trùng + ngày snapshot. Apache 2.0 — đọc thuật toán nếu muốn.
Bài đăng lại có rel=canonical không là “nội dung trùng”. Chúng tôi xem xét điểm này.
Một bài xuất hiện ở nhiều URL, SEO không hỏi “có giống hệt không?” mà là “có cùng canonical không?”. Guest post trên Medium đặt rel=canonical về bản gốc, Google sẽ nhóm và tính điểm cho bản gốc, còn lại coi là syndication hợp lệ. Nếu không, bạn tự cạnh tranh với chính mình. Công cụ lấy từng trùng, đọc tag <link rel="canonical">, gắn nhãn kết quả: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK hoặc SCRAPED.
Câu hỏi một trưởng nhóm nội dung đặt ra trước khi tích hợp.
Chỉ mục web ở đây so với Copyscape hay SEMrush thế nào?
Hơn 250 triệu trang chỉ mục từ Common Crawl cùng các domain lớn về SEO, làm mới mỗi 30 ngày. Phủ rộng hơn chỉ mục của Copyscape (tầm 120 triệu, tập trung boilerplate), nhưng không bao trùm crawl đầy đủ của Google. Cadence chỉ mục và phạm vi công khai rõ ràng. Bản Pro cho phép thêm thư viện riêng.
Nhận biết canonical hoạt động ra sao?
Khi phát hiện trùng, engine lấy source (cache hoặc live), phân tích <head>, trích rel=canonical. Sau đó, gắn nhãn ORIGIN (canonical đúng bản thân), SYND-OK (canonical về trang bạn kiểm soát), LEAK (thiếu hoặc sai canonical), hoặc SCRAPED (không canonical + domain ngoài). Gắn nhãn rõ cạnh từng kết quả, giúp đọc tỷ lệ trùng sát thực.
Có nhận diện được AI lấy lại nội dung từ nguồn ngoài không?
Có — AI khi viết sẽ lấy đoạn từ web thực trong quá trình lookup, các đoạn này hiện lên dưới dạng Near-dup hoặc Spun. Chúng tôi hiển thị kèm URL nguồn để bạn quyết: ghi nguồn, sửa, hoặc cắt. Phát hiện AI-content (tín hiệu riêng) là công cụ khác — chưa ra mắt, chỉ quét trùng là tính năng chính hiện tại.
Tôi có thể quét tài liệu lớn nhất bao nhiêu từ?
2.500 từ bản Free, 50.000 cho Premium, 250.000+ bên Enterprise (hoặc không giới hạn khi tự host). Bản Pro quét thư mục cho phép 2.000 tài liệu/một thư mục; ma trận tương đồng cho từng cặp tính trong dưới 5 phút quy mô đó.
Công cụ này có phát hiện đối thủ đã lấy trộm bài của tôi không?
Nếu bản copy nằm trong chỉ mục web (tức ở site công khai), có — URL sẽ xuất hiện kèm snapshot lại, đóng dấu giờ. Snapshot dùng làm chứng cứ DMCA: có ngày, băm nội dung, đánh dấu đoạn trùng. Chúng tôi không tự động kiện DMCA (bạn quyết định), chỉ cung cấp hồ sơ.
Có loại trừ được mạng syndication của tôi khỏi quét trùng không?
Chỉ bản Pro — thêm domain vào danh sách cho phép (medium.com/@you, linkedin.com/in/you, substack.com/p/you). Đụng trùng với domain đó gắn nhãn SYND-OK và không tính vào điểm trùng. Điểm chỉ phản ánh "trùng không mong đợi" thay vì "mọi loại trùng".
Quét thư viện 500 bài theo từng cặp được xử lý thế nào?
Thực tế cascade retrieval O(n log n) cho mỗi cặp — dùng fingerprint 60-bit lọc cặp, chỉ căn chỉnh thật sự với ứng viên trùng. 500 bài → 124.750 cặp, quét trong ~4 phút trên máy 4 lõi. Ma trận xuất CSV cho pipeline tùy ý.
Công cụ này thực sự là mã nguồn mở phải không?
Có — github.com/NoplagLabs/noplag-engine, Apache 2.0. Toàn bộ logic phân đoạn, tạo dấu vân tay, truy xuất tầng, căn chỉnh và phân loại trùng lặp đều có trong repo. Phiên bản cloud bổ sung thêm corpus, Common Crawl và bản sao Wikipedia; tự triển khai thì tự chuẩn bị corpus. Nên kiểm tra thuật toán trước khi tin vào điểm số.
API tích hợp pipeline nội dung ra sao?
REST endpoint tại /v1/checks (SDK Python + Node). Gửi tài liệu, nhận báo cáo trùng lặp đồng bộ trong tối đa 8 giây, trên mức đó sẽ trả về qua webhook. Hữu ích cho kiểm tra CI trước khi xuất bản — từ chối merge nếu tỷ lệ trùng lặp vượt ngưỡng của nhóm. Tham khảo đầy đủ tại /docs/developers/api.
Còn nội dung sau paywall hay yêu cầu đăng nhập?
Chỉ crawl nội dung công khai — Common Crawl, các trang khai báo trong sitemap, domain cho phép robots. Paywall (NYT, FT, các tạp chí học thuật) không nằm trong chỉ mục; engine không hiện match dù bạn viết lại từ đó. Bài học thuật thì OpenAlex / CORE (corpus riêng) bao phủ nguồn open-access.
Quét bài nháp hoặc toàn bộ thư viện.
Bản miễn phí soát 2.500 từ so với 250 triệu+ trang web. Pro ($23/tháng) cho phép kiểm tra từng cặp toàn thư viện đã xuất bản. Có Apache 2.0 reference nếu bạn muốn tự lưu trữ dữ liệu.