noplagApache 2.0
WEB250 juta+ halaman · sadar-kanonikal

Cek plagiarisme konten duplikat online

Temukan konten duplikat di web, folder Anda, dan perpustakaan tim Anda. Sadar-kanonikal — membedakan sindikasi legal dari hasil scrape. Gratis hingga 2.500 kata; pemindaian tingkat-folder hanya di Pro.

0 / 1,500 words
Web + Common Crawl terindeksDeteksi near-duplicate + spun-contentPemindaian perpustakaan tingkatan-folder
TIPE DUPLIKAT

Empat jenis duplikat. Penanganan beda, solusi beda.

Kebanyakan “dupe checker” hanya mendeteksi kecocokan persis. Kami mengklasifikasikan setiap kecocokan ke empat kategori supaya Anda tahu mana yang bisa diabaikan (kutipan sah), mana yang dikanoikalkan (sindikasi), dan mana yang diubah ulang (scrape/spun).

01 · EXACT

Cocok kata per kata

String identik 30+ karakter. Termasuk boilerplate copy-paste, artikel sindikasi direpublikasi utuh, halaman scrape.

Solusi: kanonikal-kan, ubah, atau biarkan (jika itu milik Anda sendiri yang disindikasi).
02 · NEAR-DUP

Sedikit diubah

Bentuk kalimat tetap, sinonim ditukar atau urutan adjektiva diganti. Pola klasik “spin”. Menangkap yang Copyscape sengaja lewatkan.

Solusi: rewrite total — argumen dasarnya harus dari Anda.
03 · SPUN

Parafrase agresif

Parafrase level kalimat: klausa diacak, tenses diganti, filler disisipkan. Umum dari alat rewrite AI dan pabrik konten pesanan.

Solusi: verifikasi niatnya. Ini parafrase asli penulis atau duplikat tersembunyi?
04 · BOILERPLATE

Berulang antar halaman

Disclaimer, bio penulis, atau deskripsi produk sama muncul di ratusan halaman Anda sendiri — inilah masalah duplikat Google yang sebenarnya.

Solusi: pindahkan ke template bersama; hindari Google mengindeks 800 kali.
APA YANG DIANGGAP DUPLIKAT OLEH GOOGLE

Bukan sekadar “copy-paste dari situs lain.“

Aturan nyata Google (dari Search Central): tiga pola memicu perlakuan duplikat, kebanyakan justru terkait halaman sendiri, bukan scrape kompetitor.

01

Salinan lintas-domain tanpa kanonikal

Artikel sama muncul di banyak situs tanpa rel=canonical ke sumber. Termasuk sindikasi keliru, scrape yang tak dideklarasikan, dan tak sengaja gandakan konten di dua outlet.

02

Konten sama di banyak URL dalam satu situs

/product/foo dan /product/foo?utm_source=email dan /product/foo/ slash belakang. Navigasi facet (filter bikin halaman identik), versi printer-friendly tanpa kanonikal, URL mobile/desktop terpisah. Google mengelompokkan, pilih satu, abaikan sisanya.

03

Boilerplate dianggap konten

Kategori e-commerce with 5 paragraf deskripsi sama di 1.200 SKU. Halaman lokasi dengan copy tim “berpengalaman 20 tahun” di 47 kota. Thin-content duplikat — selalu dikenali Google.

KASUS SEO

Enam tim rutin cek ini tiap minggu.

Satu alat, enam alur kerja — mulai dari blogger solo cek pra-terbit sampai agensi QA artikel pesanan.

Blog post sebelum terbit

Cek draft lawan web live sebelum publish. Menangkap reuse tidak sengaja dari posting lama (kanibalisasi sendiri), artikel kompetitor hasil riset, slip AI-rewriter.

Deteksi scrape kompetitor

Tempel artikel Anda, lihat siapa lagi mempublikasikannya. Berguna buat dokumentasi DMCA — tiap kecocokan tampilkan URL sumber, interval cocok, snapshot timestamp bisa disimpan.

Kebersihan perpustakaan konten

Scan tingkat-folder Pro. Taruh semua artikel tim Anda di satu folder; alat mendeteksi duplikasi antar dokumen — paragraf sama di tiga artikel berbeda, boilerplate yang harusnya template.

Audit sindikasi

Anda sindikasi artikel ke Medium, LinkedIn, Substack. Apakah semuanya pakai rel=canonical ke URL asal? Alat cek tiap republish, baca tag canonical, beri tahu mana yang bocor SEO.

QA penulis pesanan

Hasil penulis freelance di satu tampilan. Cek sebelum bayar. Deteksi pola scrape-then-spin yang sering terjadi, signature AI-rewriter, kutipan tanpa sitasi.

Asal-usul konten AI

AI ambil teks dari sumber web saat lookup konteks. Alat tampilkan bagian reuse itu supaya Anda bisa putuskan: sitasi, rewrite, atau hapus paragraf. Kurangi risiko update konten tipis Google.

SCAN DUPLIKAT TINGKAT-FOLDER

Taruh perpustakaan Anda. Lihat mana yang tumpang tindih.

Fitur Pro. Pilih folder berisi artikel terbit; mesin membangun matriks kemiripan antar tiap pasang. Bisa diurutkan, klik untuk lompat ke interval bermasalah.

FOLDER / blog-2026-q16 artikel · matriks kemiripan antar pasang
3 overlaps lintas > 10%Ekspor matriks
ARTIKELA1A2A3A4A5A6
A1 — Lima model harga SaaS·4%3%38%6%2%
A2 — Cara menulis harga SaaS4%·5%12%7%3%
A3 — Panduan harga product-led3%5%·8%6%4%
A4 — Playbook harga SaaS38%12%8%·9%5%
A5 — Memilih harga SaaS Anda6%7%6%9%·4%
A6 — Harga SaaS untuk founder2%3%4%5%4%·
Klik sel untuk melihat interval overlapping antar dua artikel
  • 250 juta+halaman web terindeks
  • 30dinterval refresh korpus
  • 94%tingkat deteksi kanonikal
  • 4tier klasifikasi dupe
  • 2014indeksasi Common Crawl
VS ALAT DUPE DASAR

Tiga hal yang dupe-checker browser dan suite SEO tidak temukan.

ALAT SEJENIS COPYSCAPE

Hanya match persis (standar Copyscape). Kalimat diubah tetap dihitung “unik” — output spun lolos. Berguna buat scrape clipboard; tidak efektif untuk QA konten.

Noplag: klasifikasi 4 tier (Exact / Near-dup / Spun / Boilerplate) plus penanda niatan — bisa ditindak, tidak sekadar Boolean.

SEO SUITES

Alat unik konten dibundel di seat $99-499/bln. Terbatas n-gram surface match; tidak ada cakupan Common Crawl; tidak ada deteksi antar dokumen dalam folder.

Noplag: Free mandiri (2.500 kata). Pro ($23/bln) tambah matriks folder-level + indeks web penuh 250 juta+. Tidak mengunci alat dupe ke bundle SEO $400.

PEMERIKSA GRATIS ONLINE

Kotak hitam. Tidak nampak sumber mana yang cocok, hanya skor similarity. Batas sering 1.000 kata. Kebanyakan tidak refresh indeks — cek ke snapshot web 2021.

Noplag: setiap match tampilkan URL sumber + canonical + interval match + tanggal snapshot korpus. Apache 2.0 — algoritma cocok bisa dibaca sendiri.

DETEKSI SADAR-KANONIKAL

Artikel repost dengan rel=canonical bukan “konten duplikat.” Kami perlakukan begitu.

Saat satu artikel ada di banyak URL, pertanyaan SEO bukan “identik?”, tapi “apakah semua pakai canonical yang sama?” Jika guest post Anda di Medium menunjuk rel=canonical ke URL asal, Google mengelompokkan, memberi ranking ke asal, dan sisanya dianggap sindikasi sah. Jika tidak, Anda bersaing dengan konten Anda sendiri. Alat mengambil semua hasil, parsing <link rel="canonical"> tag, dan label tiap hasil: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK, atau SCRAPED.

Baca logika canonical
FAQ

Pertanyaan yang diajukan content lead sebelum integrasi.

Bagaimana cakupan web dibanding Copyscape atau SEMrush?

250 juta+ halaman terindeks dari Common Crawl + domain traffic tinggi relevan SEO, update tiap 30 hari. Lebih luas dari indeks persis Copyscape (~120 juta, fokus boilerplate plagiarisme), lebih sempit dari crawl Google penuh tapi cakupan jelas dan refresh terpublikasi. Tier Pro menambah folder sendiri sebagai korpus privat.

Bagaimana deteksi canonical sebenarnya bekerja?

Untuk setiap halaman match, mesin mengambil URL sumber (cache atau live), parsing <head>, dan ekstraksi rel=canonical. Match dilabel ORIGIN (canonical ke sendiri), SYND-OK (canonical ke halaman lain yang dikontrol), LEAK (canonical hilang/ke lain di distribusi), atau SCRAPED (tidak ada canonical + bukan domain distribusi). Klasifikasinya tampil di setiap match, jadi skor dupe Anda jujur.

Apakah ini bisa mendeteksi konten AI reuse?

Bisa — asisten tulis AI mengambil teks web saat lookup konteks, reuse ini muncul sebagai Near-dup/Spun. Kami tampilkan beserta URL sumber, Anda yang putuskan: sitasi, rewrite, hapus. Deteksi konten AI (sinyal berbeda) adalah alat terpisah, sedang dikembangkan — tidak live — dan cek dupe adalah fokus di sini.

Dokumen terbesar yang bisa saya scan?

2.500 kata di Gratis, 50.000 di Premium, 250.000+ di Enterprise (atau tanpa batas di self-host). Scan folder-level Pro: satu folder bisa 2.000 dokumen; matriks dihitung semua pasangan < 5 menit untuk skala itu.

Bisakah ini temukan kompetitor yang scrape konten saya?

Jika hasil scrape ada di web index (situs publik, bisa di-crawl), bisa — URL-nya tampil di daftar kecocokan dengan snapshot bertanggal. Snapshot jadi bukti DMCA: tanggal, hash isi, interval match disorot. Tidak auto-DMCA (urusan hukum), tapi kami sediakan dokumenya.

Bisakah saya kecualikan jaringan sindikasi sendiri dari scan duplikat?

Tier Pro — tambahkan allowlist domain Anda (medium.com/@anda, linkedin.com/in/anda, substack.com/p/anda). Match ke domain allowlist diberi tag SYND-OK dan tidak dihitung skor dupe. Skor hanya menyoroti “duplikasi tak terduga” bukan “semua duplikasi.”

Bagaimana scan pairwise folder handle library 500 artikel?

Retrieval cascade O(n log n) per pasangan secara praktik — fingerprint winnowing pilah kandidat dengan hash 60-bit, alignment penuh hanya dijalankan pada kandidat. 500 artikel → 124.750 pasangan di-scan < 4 menit di mesin 4-core. Matriks bisa diekspor jadi CSV untuk pipeline lanjutan.

Apakah mesinnya benar-benar open source?

Ya — github.com/NoplagLabs/noplag-engine, Apache 2.0. Modul chunker, fingerprinter, retrieval cascade, alignment, dan logika klasifikasi duplikasi semuanya ada di repo. Layanan cloud menambahkan korpus + Common Crawl + mirror Wikipedia; self-host menggunakan korpus milik Anda sendiri. Verifikasi algoritma sebelum mempercayai skor.

API untuk integrasi pipeline konten?

REST endpoint di /v1/checks (tersedia SDK Python + Node). Kirim dokumen, dapatkan laporan duplikasi secara sinkron hingga 8 detik, selebihnya menggunakan webhook callback. Cocok untuk pengecekan CI sebelum publikasi — gagalkan merge jika persentase duplikasi melebihi ambang tim Anda. Referensi lengkap di /docs/developers/api.

Bagaimana dengan konten di balik paywall atau login?

Kami hanya crawl yang publik — Common Crawl, halaman dari sitemap, domain robots-allowed. Konten paywall (NYT, FT, jurnal akademik tertutup) tidak diindeks; mesin tidak menampilkan kalau draft re-use frasa dari sana. Untuk paper akademik, OpenAlex / CORE (korpus terpisah) cakup open-access.

Scan draft. Atau perpustakaan konten Anda.

Tier gratis: 2.500 kata lawan 150M+ halaman web. Pro ($23/bln) unlock scan pairwise folder untuk perpustakaan Anda. Apache 2.0 referensi untuk self-host korpus.

Cek plagiarisme konten duplikat online gratis