WEB150M+ pagina’s · canonical-herkenning

Plagiaat checker voor dubbele content online

Vind dubbele content op het live web, in uw eigen mappen en in het content-archief van uw team. Herkent canonical — maakt onderscheid tussen legitieme syndicatie en gekopieerde teksten. Gratis tot 2.500 woorden; mappen-scans in Pro.

0 / 1,500 words
Web + Common Crawl geïndexeerdHerkenning van nagenoeg identieke en gesponnen contentMappen-scan van bibliotheek
DUPLICAAT-TYPES

Vier soorten duplicaat. Andere aanpak, andere oplossing.

De meeste “duplicate checkers” vinden alleen exact dezelfde zinnen. Wij classificeren per match in vier categorieën, zodat u weet wat u kunt negeren (legitiem citaat), wat u canoniek moet maken (syndicatie), en wat u moet herschrijven (gekopieerd of gesponnen).

01 · EXACT

Letterlijke match

Identieke tekenreeksen van 30+ karakters. Denk aan gekopieerde boilerplate, artikelen letterlijk overgenomen, gekrabde pagina’s.

Oplossing: canoniek maken, herschrijven, of accepteren (als het uw eigen werk betreft).
02 · NEAR-DUP

Licht herschreven

Zinsstructuur behouden, synoniemen of bijvoeglijk naamwoorden verwisseld. Klassiek “spin”-patroon. Vindt wat Copyscape expres mist.

Oplossing: volledig herschrijven — het onderliggende betoog moet origineel zijn.
03 · SPUN

Aggressief geparafraseerd

Parafrase op zinsniveau met herschikte bijzinnen, andere tijden, toegevoegde opvulling. Veelvoorkomend bij AI-rewriters en uitbesteed tekstwerk.

Oplossing: intentie verifiëren. Is dit de eigen parafrase van de auteur, of toch kopie?
04 · BOILERPLATE

Terugkerend op meerdere pagina’s

Bijvoorbeeld dezelfde disclaimer, auteursbio of productbeschrijving op honderden eigen pagina’s — Googles feitelijke zorg rondom dubbele content.

Oplossing: verplaats naar een gedeelde template. Laat Google dit niet 800 keer indexeren.
WAT GOOGLE ECHT ZIET ALS DUPLICAAT

Niet alleen “copy-paste van een andere site.”

De echte Google-richtlijnen (bron: Search Central): drie patronen geven duplicaatproblemen. Meestal gaat het om uw eigen site, niet om gekrabde concurrenten.

01

Cross-domain kopieën zonder canonical

Hetzelfde artikel op meerdere sites zonder rel=canonical terug naar het origineel. Dit omvat verkeerd verspreide syndicatie, niet-geclaimde scrapes, en per ongeluk dubbele publicatie door dezelfde schrijver.

02

Zelfde content onder meerdere URLs op uw eigen site

/product/foo en /product/foo?utm_source=email en /product/foo/ met slash. Gefacetteerde navigatie (filtercombinaties produceren identieke pagina’s), printervriendelijke versie zonder canonical, aparte desktop- en mobiel-urls. Google groepeert, kiest er één, laat de rest vallen.

03

Boilerplate als inhoud vermomd

Bijvoorbeeld een categoriepagina met vijf identieke alinea’s bij 1.200 SKUs. Pagina’s over locaties met 47 keer dezelfde tekst als “Ons team heeft 20 jaar ervaring”. Dubbelen met weinig waarde — Google’s Helpful Content Update markeert dit sterk.

SEO-TOEPASSINGEN

Zes teams die dit wekelijks draaien.

Zelfde tool, zes processen — van de blogger die vooraf checkt tot een bureau dat uitbesteed werk controleert.

Blogpostcontrole vóór publicatie

Scan het concept tegen het web voordat u publiceert. Vindt onbedoelde herhaling uit oude eigen posts (zelf-cannibalisatie), concurrerende artikelen tijdens research, en AI-fouten.

Scrapings door concurrenten

Plak uw artikel, zie wie het verder publiceert. Handig voor DMCA-bewijs — elke match geeft bron-URL, overeenkomstende secties en een datumstempel die u kunt opslaan.

Bibliotheek-hygiëne

Pro-functie op mapniveau. Zet alle artikelen van het team in een map; tool markeert dubbele passages — bijv. dezelfde paragraaf in drie artikelen, boilerplate die eigenlijk in een template moet.

Syndicatie-audit

U verspreidde een artikel via Medium, LinkedIn, en Substack. Verwijzen ze allemaal met rel=canonical naar uw originele versie? De tool haalt op, leest de canonical tag, en toont welke herpublicaties SEO-waarde lekken.

QA op uitbesteed werk

Tekst van freelance schrijver direct controleren. Doe dit voor betaling. Vindt het script-pattern, AI-spins, en ontbrekende bronvermeldingen.

Herkomst AI-content

AI-tools halen tekst uit bestaande bronnen. Deze tool laat die passages zien, zodat u beslist: bron noemen, herschrijven of schrappen. Voorkomt problemen bij Helpful Content Update.

DUPLICAATSCAN OP MAPNIVEAU

Gooi uw bibliotheek erin. Zie de overlap.

Pro-functie. Kies een map met gepubliceerde artikelen; de engine bouwt een gelijkenismatrix tussen elk paar. Sorteerbaar op overlap, klikbaar naar overeenkomende secties.

MAP / blog-2026-q16 artikelen · pairwise gelijkenismatrix
3 overlappen > 10%Matrix exporteren
ARTIKELA1A2A3A4A5A6
A1 — Vijf SaaS-prijsmodellen·4%3%38%6%2%
A2 — SaaS-prijsstelling schrijven4%·5%12%7%3%
A3 — Handleiding product-geleide prijs3%5%·8%6%4%
A4 — SaaS-prijs playbook38%12%8%·9%5%
A5 — Prijs kiezen voor uw SaaS6%7%6%9%·4%
A6 — SaaS-prijzen voor oprichters2%3%4%5%4%·
Klik op een cel om overlappende passages te zien
  • 150M+webpagina’s geïndexeerd
  • 30dhernieuwingsfrequentie corpus
  • 94%canonical-detectiegraad
  • 4dupe-classificatielagen
  • 2014indexeert Common Crawl
VS BASIC DUPE TOOLS

Drie zaken die browserchecks en SEO-pakketten missen.

COPYSCAPE-ACHTIGE TOOLS

Alleen exacte match (Copyscape-standaard). Een herformuleerde zin wordt als “uniek” gezien — gesponnen tekst komt door. Nuttig voor clipboard-plagiaat, niet voor content-kwaliteit.

Noplag: 4-lagen classificatie (Exact / Near-dup / Spun / Boilerplate) met bedoelingshint — bruikbaar, geen enkelvoudig match-vlaggetje.

SEO-PAKKETTEN

Content-uniqueness-bundel inbegrepen bij uw $99-499/maand-abonnement. Alleen oppervlakkige n-gram matching; geen Common Crawl; geen mappen-scan.

Noplag: losse gratis tier (2.500 woorden). Pro ($23/mnd) biedt scan op mappen en volledige 150M+ index, los van een $400 SEO-pakket.

GRATIS ONLINE CHECKERS

Black box. Geen inzicht in WELKE bron matchte, alleen een cijfer. Vaak limiet van 1.000 woorden. Meeste verversen hun index niet — controleren tegen een web-snapshot uit 2021.

Noplag: elke match toont bron-URL + canonical + overeenkomstende secties + datum corpus-snapshot. Apache 2.0 — algoritme is in te zien.

CANONICAL-HERKENNING

Een artikel met rel=canonical is geen ‘duplicate content’. Wij behandelen het wel zo.

Verschijnt een artikel op meerdere URLs, dan is voor SEO de vraag niet ‘zijn ze identiek?’, maar ‘hebben ze dezelfde canonical?’ Verwijst uw gastpost op Medium via rel=canonical naar het origineel, dan groepeert Google ze, krijgt het originele stuk de waarde, en ziet Google de rest als legitieme syndicatie. Zonder canonical concurreert u met eigen content. De tool haalt elke match op, leest de <link rel="canonical"> tag uit en labelt elk resultaat: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK, of SCRAPED.

Bekijk de canonical-logica
FAQ

Dit vraagt een content lead voor integratie.

Hoe verhoudt de dekking zich tot Copyscape of SEMrush?

150M+ pagina’s via Common Crawl + geselecteerde SEO- en veelbezochte domeinen, elke 30 dagen ververst. Breder dan Copyscape’s exacte match (~120M, vooral plagiaat-boilerplate), smaller dan Google’s crawl, maar met gedocumenteerde dekking en update-frequentie. Pro-tier voegt eigen map als private corpus toe.

Hoe werkt de canonical-herkenning precies?

Bij elk gevonden resultaat haalt de engine de bron-URL op (cache of live), leest de <head> en haalt rel=canonical eruit. Matches krijgen de labels ORIGIN (canonical wijst naar zichzelf), SYND-OK (canonical verwijst naar een bekende eigen pagina), LEAK (canonical ontbreekt/verwarring in distributie), SCRAPED (geen canonical + niet op eigen domein). Deze classificatie staat naast elke match voor inzicht in uw dupenummer.

Detecteert dit AI-gegenereerde content uit bestaande bronnen?

Ja — AI-schrijfhulpen halen tekst uit echte webpagina’s, die passages komen als Near-dup of Spun naar boven. U krijgt de bron-URL, zodat u beslist: citeren, herschrijven of schrappen. AI-contentdetectie (ander signaal) is een losstaande tool op de roadmap, niet live — enkel de Dupe-scan zit hierin.

Hoe groot mag een document zijn?

2.500 woorden op Gratis, 50.000 op Premium, 250.000+ op Enterprise (of geen limiet bij self-host). Mappen-scan: een map mag tot 2.000 documenten; pairwise-matrix is sneller dan 5 minuten op dit formaat.

Worden concurrenten gevonden die mijn content kopiëren?

Als de kopie in de webindex staat (dus op een openbare, doorzoekbare website), ja — de URL staat in de matchlijst met een gesnapshotte kopie en datum. Die snapshot is ‘DMCA-grade’ bewijs: gedateerd, gecontroleerd op inhoud en met gemarkeerde passages. We dienen DMCAs niet automatisch in — wij leveren het bewijsstuk.

Kan ik mijn eigen syndicatiedomeinen uitsluiten?

Pro-tier — maak een allowlist van domeinen die u beheert (medium.com/@u, linkedin.com/in/u, substack.com/p/u). Matches daarmee krijgen het label SYND-OK en tellen niet mee in uw score. Score weerspiegelt dus ‘onverwachte duplicatie’, niet ‘elke duplicatie’.

Hoe werkt een map-scan bij 500 artikelen?

De retrieval cascade doet praktisch O(n log n) per paar — vingerafdrukken filteren kandidaten met 60 bits, volledige uitlijning alleen op geselecteerde paren. 500 artikelen → 124.750 paren in ~4 minuten op vier cores. Matrix kan als CSV export.

Is de engine daadwerkelijk open source?

Ja — github.com/NoplagLabs/noplag-engine, Apache 2.0. De chunker, fingerprinter, retrieval cascade, alignment en dupe-classificatie zitten allemaal in de repo. De cloud-laag voegt het corpus, de Common Crawl en een Wikipedia-mirror toe; bij self-host lever je je eigen corpus aan. Controleer het algoritme voordat je het score vertrouwt.

Is er een API voor content-pipeline integratie?

REST-endpoint op /v1/checks (Python- en Node-SDK's). Dien een document in, ontvang direct een duplicaatrapport tot 8 seconden, daarboven via webhook-callback. Handig voor CI-controles vóór publicatie — blokkeer de merge als het duplicaatpercentage boven de teamdrempel uitkomt. Volledige documentatie op /docs/developers/api.

Wat met betaalmuren of inlogbeschermde content?

We crawlen alleen wat publiek toegankelijk is — Common Crawl, sitemaps, robots-allowed. Content achter betaalmuren (NYT, FT, wetenschappelijke journals) zit niet in de index; engine vindt geen matches als uit die bronnen wordt geplukt. Voor academische papers dekt OpenAlex / CORE (losse corpus) het open-access-universum.

Scan een concept of uw hele bibliotheek.

Gratis tier scant 2.500 woorden tegen 150M+ webpagina’s. Pro (€23/mnd) biedt pairwise scans op mappen. Apache 2.0 referentie als u de corpus zelf wilt hosten.

Plagiaat checker voor dubbele content online gratis