Plagiaat checker voor dubbele content online
Vind dubbele content op het live web, in uw eigen mappen en in het content-archief van uw team. Herkent canonical — maakt onderscheid tussen legitieme syndicatie en gekopieerde teksten. Gratis tot 2.500 woorden; mappen-scans in Pro.
Vier soorten duplicaat. Andere aanpak, andere oplossing.
De meeste “duplicate checkers” vinden alleen exact dezelfde zinnen. Wij classificeren per match in vier categorieën, zodat u weet wat u kunt negeren (legitiem citaat), wat u canoniek moet maken (syndicatie), en wat u moet herschrijven (gekopieerd of gesponnen).
Letterlijke match
Identieke tekenreeksen van 30+ karakters. Denk aan gekopieerde boilerplate, artikelen letterlijk overgenomen, gekrabde pagina’s.
Licht herschreven
Zinsstructuur behouden, synoniemen of bijvoeglijk naamwoorden verwisseld. Klassiek “spin”-patroon. Vindt wat Copyscape expres mist.
Aggressief geparafraseerd
Parafrase op zinsniveau met herschikte bijzinnen, andere tijden, toegevoegde opvulling. Veelvoorkomend bij AI-rewriters en uitbesteed tekstwerk.
Terugkerend op meerdere pagina’s
Bijvoorbeeld dezelfde disclaimer, auteursbio of productbeschrijving op honderden eigen pagina’s — Googles feitelijke zorg rondom dubbele content.
Niet alleen “copy-paste van een andere site.”
De echte Google-richtlijnen (bron: Search Central): drie patronen geven duplicaatproblemen. Meestal gaat het om uw eigen site, niet om gekrabde concurrenten.
Cross-domain kopieën zonder canonical
Hetzelfde artikel op meerdere sites zonder rel=canonical terug naar het origineel. Dit omvat verkeerd verspreide syndicatie, niet-geclaimde scrapes, en per ongeluk dubbele publicatie door dezelfde schrijver.
Zelfde content onder meerdere URLs op uw eigen site
/product/foo en /product/foo?utm_source=email en /product/foo/ met slash. Gefacetteerde navigatie (filtercombinaties produceren identieke pagina’s), printervriendelijke versie zonder canonical, aparte desktop- en mobiel-urls. Google groepeert, kiest er één, laat de rest vallen.
Boilerplate als inhoud vermomd
Bijvoorbeeld een categoriepagina met vijf identieke alinea’s bij 1.200 SKUs. Pagina’s over locaties met 47 keer dezelfde tekst als “Ons team heeft 20 jaar ervaring”. Dubbelen met weinig waarde — Google’s Helpful Content Update markeert dit sterk.
Zes teams die dit wekelijks draaien.
Zelfde tool, zes processen — van de blogger die vooraf checkt tot een bureau dat uitbesteed werk controleert.
Blogpostcontrole vóór publicatie
Scan het concept tegen het web voordat u publiceert. Vindt onbedoelde herhaling uit oude eigen posts (zelf-cannibalisatie), concurrerende artikelen tijdens research, en AI-fouten.
Scrapings door concurrenten
Plak uw artikel, zie wie het verder publiceert. Handig voor DMCA-bewijs — elke match geeft bron-URL, overeenkomstende secties en een datumstempel die u kunt opslaan.
Bibliotheek-hygiëne
Pro-functie op mapniveau. Zet alle artikelen van het team in een map; tool markeert dubbele passages — bijv. dezelfde paragraaf in drie artikelen, boilerplate die eigenlijk in een template moet.
Syndicatie-audit
U verspreidde een artikel via Medium, LinkedIn, en Substack. Verwijzen ze allemaal met rel=canonical naar uw originele versie? De tool haalt op, leest de canonical tag, en toont welke herpublicaties SEO-waarde lekken.
QA op uitbesteed werk
Tekst van freelance schrijver direct controleren. Doe dit voor betaling. Vindt het script-pattern, AI-spins, en ontbrekende bronvermeldingen.
Herkomst AI-content
AI-tools halen tekst uit bestaande bronnen. Deze tool laat die passages zien, zodat u beslist: bron noemen, herschrijven of schrappen. Voorkomt problemen bij Helpful Content Update.
Gooi uw bibliotheek erin. Zie de overlap.
Pro-functie. Kies een map met gepubliceerde artikelen; de engine bouwt een gelijkenismatrix tussen elk paar. Sorteerbaar op overlap, klikbaar naar overeenkomende secties.
- 150M+webpagina’s geïndexeerd
- 30dhernieuwingsfrequentie corpus
- 94%canonical-detectiegraad
- 4dupe-classificatielagen
- 2014indexeert Common Crawl
Drie zaken die browserchecks en SEO-pakketten missen.
Alleen exacte match (Copyscape-standaard). Een herformuleerde zin wordt als “uniek” gezien — gesponnen tekst komt door. Nuttig voor clipboard-plagiaat, niet voor content-kwaliteit.
Noplag: 4-lagen classificatie (Exact / Near-dup / Spun / Boilerplate) met bedoelingshint — bruikbaar, geen enkelvoudig match-vlaggetje.
Content-uniqueness-bundel inbegrepen bij uw $99-499/maand-abonnement. Alleen oppervlakkige n-gram matching; geen Common Crawl; geen mappen-scan.
Noplag: losse gratis tier (2.500 woorden). Pro ($23/mnd) biedt scan op mappen en volledige 150M+ index, los van een $400 SEO-pakket.
Black box. Geen inzicht in WELKE bron matchte, alleen een cijfer. Vaak limiet van 1.000 woorden. Meeste verversen hun index niet — controleren tegen een web-snapshot uit 2021.
Noplag: elke match toont bron-URL + canonical + overeenkomstende secties + datum corpus-snapshot. Apache 2.0 — algoritme is in te zien.
Een artikel met rel=canonical is geen ‘duplicate content’. Wij behandelen het wel zo.
Verschijnt een artikel op meerdere URLs, dan is voor SEO de vraag niet ‘zijn ze identiek?’, maar ‘hebben ze dezelfde canonical?’ Verwijst uw gastpost op Medium via rel=canonical naar het origineel, dan groepeert Google ze, krijgt het originele stuk de waarde, en ziet Google de rest als legitieme syndicatie. Zonder canonical concurreert u met eigen content. De tool haalt elke match op, leest de <link rel="canonical"> tag uit en labelt elk resultaat: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK, of SCRAPED.
Dit vraagt een content lead voor integratie.
Hoe verhoudt de dekking zich tot Copyscape of SEMrush?
150M+ pagina’s via Common Crawl + geselecteerde SEO- en veelbezochte domeinen, elke 30 dagen ververst. Breder dan Copyscape’s exacte match (~120M, vooral plagiaat-boilerplate), smaller dan Google’s crawl, maar met gedocumenteerde dekking en update-frequentie. Pro-tier voegt eigen map als private corpus toe.
Hoe werkt de canonical-herkenning precies?
Bij elk gevonden resultaat haalt de engine de bron-URL op (cache of live), leest de <head> en haalt rel=canonical eruit. Matches krijgen de labels ORIGIN (canonical wijst naar zichzelf), SYND-OK (canonical verwijst naar een bekende eigen pagina), LEAK (canonical ontbreekt/verwarring in distributie), SCRAPED (geen canonical + niet op eigen domein). Deze classificatie staat naast elke match voor inzicht in uw dupenummer.
Detecteert dit AI-gegenereerde content uit bestaande bronnen?
Ja — AI-schrijfhulpen halen tekst uit echte webpagina’s, die passages komen als Near-dup of Spun naar boven. U krijgt de bron-URL, zodat u beslist: citeren, herschrijven of schrappen. AI-contentdetectie (ander signaal) is een losstaande tool op de roadmap, niet live — enkel de Dupe-scan zit hierin.
Hoe groot mag een document zijn?
2.500 woorden op Gratis, 50.000 op Premium, 250.000+ op Enterprise (of geen limiet bij self-host). Mappen-scan: een map mag tot 2.000 documenten; pairwise-matrix is sneller dan 5 minuten op dit formaat.
Worden concurrenten gevonden die mijn content kopiëren?
Als de kopie in de webindex staat (dus op een openbare, doorzoekbare website), ja — de URL staat in de matchlijst met een gesnapshotte kopie en datum. Die snapshot is ‘DMCA-grade’ bewijs: gedateerd, gecontroleerd op inhoud en met gemarkeerde passages. We dienen DMCAs niet automatisch in — wij leveren het bewijsstuk.
Kan ik mijn eigen syndicatiedomeinen uitsluiten?
Pro-tier — maak een allowlist van domeinen die u beheert (medium.com/@u, linkedin.com/in/u, substack.com/p/u). Matches daarmee krijgen het label SYND-OK en tellen niet mee in uw score. Score weerspiegelt dus ‘onverwachte duplicatie’, niet ‘elke duplicatie’.
Hoe werkt een map-scan bij 500 artikelen?
De retrieval cascade doet praktisch O(n log n) per paar — vingerafdrukken filteren kandidaten met 60 bits, volledige uitlijning alleen op geselecteerde paren. 500 artikelen → 124.750 paren in ~4 minuten op vier cores. Matrix kan als CSV export.
Is de engine daadwerkelijk open source?
Ja — github.com/NoplagLabs/noplag-engine, Apache 2.0. De chunker, fingerprinter, retrieval cascade, alignment en dupe-classificatie zitten allemaal in de repo. De cloud-laag voegt het corpus, de Common Crawl en een Wikipedia-mirror toe; bij self-host lever je je eigen corpus aan. Controleer het algoritme voordat je het score vertrouwt.
Is er een API voor content-pipeline integratie?
REST-endpoint op /v1/checks (Python- en Node-SDK's). Dien een document in, ontvang direct een duplicaatrapport tot 8 seconden, daarboven via webhook-callback. Handig voor CI-controles vóór publicatie — blokkeer de merge als het duplicaatpercentage boven de teamdrempel uitkomt. Volledige documentatie op /docs/developers/api.
Wat met betaalmuren of inlogbeschermde content?
We crawlen alleen wat publiek toegankelijk is — Common Crawl, sitemaps, robots-allowed. Content achter betaalmuren (NYT, FT, wetenschappelijke journals) zit niet in de index; engine vindt geen matches als uit die bronnen wordt geplukt. Voor academische papers dekt OpenAlex / CORE (losse corpus) het open-access-universum.
Scan een concept of uw hele bibliotheek.
Gratis tier scant 2.500 woorden tegen 150M+ webpagina’s. Pro (€23/mnd) biedt pairwise scans op mappen. Apache 2.0 referentie als u de corpus zelf wilt hosten.