Plagiatkontroll för duplicerat innehåll online
Hitta duplicerat innehåll på den publika webben, i egna mappar och i teamets innehållsbibliotek. Kanonisk-medvetet — skiljer syndikering från kopierade versioner. Gratis upp till 2 500 ord; mappnivå i Pro.
Fyra typer av dubbletter. Olika hantering, olika lösning.
De flesta 'dubblettverktyg' hittar bara exakta kopior. Vi klassificerar varje träff i fyra kategorier så de kan avgöra vad som kan ignoreras (korrekt citat), vad som ska kanoniseras (syndikering) och vad som bör skrivas om (kopierat eller spunnet).
Ord för ord-matchning
Identiska strängar på 30+ tecken. Omfattar kopierad boilerplate, syndikerade artiklar utan ändringar, kopierade sidor.
Lätt omformulerat
Satsstruktur kvar, bytta synonymer eller omkastade adjektiv. Typisk för "spinnade" texter. Fångar det Grammarly missar avsiktligt.
Aggressivt parafraserat
Parafras i meningsnivå med omkastade satser, bytta tempus, inskjutna utfyllnader. Vanligt från AI-omskrivningsverktyg och billig produktion.
Återkommande mellan sidor
Samma ansvarsfriskrivning, författarbeskrivning eller produkttext på hundratals av era sidor — Googles faktiska oro kring dubbletter.
Det är inte bara "copy-paste från en annan sajt."
Googles faktiska regler (från Search Central): tre mönster triggar dubblettbehandling, de flesta gäller era egna sidor snarare än stulna konkurrenter.
Korsdomän-kopior utan kanonisk
Samma artikel på flera sajter utan rel=canonical pekande på ursprunget. Gäller felaktigt syndikerat innehåll, otillkännagivna kopieringar, och av misstag publicerat material på flera sajter.
Samma innehåll under flera URL:er på er sajt
/produkt/foo och /produkt/foo?utm_source=email och /produkt/foo/ med/utan slash. Facetterad navigation (filter som ger identiska sidor), utskriftsversioner utan kanonisk, mobil/desktop separata URL:er. Google grupperar, väljer en, ignorerar resten.
Boilerplate utklädd som innehåll
En e-handelskategori med identisk beskrivning på 1 200 produkter. En plats-sida med 'Vårt team har 20 års erfarenhet' på 47 städer. Tunt, duplicerat innehåll — flaggat i Googles Helpful Content Update.
Sex team använder detta varje vecka.
Samma verktyg, sex arbetsflöden — från ensam bloggare innan publicering till byråns kvalitetskontroll av inköpt innehåll.
Blogginlägg före publicering
Kör utkastet mot webben innan publicering. Hittar oavsiktlig återanvändning av fraser från egna gamla poster (själv-kanibalisering), konkurrentartiklar som ni läst under research, och slarv med AI-omskrivare.
Upptäckta kopierade artiklar av konkurrent
Klistra in er artikel, se vem som publicerat samma. Användbart för dokumentation (DMCA) — varje träff visar källa, området den matchar och ett tidsstämplat snapshot som kan sparas.
Innehållsbibliotek-koll
Pro-nivå mappskanning. Släpp hela teamets bibliotek i en mapp; verktyget flaggar intern duplicering — samma stycke i flera artiklar eller boilerplate som borde mallifieras.
Syndikeringstest
En artikel syndikerades till Medium, LinkedIn och Substack. Pekar de alla rel=canonical tillbaka till ert ursprung? Verktyget hämtar varje, kollar taggen och visar vilka versioner som tappar SEO.
QA av inhyrd skribent
Frilansskribentens leverans i ett fönster. Kör verktyget innan betalning. Hittar vanligaste mönstren: kopiera-och-spin, AI-omskriven text samt citat utan källa.
AI-innehåll ursprung
AI-verktyg hämtar text från webben under sin process. Verktyget visar dessa återanvända passager så att de kan välja: citera, skriv om eller ta bort. Minskar risk i Helpful Content Update.
Släpp in biblioteket. Se vad som överlappar.
Pro-funktion. Välj en mapp med publicerade artiklar; motorn bygger en likhetsmatris mellan varje par. Sorterbar, klicka för att hoppa till överlappande text.
- 150M+webbsidor indexerade
- 30duppdateringsintervall corpus
- 94%kanonisks-identifieringsgrad
- 4duplikatklassificering
- 2014indexering Common Crawl
Tre saker som browser- och SEO-verktyg missar.
Enbart exakt matchning (Copyscape standard). En omformulerad mening läses som 'unik' — och spunnet innehåll går igenom rent. Bra för enkel klippbordskontroll, men värdelöst för innehållsgranskning.
Noplag: fyra klassificeringsnivåer (Exakt / Nära-dup / Spunnet / Boilerplate), med avsiktshints — ger åtgärdsförslag, inte bara ja/nej-resultat.
Innehåller ett enkelhetsverktyg i ert $99-499/mån-säte. Begränsat till enkel n-gram-matchning; inget Common Crawl-täckning; ingen tvärdokument-skanning på mappnivå.
Noplag: fristående gratisnivå (2 500 ord). Pro ($23/mån) ger mappmatris och hela webindexet — utan låsning till ett stort SEO-paket.
Svart låda. Går inte att se VILKEN källa träffade, bara en likhetssiffra. Ofta gräns på 1 000 ord. De flesta uppdaterar inte sina index — kollar mot webben 2021.
Noplag: varje träff visar källa + kanonisk + matchinterval + corpusdatum. Apache 2.0 — se algoritmen själv.
En omskriven artikel med rel=canonical är inte "duplicerat innehåll." Vi hanterar det så.
När en artikel ligger på flera URL:er är SEO-frågan inte 'är de identiska?' — det är 'deklarerar alla samma kanoniska?' Om ert inlägg på Medium pekar rel=canonical till urspungsadressen, grupperar Google dessa, rankar ursprunget och ser resten som korrekt syndikering. Om inte, tävlar ni mot er egen återpublicerade text. Verktyget hämtar varje träff, tolkar dess <link rel="canonical">-tagg och märker varje resultat: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK eller SCRAPED.
Frågor från innehållsansvarig före integration.
Hur täcker ert index webben jämfört med Copyscape eller SEMrush?
150M+ sidor indexerat från Common Crawl och utvalda, SEO-relevanta, högtrafikerade domäner, uppdaterat var 30:e dag. Större än Copyscapes exakta index (~120M, mest plagierings- och boilerplatefokus) men mindre än Googles crawl— däremot dokumenterad täckning och känd uppdateringsfrekvens. Pro-nivå lägger till privat index från valfri mapp.
Hur fungerar er kanonisk-detektion konkret?
Varje matchad sida hämtas (cache/live), <head> parsas, rel=canonical extraheras. Matcherna märks sedan ORIGIN (pekar på sig själv), SYND-OK (pekar på annan känd sida ni kontrollerar), LEAK (saknar/annat på er distribution), eller SCRAPED (ingen kanonisk, utanför distributionsdomän). Klassificeringen visas intill varje match.
Upptäcker detta AI-genererat innehåll återanvänt från källor?
Ja — AI-skrivverktyg hämtar text från riktiga sidor under lookup och dessa passager syns som Near-dup eller Spun. Källa visas så ni kan avgöra: citera, skriv om eller ta bort. Detektion av AI-genererat (annat signal) är en separat funktion på väg — inte klar än — och endast duplektskanning finns här.
Hur stora dokument kan jag skanna?
2 500 ord gratis, 50 000 på Premium, 250 000+ på Enterprise (eller obegränsat self-host). För Pro-mappskanning: en mapp kan innehålla 2 000 dokument, matris sammanställs för alla par på under 5 minuter vid denna storlek.
Finner detta konkurrenter som kopierat mitt innehåll?
Om kopian finns i indexet (öppen, indexerbar publik webbsida) syns webbadressen i träfflistan med tidsstämplat snapshot. Snapshot är godtagbart som DMCA-bevis: daterat, innehållshashat, markerade intervall. Vi skickar inga automatiska DMCA (det är juridik), men ger dig underlaget.
Kan jag exkludera mitt syndikeringsnätverk från dubblettskanningen?
Pro-nivå — lägg till en tillåten lista över domäner du kontrollerar (medium.com/@you, linkedin.com/in/you, substack.com/p/you). Träffar på vita-listade domäner märks SYND-OK och räknas inte i duplikatscore. Score visar 'oväntad duplicering', inte 'all duplicering'.
Hur fungerar skanning parvis på mappnivå vid 500 artiklar?
Återhämtningsstegen är O(n log n) per par i praktiken — fingeravtryck filtrerar möjliga par med 60-bitars hash, full inriktning endast på kandidater. 500 artiklar är 124 750 par, körs på ~4 minuter på fyrkärnig server. Matris kan exporteras som CSV.
Är motorn verkligen open source?
Ja — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker, fingerprinter, retrieval-kedja, alignering och logik för duplikatklassificering finns i repot. Molnversionen lägger till korpus + Common Crawl + Wikipedia-spegel; vid self-host tar du med eget material. Kontrollera algoritmen innan du litar på poängen.
Hur ser API:et ut för innehållsintegration?
REST-endpoint på /v1/checks (Python + Node SDK). Skicka in ett dokument, få en duplikatrapport tillbaka synkront upp till 8 sekunder, webhook-callback vid längre svarstid. Användbart för CI-kontroller före publicering — stoppa merge om duplikatprocenten överskrider teamets gräns. Fullständig referens finns på /docs/developers/api.
Vad gäller innehåll bakom betalväggar eller lösenord?
Vi crawlar endast det som är publikt — Common Crawl, sidor via sitemap, robots-tillåtna domäner. Betalväggat innehåll (NYT, FT, akademiska journaler bakom väggar) är inte med i index, vi visar inga träffar ens om texten återanvänds från dessa. För akademiska artiklar täcker OpenAlex/CORE (separat corpus) öppet tillgängligt material.
Skanna ett utkast. Eller hela ert innehållsbibliotek.
Gratisnivån täcker 2 500 ord mot 150M+ webbsidor. Pro ($23/mån) ger parvis mappskanning för publicerat bibliotek. Apache 2.0-referens om ni vill köra corpus på egen server.