WEBB150M+ sidor · kanonisk-medveten

Plagiatkontroll för duplicerat innehåll online

Hitta duplicerat innehåll på den publika webben, i egna mappar och i teamets innehållsbibliotek. Kanonisk-medvetet — skiljer syndikering från kopierade versioner. Gratis upp till 2 500 ord; mappnivå i Pro.

0 / 1,500 words
Webb + Common Crawl indexeradeNärliggande dubblett- och spin-detektionMappnivå-biblioteksgenomsökning
DUPLIKTYPER

Fyra typer av dubbletter. Olika hantering, olika lösning.

De flesta 'dubblettverktyg' hittar bara exakta kopior. Vi klassificerar varje träff i fyra kategorier så de kan avgöra vad som kan ignoreras (korrekt citat), vad som ska kanoniseras (syndikering) och vad som bör skrivas om (kopierat eller spunnet).

01 · EXAKT

Ord för ord-matchning

Identiska strängar på 30+ tecken. Omfattar kopierad boilerplate, syndikerade artiklar utan ändringar, kopierade sidor.

Lösning: kanonisera, skriv om eller acceptera (om det är er egen syndikerade text).
02 · NÄRA-DUP

Lätt omformulerat

Satsstruktur kvar, bytta synonymer eller omkastade adjektiv. Typisk för "spinnade" texter. Fångar det Grammarly missar avsiktligt.

Lösning: skriv om helt — argumentet måste vara ert eget.
03 · SPUNNET

Aggressivt parafraserat

Parafras i meningsnivå med omkastade satser, bytta tempus, inskjutna utfyllnader. Vanligt från AI-omskrivningsverktyg och billig produktion.

Lösning: kontrollera syfte. Är detta skribentens egen parafras eller en dold kopia?
04 · BOILERPLATE

Återkommande mellan sidor

Samma ansvarsfriskrivning, författarbeskrivning eller produkttext på hundratals av era sidor — Googles faktiska oro kring dubbletter.

Lösning: flytta till gemensam mall, indexera inte samma text 800 gånger.
VAD GOOGLE RÄKNAR SOM DUBLIKAT

Det är inte bara "copy-paste från en annan sajt."

Googles faktiska regler (från Search Central): tre mönster triggar dubblettbehandling, de flesta gäller era egna sidor snarare än stulna konkurrenter.

01

Korsdomän-kopior utan kanonisk

Samma artikel på flera sajter utan rel=canonical pekande på ursprunget. Gäller felaktigt syndikerat innehåll, otillkännagivna kopieringar, och av misstag publicerat material på flera sajter.

02

Samma innehåll under flera URL:er på er sajt

/produkt/foo och /produkt/foo?utm_source=email och /produkt/foo/ med/utan slash. Facetterad navigation (filter som ger identiska sidor), utskriftsversioner utan kanonisk, mobil/desktop separata URL:er. Google grupperar, väljer en, ignorerar resten.

03

Boilerplate utklädd som innehåll

En e-handelskategori med identisk beskrivning på 1 200 produkter. En plats-sida med 'Vårt team har 20 års erfarenhet' på 47 städer. Tunt, duplicerat innehåll — flaggat i Googles Helpful Content Update.

SEO-ANVÄNDNINGAR

Sex team använder detta varje vecka.

Samma verktyg, sex arbetsflöden — från ensam bloggare innan publicering till byråns kvalitetskontroll av inköpt innehåll.

Blogginlägg före publicering

Kör utkastet mot webben innan publicering. Hittar oavsiktlig återanvändning av fraser från egna gamla poster (själv-kanibalisering), konkurrentartiklar som ni läst under research, och slarv med AI-omskrivare.

Upptäckta kopierade artiklar av konkurrent

Klistra in er artikel, se vem som publicerat samma. Användbart för dokumentation (DMCA) — varje träff visar källa, området den matchar och ett tidsstämplat snapshot som kan sparas.

Innehållsbibliotek-koll

Pro-nivå mappskanning. Släpp hela teamets bibliotek i en mapp; verktyget flaggar intern duplicering — samma stycke i flera artiklar eller boilerplate som borde mallifieras.

Syndikeringstest

En artikel syndikerades till Medium, LinkedIn och Substack. Pekar de alla rel=canonical tillbaka till ert ursprung? Verktyget hämtar varje, kollar taggen och visar vilka versioner som tappar SEO.

QA av inhyrd skribent

Frilansskribentens leverans i ett fönster. Kör verktyget innan betalning. Hittar vanligaste mönstren: kopiera-och-spin, AI-omskriven text samt citat utan källa.

AI-innehåll ursprung

AI-verktyg hämtar text från webben under sin process. Verktyget visar dessa återanvända passager så att de kan välja: citera, skriv om eller ta bort. Minskar risk i Helpful Content Update.

MAPPNIVÅ-DUBLIKATSKANNING

Släpp in biblioteket. Se vad som överlappar.

Pro-funktion. Välj en mapp med publicerade artiklar; motorn bygger en likhetsmatris mellan varje par. Sorterbar, klicka för att hoppa till överlappande text.

MAPP / blog-2026-q16 artiklar · parvis likhetsmatris
3 överlapp >10%Exportera matris
ARTIKELA1A2A3A4A5A6
A1 — Fem SaaS-prismodeller·4%3%38%6%2%
A2 — Så skriver du Saas-prissättning4%·5%12%7%3%
A3 — Produktledd prisguide3%5%·8%6%4%
A4 — SaaS-prissättningshandbok38%12%8%·9%5%
A5 — Välj rätt SaaS-pris6%7%6%9%·4%
A6 — SaaS-prissättning för grundare2%3%4%5%4%·
Klicka på cell för att se överlappande text mellan två artiklar
  • 150M+webbsidor indexerade
  • 30duppdateringsintervall corpus
  • 94%kanonisks-identifieringsgrad
  • 4duplikatklassificering
  • 2014indexering Common Crawl
VS GRUNDLÄGGANDE DUBLIKATVERKTYG

Tre saker som browser- och SEO-verktyg missar.

COPYSCAPE-LIKNANDE VERKTYG

Enbart exakt matchning (Copyscape standard). En omformulerad mening läses som 'unik' — och spunnet innehåll går igenom rent. Bra för enkel klippbordskontroll, men värdelöst för innehållsgranskning.

Noplag: fyra klassificeringsnivåer (Exakt / Nära-dup / Spunnet / Boilerplate), med avsiktshints — ger åtgärdsförslag, inte bara ja/nej-resultat.

SEO-PAKET

Innehåller ett enkelhetsverktyg i ert $99-499/mån-säte. Begränsat till enkel n-gram-matchning; inget Common Crawl-täckning; ingen tvärdokument-skanning på mappnivå.

Noplag: fristående gratisnivå (2 500 ord). Pro ($23/mån) ger mappmatris och hela webindexet — utan låsning till ett stort SEO-paket.

GRATIS ONLINEKONTROLLER

Svart låda. Går inte att se VILKEN källa träffade, bara en likhetssiffra. Ofta gräns på 1 000 ord. De flesta uppdaterar inte sina index — kollar mot webben 2021.

Noplag: varje träff visar källa + kanonisk + matchinterval + corpusdatum. Apache 2.0 — se algoritmen själv.

KANONISK-MEDVETEN DETEKTION

En omskriven artikel med rel=canonical är inte "duplicerat innehåll." Vi hanterar det så.

När en artikel ligger på flera URL:er är SEO-frågan inte 'är de identiska?' — det är 'deklarerar alla samma kanoniska?' Om ert inlägg på Medium pekar rel=canonical till urspungsadressen, grupperar Google dessa, rankar ursprunget och ser resten som korrekt syndikering. Om inte, tävlar ni mot er egen återpublicerade text. Verktyget hämtar varje träff, tolkar dess <link rel="canonical">-tagg och märker varje resultat: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK eller SCRAPED.

Läs logiken kring kanonisk
FAQ

Frågor från innehållsansvarig före integration.

Hur täcker ert index webben jämfört med Copyscape eller SEMrush?

150M+ sidor indexerat från Common Crawl och utvalda, SEO-relevanta, högtrafikerade domäner, uppdaterat var 30:e dag. Större än Copyscapes exakta index (~120M, mest plagierings- och boilerplatefokus) men mindre än Googles crawl— däremot dokumenterad täckning och känd uppdateringsfrekvens. Pro-nivå lägger till privat index från valfri mapp.

Hur fungerar er kanonisk-detektion konkret?

Varje matchad sida hämtas (cache/live), <head> parsas, rel=canonical extraheras. Matcherna märks sedan ORIGIN (pekar på sig själv), SYND-OK (pekar på annan känd sida ni kontrollerar), LEAK (saknar/annat på er distribution), eller SCRAPED (ingen kanonisk, utanför distributionsdomän). Klassificeringen visas intill varje match.

Upptäcker detta AI-genererat innehåll återanvänt från källor?

Ja — AI-skrivverktyg hämtar text från riktiga sidor under lookup och dessa passager syns som Near-dup eller Spun. Källa visas så ni kan avgöra: citera, skriv om eller ta bort. Detektion av AI-genererat (annat signal) är en separat funktion på väg — inte klar än — och endast duplektskanning finns här.

Hur stora dokument kan jag skanna?

2 500 ord gratis, 50 000 på Premium, 250 000+ på Enterprise (eller obegränsat self-host). För Pro-mappskanning: en mapp kan innehålla 2 000 dokument, matris sammanställs för alla par på under 5 minuter vid denna storlek.

Finner detta konkurrenter som kopierat mitt innehåll?

Om kopian finns i indexet (öppen, indexerbar publik webbsida) syns webbadressen i träfflistan med tidsstämplat snapshot. Snapshot är godtagbart som DMCA-bevis: daterat, innehållshashat, markerade intervall. Vi skickar inga automatiska DMCA (det är juridik), men ger dig underlaget.

Kan jag exkludera mitt syndikeringsnätverk från dubblettskanningen?

Pro-nivå — lägg till en tillåten lista över domäner du kontrollerar (medium.com/@you, linkedin.com/in/you, substack.com/p/you). Träffar på vita-listade domäner märks SYND-OK och räknas inte i duplikatscore. Score visar 'oväntad duplicering', inte 'all duplicering'.

Hur fungerar skanning parvis på mappnivå vid 500 artiklar?

Återhämtningsstegen är O(n log n) per par i praktiken — fingeravtryck filtrerar möjliga par med 60-bitars hash, full inriktning endast på kandidater. 500 artiklar är 124 750 par, körs på ~4 minuter på fyrkärnig server. Matris kan exporteras som CSV.

Är motorn verkligen open source?

Ja — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker, fingerprinter, retrieval-kedja, alignering och logik för duplikatklassificering finns i repot. Molnversionen lägger till korpus + Common Crawl + Wikipedia-spegel; vid self-host tar du med eget material. Kontrollera algoritmen innan du litar på poängen.

Hur ser API:et ut för innehållsintegration?

REST-endpoint på /v1/checks (Python + Node SDK). Skicka in ett dokument, få en duplikatrapport tillbaka synkront upp till 8 sekunder, webhook-callback vid längre svarstid. Användbart för CI-kontroller före publicering — stoppa merge om duplikatprocenten överskrider teamets gräns. Fullständig referens finns på /docs/developers/api.

Vad gäller innehåll bakom betalväggar eller lösenord?

Vi crawlar endast det som är publikt — Common Crawl, sidor via sitemap, robots-tillåtna domäner. Betalväggat innehåll (NYT, FT, akademiska journaler bakom väggar) är inte med i index, vi visar inga träffar ens om texten återanvänds från dessa. För akademiska artiklar täcker OpenAlex/CORE (separat corpus) öppet tillgängligt material.

Skanna ett utkast. Eller hela ert innehållsbibliotek.

Gratisnivån täcker 2 500 ord mot 150M+ webbsidor. Pro ($23/mån) ger parvis mappskanning för publicerat bibliotek. Apache 2.0-referens om ni vill köra corpus på egen server.

Plagiatkontroll för duplicerat innehåll online