WEB150M+ lehte · kanoniseerimisteadlik

Plagiaadikontroll duplikaatsisu leidmiseks veebis

Leia dubleeritud sisu otse veebist, oma kaustadest ja tiimi sisukogust. Tunneb ära kanoniseeritud sisu — eristab legaalset sisu jagamist kopeeritud versioonidest. Tasuta kuni 2 500 sõna; kaustapõhised skaneeringud Pro's.

0 / 1,500 words
Veeb + Common Crawl indekseeritudPeaaegu-identsed + keerutatud sisu tuvastusKausta-põhine sisukontroll
DUBLEERIMISE TÜÜBID

Neli dubleerimise tüüpi. Erinev tõlgendus, erinev lahendus.

Enamik “dubleerimise tuvastajaid” leiavad ainult täpsed kattuvused. Me liigitame iga vaste nelja kategooriasse — teate, millist võib ignoreerida (legaalse tsitaadi korral), milline tuleb kanoniseerida (sisu levitamine), ja milline ümber kirjutada (kopeeritud või keerutatud sisu).

01 · TÄPNE

Sõna-sõnalt vastavus

Identsed tekstijadad vähemalt 30 tähemärgi ulatuses. Sisaldab kopeeritud boilerplate'i, täpselt ümber avaldatud artikleid, kraabitud lehti.

Lahendus: kanoniseeri, kirjuta ümber või aktsepteeri (kui see on sinu enda sisu).
02 · PEA-AEGU DUBLEERITUD

Kergelt ümber sõnastatud

Lause struktuur sama, vahetatud sünonüümid või omadussõnade järjekord. Klassikaline "keerutatud" tulemus. Tuvastab selle, mida Copyscape ei leia.

Lahendus: täielik ümberkirjutus — põhiseisukoht peab olema teie oma.
03 · KEERUTATUD

Tugevalt parafraseeritud

Lausetasandil ümberkirjutus — muudetud sõnajärg, pöörded, täitekohad. Levinud AI-ümberkirjutajate ja palgatöömeeste puhul.

Lahendus: kontrollige eesmärki. Kas see on kirjutaja enda parafraas või varjatud koopia?
04 · BOILERPLATE

Leheülene korduvus

Sama lahtiütlus, autoribio või tootekirjeldus sadadel teie enda lehtedel — see on Google'i tegelik dubleeritud sisu probleem.

Lahendus: tõsta ühisesse mallifaili; ära lase Google'il seda 800 korda indekseerida.
MIDA GOOGLE ARVAB DUBLEERINGUST

See pole ainult “kopeeritud teisest saidist.”

Google'i tegelikud juhised (Search Central): kolm mustrit kutsuvad esile dubleeritud sisu tõlgenduse, neist enamik puudutab teie enda lehti, mitte konkurente.

01

Domeenideülene kopeerimine ilma kanoniseerimiseta

Sama artikkel mitmel saidil ilma rel=canonical tag-ita originaalile viitamata. Hõlmab valesti jagatud sisu, lahtisele konkurentide kraabitud koopiad, juhuslik samade tekstide avaldamine kahel kanalil.

02

Sama sisu mitme URL-i all teie saidil

/product/foo ja /product/foo?utm_source=email ja /product/foo/ — sama leht erinevate aadressidega. Fassettnavigatsioon (filtrite kombinatsioonid), printerisõbralikud versioonid, mobiili/desktop erinevad URLid. Google rühmitab ja valib neist ühe; ülejäänu kaob.

03

Boilerplate sisu pähe sisuna

E-poe kategoorialeht, millel sama kirjeldustekst 1 200 tootel. Meeskonnakirjeldus 47 linna lehel korduvana. Õhuke, dubleeritud sisu — Google'i Helpful Content Update märgib selle kiirelt.

SEO KASUTUSJUHUD

Kuus tiimi kasutavad iganädalast kontrolli.

Sama tööriist, kuus erinevat töövoogu — alates üksikblogija eelkontrollist kuni agentuuri QA-ni tellimustööle.

Blogipostituse eelkontroll

Kontrollige mustandit elava veebi vastu enne avaldamist. Leiab kogemata kaaskasutused varasematest postitustest (enesekordus), konkurentidelt kogemata laenatud lõigud ja AI-ümberkirjutaja apsakad.

Konkurentide kraabingu tuvastus

Kleebi oma artikkel, näe, kes veel seda avaldab. Kasulik DMCA dokumentide jaoks — iga vaste näitab allika URL-i, kattuvad lõigud ja ajatempliga salvestuse, mida saad kausta tõendina salvestada.

Sisukogu puhtus

Pro taseme kausta skaneerimine. Katke kogu tiimi avaldatud sisu ühte kausta; tööriist märgib sisu kattumise — sama lõik kolmes artiklis, boilerplate, mida võiks mallistada.

Sisu jagamise audit

Olete jaganud artikli Mediumi, LinkedIn ja Substacki. Kas nad kõik viitavad rel=canonical abil teie algsele URL-ile? Tööriist tõmbab kõik koopiad, kontrollib kanoniseeringud, ja ütleb, millised versioonid jagavad SEO väärtust valesti.

Tellitud töö QA

Teie vabakutselise töö ühes vaates. Käivitage enne maksmist. Leiab tavalised kraabitud-keerd sisu mustrid, AI-ümberkirjutaja tunnused, ja tsitaadid ilma viiteta.

AI-sisu allika jälgimine

AI-assistendid võtavad teksti päris veebilehtedest. Tööriist toob üles need lõigud, et saaksite valida: viidata, ümber kirjutada või eemaldada. Aitab vältida HCU riske.

KAUSTA DUBLEERIMISE SKANNEERIMINE

Tõsta kogu raamatukogu sisse. Näed, mis kattub.

Pro funktsioon. Vali avaldatud artiklite kaust; mootor ehitab sarnasuse maatriksi kõigi paaride vahel. Sorteeritav kattuvuse järgi, klõpsatavad konfliktide vaatamiseks.

KAUST / blog-2026-q16 artiklit · paaride kattuvuse maatriks
3 kattuvust > 10%Ekspordi maatriks
ARTIKKELA1A2A3A4A5A6
A1 — Viis SaaS hinnastamise mudelit·4%3%38%6%2%
A2 — Kuidas kirjutada SaaS hinnastust4%·5%12%7%3%
A3 — Tootepõhise hinnastuse juhend3%5%·8%6%4%
A4 — SaaS hinnastuse käsiraamat38%12%8%·9%5%
A5 — Kuidas valida SaaS hind6%7%6%9%·4%
A6 — SaaS hinnastamine asutajatele2%3%4%5%4%·
Klõpsake mistahes lahtril, et näha artiklite kattuvaid lõike
  • 150M+indekseeritud veebilehte
  • 30dkorpuse värskenduse sagedus
  • 94%kanoniseeringu tuvastamise määr
  • 4dubleerimise tasemed
  • 2014indekseerib Common Crawl
VÕRDLUSES BAASDUBLEERIJATEGA

Kolm asja, mida brauseri dubleerijad ja SEO-platvormid ei leia.

COPYSCAPE-TÜÜPI TÖÖRIISTAD

Ainult täpsed kattuvused (Copyscape standard). Ümber sõnastatud lause näib „unikaalne” — ja „keerutatud” tekst läbib kontrolli. Kasulik kui kraabite lõike lõikepuhvrisse; sobimatu sisukvaliteedi kontrolliks.

Noplag: 4-tasandiline liigitus (täpne / peaaegu / keerutatud / boilerplate) koos selgitustega — praktiline, mitte ainult Booleani tulemus.

SEO SUITE'D

Lisatud sisu-unikaalsuse tööriist $99-499/kuu kohta. Piiratud näilise n-grammi vastavusega; ei Common Crawl katvust; ei kaustapõhist võrreldavust.

Noplag: eraldiseisev tasuta (2 500 sõna). Pro (23 $/kuu) annab kausta maatriksi ja täiskatvusega 150M+ veebi — ilma, et dubleerimise tööriist oleks seotud 400 $ SEO paketiga.

TASUTA VEEBIPÕHISED KONTROLLIJAD

Must kast. Ei näe, MILLINE allikas kattus, näeb ainult sarnasuse protsenti. Sageli 1 000 sõna piirang. Enamik ei uuenda indeksit — võrdlevad 2021. aasta veebisnapiga.

Noplag: iga vaste näitab allika URL-i + kanoniseeringut + kattuvaid lõike + indeksi kuupäeva. Apache 2.0 — algoritm avalik.

KANONISEERIMISTEADLIK TUVASTUS

Originaalil rel=canonical märgiga artikkel pole "dubleeritud sisu". Me käsitleme seda nii.

Kui artikkel on mitmel URL-il, pole SEO küsimus "kas sisu on sama?" — vaid "kas kõik osutavad samale kanoniseerimisele?" Kui Mediumis avaldatud külalispost viitab rel=canonical abil tagasi lähteadressile, rühmitab Google need ja annab väärtuse lähteversioonile. Kui ei, konkureerite omaenda sisuga. Tööriist toob igale vastele rel=<link rel="canonical"> märgise, märgistab tulemused: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK või SCRAPED.

Loe kanoniseerimisloogikat
KKK

Küsimused, mida sisujuht küsib enne integratsiooni.

Kui lai on veebikatvus võrreldes Copyscape'i või SEMrushiga?

Indekseeritud 150M+ lehte Common Crawl + SEO-relevantsete, kõrge liiklusega domeenide hulgast, värskenduskord iga 30 päeva järel. Laiem kui Copyscape'i täpne kattuvus (~120M, keskendub plagiaadi boilerplate'ile). Kitsam kui Google'i kogu roomamine, aga dokumenteeritud katvuse ja avaliku värskenduse sagedusega. Pro tase lisab oma kausta kui eraldi korpuse.

Kuidas kanoniseerimise tuvastus tegelikult toimib?

Iga leitud lehe puhul toob mootor allika URL-i (puhverdatud või reaalajas), loeb <head> ploki ja võtab sealt rel=canonical info. Tulemused märgistatakse: ORIGIN (iseendale viide), SYND-OK (teine tuntud leht teie käes), LEAK (puudub/vale teie jagamisel), SCRAPED (puudub ja vale domeen). Märgis on iga vaste juures, et skoor oleks aus.

Kas see leiab AI-toodetud sisu, mis on korduvallikast?

Jah — AI kirjutajad kasutavad päris veebi tekste konteksti otsimisel ja nii tekkivad lõigud paistavad Near-dup või Spun tulemusena. Toome neid koos allika URL-iga esile — saate ise otsustada: viidata, ümberkirjutada või eemaldada. AI-sisu tuvastus (oma signaal) on eraldi tööriist — veel arenduses. Hetkel keskendutakse ainult duplikaadi tuvastusele.

Mis on suurim dokument, mida saan skaneerida?

Tasuta kuni 2 500 sõna, Premiumis 50 000, Enterprise’is 250 000+ (või enda serveris ilma limiidita). Pro kaustaskaneerimisel võib kaustas olla kuni 2 000 dokumenti; kõik paarid skaneeritakse viie minutiga.

Kas see leiab konkurendid, kes mu sisu kopeerisid?

Kui koopia on avalikus veebis (avaldatud ja roomatav), jah — URL kuvatakse vastete loendis koos ajatempliga. Snapshop on DMCA-kõlblik: kuupäevaga, hashitud sisuga, esiletõstetud kattuvustega. Me ei esita iseseisvalt DMCA-t (see on teie otsus), anname dokumendi.

Kas saan oma levitusvõrgu duplikaatidest välja jätta?

Pro tasemel — saate lisada omatava domeenide loendi (medium.com/@teie, linkedin.com/in/teie, substack.com/p/teie). Neid leitud vasteid märgitakse SYND-OK, need skoori ei mõjuta. Skoor näitab "ootamatut kattuvust", mitte "kõiki kattuvusi".

Kuidas kaustapõhine paariskontroll töötab näiteks 500 artikliga kogu puhul?

Toomise kaskaad O(n log n) paari kohta tegelikkuses — sõrmejälgede filtrid välistavad enamiku paaridest, täisvõrdlus ainult kandidaatidele. 500 artiklit → 124 750 paariskontrolli u 4 minutiga 4-tuumses serveris. Maatriks eksporditav CSV-ks.

Kas mootor on tegelikult avatud lähtekoodiga?

Jah — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker, sõrmejälgede loomine, päringute kaskaad, joondamine ja duplikaatide klassifitseerimine on kõik repositooriumis olemas. Pilveversioonis on lisaks korpus, Common Crawl ja Wikipedia peegel; isemajutamisel tuleb korpus ise tuua. Kontrolli algoritmi enne, kui usaldad tulemust.

Mis API võimalused sisupipeline'i jaoks?

REST-lõpppunkt aadressil /v1/checks (Python + Node SDK-d). Saada dokument, saad sünkroonselt duplikaatide raporti kuni 8 sekundiga, pikema töötluse puhul tuleb vastus webhooki kaudu. Sobib CI eelkontrolliks — katkesta merge, kui duplikaatide % ületab tiimi piiri. Täpsem info /docs/developers/api.

Aga sisu maksumüüride või sisselogimise taga?

Indekseerime ainult avalikku sisu — Common Crawl, sitemap'is nähtaval lehed, robots lubatud domeenid. Maksumüüriga lehed (NYT, FT, teadusajakirjad) pole indeksis; mootor ei tuvasta kattuvust ka juhul, kui teie tekst neist pärineb. Teadusartiklite jaoks katab OpenAlex / CORE avaliku sisu universumi (eraldi korpus).

Skaneeri mustand või kogu sisukogu.

Tasuta kuni 2 500 sõna kontroll 150M+ veebilehe vastu. Pro (23 $/kuu) avab kaustapõhised paariskontrollid kogu avaldatud raamatukogule. Apache 2.0 viide, kui soovite korpust oma serveris hoida.

Plagiaadikontroll duplikaatsisu tuvastamiseks veebis