WEB150M+ lapas · kanoniskā atpazīšana

Plaģiāta pārbaude tiešsaistē dublikātiem

Atrodiet dublētu saturu tiešsaistē, savās mapēs un komandas satura bibliotēkā. Kanoniskā atpazīšana — atšķir legālu satura sindicēšanu no kopijām. Bezmaksas līdz 2 500 vārdiem; mapju līmeņa skenēšana Pro versijā.

0 / 1,500 words
Web + Common Crawl indeksētsTuvumā esošu dublikātu + ģenerēta satura noteikšanaMapes līmeņa bibliotēkas skenēšana
DUBLIKĀTU TIPS

Četri dublikātu veidi. Dažādas pieejas, dažādi risinājumi.

Lielākā daļa “dublikātu pārbaudītāju” atrod tikai precīzus sakritības. Mēs klasificējam katru sakritību četrās kategorijās, lai Jūs zinātu, ko ignorēt (legāla atsauce), ko norādīt kā kanonisko (sindikācija), un ko pārrakstīt (kopēts vai ģenerēts).

01 · PRECĪZS

Vārds pēc vārda sakritība

Identiski virknes vismaz 30 rakstzīmju garumā. Ietver kopētus standarta tekstus, sindicētus rakstus publicētus bez izmaiņām, nokopētas lapas.

Risinājums: norādīt kā kanonisko, pārrakstīt vai atstāt (ja tas ir Jūsu sindicētais raksts).
02 · TUVU

Viegls pārraksts

Saglabāts teikuma raksts, aizvietoti sinonīmi vai mainīta īpašības vārdu secība. Klasisks “spun” saturs. Atrod to, ko Copyscape pēc definīcijas nelasa.

Risinājums: pilnībā pārrakstīt — saturam jābūt Jūsu argumentam.
03 · ĢENERĒTS

Agresīvi pārrakstīts

Teikumu līmeņa pārformulējums, mainīta secība, ievietoti papildu vārdi. Raksturīgi AI pārrakstītājiem un ārpakalpojumu satura ražotājiem.

Risinājums: pārbaudīt nolūku. Vai tas ir autora paša pārformulējums vai slēpta kopija?
04 · STANDARTS

Atkārtojas vairākās lapās

Viena un tā pati atruna, autora biogrāfija vai produkta apraksts vairākās Jūsu lapās — tas ir Google faktiskais dublētā satura risks.

Risinājums: izvietot kopējo tekstu šablonā; nepieļaut indekšēšanu vairākas reizes.
KO GOOGLE SKATA KĀ DUBLIKĀTU

Tā nav tikai “kopēšana no citas lapas”.

Google patiesie noteikumi (pēc Search Central dokumentiem): trīs modeļi izraisa dublētā satura apstrādi, un lielākā daļa attiecas uz Jūsu paša lapām, nevis uz konkurentu kopēšanas gadījumiem.

01

Teksts vairākās vietnēs bez kanoniskā apzīmējuma

Tas pats raksts vairākās vietnēs, kur nav rel=canonical uz oriģinālu. Ietver kļūdaini izplatītu sindicētu saturu, kopētas lapas, kļūdainu daudzu domēnu pārvaldību, kur viens autors publicē vairākās vietās.

02

Tas pats saturs vairākos URL Jūsu vietnē

/product/foo un /product/foo?utm_source=email un /product/foo/ ar_slash beigās. Filtrētā navigācija (kombinācijas ražo identiskas lapas), drukas versijas bez kanoniskā, mobilās un darbvirsmas atsevišķi URL. Google tos apvieno, izvēlas vienu, pārējo ignorē.

03

Standarta teksts, kas izskatās pēc unikāla satura

E-komercijas kategoriju lapa ar pieciem identiskiem kategorijas apraksta paragrāfiem 1 200 preču lapās. Atrašanās vietas lapa ar tekstu “Mūsu komanda ar 20 gadu pieredzi” 47 pilsētu lapās. Neoriģināls saturs — Google to agresīvi filtrē ar Helpful Content Update.

SEO LIETOŠANAS GADĪJUMI

Sešas komandas izmanto reizi nedēļā.

Tas pats rīks, sešas dažādas darba plūsmas — no emuāra autora pārbaudes pirms publicēšanas līdz aģentūras kvalitātes kontrolei ārpakalpojumu rakstiem.

Bloga ieraksta pirmspublicēšana

Pārbaudiet melnrakstu pret tiešsaistes tīmekli pirms publicēšanas. Noķer nejaušu frāžu atkārtotu lietojumu no Jūsu iepriekšējiem ierakstiem (paškanibalizācija), konkurentu rakstiem lasītiem pētniecībai un jebkuru AI ģenerētu kļūdu.

Konkurentu satura kopēšanas atklāšana

Ievietojiet savu rakstu, uzziniet, kas vēl to publicē. Noder DMCA dokumentācijai — katra sakritība rāda avota URL, sakritušās vietas un drosētu momentuzņēmumu, ko varat saglabāt kā pierādījumu.

Satura bibliotēkas tīrība

Pro līmeņa mapju skenēšana. Atvērt visas komandas publicētās mapes; rīks atzīmē krustojošos dokumentus — viens paragrāfs trīs dažādos rakstos, atkārtots teksts, kas jāievieto šablonā.

Sindikācijas audits

Jūs sindicējāt rakstu uz Medium, LinkedIn un Substack. Vai rel=canonical norāda uz Jūsu oriģinālu? Rīks pārbauda katru, lasa kanonisko tagu un ziņo, kuros pārsūtījumos atšķiras SEO signāls.

Ārpakalpojuma rakstītāju kvalitātes kontrole

Jūsu ārštata rakstītāja darbs vienā panelī. Pārbaudiet pirms apmaksas. Atklāj biežu kopē-uzreiz-izmaini modeli, AI pārrakstu laikrakstu pazīmes, un citātus bez nepieciešamās atsauces.

AI satura izcelsme

AI palīgi ņem tekstu no reāliem avotiem konteksta meklēšanas laikā. Rīks parāda atkārtoti izmantotās vietas, lai Jūs varētu izlemt: citēt avotu, pārrakstīt, vai dzēst paragrāfu. Mazina Helpful-Content-Update risku.

MAPES LĪMEŅA DUBLIKĀTU SKENĒŠANA

Nometiet savu bibliotēku. Redziet kas kur pārklājas.

Pro līmeņa funkcija. Izvēlieties mapi ar rakstiem; dzinējs salīdzina katru pāri. Sarindojams pēc pārklājuma, uzklikšķinot pārlecat uz attiecīgajiem fragmentiem.

MAPE / blog-2026-q16 raksti · pāra līdzības matrica
3 pāri > 10% pārklājumsEksportēt matricu
RAKSTSA1A2A3A4A5A6
A1 — Pieci SaaS cenu modeļi·4%3%38%6%2%
A2 — Kā veidot SaaS cenu4%·5%12%7%3%
A3 — Produkta orientētas cenu noteikšanas ceļvedis3%5%·8%6%4%
A4 — SaaS cenu noteikšanas rokasgrāmata38%12%8%·9%5%
A5 — Kā izvēlēties savu SaaS cenu6%7%6%9%·4%
A6 — SaaS cenas dibinātājiem2%3%4%5%4%·
Noklikšķiniet uz jebkura lauka, lai redzētu pārklāšanās fragmentus abu rakstu starpā
  • 150M+tīmekļa lapas indeksētas
  • 30dkorpusa atjaunošanas biežums
  • 94%kanoniskās atpazīšanas attiecība
  • 4dublikātu klasifikācijas līmeņi
  • 2014indeksācija Common Crawl
PRET PAMATA DUBLIKĀTU RĪKIEM

Trīs lietas, ko pārlūka rīki un SEO komplekti nepamana.

COPYSCAPE-TIPA RĪKI

Tikai precīzu sakritību meklēšana (Copyscape standarts). Viegls pārraksts uzskatīts par unikālu — un “ģenerētais” saturs tiek cauri. Noder kopētā teksta pārbaudē; nederīgs satura kvalitātes kontrolei.

Noplag: četru līmeņu klasifikācija (Precīzs / Tuvu / Ģenerēts / Standarts) ar norādēm par saturu — skaidrs, ne tikai jā/nē indikators.

SEO KOMPLEKTI

Tiek komplektēts ar satura unikalitātes rīku par $99-499/mēn. Ierobežots līdz virspusējai n-grammu pārbaudei; nav Common Crawl; nav mapju līmeņa skenēšanas.

Noplag: neatkarīgs bezmaksas līmenis (2 500 vārdu). Pro ($23/mēn) pievieno mapju matricu un pilnu tīmekļa indeksu — bez piesaistes dārgai SEO pakotnei.

BEZMAKSAS TIEŠSAISTES RĪKI

Melnais kaste. Nav iespējams redzēt, KURŠ avots sakrita — tikai līdzības skaitlis. Bieži ierobežojums līdz 1 000 vārdiem. Lielākā daļa neatjauno indeksu — pārbauda pret 2021. gada tīmekli.

Noplag: katra sakritība rāda avota URL + kanonisko + sakritušos laika intervālus + korpusa momentuzņēmuma datumu. Apache 2.0 — algoritmu var pārbaudīt paša spēkiem.

KANONISKO SAITES ATPAZĪŠANA

Pārpublicēts raksts ar rel=canonical nav “dublēts saturs.” Mēs atzīmējam šādi.

Kad raksts parādās vairākos URL, SEO jautājums nav “vai teksti identiski?”, bet “vai visos ir tas pats kanoniskais?” Ja Jūsu publikācija Medium norāda rel=canonical uz oriģinālu, Google tos grupē, atribūcija paliek Jūsu lappusei, pārējais skaitās legāla sindicēšana. Ja nav — Jūsu atkārtotais saturs konkurē ar oriģinālu. Rīks no katras sakritības nolasīs, pārbaudīs <link rel="canonical"> tagu un atzīmēs rezultātu: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK vai SCRAPED.

Lasīt par kanoniskā loģiku
FAQ

Jautājumi, ko uzdod satura nodaļas vadītājs pirms integrācijas.

Kāds pārklājums ar tīmekli, salīdzinot ar Copyscape vai SEMrush?

Indeksētas 150M+ lapas no Common Crawl + atlasītas SEO nozīmīgas domēnas, atjaunošana reizi 30 dienās. Plašāks nekā Copyscape precīzi sakritībām (~120M, vairāk uz plaģiātu šabloniem), šaurāks nekā pilns Google rāpojums, bet ar skaidri dokumentētu pārklājumu un atjauninājumu grafiku. Pro līmenī pievienojat savu mapi kā privātu korpusu.

Kā tieši darbojas kanoniskās atpazīšana?

No katras atbilstošās lappuses dzinējs nolasa URL (glabāts kešā vai dzīvajā), lasa <head>, atrod rel=canonical. Sakritības saņem atzīmi: ORIGIN (kanonika uz sevi), SYND-OK (kanonika uz citu Jums piederošu lapu), LEAK (nav/ir citā vietā), SCRAPED (nav kanonikas + ārēja adrese). Katrai sakritībai šī atzīme redzama, lai dublikāta skaitlis būtu caurspīdīgs.

Vai šis atklāj AI ģenerētu saturu, kas paņemts no avotiem?

Jā — AI tekstģeneratori izmanto tīmekļa avotus kontekstam, un šīs vietas parādās kā Tuvu vai Ģenerēts. Mēs rādam avota URL, lai Jūs varētu izlemt: citēt, pārrakstīt vai dzēst. AI satura atpazīšana (cits signāls) ir atsevišķs rīks, tas vēl nav aktīvs, tas ir ceļā. Šeit strādā tikai dublikātu skenēšana.

Cik lielu dokumentu varu pārbaudīt?

2 500 vārdu Bezmaksas plānā, 50 000 Premium, 250 000+ Enterprise (vai neierobežoti pašuzstādot). Pro mapju pārbaude — vienā mapē var būt līdz 2 000 dokumentu; pilna pāru matrica izrēķināta zem 5 minūtēm šim skaitam.

Vai šis atklās konkurentus, kas nokopējuši manu saturu?

Ja kopija ir indeksā (t.i., publiskā vietnē), jā — URL parādās sarakstā ar laika zīmogu. Drosētais momentuzņēmums būs ar datumu, satura hash un atzīmētiem sakritības fragmentiem. Mēs automātiski DMCA nepieprasam (tas ir Jūsu juridisks lēmums), bet dokumentācija tiek nodrošināta.

Vai varu izslēgt savu sindikācijas tīklu no skenēšanas?

Pro līmenis — atļauto domēnu saraksts, kurus kontrolējat (medium.com/@jūs, linkedin.com/in/jūs, substack.com/p/jūs). Sakritības ar šiem tagojas kā SYND-OK un neietekmē Jūsu kopējo rādītāju. Skaitlis atspoguļo “negaidītu dublēšanos,” nevis “jebkādu dublēšanos.”

Kā mapju pārbaude apstrādā 500 rakstu bibliotēku?

Atlases kaskāde praksē O(n log n) uz pāri — nospiedumu filtri atmet kandidātus pēc 60 bitu hashiem, pilnā salīdzināšana palaista tikai topošajiem kandidātiem. 500 raksti → 124 750 pāri izskatīti ~4 minūtēs uz 4 kodolu sistēmas. Var eksportēt matricu CSV jebkādām datu plūsmām.

Vai dzinējs patiešām ir ar atvērtā pirmkoda licenci?

Jā — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker, pirkstu nospiedumu ģenerators, meklēšanas kaskāde, izlīdzināšana un dublikātu klasifikācijas loģika ir repozitorijā. Mākoņpakalpojuma līmenī pievienots korpuss + Common Crawl + Wikipedia spoguļattēls; pašmitināšanai jāizmanto savs korpuss. Pirms uzticaties rezultātam, pārbaudiet algoritmu.

Kāds API satura automatizācijai?

REST galapunkts /v1/checks (Python un Node SDK). Iesniedziet dokumentu, saņemiet dublikātu pārskatu sinhroni līdz 8 sekundēm, pēc tam — webhook atbilde. Noderīgi pirms publicēšanas CI pārbaudēm — pārtrauciet sapludināšanu, ja dublikātu % pārsniedz jūsu komandas slieksni. Pilna dokumentācija: /docs/developers/api.

Kā ar maksas sienām vai autorizētu saturu?

Tiek pārmeklēts tikai publiski pieejamais — Common Crawl, sitemap deklarētās lapas, robots-atļautie domēni. Maksas saturs (NYT, FT, žurnāli aiz sienām) indeksā nav; dzinējs šādas sakritības neparādīs arī tad, ja frāze atkārtota. Akadēmiskajiem darbiem OpenAlex / CORE (atsevišķs korpuss) aptver atvērto pieeju.

Pārbaudīt melnrakstu vai visu satura bibliotēku.

Bezmaksas līmenī — 2 500 vārdu pārbaude pret 150M+ lapām. Pro ($23/mēn) atvērs mapju līmeņa pāru pārbaudi publicētajai bibliotēkai. Apache 2.0 dokumentācija, ja vēlaties korpusu glabāt uz sava servera.

Plaģiāta pārbaude tiešsaistē bez maksas