WEB150M+ puslapių · kanoninio formato

Plagiato patikra internete – pasikartojančio turinio analizė

Raskite pasikartojantį turinį tiesioginiame internete, savo aplankuose ir komandos turinio bibliotekoje. Kanoninio formato — atskiria teisėtą sindikaciją nuo plagijuotų kopijų. Nemokamai iki 2 500 žodžių; aplanko lygio tikrinimas su Pro.

0 / 1,500 words
Internetas + Common Crawl indeksasBeveik tapatūs ir „spintinimo“ aptikimasAplanko lygio bibliotekos tikrinimas
DUBLIAVIMO TIPAI

Keturi dubliavimo variantai. Skirtinga priežastis, skirtingas sprendimas.

Dauguma „dubliavimo tikrintuvų“ fiksuoja tik tikslias atitiktis. Mes kiekvieną sutampantį fragmentą klasifikuojame į vieną iš keturių kategorijų, kad žinotumėte, ką ignoruoti (teisėta citata), ką kanonizuoti (sindikacija) ir ką perrašyti (nukopijuota ar „spinta“).

01 · TIKSLUS

Žodis į žodį

Identiškos 30+ simbolių sekos. Įskaitant nukopijuotus šablonus, iš naujo publikuotus straipsnius ir parsiųstus puslapius.

Sprendimas: kanonizuoti, perrašyti arba tiesiog palikti (jei tai jūsų sindikuotas tekstas).
02 · BEVEIK SUTAMPA

Švelniai perrašyta

Išlaikyta sakinio struktūra, pakeisti sinonimai ar pakeisti būdvardžiai. Klasikinis „spintinimas“. Aptinka tai, ko Copyscape neaptinka sąmoningai.

Sprendimas: perrašyti iš esmės — argumentas turi būti jūsų.
03 · „SPINTA“

Agresyviai perfrazuota

Sakinio lygio perrašymas su sukeistomis dalimis, pakeistomis laikais, įterptu užpildu. Dažnai pasitaiko su AI rašymo įrankiais ir užsakytų tekstų gamintojais.

Sprendimas: patikrinkite paskirtį. Tai autoriaus perfrazė ar paslėpta kopija?
04 · ŠABLONAI

Pasikartojančios dalys skirtinguose puslapiuose

Tas pats atsakomybės pareiškimas, autoriaus aprašymas ar produkto tekstas keliuose šimtuose jūsų puslapių — tai, dėl ko Google realiai sprendžia dubliuotą turinį.

Sprendimas: iškelkite į bendrą šabloną; neleiskite Google indekstuoti 800 kartų.
KO GOOGLE SKAIČIUOJA KAIP DUBLIATĄ

Tai nereiškia tik „nukopijuota iš kitos svetainės“.

Google tikros taisyklės (iš Search Central): trys šablonai skaičiuojami kaip dubliuotas turinys — dažniausiai kalba apie jūsų puslapius, ne apie konkurentų nukopijuotus.

01

Skerčiasi skirtingose svetainėse be kanoninės nuorodos

Tas pats straipsnis keliuose puslapiuose be rel=canonical nuorodos į originalą. Įskaitant sindikuotą turinį, paskelbtą netinkamai, konkurento nukopijuotus nepažymėtus puslapius ir atsitiktinį dubliavimą, kai tas pats autorius atsiunčia į du puslapius.

02

Tas pats turinys per kelis URL tame pačiame puslapyje

/product/foo ir /product/foo?utm_source=email bei /product/foo/ su pasvira brūkšniu. Fasuota navigacija (filtrai sukuria tą patį puslapį), atspausdinama versija be kanoninės nuorodos, skirtingi mobilūs/staliniai URL. Google juos sugrupuoja, pasilieka vieną, kiti išmetami.

03

Šablonas vietoj turinio

El. komercijos kategorijos puslapis su tomis pačiomis penkiomis pastraipomis per 1 200 SKU. Vietovių puslapis su fraze „Mūsų komanda turi 20 metų patirtį“ per 47 miestų puslapių. Plonas, dubliuotas turinys — Google Helpful Content Update tai žymi griežtai.

SEO NAUDOJIMO ATVEJAI

Šešios komandos, kurios tai paleidžia kas savaitę.

Tas pats įrankis, šeši skirtingi darbų srautai — nuo individualaus tinklaraštininko iki agentūros kokybės patikrinimo užsakytam tekstui.

Tinklaraščio teksto tikrinimas prieš publikavimą

Praleiskite juodraštį per tikrintuvą prieš publikuodami. Aptinka netyčinį savo ankstesnių tekstų (savęs kanibalizacija), skaitytų konkurentų ar AI perrašytų fragmentų sutapimą.

Konkurentų plagiato nustatymas

Įklijuokite savo tekstą ir matykite, kas dar jį paskelbė. Naudinga DMCA įrodymams — kiekviena atitiktis pateikia šaltinio URL, sutampančias vietas bei laiko žymą, kurią galėsite saugoti kaip įrodymą.

Turinio bibliotekos higiena

Pro lygio aplanko tikrinimas. Sukelkite visos komandos biblioteką į aplanką; įrankis pažymi dubliuotus fragmentus — tą pačią pastraipą trijuose straipsniuose, šabloninį tekstą, kurį reikia atskirti.

Sindikacijos auditas

Straipsnis išplatintas per Medium, LinkedIn, Substack. Ar visur rel=canonical nuoroda į pirminį šaltinį? Įrankis patikrina kiekvieną, nuskaito canonical žymą ir pasako, kurios kopijos nutekina SEO prasme.

Užsakytų tekstų tikrinimas

Užsakytas tekstas — viena eilutė. Patikrinkite prieš mokėdami. Aptinka dažną sumaišytą schemą — plagijuota, tada perrašyta AI, citatas be nuorodų.

AI turinio kilmės tikrinimas

AI asistentai semiasi tekstų iš interneto per kontekstinį paiešką. Įrankis iškelia tokius fragmentus — galite nuspręsti: nurodyti šaltinį, perrašyti ar išmesti pastraipą. Sumažina Helpful Content Update riziką.

APLANKE DUBLIATŲ TIKRINIMAS

Įkelkite biblioteką. Matysite, kas su kuo dubliuojasi.

Pro lygio funkcija. Pasirinkite straipsnių aplanką; variklis sudarys panašumų matricą kiekvienai porai. Rikiuokite pagal sutampančius intervalus, eikite tiesiai į problemų vietas.

APLAKAS / blog-2026-q16 straipsniai · porinė panašumų matrica
3 dubliavimai > 10%Eksportuoti matricą
STRAIPSNISA1A2A3A4A5A6
A1 — Penki SaaS kainodaros modeliai·4%3%38%6%2%
A2 — Kaip rašyti apie SaaS kainas4%·5%12%7%3%
A3 — Gidas apie kainodarą pagal produktą3%5%·8%6%4%
A4 — SaaS kainodaros vadovas38%12%8%·9%5%
A5 — Kaip pasirinkti SaaS kainą6%7%6%9%·4%
A6 — Kainodara SaaS steigėjams2%3%4%5%4%·
Spustelėkite bet kurią langelį, kad matytumėte sutampančius intervalus tarp straipsnių
  • 150M+puslapių indekse
  • 30dduomenų atnaujinimo dažnis
  • 94%kanoninio atpažinimo tikslumas
  • 4dubliavimo tipai
  • 2014indeksuoja Common Crawl
PRIEŠ PAPRASTUS DUBLIATŲ ĮRANKIUS

Trys dalykai, kurių naršyklės įskiepiai ar SEO paketai neras.

COPYSCAPE PAVYZDŽIO ĮRANKIAI

Fiksuoja tik tikslias atitiktis (Copyscape standartas). Pervadintas sakinys laikomas „unikaliu“ — perrašytas tekstas pereina be kliūčių. Tinka kopijuoti iš iškarpinės; nenaudinga kokybės kontrolei.

Noplag: 4 lygio klasifikacija (Tikslus / Beveik sutampa / Spinta / Šablonas) ir sprendimų patarimai — tai veiksnumas, ne tik Boolean vėliavėlė.

SEO RINKINIAI

Turinio originalumo įrankis įtrauktas prie $99-499/mėn. plano. Ribotas n-gramų lygio atitikimas, nėra Common Crawl, nėra aplankų tikrinimo.

Noplag: atskira nemokama versija (2 500 žodžių). Pro ($23/mėn.) — aplankų matrica ir pilnas indeksas. Nereikia brangaus SEO rinkinio.

NEMOKAMI ONLINE TIKRINTUVAI

Juodas langelis. Nematysite, kuris šaltinis sutapo — tik skaitinį panašumo rodiklį. Dažnai apribota iki 1 000 žodžių. Daugelis neatnaujina duomenų — tikrinate pagal 2021 metų indeksą.

Noplag: kiekviena atitiktis — šaltinio URL + canonical + intervalai + duomenų data. Apache 2.0 — galite peržiūrėti algoritmą.

KANONINIO FORMATO TIKRINIMAS

Iš naujo paskelbtas straipsnis su rel=canonical nėra „dubliuotas turinys“. Mes tai taip ir traktuojame.

Kai straipsnis pasirodo keliuose URL, SEO klausimas ne „ar jie identiški?“, o „ar visi deklaruoja tą patį canonical?“. Jei jūsų svečio įrašas Medium nurodo rel=canonical į originalą, Google juos sugrupuoja, reitingą duoda originalui, likusius vertina kaip teisėtą sindikaciją. Jei nenurodo — patys konkuruojate su originalu. Įrankis parsiunčia visas atitiktis, išskaito jų <link rel="canonical"> žymą ir pažymi rezultatus: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK arba SCRAPED.

Skaityti canonical logiką
DUK

Klausimai, kuriuos užduoda turinio vadovas prieš diegimą.

Kuo jūsų paieška skiriasi nuo Copyscape ar SEMrush?

150M+ puslapių iš Common Crawl + atrinktų SEO kanalų, atnaujinama kas 30 d. Platesnė nei Copyscape tikslių atitikimų indeksas (~120M, orientuota į plagijavimo šablonus), siauresnė už pilną Google, bet aiškiai dokumentuojama ir reguliariai atnaujinama. Pro versija — galite pridėti savo aplanką kaip privatų korpusą.

Kaip iš tikrųjų veikia canonical aptikimas?

Kiekvienam atitikčiai variklis paima šaltinio URL (saugotą ar gyvą), nuskaito <head> ir išskiria rel=canonical. Atitiktims suteikia ORIGIN (canonical į save), SYND-OK (canonical į kitą jūsų valdomą), LEAK (canonical nėra arba ne jūsų paskirstyme), arba SCRAPED (nėra canonical + ne jūsų domenas). Visa tai matysite šalia kiekvienos atitikties, jūsų dubliavimo rodiklis bus tikslus.

Ar aptinka AI sugeneruotą ištrauktą tekstą?

Taip — AI rašytojai per kontekstinę paiešką naudoja tikrus interneto puslapius, o tie fragmentai pasirodo kaip Beveik sutampa arba Spinta. Mes rodome juos su šaltinio URL — galite nuspręsti: cituoti, perrašyti ar pašalinti. AI turinio atpažinimas (kitas signalas) — kitas įrankis. Šiuo metu tik dubliavimo paieška.

Koks didžiausias dokumentas, kurį galiu tikrinti?

2 500 žodžių nemokamai, 50 000 Premium, 250 000+ Enterprise (arba be limito, jei vartojate patys). Pro aplanko patikra — iki 2 000 dokumentų, visos poros patikrinamos per 5 min. tokio dydžio bibliotekai.

Ar įrankis suras, kas nukopijavo mano turinį?

Jei nukopijuota versija yra interneto indekse (viešai prieinamoje svetainėje) — taip, pamatysite URL atitikčių sąraše ir laiko žymę. Laiko žyma yra DMCA tipo įrodymas: su data, turinio žyma, pažymėtomis vietomis. Automatinio DMCA nesiunčiame (teisinis sprendimas), bet gaunate visus dokumentus.

Ar galiu išskirti savo sindikacijos tinklą iš dubliato paieškos?

Pro versija — įtraukite sąrašą domenų, kuriuos valdote (medium.com/@jūs, linkedin.com/in/jūs, substack.com/p/jūs). Atitiktis prieš leidžiamus domenus žymimos SYND-OK ir nesiskaičiuoja į dubliavimo rodiklį. Rodiklis rodo „netikėtą dubliavimą“, ne „bet kokį dubliavimą“.

Kaip porinė analizė apdoroja 500 straipsnių biblioteką?

Išrinkimo eiga praktikoje užtikrina O(n log n) analizę porai — pirminis filtravimas atliekamas pagal 60 bitų žymes, o visiškas palyginimas tik atrinktiems. 500 straipsnių → 124 750 porų per ~4 min. su 4 branduolių serveriu. Matrica eksportuojama kaip CSV — naudokite kaip reikia.

Ar variklis iš tikrųjų yra atvirojo kodo?

Taip — github.com/NoplagLabs/noplag-engine, Apache 2.0. Repo yra teksto dalijimo, pirštų atspaudų kūrimo, paieškos kaskados, sulyginimo ir dublikatų klasifikavimo logika. Debesijos lygmuo prideda korpusą + Common Crawl + Wikipedia kopiją; diegiant savarankiškai, korpusą pateikiate patys. Prieš pasitikėdami rezultatu, patikrinkite algoritmą.

Koks API integracijai su turinio srautu?

REST galinis taškas /v1/checks (Python + Node SDK). Pateikite dokumentą, gaukite dublikatų ataskaitą sinchroniškai iki 8 sekundžių, jei ilgiau — grąžinama per webhook. Tinka CI patikroms prieš publikavimą — jei dublikatų % viršija jūsų komandos ribą, sujungimas atmetamas. Visa dokumentacija — /docs/developers/api.

O jei turinys už paywall ar login?

Kreipiame tik prieinamą turinį — Common Crawl, sitemap deklaruoti puslapiai, robots leidžiami domenai. Paywall (NYT, FT, akademiniai žurnalai už užrakto) nėra indekse; variklis jų nesuras net jei perrašysite jų tekstą. Akademiniams tekstams — OpenAlex / CORE indeksas apima atviros prieigos literatūrą.

Nuskenuokite juodraštį. Arba visą savo biblioteką.

Nemokama versija apima 2 500 žodžių patikrą 150M+ puslapių. Pro ($23/mėn.) — porinė bibliotekos paieška. Apache 2.0 algoritmas jums, jei norite laikyti korpusą pas save.

Plagiato patikra internete – nemokamas įrankis