WEB150M+ stránek · podpora kanonických odkazů

Kontrola plagiátů pro online duplicitní obsah

Najděte duplicitní obsah na internetu, ve svých složkách a v týmové knihovně. Kanonická logika — rozpozná syndikaci versus kopírování. Zdarma do 2 500 slov; skenování složek v Pro verzi.

0 / 1,500 words
Web + indexace Common CrawlDetekce téměř shodných i přepisovaných textůSkenování knihovny ve složkách
TYPY DUPLIKÁTŮ

Čtyři druhy duplicity. Jiná příčina, jiný způsob řešení.

Většina “dupe checkerů” najde jen přesné shody. My každou shodu klasifikujeme do čtyř kategorií: víte, co ignorovat (citace), co kanonizovat (syndikace), co přepsat (kopie, přepis).

01 · PŘESNÁ SHODA

Doslovná shoda

Identické úseky od 30 znaků. Patří sem vložené šablony, doslovná syndikace, okopírované stránky.

Řešení: kanonizujte, přepište, nebo ponechte (pokud je to vaše syndikace).
02 · TÉMĚŘ SHODA

Lehce přeformulované

Zachována struktura věty, změněná slova, přehozená adjektiva. Typický výstup “spinningu”. Zachytí, co Copyscape záměrně nevidí.

Řešení: kompletní přepsání — argument by měl být váš.
03 · SPUN

Silně přeformulované

Parafráze na úrovni vět: popřeházené části, jiné časy, vložená omáčka. Často z AI-přepisovačů nebo externích agentur.

Řešení: ověřit záměr. Jde o vlastní parafrázi autora, nebo skrytou kopii?
04 · ŠABLONY

Opakující se napříč stránkami

Stejné prohlášení, bio autora nebo popis produktu na stovkách vašich stránek — tohle je faktický problém duplicit u Google.

Řešení: přesunout do šablony; nemějte to indexované Googlem stokrát.
CO GOOGLE SKUTEČNĚ ZA DUPLIKÁT POVAŽUJE

Není to jen „kopírování z jiného webu“.

Pravidla od Google (Search Central): tři vzory spouští hodnocení jako duplicitu — většinou jde o vaše vlastní stránky, ne o kopie od konkurence.

01

Překryv mezi doménami bez canonical

Stejný článek na více webech bez rel=canonical zpět na původní. Sem patří špatně distribuovaná syndikace, nahlášené kopie konkurence, náhodně publikované vícekrát.

02

Týž obsah pod více URL na vašem webu

/product/foo, /product/foo?utm_source=email a /product/foo/ s lomítky. Filtrování (kombinace tvořící stejné stránky), tisková verze bez canonical, mobilní/desktopové URL zvlášť. Google stránky seskupí, jednu ponechá, ostatní vyřadí.

03

Šablony vydávané za obsah

Kategorie e-shopu s identickým popisem u 1 200 produktů. Lokální stránky se stejnou větou o zkušenostech týmu na 47 městech. Tenký duplicitní obsah — Google ho vyřazuje agresivně.

SEO VYUŽITÍ

Šest týmů, které kontrolují každý týden.

Stejný nástroj, šest různých workflow — od sólo bloggera po agenturní kontrolu článků od externistů.

Kontrola blogu před publikací

Projeďte návrh před zveřejněním. Odhalí náhodné opakování frází z vlastních starších textů (kanibalizace), články konkurence, které jste četli při rešerši, nebo použití AI-přepisovače.

Detekce kopírování konkurencí

Vložte svůj text, uvidíte, kdo ho zveřejnil taky. Použitelné pro DMCA — u každé shody zdrojová URL, přesný úsek, timestamp, vše uložíte jako důkaz.

Hygiena obsahové knihovny

Pro sken složek v Pro verzi. Vložte celý týmový archiv do složky; nástroj označí duplicity napříč články, šablony k přesunu.

Audit syndikace

Publikovali jste článek na Medium, LinkedIn a Substack. Všude rel=canonical zpět na původní URL? Nástroj zkontroluje každý, označí, kde chybí a kde uniká SEO signál.

Kontrola textu od externisty

Dodávka od externího autora v jednom okně. Spusťte před úhradou. Zachytí běžné vzory: nejprve zkopírovat, pak přepsat, AI-přepis, citace bez zdroje.

Původ AI obsahu

AI si pro text stahuje reálné webové zdroje. Nástroj tyto segmenty zobrazí, rozhodnutí je na vás: citovat, přepsat, nebo odstranit. Sníží riziko penalizace Helpful Content Aktualizací.

SKEN DUPLIKÁTŮ VE SLOŽKÁCH

Nahrajte knihovnu. Uvidíte, co se kde kryje.

Pro funkce. Vyberte složku s publikovanými články, engine vytvoří matici podobností napříč páry. Seřaditelné podle překryvu, proklik na konkrétní úseky.

SLOŽKA / blog-2026-q16 článků · párová matice podobností
3 překryvy > 10 %Exportovat matici
ČLÁNEKA1A2A3A4A5A6
A1 — Pět SaaS cenových modelů·4%3%38%6%2%
A2 — Jak napsat SaaS cenotvorbu4%·5%12%7%3%
A3 — Průvodce produktově řízeným oceňováním3%5%·8%6%4%
A4 — Playbook SaaS cen38%12%8%·9%5%
A5 — Jak volit SaaS cenu6%7%6%9%·4%
A6 — SaaS ceny pro zakladatele2%3%4%5%4%·
Klikněte na buňku pro zobrazení přesahu mezi dvěma články
  • 150M+indexovaných stránek
  • 30dobnova korpusu
  • 94%úspěšnost určení kanonical
  • 4úrovně klasifikace duplikátů
  • 2014indexace Common Crawl
VS ZÁKLADNÍM DUPE NÁSTROJŮM

Tři věci, které prohlížečové nebo SEO dupe-nástroje nenajdou.

NÁSTROJE TYPU COPYSCAPE

Jen přesná shoda (Copyscape standard). Přepsaná věta projde jako 'unikát' — a 'spun' projde čistě. Dobré na výřezy clipboardu, zbytečné pro skutečnou QA obsahu.

Noplag: klasifikace do 4 úrovní (Přesná / Téměř shoda / Spun / Šablona) s nápovědou k záměru — rozhodnutí, ne jen 'ano/ne'.

SEO NÁSTROJE

Unikátní obsah v nástroji za $99-499/měsíc. Povrchní n-gramy; bez Common Crawl; bez mezidokumentového skenu ve složce.

Noplag: samostatná varianta zdarma (2 500 slov). Pro ($23/měsíc) přidává sken maticí a plný index 150M+ webů — bez závislosti na drahém SEO balíku.

ONLINE KONTROLY ZDARMA

Černá skříňka. Nevidíte, KTERÝ zdroj byl shodný, jen číslo podobnosti. Limity často 1 000 slov. Většina neobnovuje index — porovnává proti webu z roku 2021.

Noplag: každá shoda ukáže URL zdroje + canonical + úseky + datum snapshotu. Apache 2.0 — ověřit algoritmus přímo.

DETEKCE KANONICKÝCH ADRES

Znovu zveřejněný článek s rel=canonical není „duplicitní obsah“. My to tak posuzujeme.

Když je článek na více URL, SEO otázka nezní „jsou stejné?“, ale „všichni deklarují stejnou kanonickou adresu?“. Pokud váš příspěvek na Medium odkazuje rel=canonical na původní URL, Google je seskupí, přičte autorství původnímu zdroji, ostatní hodnotí jako legitimní syndikaci. Pokud ne, soutěžíte se svým vlastním obsahem. Nástroj u každé shody stáhne stránku, projde tag <link rel="canonical">, a výsledek označí: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK, nebo SCRAPED.

Přečtěte si logiku canonical
FAQ

Otázky, které padnou před nasazením.

Jaký je záběr webu ve srovnání s Copyscape nebo SEMrush?

150M+ stránek z Common Crawl + vybrané domény s návštěvností pro SEO, každý měsíc aktualizace. Větší než index Copyscape (asi 120M, zaměřeno na plagiáty), menší než úplné procházení Googlem, ale s dokumentovaným pokrytím a cyklem obnovy. Pro tier přidá možnost použít vlastní složku jako další korpus.

Jak přesně probíhá detekce canonical?

Pro každou nalezenou stránku engine načte zdrojovou URL (cache nebo live), projde <head>, vytáhne rel=canonical. Výsledky označí jako ORIGIN (canonical vede na sebe), SYND-OK (canonical vede na jinou vaši stránku), LEAK (canonical chybí/odkazuje jinam), SCRAPED (žádný canonical + doména není distribuční síť). Klasifikace je u každé shody — skóre je transparentní.

Pozná to AI-generovaný obsah z kopií?

Ano — AI generátory používají reálné webové texty, tyto průniky najdete jako Téměř shoda nebo Spun. Vždy ukážeme zdroj URL, rozhodnutí je na vás: citovat, přepsat, odstranit. AI-detekce obsahu (jiný signál) je jiný nástroj — je ve vývoji, zde je jen dupe scan.

Jak dlouhý dokument lze zkontrolovat?

2 500 slov zdarma, 50 000 v Premium, 250 000+ v Enterprise (nebo bez limitu při self-hostu). Pro sken ve složkách: až 2 000 dokumentů ve složce, matice párových podobností u takového objemu do 5 minut.

Najde to kopie mého obsahu u konkurence?

Pokud je kopie v indexu (tj. na veřejném webu), ano — URL se objeví s timestampem. Snapshot je použitelný jako důkaz pro DMCA: s datem, otiskem obsahu, zvýrazněné průniky. DMCA nepodáváme — je to právní rozhodnutí — ale vše potřebné dostanete.

Lze ze skenu vyřadit vlastní syndikaci?

Pro verze — přidáte seznam domén, které kontrolujete (medium.com/@vy, linkedin.com/in/vy, substack.com/p/vy). Průniky na těchto doménách jsou SYND-OK a nejsou započítány do skóre duplicity. Skóre tak reflektuje „nečekanou duplicitu“, ne každou.

Jak sken párových shod zvládne knihovnu s 500 články?

Vyhledávání O(n log n) na pár — fingerprinty filtrují kandidáty 60bitovými hashi, pak detailní porovnání jen na kandidátech. 500 článků → 124 750 párových průniků za ~4 minuty na 4 jádrech. Matice lze vyexportovat jako CSV pro další zpracování.

Je tento engine skutečně open source?

Ano — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker, fingerprinter, retrieval cascade, alignment a logika pro klasifikaci duplicit jsou všechny v repozitáři. Cloudová verze přidává korpus + Common Crawl + zrcadlo Wikipedie; při self-hostingu si korpus zajišťujete sami. Ověřte algoritmus, než budete důvěřovat výslednému skóre.

Existuje API pro integraci do workflow?

REST endpoint na /v1/checks (Python + Node SDK). Pošlete dokument, zpět dostanete duplicitní report synchronně do 8 sekund, nad tuto dobu přes webhook callback. Vhodné pro CI kontroly před publikací — merge selže, pokud duplikace v % překročí nastavený limit týmu. Kompletní dokumentace na /docs/developers/api.

Co obsah za paywallem nebo s loginem?

Prohledáváme jen veřejně dostupný web — Common Crawl, stránky nahlášené v sitemapách, domény povolené v robots.txt. Obsah za paywallem (NYT, FT, vědecké časopisy) v indexu není; engine tyto průniky neodhalí, i když máte v textu identickou pasáž. Pro vědecké práce využijte OpenAlex / CORE (oddělený korpus) pro otevřeně přístupné zdroje.

Zkontrolujte návrh. Nebo celou knihovnu.

Zdarma do 2 500 slov proti 150M+ webům. Pro ($23/měsíc) odemyká sken složky i matici překryvů ve vaší knihovně. Apache 2.0 referenční implementace, pokud chcete hostovat na svém serveru.

Kontrola plagiátů pro duplicitní obsah zdarma online