Kontrola plagiátů pro online duplicitní obsah
Najděte duplicitní obsah na internetu, ve svých složkách a v týmové knihovně. Kanonická logika — rozpozná syndikaci versus kopírování. Zdarma do 2 500 slov; skenování složek v Pro verzi.
Čtyři druhy duplicity. Jiná příčina, jiný způsob řešení.
Většina “dupe checkerů” najde jen přesné shody. My každou shodu klasifikujeme do čtyř kategorií: víte, co ignorovat (citace), co kanonizovat (syndikace), co přepsat (kopie, přepis).
Doslovná shoda
Identické úseky od 30 znaků. Patří sem vložené šablony, doslovná syndikace, okopírované stránky.
Lehce přeformulované
Zachována struktura věty, změněná slova, přehozená adjektiva. Typický výstup “spinningu”. Zachytí, co Copyscape záměrně nevidí.
Silně přeformulované
Parafráze na úrovni vět: popřeházené části, jiné časy, vložená omáčka. Často z AI-přepisovačů nebo externích agentur.
Opakující se napříč stránkami
Stejné prohlášení, bio autora nebo popis produktu na stovkách vašich stránek — tohle je faktický problém duplicit u Google.
Není to jen „kopírování z jiného webu“.
Pravidla od Google (Search Central): tři vzory spouští hodnocení jako duplicitu — většinou jde o vaše vlastní stránky, ne o kopie od konkurence.
Překryv mezi doménami bez canonical
Stejný článek na více webech bez rel=canonical zpět na původní. Sem patří špatně distribuovaná syndikace, nahlášené kopie konkurence, náhodně publikované vícekrát.
Týž obsah pod více URL na vašem webu
/product/foo, /product/foo?utm_source=email a /product/foo/ s lomítky. Filtrování (kombinace tvořící stejné stránky), tisková verze bez canonical, mobilní/desktopové URL zvlášť. Google stránky seskupí, jednu ponechá, ostatní vyřadí.
Šablony vydávané za obsah
Kategorie e-shopu s identickým popisem u 1 200 produktů. Lokální stránky se stejnou větou o zkušenostech týmu na 47 městech. Tenký duplicitní obsah — Google ho vyřazuje agresivně.
Šest týmů, které kontrolují každý týden.
Stejný nástroj, šest různých workflow — od sólo bloggera po agenturní kontrolu článků od externistů.
Kontrola blogu před publikací
Projeďte návrh před zveřejněním. Odhalí náhodné opakování frází z vlastních starších textů (kanibalizace), články konkurence, které jste četli při rešerši, nebo použití AI-přepisovače.
Detekce kopírování konkurencí
Vložte svůj text, uvidíte, kdo ho zveřejnil taky. Použitelné pro DMCA — u každé shody zdrojová URL, přesný úsek, timestamp, vše uložíte jako důkaz.
Hygiena obsahové knihovny
Pro sken složek v Pro verzi. Vložte celý týmový archiv do složky; nástroj označí duplicity napříč články, šablony k přesunu.
Audit syndikace
Publikovali jste článek na Medium, LinkedIn a Substack. Všude rel=canonical zpět na původní URL? Nástroj zkontroluje každý, označí, kde chybí a kde uniká SEO signál.
Kontrola textu od externisty
Dodávka od externího autora v jednom okně. Spusťte před úhradou. Zachytí běžné vzory: nejprve zkopírovat, pak přepsat, AI-přepis, citace bez zdroje.
Původ AI obsahu
AI si pro text stahuje reálné webové zdroje. Nástroj tyto segmenty zobrazí, rozhodnutí je na vás: citovat, přepsat, nebo odstranit. Sníží riziko penalizace Helpful Content Aktualizací.
Nahrajte knihovnu. Uvidíte, co se kde kryje.
Pro funkce. Vyberte složku s publikovanými články, engine vytvoří matici podobností napříč páry. Seřaditelné podle překryvu, proklik na konkrétní úseky.
- 150M+indexovaných stránek
- 30dobnova korpusu
- 94%úspěšnost určení kanonical
- 4úrovně klasifikace duplikátů
- 2014indexace Common Crawl
Tři věci, které prohlížečové nebo SEO dupe-nástroje nenajdou.
Jen přesná shoda (Copyscape standard). Přepsaná věta projde jako 'unikát' — a 'spun' projde čistě. Dobré na výřezy clipboardu, zbytečné pro skutečnou QA obsahu.
Noplag: klasifikace do 4 úrovní (Přesná / Téměř shoda / Spun / Šablona) s nápovědou k záměru — rozhodnutí, ne jen 'ano/ne'.
Unikátní obsah v nástroji za $99-499/měsíc. Povrchní n-gramy; bez Common Crawl; bez mezidokumentového skenu ve složce.
Noplag: samostatná varianta zdarma (2 500 slov). Pro ($23/měsíc) přidává sken maticí a plný index 150M+ webů — bez závislosti na drahém SEO balíku.
Černá skříňka. Nevidíte, KTERÝ zdroj byl shodný, jen číslo podobnosti. Limity často 1 000 slov. Většina neobnovuje index — porovnává proti webu z roku 2021.
Noplag: každá shoda ukáže URL zdroje + canonical + úseky + datum snapshotu. Apache 2.0 — ověřit algoritmus přímo.
Znovu zveřejněný článek s rel=canonical není „duplicitní obsah“. My to tak posuzujeme.
Když je článek na více URL, SEO otázka nezní „jsou stejné?“, ale „všichni deklarují stejnou kanonickou adresu?“. Pokud váš příspěvek na Medium odkazuje rel=canonical na původní URL, Google je seskupí, přičte autorství původnímu zdroji, ostatní hodnotí jako legitimní syndikaci. Pokud ne, soutěžíte se svým vlastním obsahem. Nástroj u každé shody stáhne stránku, projde tag <link rel="canonical">, a výsledek označí: ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK, nebo SCRAPED.
Otázky, které padnou před nasazením.
Jaký je záběr webu ve srovnání s Copyscape nebo SEMrush?
150M+ stránek z Common Crawl + vybrané domény s návštěvností pro SEO, každý měsíc aktualizace. Větší než index Copyscape (asi 120M, zaměřeno na plagiáty), menší než úplné procházení Googlem, ale s dokumentovaným pokrytím a cyklem obnovy. Pro tier přidá možnost použít vlastní složku jako další korpus.
Jak přesně probíhá detekce canonical?
Pro každou nalezenou stránku engine načte zdrojovou URL (cache nebo live), projde <head>, vytáhne rel=canonical. Výsledky označí jako ORIGIN (canonical vede na sebe), SYND-OK (canonical vede na jinou vaši stránku), LEAK (canonical chybí/odkazuje jinam), SCRAPED (žádný canonical + doména není distribuční síť). Klasifikace je u každé shody — skóre je transparentní.
Pozná to AI-generovaný obsah z kopií?
Ano — AI generátory používají reálné webové texty, tyto průniky najdete jako Téměř shoda nebo Spun. Vždy ukážeme zdroj URL, rozhodnutí je na vás: citovat, přepsat, odstranit. AI-detekce obsahu (jiný signál) je jiný nástroj — je ve vývoji, zde je jen dupe scan.
Jak dlouhý dokument lze zkontrolovat?
2 500 slov zdarma, 50 000 v Premium, 250 000+ v Enterprise (nebo bez limitu při self-hostu). Pro sken ve složkách: až 2 000 dokumentů ve složce, matice párových podobností u takového objemu do 5 minut.
Najde to kopie mého obsahu u konkurence?
Pokud je kopie v indexu (tj. na veřejném webu), ano — URL se objeví s timestampem. Snapshot je použitelný jako důkaz pro DMCA: s datem, otiskem obsahu, zvýrazněné průniky. DMCA nepodáváme — je to právní rozhodnutí — ale vše potřebné dostanete.
Lze ze skenu vyřadit vlastní syndikaci?
Pro verze — přidáte seznam domén, které kontrolujete (medium.com/@vy, linkedin.com/in/vy, substack.com/p/vy). Průniky na těchto doménách jsou SYND-OK a nejsou započítány do skóre duplicity. Skóre tak reflektuje „nečekanou duplicitu“, ne každou.
Jak sken párových shod zvládne knihovnu s 500 články?
Vyhledávání O(n log n) na pár — fingerprinty filtrují kandidáty 60bitovými hashi, pak detailní porovnání jen na kandidátech. 500 článků → 124 750 párových průniků za ~4 minuty na 4 jádrech. Matice lze vyexportovat jako CSV pro další zpracování.
Je tento engine skutečně open source?
Ano — github.com/NoplagLabs/noplag-engine, Apache 2.0. Chunker, fingerprinter, retrieval cascade, alignment a logika pro klasifikaci duplicit jsou všechny v repozitáři. Cloudová verze přidává korpus + Common Crawl + zrcadlo Wikipedie; při self-hostingu si korpus zajišťujete sami. Ověřte algoritmus, než budete důvěřovat výslednému skóre.
Existuje API pro integraci do workflow?
REST endpoint na /v1/checks (Python + Node SDK). Pošlete dokument, zpět dostanete duplicitní report synchronně do 8 sekund, nad tuto dobu přes webhook callback. Vhodné pro CI kontroly před publikací — merge selže, pokud duplikace v % překročí nastavený limit týmu. Kompletní dokumentace na /docs/developers/api.
Co obsah za paywallem nebo s loginem?
Prohledáváme jen veřejně dostupný web — Common Crawl, stránky nahlášené v sitemapách, domény povolené v robots.txt. Obsah za paywallem (NYT, FT, vědecké časopisy) v indexu není; engine tyto průniky neodhalí, i když máte v textu identickou pasáž. Pro vědecké práce využijte OpenAlex / CORE (oddělený korpus) pro otevřeně přístupné zdroje.
Zkontrolujte návrh. Nebo celou knihovnu.
Zdarma do 2 500 slov proti 150M+ webům. Pro ($23/měsíc) odemyká sken složky i matici překryvů ve vaší knihovně. Apache 2.0 referenční implementace, pokud chcete hostovat na svém serveru.