Kontrola plagiátů pro vydavatele před publikací
Kontroly před zveřejněním u externích příspěvků, audity syndikace pro převzatý obsah, a REST API, které může váš tým připojit k CMS. Detekční engine je Apache 2.0 — čitelný před nasazením, ne až po něm.
Čtyři stoly. Jeden workflow.
Prověřte externí námět před zadáním
10 minut na příspěvek, před přidělením rozpočtu na editaci.
- Vložte návrh/námět, zobrazí se dříve publikované verze
- AI pravděpodobnost po odstavcích (již brzy), včetně podpory pro ESL texty
- Vynechejte opakované dotazování na původnost
Zkontrolujte denní frontu před publikací
Hromadná kontrola dnešních článků před zařazením do publikační fronty CMS.
- Pohled fronty řazený dle podobnosti + AI skóre
- Práh pro každou sekci (komentář vs zpráva vs recenze)
- Auditní stopa dle autora pro standards desk
Šetřete sporný příspěvek
Nejdřív algoritmus, pak porovnané pasáže.
- Reprodukovatelnost přes X-Engine-Commit
- Možnost změnit verdikt s dokumentovaným důvodem
- Apache 2.0 — obhajitelné při zpětné kontrole
Audituje partnery, kteří vás přebírají
Sleduje správnost canonical tagu v rámci syndikační sítě.
- Detekce rozpoznávající canonical (ORIGIN / SYND OK / LEAK)
- Týdenní srovnání po partnerech
- Balíček důkazních materiálů pro DMCA na vyžádání
Tři kroky, než článek dorazí do publikační fronty CMS.
Napojené přímo do redakčního workflow přes API, spuštěné hromadně před publikací nebo jednorázově v dashboardu. Stejný engine, stejný report, použitelné dle potřeby.
01 · Příjem
Příspěvek dorazí do fronty CMS — drag & drop .docx / .gdoc / vložení, nebo CMS pushne přes webhook. Metadata autora, sekce a přiřazeného editora cestují s dokumentem do auditního záznamu.
02 · Skenování + třídění
Kaskáda běží nad otevřeným webem + Common Crawl + (volitelně) vaším vlastním archivem. Klasifikace citací odděluje přímé citace s uvedením zdroje od necitovaných parafrází. AI pravděpodobnost po odstavcích bude brzy, včetně podpory pro ESL. Medián 42 s na článek.
03 · Rozhodnutí + publikace
Editor vidí: podobnost titulku, rozbor dle kategorií, řaditelný seznam zdrojů (AI skóre s vlaječkou pro ESL bude brzy). Tři možnosti: publikovat, vrátit s poznámkami, eskalovat na standards desk. Rozhodnutí se ukládá s engine commit + snapshotem korpusu.
Čtyři CMS. Jeden REST kontrakt.
Připojte Noplag k CMS, které už novináři používají. API je stejné — liší se pouze integrační vrstva (WordPress, Ghost, Drupal, nebo vlastní webhooky).
Oficiální plugin z WordPress.org Plugins Directory. Kompatibilní s Gutenbergem.
- Metabox před publikací na každém typu příspěvku
- Zvýraznění na úrovni bloků v editoru
- Auditní log přes WP REST API
Webhook integrace + Admin API consumer. Funguje i pro obsah pro členy.
- Webhook před publikací při save_draft
- Pravidla skenování podle typu obsahu
- Vhodné pro self-host (Noplag + Ghost self-host)
Contrib modul z drupal.org. Integrace přes Field API.
- Pole pro plagiát podle typu obsahu
- Napojení do workflow přes Content Moderation
- Podpora pro multi-site konfiguraci
Webhooks + OpenAPI 3.0 specifikace. Pro headless CMS, vlastní systémy, cokoli.
- POST /v1/checks z libovolného CMS hooku
- Webhook odpovědi podepsané přes HMAC
- Python + Node SDK vzniká z OpenAPI specifikace
Dnešní fronta k publikaci. Přehledná, auditovaná.
Řádky pro každý článek: autor, sekce, podobnost, AI skóre, kliknutí na report se zvýrazněním. Možné řadit. Hromadně schválit bezpečné články, ostatní eskalovat.
Zjistěte, kdo vás přebírá — a jestli canonical míří k vám.
Sledujte svou distribuční síť
Přidejte domény, kam syndikujete (Medium, LinkedIn, Substack, síťoví partneři) jako allowlist. Týdenní crawl potvrzuje, kde rel=canonical vede domů (ORIGIN), kde chybí (SEO leak), a kde je obsah převzat bez svolení (SCRAPED).
Na kterém webu chybí vaše byline?
Měsíční diff z veřejného webu odhalí domény mimo allowlist, kde se objevil váš obsah. U každého případu je snapshot s datem — pro DMCA důkaz, kdy kopie vyšla. DMCA nezajišťujeme (právní otázka), jen předáme potřebné podklady.
Vnitřní duplicity mezi vlastními stránkami
Profesionální sken složky: nahrajte korpus vydaných článků, engine vytvoří matici podobnosti mezi páry. Najde třeba 47 městských stránek se stejným odstavcem — riziko pro Helpful-Content-Update, o kterém je dobré vědět dřív než Google.
Tři zásady, které standardní pracovní stůl požaduje před nákupem.
Za prvé — odevzdané články nikdy neslouží k trénování modelu. Ani našeho, ani žádného jiného. Odevzdaný text je otiskován, indexován ve vašem tenantovi a po 30 dnech odstraněn, pokud není výslovně nastaveno delší uchování. Za druhé — AI posouzení (připravujeme, je na roadmapě) bude po odstavcích, ne po článcích, a bude označeno konkrétním commitem enginu a časovým razítkem snapshotu korpusu. Sporné označení AI půjde po měsících ověřit proti stejnému commitu. Žádné tiché pře-učení modelu. Za třetí — Apache 2.0 znamená, že váš technický tým může klonovat github.com/NoplagLabs/noplag-engine, provozovat na vlastní infrastruktuře, auditovat tok dat a ověřit kompletní proces práva na výmaz. Většina institucionálních výběrových řízení na software pro detekci plagiátorství se zastaví na těchto třech otázkách; snažili jsme se na ně odpovědět předem.
Přečíst standardizační příručkuCo si standardizační tým opravdu ověřuje před nákupem.
- Budou naše články použity pro trénink vašeho AI modelu?
- Ne. Odevzdané články se pouze otiskují (hashují) a indexují v izolované databázi vašeho nájemce. Text se po 30 dnech smaže, pokud neaktivujete trvalost. AI model (Binoculars-based, Hans et al. 2024; brzy v roadmapě) bude trénovaný jen na veřejných datech, nikdy ne na zákaznických. Výslovně v DPA.
- Jak AI verdikt po odstavcích obstojí v případě sporu s autorem?
- AI detekce bude brzy dostupná — je na roadmapě pro v1.2, při spuštění ještě není. Po nasazení bude každý označený odstavec obsahovat commit enginu a snapshot korpusu. Znovu ověření stejného odstavce proti tomuto commitu dá shodný výsledek. Algoritmus je otevřený na github.com/NoplagLabs/noplag-engine (Apache 2.0), včetně prahu perplexity a dokumentace kalibrace upravené pro ESL. Nemáme režim „důvěřujte skóre“.
- A co externisti v zemích s nízkou konektivitou?
- Detekce je při spuštění kalibrovaná pro angličtinu, španělštinu, portugalštinu, polštinu a ukrajinštinu; další jazyky budou přibývat. Kvalita detekce je měřena na PAN-PC-11; vyhodnocení po jednotlivých jazycích je v plánu. AI posouzení upravené pro ESL označí text psaný nerodilým mluvčím angličtiny jako ESL ADJ místo LIKELY-AI, pokud to naznačuje lexikální profil.
- Lze provozovat kompletně ve vlastní infrastruktuře?
- Ano — Apache 2.0 engine + Docker. Kompletně uvnitř vaší sítě. Páruje se s vaším Postgres + Redis; žádný obsah neputuje ven z vašeho VPC. Vhodné pro redakce s důrazem na ochranu zdrojů nebo mlčenlivost před publikací.
- Integruje se s naším CMS?
- WordPress (oficiální plugin), Ghost (Admin API + webhooky), Drupal (contrib modul). Pro ostatní — custom CMS, headless, interní — REST + OpenAPI 3.0 poskytne vše pro vlastní pre-publish hook během dne. Python i Node SDK jsou přímo ze speku.
- Co přesně umí syndication-audit?
- Přidejte distribuční domény jako allowlist (medium.com/@you, partneři). Týdenní crawl reportuje stav canonical tagu: ORIGIN (směřuje k vám), SYND OK (z partnerské domény směruje k vám), LEAK (chybí nebo směřuje jinam, riziko pro SEO), SCRAPED (kopie, bez canonical a mimo allowlist). SCRAPED má snapshot s datem jako důkaz pro DMCA.
- Jak se počítá cena pro redakci s 30 reportéry?
- Premium za $79/měsíc je 5000 slov/kontrolu, 5000 článků/měsíc, plné API + CMS integrace. Pro vysoký objem (10 000+ článků/měsíc) je Enterprise smluvní na základě objemu a infrastruktury. Sazba není na počet lidí, ale na objem.
- A co op-edy, syndikace a knižní ukázky, kde je „reuse“ běžný?
- Prahy podle sekcí na Pro+ — nastavíte různé citlivosti pro zprávy vs komentáře vs recenze vs syndikované výňatky. Komentář s přímou citací projevu senátu nemá stejné prahy jako zpráva s převzatou frází. Klasifikace citací odděluje legitimní citace od nechtěného reuse.
- Zpomalí to naši frontu k publikaci?
- Medián 47 sekund na článek (1 500–4 000 slov). Hook CMS je asynchronní — při uloženém návrhu vidí editor výsledek, než dopíše korektury. Dlouhé články (8 000+ slov) trvají ~90 sekund a je vhodné je spustit mimo synchronní hook.
- Můžeme přidat náš archiv jako soukromý korpus?
- Ano — varianta Enterprise. Hromadně importujete archiv do odděleného korpusu, engine porovnává nové příspěvky i s vašimi starými. Najde opakované články autora (někdy legitimní, někdy ne) a záměrné reuse pod jiným byline.
Spusťte návrh skrz frontu. Podívejte se na pohled pro článek.
Vložte Word, Google Doc nebo export z CMS. Do 47 vteřin report po odstavcích. Na 2 500 slov zdarma; Pro plán pro objem; Enterprise pro korpus + vlastní infrastrukturu.