NEWSROOMRedakční workflow · CMS API · audit syndikace

Kontrola plagiátů pro vydavatele před publikací

Kontroly před zveřejněním u externích příspěvků, audity syndikace pro převzatý obsah, a REST API, které může váš tým připojit k CMS. Detekční engine je Apache 2.0 — čitelný před nasazením, ne až po něm.

Workflow před zveřejněnímAudit syndikaceREST API připravené pro CMS
PRO TY, KDO SCHVALUJÍ PUBLIKACI

Čtyři stoly. Jeden workflow.

EDITOR

Prověřte externí námět před zadáním

10 minut na příspěvek, před přidělením rozpočtu na editaci.

  • Vložte návrh/námět, zobrazí se dříve publikované verze
  • AI pravděpodobnost po odstavcích (již brzy), včetně podpory pro ESL texty
  • Vynechejte opakované dotazování na původnost
MANAGING EDITOR

Zkontrolujte denní frontu před publikací

Hromadná kontrola dnešních článků před zařazením do publikační fronty CMS.

  • Pohled fronty řazený dle podobnosti + AI skóre
  • Práh pro každou sekci (komentář vs zpráva vs recenze)
  • Auditní stopa dle autora pro standards desk
STANDARDS DESK

Šetřete sporný příspěvek

Nejdřív algoritmus, pak porovnané pasáže.

  • Reprodukovatelnost přes X-Engine-Commit
  • Možnost změnit verdikt s dokumentovaným důvodem
  • Apache 2.0 — obhajitelné při zpětné kontrole
SYNDICATION

Audituje partnery, kteří vás přebírají

Sleduje správnost canonical tagu v rámci syndikační sítě.

  • Detekce rozpoznávající canonical (ORIGIN / SYND OK / LEAK)
  • Týdenní srovnání po partnerech
  • Balíček důkazních materiálů pro DMCA na vyžádání
WORKFLOW PŘED PUBLIKACÍ

Tři kroky, než článek dorazí do publikační fronty CMS.

Napojené přímo do redakčního workflow přes API, spuštěné hromadně před publikací nebo jednorázově v dashboardu. Stejný engine, stejný report, použitelné dle potřeby.

01

01 · Příjem

Příspěvek dorazí do fronty CMS — drag & drop .docx / .gdoc / vložení, nebo CMS pushne přes webhook. Metadata autora, sekce a přiřazeného editora cestují s dokumentem do auditního záznamu.

02

02 · Skenování + třídění

Kaskáda běží nad otevřeným webem + Common Crawl + (volitelně) vaším vlastním archivem. Klasifikace citací odděluje přímé citace s uvedením zdroje od necitovaných parafrází. AI pravděpodobnost po odstavcích bude brzy, včetně podpory pro ESL. Medián 42 s na článek.

03

03 · Rozhodnutí + publikace

Editor vidí: podobnost titulku, rozbor dle kategorií, řaditelný seznam zdrojů (AI skóre s vlaječkou pro ESL bude brzy). Tři možnosti: publikovat, vrátit s poznámkami, eskalovat na standards desk. Rozhodnutí se ukládá s engine commit + snapshotem korpusu.

INTEGRACE CMS

Čtyři CMS. Jeden REST kontrakt.

Připojte Noplag k CMS, které už novináři používají. API je stejné — liší se pouze integrační vrstva (WordPress, Ghost, Drupal, nebo vlastní webhooky).

WordPress5.5+

Oficiální plugin z WordPress.org Plugins Directory. Kompatibilní s Gutenbergem.

  • Metabox před publikací na každém typu příspěvku
  • Zvýraznění na úrovni bloků v editoru
  • Auditní log přes WP REST API
Ghost4.0+

Webhook integrace + Admin API consumer. Funguje i pro obsah pro členy.

  • Webhook před publikací při save_draft
  • Pravidla skenování podle typu obsahu
  • Vhodné pro self-host (Noplag + Ghost self-host)
Drupal9+ / 10

Contrib modul z drupal.org. Integrace přes Field API.

  • Pole pro plagiát podle typu obsahu
  • Napojení do workflow přes Content Moderation
  • Podpora pro multi-site konfiguraci
CustomREST

Webhooks + OpenAPI 3.0 specifikace. Pro headless CMS, vlastní systémy, cokoli.

  • POST /v1/checks z libovolného CMS hooku
  • Webhook odpovědi podepsané přes HMAC
  • Python + Node SDK vzniká z OpenAPI specifikace
REDAKČNÍ POHLED

Dnešní fronta k publikaci. Přehledná, auditovaná.

Řádky pro každý článek: autor, sekce, podobnost, AI skóre, kliknutí na report se zvýrazněním. Možné řadit. Hromadně schválit bezpečné články, ostatní eskalovat.

FRONTA K PUBLIKACI · Úterý 21. května7 článků čeká · 2 eskalovány
Sekce: VšeHromadně publikovat OK
ČLÁNEKAUTORSEKCEPODOBNOSTAI %VERDIKTAKCE
Rada schválila nové územní plánování pro centrumnávrh · 1 840 slovMarisol ChenLOKÁLNÍ6%0.04OKPublikovat
Rekonstrukce: ponaučení z Q1 fiaskanávrh · 1 840 slovTobias ReinhartTECH12%0.08OKPublikovat
Jak AI změnila naši redakci za 18 měsícůnávrh · 1 840 slovPriya AnandNÁZORY38%0.62POZDRŽETZkontrolovat
Moderní romány a otázka hlasunávrh · 1 840 slovSara BeltranKULTURA22%0.18OKPublikovat
Schvalování rozpočtu v senátu — co dálnávrh · 1 840 slovMarcus AdekunlePOLITIKA67%0.41ESKALOVATZkontrolovat
Klimatické uprchlíky: pět let poténávrh · 1 840 slovYuki HiranoREPORTÁŽ14%0.06OKPublikovat
Výsledky technologických firem: kdo překvapil, kdo zklamalnávrh · 1 840 slovDiego MoralesBYZNYS51%0.28POZDRŽETZkontrolovat
Zobrazeno 7 z 7 · řazeno dle sekce a času odevzdáníaudit log: 47 rozhodnutí dnes · 2 eskalováno
47smedián kontroly článku
4integrace s CMS
RESTOpenAPI 3.0 · připraveno pro self-host
0příspěvků v trénovací sadě (policy)
5jazyků pro detekci, rozšiřujeme
AUDIT SYNDIKACE

Zjistěte, kdo vás přebírá — a jestli canonical míří k vám.

01 · STAV CANONICAL

Sledujte svou distribuční síť

Přidejte domény, kam syndikujete (Medium, LinkedIn, Substack, síťoví partneři) jako allowlist. Týdenní crawl potvrzuje, kde rel=canonical vede domů (ORIGIN), kde chybí (SEO leak), a kde je obsah převzat bez svolení (SCRAPED).

Najděte repost na LinkedIn, kde se canonical ztratil kvůli platformě.
02 · DETEKCE SCRAPERŮ

Na kterém webu chybí vaše byline?

Měsíční diff z veřejného webu odhalí domény mimo allowlist, kde se objevil váš obsah. U každého případu je snapshot s datem — pro DMCA důkaz, kdy kopie vyšla. DMCA nezajišťujeme (právní otázka), jen předáme potřebné podklady.

Exportujte důkazní balíček do PDF pro právníka.
03 · AUDIT STEJNÝCH ÚSEKŮ

Vnitřní duplicity mezi vlastními stránkami

Profesionální sken složky: nahrajte korpus vydaných článků, engine vytvoří matici podobnosti mezi páry. Najde třeba 47 městských stránek se stejným odstavcem — riziko pro Helpful-Content-Update, o kterém je dobré vědět dřív než Google.

Spusťte týdně; exportujte matici jako CSV.
REDAKČNÍ PRINCIPY

Tři zásady, které standardní pracovní stůl požaduje před nákupem.

Za prvé — odevzdané články nikdy neslouží k trénování modelu. Ani našeho, ani žádného jiného. Odevzdaný text je otiskován, indexován ve vašem tenantovi a po 30 dnech odstraněn, pokud není výslovně nastaveno delší uchování. Za druhé — AI posouzení (připravujeme, je na roadmapě) bude po odstavcích, ne po článcích, a bude označeno konkrétním commitem enginu a časovým razítkem snapshotu korpusu. Sporné označení AI půjde po měsících ověřit proti stejnému commitu. Žádné tiché pře-učení modelu. Za třetí — Apache 2.0 znamená, že váš technický tým může klonovat github.com/NoplagLabs/noplag-engine, provozovat na vlastní infrastruktuře, auditovat tok dat a ověřit kompletní proces práva na výmaz. Většina institucionálních výběrových řízení na software pro detekci plagiátorství se zastaví na těchto třech otázkách; snažili jsme se na ně odpovědět předem.

Přečíst standardizační příručku
REDAKČNÍ Q&A
Q1Učí se engine z našich článků? — Ne. Odevzdaný obsah se jen otiskuje; netrénuje se na něm model.
Q2Lze hostovat vlastní instanci? — Ano. Apache 2.0 + Docker. Celý provoz uvnitř vaší sítě.
Q3Co evropská rezidence? — Pro+ je na api.eu.noplag.com. GDPR je výchozí stav.
Q4Reprodukovatelnost? — Každá kontrola nese X-Engine-Commit a snapshot korpusu. Možné zopakovat i za měsíce.
Q5Hromadná cena? — Pro verze podle objemu článků, Enterprise podle licence ke korpusu + vlastní infrastruktura.
Q6Určování zdroje? — Každá shoda má URL zdroje, canonical tag, datum snapshotu, engine commit.
FAQ

Co si standardizační tým opravdu ověřuje před nákupem.

Budou naše články použity pro trénink vašeho AI modelu?
Ne. Odevzdané články se pouze otiskují (hashují) a indexují v izolované databázi vašeho nájemce. Text se po 30 dnech smaže, pokud neaktivujete trvalost. AI model (Binoculars-based, Hans et al. 2024; brzy v roadmapě) bude trénovaný jen na veřejných datech, nikdy ne na zákaznických. Výslovně v DPA.
Jak AI verdikt po odstavcích obstojí v případě sporu s autorem?
AI detekce bude brzy dostupná — je na roadmapě pro v1.2, při spuštění ještě není. Po nasazení bude každý označený odstavec obsahovat commit enginu a snapshot korpusu. Znovu ověření stejného odstavce proti tomuto commitu dá shodný výsledek. Algoritmus je otevřený na github.com/NoplagLabs/noplag-engine (Apache 2.0), včetně prahu perplexity a dokumentace kalibrace upravené pro ESL. Nemáme režim „důvěřujte skóre“.
A co externisti v zemích s nízkou konektivitou?
Detekce je při spuštění kalibrovaná pro angličtinu, španělštinu, portugalštinu, polštinu a ukrajinštinu; další jazyky budou přibývat. Kvalita detekce je měřena na PAN-PC-11; vyhodnocení po jednotlivých jazycích je v plánu. AI posouzení upravené pro ESL označí text psaný nerodilým mluvčím angličtiny jako ESL ADJ místo LIKELY-AI, pokud to naznačuje lexikální profil.
Lze provozovat kompletně ve vlastní infrastruktuře?
Ano — Apache 2.0 engine + Docker. Kompletně uvnitř vaší sítě. Páruje se s vaším Postgres + Redis; žádný obsah neputuje ven z vašeho VPC. Vhodné pro redakce s důrazem na ochranu zdrojů nebo mlčenlivost před publikací.
Integruje se s naším CMS?
WordPress (oficiální plugin), Ghost (Admin API + webhooky), Drupal (contrib modul). Pro ostatní — custom CMS, headless, interní — REST + OpenAPI 3.0 poskytne vše pro vlastní pre-publish hook během dne. Python i Node SDK jsou přímo ze speku.
Co přesně umí syndication-audit?
Přidejte distribuční domény jako allowlist (medium.com/@you, partneři). Týdenní crawl reportuje stav canonical tagu: ORIGIN (směřuje k vám), SYND OK (z partnerské domény směruje k vám), LEAK (chybí nebo směřuje jinam, riziko pro SEO), SCRAPED (kopie, bez canonical a mimo allowlist). SCRAPED má snapshot s datem jako důkaz pro DMCA.
Jak se počítá cena pro redakci s 30 reportéry?
Premium za $79/měsíc je 5000 slov/kontrolu, 5000 článků/měsíc, plné API + CMS integrace. Pro vysoký objem (10 000+ článků/měsíc) je Enterprise smluvní na základě objemu a infrastruktury. Sazba není na počet lidí, ale na objem.
A co op-edy, syndikace a knižní ukázky, kde je „reuse“ běžný?
Prahy podle sekcí na Pro+ — nastavíte různé citlivosti pro zprávy vs komentáře vs recenze vs syndikované výňatky. Komentář s přímou citací projevu senátu nemá stejné prahy jako zpráva s převzatou frází. Klasifikace citací odděluje legitimní citace od nechtěného reuse.
Zpomalí to naši frontu k publikaci?
Medián 47 sekund na článek (1 500–4 000 slov). Hook CMS je asynchronní — při uloženém návrhu vidí editor výsledek, než dopíše korektury. Dlouhé články (8 000+ slov) trvají ~90 sekund a je vhodné je spustit mimo synchronní hook.
Můžeme přidat náš archiv jako soukromý korpus?
Ano — varianta Enterprise. Hromadně importujete archiv do odděleného korpusu, engine porovnává nové příspěvky i s vašimi starými. Najde opakované články autora (někdy legitimní, někdy ne) a záměrné reuse pod jiným byline.

Spusťte návrh skrz frontu. Podívejte se na pohled pro článek.

Vložte Word, Google Doc nebo export z CMS. Do 47 vteřin report po odstavcích. Na 2 500 slov zdarma; Pro plán pro objem; Enterprise pro korpus + vlastní infrastrukturu.

Kontrola plagiátů pro vydavatele před publikací