Kontrola plagiátů pro novináře před publikací
Předběžná kontrola před tím, než to vidí editor. Detekuje převzaté parafráze a pasáže z tiskových zpráv, detekce textů generovaných AI bude brzy k dispozici. Navíc: sleduje, kdo přebírá vaši bylinku. Zdarma do 2 500 slov; REST API pro redakční integraci při podávání přes CMS.
Čtyři pracovní postupy pro novináře. Jedna kontrola.
Denní uzávěrky na termín
Editor to uvidí jako další – nejprve zajistěte čistotu.
- 30vteřinová kontrola na 900 slovech
- Automatické označení pasáží z tiskových zpráv
- Zachycení agenturní shody před publikací
Dlouhé texty s využitím dřívějších materiálů
5 000 slov s odkazy na přepisy rozhovorů a starší články.
- Vlastní citace: minulé články označené SELF-CITE
- Klasifikace citovaného materiálu (přímá citace vs parafráze)
- Respektování embarga: kontrola pouze proti neembargovaným materiálům
Měsíce zdrojových dokumentů v jednom textu
Zachytí nezamýšlené parafrázování bez citace napříč návrhem.
- Kontrola zdrojů po odstavcích
- Prohledání složky zdrojových dokumentů
- Snapshot pro DMCA při převzetí materiálu jiným subjektem
Více výstupů, žádná interní kontrola
Jste editor; předběžná kontrola je jediná kontrola před editorem.
- Mobilní kontrola na telefonu (v terénu)
- Opakované použití přes více výstupů – označení s allowlistem
- Bezplatná verze pokryje běžných 2 500 slov
Tři kroky před tlačítkem pro podání.
Vložené do redakčního workflow přes API, nebo jednorázově v přehledu. Stejný engine. Stejný report. Stejných 47 sekund.
01 · Kontrola návrhu
Vložte nebo nahrajte text. Přidejte allowlist bylinek (vaše předchozí texty, seznam syndikovaných článků). Engine zvlášť označí neúmyslné parafráze vašich vlastních materiálů (legitimní) a parafráze cizích (nelegitimní).
02 · Ověřte zdroje
Report ukáže každou shodu, URL zdroje, stav canonical tagu a datum zachycení. Tiskové zprávy automaticky označené REPRINT (některá média umožňují citace, jiná trvají na přepsání). Klasifikace AI-generated textu po odstavcích s ESL úpravou – brzy.
03 · Rozhodnutí před odesláním
Podívejte se na klasifikaci: správně citované citace (nezapočítávají se do hlavního skóre), parafráze s citací (nízká váha), necitované parafráze (to opravte). Po spuštění AI detekce budou AI-odstavce vyžadovat zveřejnění nebo přepsání dle pravidel redakce. Po kontrole podávejte. Report přiložte k odevzdanému textu jako audit.
Šest věcí, které je potřeba zkontrolovat v každém odstavci před podáním.
Každá kategorie je u své shody. Automatická kontrola, kde vyžaduje vaše médium citaci. Kritérium: uznal by to standards desk?
01 · PŘÍMÁ CITACE
Uvozovky a jméno mluvčího ve stejné větě. Počítáno jako citace, nepočítáno do skóre podobnosti. Detekováno i z nahraných přepisů rozhovorů.
02 · TISKOVÁ ZPRÁVA
Shoda s veřejnou tiskovou zprávou. Označeno REPRINT. Některá média umožňují doslovné citace, jiná je vyžadují přepsat. Lze nastavit v politice média.
03 · AGENTURNÍ TEXT
Shoda s AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA (Premium – nutné předplatné). Agenturní text je běžně přepisovatelný v rámci vaší licence; engine rozliší, co je licencované a co převzaté.
04 · EMBARGO
Přidejte embargo materiály do dočasného rozsahu. S embargem shoda označena EMBARGO-OK do data, pak zpět na běžné označení. Vhodné pro vědeckou žurnalistiku.
05 · AI-GENEROVANÝ (JIŽ BRZY)
AI-pravděpodobnost u každého odstavce s ESL úpravou, na roadmapě. Zamýšleno na kontrolu freelancerských textů — AI generované příspěvky jsou běžné, automatizovaná kontrola je zachytí ještě před editorem. Otevřená metodika (Binoculars, Hans et al. 2024).
06 · VLASTNÍ TEXTY
Allowlist bylinek: vaše předchozí články, vaše weby, Substack, Medium archiv. Opakované použití označeno SELF-CITE — běžné v delších textech navazujících na předchozí práci. Nezvyšuje skóre podobnosti, značí se k revizi.
Co uvidíte za 47 sekund na souboru o 1 500 slovech.
Klasifikace po odstavcích s odkazy na zdroje, stavem citace a kliknutím na shodu. Obhajitelné na standards desk, reprodukovatelné dle engine commitu zapsaného v reportu.
Tři kroky, když vaše novinka vyjde pod cizím jménem.
Nastavte bylinek jako monitorovací dotaz
Vložte svůj publikovaný text (nebo jejich seznam) do watchlistu. Denní web-scan zachytí všechny neallowované domény publikující shodné pasáže — doslovné kopie, lehké přepisy, AI generované varianty. Notifikace obsahuje URL, shodné odstavce a čas scrape.
DMCA snapshot, datovaný a hashovaný
Každé označení přináší HTML snapshot strany serveru, s datem zachycení a otiskem pro nedotknutelnost. Srovnejte s datem vaší původní bylinky (CMS publish date, tweet, Wayback Machine) a máte důkazní řetězec.
Vaše bylinek na legálním syndikátu
Pokud syndikujete na Medium, LinkedIn, Substack nebo jinam, engine sleduje stav canonical tagu. ORIGIN = SEO kredit plyne vám; LEAK = syndikace dělí vaše skóre. Častý LinkedIn případ: defaultně odstraňují canonical tag.
Dvě věci, které kontrola pro novináře musí, akademické nástroje nikdy neumí.
Většina plagiátorských nástrojů není pro redakce. Označují doslovný agenturní text jako plagiátorství, i když je to licencované — falešně pozitivní, náročné při objemu. Krádež bylinky úplně chybí, zpracuje jen to, co vložíte, ne to, co publikuje web. Noplag agenturní předplatné (AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA) klasifikuje agenturní text jako WIRE, ne jako PLAGIARISM. Monitorování bylinky sleduje web pro přebírané texty. Obě funkce jsou ve výchozím stavu vypnuté — aktivujete jen při potřebě specifické pro žurnalistiku.
Přečtěte si průvodce klasifikací agenturOtázky, které novináři skutečně mají.
- Bude můj návrh uložen nebo použit pro trénink vašich modelů?
- Ne. Návrhy jsou otiskovány (winnowing hash, nevratné) a uložené v databázi izolované pro vaše uživatele. Text je mazán po 30 dnech, pokud sami nevyberete uchování. Detekční modely (základ Binoculars) jsou trénované na veřejných korpusech; texty novinářů do tréninku nepřidáváme. Výslovně v DPA.
- Jak funguje klasifikace agentur?
- Premium tarif s předplatným agenturního korpusu (AP, Reuters, AFP, Bloomberg, dpa, Kyodo, PA). Doslovné shody s agenturním feedem označeny jako WIRE — ne PLAGIÁTORSTVÍ — protože každé médium tento text licencuje. Nastavitelná politika pro každé médium: některé povolují libovolnou délku, jiné trvají na citaci. Klasifikace je uvedena u každého intervalu.
- Jak je to s tiskovými zprávami?
- Shoda s veřejným indexem tiskových zpráv (PR Newswire, Business Wire, EurekAlert, PRWeb). Označeno REPRINT. Některá média umožňují doslovnou citaci s uvedením zdroje; jiná (většina US deníků) vyžaduje přepsání. Nastavte v nastavení podle své politiky; report vám ukáže, co vaše politika požaduje.
- Jak bude AI-detekce posuzovat freelancerské texty?
- AI detekce bude brzy dostupná (na roadmapě pro v1.2). Po spuštění nabídne pravděpodobnost AI původu po odstavcích s verdiktem upraveným podle úrovně angličtiny — určeno pro redakce, které prověřují externí příspěvky, protože texty generované AI jsou stále častější. Úprava podle úrovně angličtiny je důležitá, protože projevy ne-rodilých mluvčích se překrývají s AI vzory (Stanford 2023 zjistil 61,3 % falešně pozitivních u běžných detektorů); naše kalibrace má tento podíl výrazně snížit, zbytková míra bude zveřejněna po dokončení vyhodnocení funkce.
- Mohu monitorovat své publikované bylinky před scrapery?
- Premium tarif s funkcí byline-watch. Přidejte své publikované texty do seznamu; denní scan zachytí neallowované domény s vaším textem. Každé označení má hashovaný HTML snapshot s datem zcizení — důkaz pro DMCA. DMCAs nepodáváme (to řešíte vy/právník); dodáme dokumentaci.
- A co embargo?
- Embargovaný materiál lze přidat do dočasného rozsahu s datem embarga. Po dobu embarga tag EMBARGO-OK, pak zpět na standardní režim. Vhodné pro vědeckou (NIH / EurekAlert) i politickou žurnalistiku (přepisy kongresu, embargo).
- Funguje to i pro neanglické texty?
- Detekce je při spuštění kalibrovaná pro angličtinu, španělštinu, portugalštinu, polštinu a ukrajinštinu, další jazyky budou přibývat. Kvalita detekce je ověřena na PAN-PC-11; vyhodnocení po jednotlivých jazycích je v plánu. Vhodné pro zahraniční zpravodaje, kteří podávají texty ve více jazycích.
- Jak vypadá API pro redakční CMS integraci?
- REST + OpenAPI 3.0 specifikace. SDK pro Python a Node jsou generovány ze specifikace. Webhooky pro asynchronní kontroly delších textů. POST /v1/checks z vašeho CMS háku při uložení konceptu; report se připojí k článku jako auditní metadata. Ukázky integrací pro WordPress, Ghost a Drupal na github.com/NoplagLabs/noplag-engine.
- Co když jsem freelancer bez podpory redakce?
- Bezplatná verze pokryje 2 500 slov na kontrolu, neomezené počty, bez registrace. Funkční i na mobilu (lze použít v terénu před podáním). Premium tarif za 79 USD/měsíc pro agenturní/monitorovací/folderové funkce. Self-host je také Apache 2.0 zdarma, pokud chcete provozovat vše lokálně.
- Co když se ukáže, že citace od zdroje je AI-generovaná?
- Po spuštění AI detekce se AI-verdict po odstavcích ukáže v podezřelém odstavci s ESL úpravou. Pokud citace u zdroje bude AI-likely, je to redakční výstraha — může jít o text generovaný zdrojem, nebo zdroj parafrázoval AI, nebo false positive. Verdikt je signál pro ověření přímo u zdroje, ne automatická diskvalifikace.
Zkontrolujte text, než to udělá editor.
Vložte podaný text. Přehled po odstavcích do 47 s: citované pasáže, shoda s agenturou, vlastní citace, AI detekce brzo. Zdarma do 2 500 slov. Premium pro agenturní korpus a byline-watch.