Kontrola plagiátů pro výzkumníky před odevzdáním
Kontrola rukopisů před odesláním proti 700M+ vědeckých prací. Složka Moje publikace sleduje vaše dřívější články, aby legitimní vlastní citace nezvedly skóre. Sídlo v EU k dispozici pro citlivé rukopisy před zveřejněním. Stroj Apache 2.0 — ověřitelný IRB.
Čtyři výzkumné role. Jeden self-check postup.
Před-odevzdání disertační kapitoly
Iterace mezi kapitolami. Sledování vlastních citací mezi verzemi.
- Kontrola po kapitolách + historie verzí
- Povolená vlastní citace (váš ORCID + seznam DOIs)
- Bibliografie automaticky vynechaná
Rukopis před odevzdáním do časopisu
iThenticate kontroluje až při odevzdání; my řešíme předtím.
- 700M+ open-access index vědeckých prací
- Klasifikace citací (citované vs necitované parafráze)
- Paušální cena Pro · žádné počítání kreditu na kontrolu
Literární rešerše + ověřování návrhů
Recyklace starších grantových šablon je běžná — označíme to.
- Rozpoznání vašich publikací + grantů z minulosti
- Whitelist spoluautorů (práce vašich spolupracovníků)
- Export klasifikační zprávy do PDF pro spolupracovníky
Kontrola kvality napříč laboratoří před publikací
Jedna fronta zachytí problémy napříč podáními laboratoře.
- Složka pro každý projekt + postdoka
- Sídlo v EU pro klinická / citlivá primární data
- Stroj Apache 2.0 — obhajitelný před IRB
Tři kroky předtím, než rukopis odešlete do časopisu.
Použijte opakovaně. Zachyťte vlastní citace, aby nezvedly vaše skóre v iThenticate / Crossref při odevzdání. Verdikty AI-detektoru budou brzy, abyste si je mohli prohlédnout, než na to přijde recenzent 2.
01 · Návrh + whitelist
Nahrajte kapitolu nebo rukopis. Přidejte své ORCID + seznam DOIs (whitelist) — vaše vlastní publikace budou označeny jako SELF-CITE, neplagiátorství. Přidejte také DOIs spoluautorů, pokud jste spolupracovali; systém rozpozná legitimní recyklaci vědeckého textu.
02 · Spusťte kaskádu
L1 winnowing → aktuální web, následovat budou L2 MinHash (v1.1) a L3 vektorová vnoření (v1.2). Odhalí doslovné i téměř doslovné kopírování; detekce parafrází bude dostupná s L2 a L3. Klasifikace citací rozlišuje citované pasáže od neoznačených parafrází. Podpora více jazyků, detekce je kalibrovaná pro angličtinu, španělštinu, portugalštinu, polštinu a ukrajinštinu při spuštění, další jazyky budou přibývat. Medián doby zpracování rukopisu je 47 sekund.
03 · Zkontrolujte + upravte
Zpráva rozdělí úseky podle typu: SELF-CITE (vaše vlastní, očekávané), CITED (citované s uvedením zdroje, v pořádku), CITED-PARA (parafráze s citací, nízká váha), UNCITED-PARA (to, co je potřeba řešit), a AI-LIKELY (s pásem upraveným pro cizojazyčné — brzy). Opakovatelné — každá zpráva má otisk stroje + snapshot korpusu.
Šest typů legitimní recyklace odborných textů — nemají zvedat skóre.
Black-box kontroly hlásí každou shodu jako plagiátorství. Výzkumníci recyklují texty často legitimně. Tady je, jak to klasifikátor řeší.
01 · VAŠE DŘÍVĚJŠÍ PRÁCE
Whitelist ORCID + DOI. Vaše starší publikované články označí jako SELF-CITE při shodě — ne označeno jako plagiátorství. Typické v rešerších („jak jsem ukázal v Chen 2023…“) a grantech při navazování na vlastní práci.
02 · SPOLUAUTORSKÉ PRÁCE
Přidejte ORCID spoluautora do whitelistu. Společné práce označí jako CO-CITE. Užitečné pokud stavíte na článku, který jste psal se spoluautorem — sdílené metodické pasáže jsou legitimní.
03 · LABORATORNÍ DĚDICTVÍ
Složka PI: sdílené korpusy standardních metod, laboratorních protokolů a etických částí, které se kopírují napříč publikacemi. Označí LAB-CITE a zcela vynechá ze skóre. Ověřený boilerplate nepište do každé práce znovu.
04 · EMBARGOVANÉ PREPRINTY
Vaše arXiv / bioRxiv preprint rukopisu, který teď podáváte. Klasifikátor pozná vývoj preprint → verze pro časopis a označí jako PREPRINT-SELF. Nezapočítává se do skóre. Časopisy striktně neumožňující preprinty mají možnost přísnějšího nastavení.
05 · CITACE STAŽENÝCH PRÁCÍ
Crossref integrace s Retraction Watch označí úseky odkazující na stažené práce. Neovlivňuje skóre — ale měl/a byste to vědět před odevzdáním. Řeší problém „citoval/a jsem práci staženou minulý měsíc“ dřív než recenzent.
06 · IRB / CITLIVÉ ÚDAJE
Sídlo v EU (api.eu.noplag.com) drží rukopis v EU infrastruktuře. Engine může běžet plně ve vašem síťi pro HIPAA / GDPR / rukopisy s údaji o pacientech. Apache 2.0 + Docker; žádný provoz neopustí váš VPC.
Podle projektů. Auditní stopa podle data.
Třiďte rukopisy podle projektu, roku laboratoře nebo grantu. Znovu kontrolujte návrhy proti stejné verzi stroje — zprávy jsou reprodukovatelné i za měsíce.
Tři požadavky na kontrolu plagiátorství pro citlivý výzkum před publikací.
Rukopisy neopustí infrastrukturu v EU
Pro+ hostováno na api.eu.noplag.com. Datová centra Hetzner (Falkenstein + Helsinki), EU lokalita. Podání, fingerprinty i report zůstávají v EU. Standardně v souladu s GDPR; DPA na vyžádání.
Spusťte stroj ve vaší instituci
Apache 2.0 + Docker compose. Celý detekční řetězec běží na vaší infrastruktuře. Vlastní Postgres + Redis; korpus expedujeme jako indexovatelný balík na Enterprise. Žádný provoz mimo vaši síť (VPC). Hodí se pro data z klinických studií, případovky pacientů nebo komerčně citlivý primární výzkum.
Vymažte otisky, které u vás máme
Jeden klik v Nastavení. Do 24 h jsou všechny otisky, reporty, whitelist i metadata smazány. Odpovídá GDPR čl. 17. Uživatele s vlastním hostováním mají přímý přístup do databáze; cloudová varianta má API na výmaz.
Stroj Apache 2.0 ke kontrole IRB před schválením.
Většina softwarových kontrol v institucích stojí na stejných otázkách: kam text po zadání odchází, jak funguje algoritmus shod, jestli se osobní nebo citlivá data někde přenáší, jaké je právo na výmaz, a zda umíte reprodukovat deklarovanou přesnost. U uzavřených řešení dostanete odpovědi jen v obchodním hovoru. U Apache 2.0 si váš IRB může stáhnout zdrojáky, spustit engine v sandboxu, auditovat datový tok, ověřit funkčnost výmazu a zreplikovat F1 skóre pro konkrétní jazyk přímo. Neargumentujeme levnějším schválením — argumentujeme konkrétní možností skutečné kontroly IRB. Proto i datové kanceláře, které dříve nové plagiátorské nástroje odmítaly, pouští tento.
Přečtěte si IRB review guideOtázky, které výzkumné oddělení skutečně řeší.
- Proč se skóre shody změní, když přidám svůj ORCID + DOIs?
- Protože engine zpětně označí každé místo, které odpovídá práci z vašeho whitelistu, jako SELF-CITE místo UNCITED-PARA. Shody nezmizí — jen dostanou jiné označení. SELF-CITE mají ve skóre téměř nulovou váhu. Příklad: pokud citujete své preprinty dvakrát a jednou článek spoluautora, tři intervaly se změní z „počítané“ na „legitimní recyklaci“.
- Učí se engine na podaných rukopisech?
- Ne. Podaný text se otiskuje (výhradně hash, nevratný otisk) a ukládá do tenant-instance. Samotný text se maže po 30 dnech, pokud si nenastavíte delší uchovávání. Binoculars-based AI detektor — brzy — bude předtrénovaný na veřejných datech; zákaznické rukopisy se do tréninkové sady nepřidávají. Je to výslovně v DPA.
- Co s mým preprintem na arXiv / bioRxiv?
- Pokud zadáte DOI preprintu do whitelistu, shody se označí jako PREPRINT-SELF a nezapočítávají se do skóre. Engine očekává, že vývoj preprint → verze do časopisu je normální. Časopisy striktně nepřijímající preprinty lze nastavit přísněji — ale většina hlavních časopisů (Nature, Cell, NEJM, PLOS) akceptuje preprinty a značení SELF to reflektuje.
- Jak AI detekce zohlední spoluautory pro které není angličtina materštinou?
- Detekce AI obsahu bude brzy dostupná — je na roadmapě v1.2. Po spuštění bude používat kalibraci pro jednotlivé jazyky a verdikt upravený pro ESL. Pokud lexikální profil naznačuje ne-rodilou angličtinu (běžné u mezinárodních týmů), výsledek bude označen jako ESL ADJ s uvedením zbytkové chyby, ne jako nulový. Studie Liang et al. 2023 naměřila 61,3 % FPR na TOEFL esejích u naivních detektorů; naši metodiku mitigace zveřejňujeme na /docs/developers/benchmarks. Spoluautoři s ESL nebudou nespravedlivě označováni.
- Mohu spustit engine v clusteru Slurm na dávkové kontroly?
- Ano — Apache 2.0 + Docker. Spusťte kontejner s enginem na výpočetních uzlech vašeho clusteru; načítejte data ze sdíleného filesystému; reporty ve formátu JSON ukládejte tam, odkud je čte váš pipeline. Vhodné pro hromadnou kontrolu roční produkce laboratoře proti aktuálnímu snapshotu korpusu. Ukázkový Slurm sbatch skript najdete na github.com/NoplagLabs/noplag-engine.
- Co když má rukopis citlivá/klinická data z pacientů?
- Hostujte stroj přímo ve vašem VPC. Žádný provoz mimo vaši síť. Engine nepotřebuje internet pro indexed-corpus kontroly (na živý web přijdete o druhou vrstvu ověření, ale ta je volitelná). Nasazení kompatibilní s HIPAA při správné konfiguraci; správce IT jako u ostatního interního softwaru.
- V čem je to jiné než iThenticate při odevzdání?
- iThenticate kontroluje až při odevzdání do časopisu a skóre vidí editor — nemáte prostor iterovat. Noplag je vaše kontrola před tímto krokem. Kaskáda je srovnatelná pro open-access obsah (ve skutečnosti širší po Plan S); užší pro komerčně licencované/prázdné články, kde má iThenticate smlouvy. Detailní citace je to, co většině vědců chybí a iThenticate neřeší.
- Spolupracuje s mým reference managerem (Zotero / Mendeley / EndNote)?
- Whitelist načítá BibTeX, RIS i API ORCID. Nahrajte export vaší knihovny ze Zotera nebo vložte ORCID; whitelist se vyplní všemi DOIs během pár sekund. Real-time sync s Mendeley + EndNote je v roadmapě v1.2; aktuálně přes export.
- Jak je pokrytá detekce pro neanglické časopisy?
- Detekce je kalibrovaná pro angličtinu, španělštinu, portugalštinu, polštinu a ukrajinštinu při spuštění, další jazyky budou přibývat. Nejvyšší přesnost má u evropských jazyků (dlouhodobá kalibrace). Kvalita detekce je ověřována na PAN-PC-11; hodnocení po jednotlivých jazycích je v plánu. Vhodné zejména pro evropské a jihoamerické akademické prostředí.
- Co když se citovaný článek stáhne po mém odevzdání?
- Crossref napojení na Retraction Watch to označí při každé re-kontrole rukopisu. Pokud už jste odevzdal/a, bude třeba informovat editora (některé časopisy to vyžadují). Skóre se nemění, ale víte to dřív než recenzent.
Pošlete kapitolu do kaskády. Uvidíte rozdělení vlastních citací.
Nahrajte koncept rukopisu, disertační kapitolu nebo rešerši ke grantu. Přidejte svůj ORCID. Vidíte, které úseky jsou SELF-CITE, CITED, UNCITED-PARA a brzy i AI-LIKELY. Do 2 500 slov zdarma. Sídlo v EU na Pro+ pro citlivé rukopisy před publikací.