Kontrola plagiátů pro akademiky s podporou citací
Detekce plagiátů pro vědecké psaní — prověřuje proti 700M+ odborným pracím z OpenAlex, CORE, arXiv, PubMed Central a Crossref. Klasifikace pracující s citacemi. Apache 2.0 engine auditovatelný i pro institucionální IT.
Pět zdrojů. 700M+ prací. Jen open-access nebo DOI-registrace.
Žádný uzamčený obsah za paywallem — fungujeme pouze na open-access indexech. Širší pokrytí pro výzkum po Plan-S; užší pro starší časopisové archivy za paywallem.
OpenAlex
250M+ pracíOtevřený odborný index — nahrazuje Microsoft Academic Graph. Pokrývá články, příspěvky z konferencí, datové sady, knihy ze všech oborů.
CORE
290M+ publikacíNejvětší agregátor open-access výzkumu. Full-text index z 11 000+ repozitářů. Silné pokrytí pro evropské a britské výstupy.
arXiv
2,4M+ preprintůFyzika, matematika, informatika, kvantitativní biologie, statistika, ekonomie. Porovnání i s verzí, kterou recenzent viděl na arXiv.
PubMed Central
10M+ publikacíOtevřený archiv biomedicíny a life sciences. Indexován fulltext + metadata. NIH-depozitovaný výzkum a zrcadlení časopisů.
Tři workflow. Jeden produkt.
Ať už připravujete časopisecký článek, obhajujete kapitolu disertace, nebo finalizujete grant — nástroj se přizpůsobí etapě práce, ne naopak.
01 · Kontrola před odesláním do časopisu
Dejte rukopis prověřit open-access světem dřív, než to udělá časopis. iThenticate / Crossref Similarity Check jej projde při odevzdání stejně — je dobré znát, co uvidí editor, než to uvidí. Pro tarif Pro neřešíte počet revizí.
02 · Kapitola disertace / diplomky
Vložte po kapitolách, nebo najednou celou práci. Vlastní citace mezi kapitolami se zaznamenají a klasifikují zvlášť (v doktorských pracích jsou často legitimní). Bibliografie je ze skóre automaticky vyloučená. Historie vám ukáže, jaké změny jste během měsíců provedli.
03 · Grantová žádost / rešerše
Opakovaně použitý text z minulých grantů nemá hlásit plagiát. Správně citovaná rešerše také ne. Model rozlišuje legitimní opakované použití vlastních textů od nekorektního kopírování. Skóre odráží jen skutečný problém, ne nevyhnutelné opakování.
Šest kategorií. Každý shodný úsek se zařadí.
28% shoda na silně citované rešerši znamená něco jiného než 28% na nezcitovaném parafrázování. O to jde při klasifikaci.
01 · Přímá citace (s uvedením zdroje)
Uvozovky + citace v závorkách nebo poznámka pod čarou. Počítá se očekávaně; vynechává se ze skóre. Více citačních stylů rozpoznáno automaticky (MLA / APA / Chicago / Harvard / Vancouver / IEEE).
02 · Bloková citace
Odsazený úsek o 40+ slovech s citací na konci. Počítá se očekávaně. 1,27 cm odsazení + citace se rozpozná, chybějící odsazení značí formátovací odchylku.
03 · Parafráze (s citací)
Shoda ve tvaru věty s uvedením zdroje někde v okolí. Počítá se sníženou vahou. „Smith (2023) uvádí…“ projde jako legitimní.
04 · Obecně známé
Fráze z více než 2 000 nezávislých zdrojů („Voda vaří při 100°C“, základní definice, známé vzorce). Nezapočítává se do shody. Prahová hodnota lze upravit podle oboru.
05 · Bibliografie
Seznam literatury rozpoznán podle nadpisu a formátu. Zcela vyloučen ze skóre. Reference nemají být původní tvorbou — jejich započítání by skóre zkreslilo.
06 · Parafráze bez citace
Shoda ve tvaru věty bez citace v okolí, bez uvozovek, bez formátování blokové citace. Ta hlavní kategorie, která by měla ovlivnit skóre. Počítá se plnou vahou, ostatní ne.
Klasifikace po úsecích. URL každého zdroje. Auditovatelnost.
Každý nalezený úsek je opatřen DOI / URL zdroje, zařazenou kategorií, časovým razítkem indexu a verzí engine. Použitelné u peer-review, etické komise i IT auditu.
Modernismus je spíše konstelací odmítnutí (realismu, pokroku, jednotného Já...) než uceleným hnutím. (Eysteinsson, 1990, s.117).
doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990Eliotův důraz na neosobnost přetváří lyriku na záměrně konstruovaný artefakt místo spontánní výpovědi.
Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…Román vzniká z převážně měšťanského pohledu, který se formoval v osmnáctém století.
openalex.org/W12345678 · Watt (1957) — shoda bez citaceJoyceův proud vědomí vychází z Jamesovy psychologie vnitřního trvání.
James, W. (1890). The Principles of Psychology, kap. IX (uvedeno v seznamu literatury)Vlastní dříve publikovaná disertační práce autora, kapitola 1.
ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · self-citace bez uvedení v tomto odstavciVšechny odkazy: Eysteinsson, Eliot, Joyce, James, Watt a dalších 32.
Sekce bibliografie, s. 38–41- 700M+indexovaných odborných prací
- 6citace automaticky rozpoznané
- 5jazyky kalibrované při spuštění
- 3%zbytkové ESL zkreslení (zdokumentováno)
- Apache2.0 · ověřitelné etickou komisí
Tři věci, které uzavřený systém před komisí neobhájí.
Znovu spustit stejný text na stejné verzi
Každá zpráva uvádí X-Engine-Commit i čas snímku korpusu. Můžete kdykoliv prověřit stejný rukopis na téže verzi engine — stejné vstupy, stejný výsledek. Uzavřené systémy mohou tichou aktualizací změnit výsledek, aniž byste si toho všimli.
Apache 2.0 open-source na GitHubu — přineste na schůzku
Když bude dostupná detekce AI (již brzy, je na roadmapě v1.2) a student napadne výsledek před komisí, můžete doložit konkrétní verzi engine a ukázat i řádek kódu, který výsledek vyhodnotil — včetně dokumentace ESL kalibrace. Ne jen screenshot podpory.
Liang a kol. 2023 zdokumentovali; mitigace je v plánu
Stanford 2023 naměřil 61,3 % FPR u TOEFL esejí na naivních detektorech. Jakmile bude spuštěna detekce AI v Noplagu (již brzy, v1.2 roadmapa), výsledek bude obsahovat pásmo upravené podle ESL, pokud lexikální profil naznačí nerodilého mluvčího angličtiny. Zbytková chybovost bude zdokumentována, nebude tvrzeno, že je nulová. Přepsání výsledku bude zaznamenáno s číslem commitu enginu a důvodem.
Apache 2.0 engine, který vaše IT skutečně zkontroluje před podpisem.
Klasické institucionální hodnocení plagiátorských nástrojů obvykle vázne na stejných otázkách: kam text odešlete, jak funguje algoritmus porovnání, kdo má přístup k datům, jak se lze odvolat na právo na výmaz, jestli lze ověřit marketingová čísla přesnosti. U uzavřených systémů je odpovědí schůzka s prodejcem. U Apache 2.0 může vaše IT stáhnout repozitář, spustit engine na sandboxu, projít datový tok, ověřit proces výmazu i nezávisle přeměřit F1 skóre na vlastním vzorku. Nejde o levnější audit — ale o audit, který IT skutečně dokončí. Proto vysoké školy, které dřív odolávaly novým plagiátorským systémům, tento podepisují.
Přečtěte si návod pro zadavateleOtázky, které reálně zaznívají v akademii.
Nahrazuje to iThenticate před odevzdáním článku?
Většinou ne — pokud časopis trvá na iThenticate (Elsevier, Springer, Wiley, IEEE), ten se spustí při odeslání automaticky. Noplag nahrazuje kontrolu napříč revizemi před tímto odevzdáním. iThenticate stojí $125/dokument a pro 4+ verzí je to už drahé; flat-rate Pro tohle neřeší. Srovnání se všemi rozdíly na noplag.com/vs-ithenticate.
A co disertace z ProQuestu? Nemáte k nim přístup?
Správně — tahle mezera existuje. ProQuest má disertační databázi uzavřenou, placenou, není v OpenAlex/CORE. Pokrýváme 700M open-access odborných publikací, což je širší záběr pro post-Plan-S práce (hlavní časopisy od 2018 dál); užší pokud hledáte konkrétně starší disertace z paywalled databáze. Potřebujete-li porovnat konkrétně s US PhD disertacemi, iThenticate je lepší nástroj.
Co zvládne engine s méně obvyklými citačními styly?
MLA, APA, Chicago / Turabian, Harvard, Vancouver a IEEE detekuje podle formátu bibliografie. U méně častých stylů (ACS, AMA, ASA, Bluebook, Oxford) engine rozpoznává uvozovky + přilehlé závorky, styl-specifická validace je na roadmapě v1.2. Self-host může další styly doplnit v modulu alignment/.
Jaká je míra falešných pozitiv na rozsáhlých rešerších?
Nižší, než překvapí recenzenty, protože klasifikace vylučuje citované části ze skóre. Běžně ~3,4% false-positive na subsetu PAN-PC-11 (většina jsou legitimní citace). Uzavřené konkurence, co neodlišují citované úseky, hlásí na stejném korpusu 12–18%.
Mohu vyjmout své předchozí publikace?
Tarif Pro — přidejte allowlist (váš ORCID, vlastní DOI, institucionální repozitář). Shody s allowlist dokumenty označíme jako SELF-CITE, nepočítají se do skóre. Funguje hlavně u grantů, které navazují na vaše dřívější práce; vlastnost opakování s citací je tu očekávaná, není to plagiát.
Jaké je reálné pokrytí jazyků?
Detekce je při spuštění kalibrovaná pro angličtinu, španělštinu, portugalštinu, polštinu a ukrajinštinu; další jazyky budou přibývat. Kvalita detekce je měřena podle PAN-PC-11; vyhodnocení po jednotlivých jazycích je v plánu. Nejvyšší přesnost u evropských jazyků s nejdelší historií validace; novější jazyky jsou nasazovány, jakmile je jejich kalibrace dostatečná.
Co znamená „Apache 2.0“ pro institucionální zadavatele?
Vaše IT / DPO / IRB může naklonovat github.com/NoplagLabs/noplag-engine, spustit engine v sandboxu, prověřit tok dat, ověřit funkčnost práva na výmaz a reprodukovat naše zveřejněné výsledky na vlastním testovacím korpusu. Bez podpisu, bez NDA, bez spoléhání na marketing. Pro instituce, které vyžadují takto hlubokou kontrolu v rámci nákupu, je to řešení.
Funguje AI detekce i na Claude-3 + Gemini, nebo jen na GPT?
Detekce AI bude brzy dostupná — je na roadmapě v1.2, při spuštění není aktivní. Použitý přístup je Binoculars (Hans et al. 2024), modelově nezávislý: netrénuje se na konkrétní LLM, porovnává perplexitu malého referenčního modelu s testovaným textem, což je zobecnitelné. Přesnost bude zveřejněna až po dokončení vyhodnocení, ne předem, na smíšeném LLM obsahu (oproti ~70 % na Claude-3 u detektorů trénovaných na GPT). Metodický článek dokumentuje selhání; nejsou zatajována.
Co když můj školitel zpochybní hlášení plagiátu?
Každý označený úsek nese DOI zdroje, čas snímku korpusu, engine commit a důvod klasifikace. Proveďte kontrolu znovu na téže verzi engine — výsledek je pokaždé stejný. Na schůzce předložte papírový report; citace jsou proklikatelné. Nemáme režim „věřte skóre“, takové mají black-box detektory.
Jak funguje nasazení v medicíně / klinických studiích s HIPAA?
Apache 2.0 + Docker — běží zcela uvnitř vaší sítě. PostgreSQL + Redis na vlastní infrastruktuře, žádná data neopouští VPC. Osvědčuje se pro klinické zprávy, kazuistiky i výzkumné návrhy, které nesmí z pracoviště. Enterprise zákazníkům lze dodat korpus jako vlastní index.
Spusťte kapitolu proti 700M+ odborných prací.
Vložte kapitolu disertace, grantovou žádost nebo koncept rukopisu. Zpráva s rozpoznáním citací ukáže, co se očekává, co musíte doplnit, co je vaše. Do 2 500 slov zdarma. Apache 2.0 použijte, pokud vaše etická komise potřebuje zkontrolovat algoritmus.