AKADEMICKÝ700M+ odborných prací · Apache 2.0

Kontrola plagiátů pro akademiky s podporou citací

Detekce plagiátů pro vědecké psaní — prověřuje proti 700M+ odborným pracím z OpenAlex, CORE, arXiv, PubMed Central a Crossref. Klasifikace pracující s citacemi. Apache 2.0 engine auditovatelný i pro institucionální IT.

0 / 1,500 words
700M+ odborných pracíKlasifikace rozpoznávající citaceApache 2.0 · auditovatelný pro instituce
ODBORNÝ KORPUS

Pět zdrojů. 700M+ prací. Jen open-access nebo DOI-registrace.

Žádný uzamčený obsah za paywallem — fungujeme pouze na open-access indexech. Širší pokrytí pro výzkum po Plan-S; užší pro starší časopisové archivy za paywallem.

01 · INDEXměsíčně

OpenAlex

250M+ prací

Otevřený odborný index — nahrazuje Microsoft Academic Graph. Pokrývá články, příspěvky z konferencí, datové sady, knihy ze všech oborů.

02 · OPEN ACCESStýdně

CORE

290M+ publikací

Největší agregátor open-access výzkumu. Full-text index z 11 000+ repozitářů. Silné pokrytí pro evropské a britské výstupy.

03 · PREPRINTdenně

arXiv

2,4M+ preprintů

Fyzika, matematika, informatika, kvantitativní biologie, statistika, ekonomie. Porovnání i s verzí, kterou recenzent viděl na arXiv.

04 · BIOMEDtýdně

PubMed Central

10M+ publikací

Otevřený archiv biomedicíny a life sciences. Indexován fulltext + metadata. NIH-depozitovaný výzkum a zrcadlení časopisů.

Crossref · 150M+ DOI-registrací · používá se pro kanonické rozpoznání a procházení citačního grafu
AKADEMICKÉ PRACOVNÍ POSTUPY

Tři workflow. Jeden produkt.

Ať už připravujete časopisecký článek, obhajujete kapitolu disertace, nebo finalizujete grant — nástroj se přizpůsobí etapě práce, ne naopak.

01

01 · Kontrola před odesláním do časopisu

Dejte rukopis prověřit open-access světem dřív, než to udělá časopis. iThenticate / Crossref Similarity Check jej projde při odevzdání stejně — je dobré znát, co uvidí editor, než to uvidí. Pro tarif Pro neřešíte počet revizí.

02

02 · Kapitola disertace / diplomky

Vložte po kapitolách, nebo najednou celou práci. Vlastní citace mezi kapitolami se zaznamenají a klasifikují zvlášť (v doktorských pracích jsou často legitimní). Bibliografie je ze skóre automaticky vyloučená. Historie vám ukáže, jaké změny jste během měsíců provedli.

03

03 · Grantová žádost / rešerše

Opakovaně použitý text z minulých grantů nemá hlásit plagiát. Správně citovaná rešerše také ne. Model rozlišuje legitimní opakované použití vlastních textů od nekorektního kopírování. Skóre odráží jen skutečný problém, ne nevyhnutelné opakování.

KLASIFIKACE S CITACEMI

Šest kategorií. Každý shodný úsek se zařadí.

28% shoda na silně citované rešerši znamená něco jiného než 28% na nezcitovaném parafrázování. O to jde při klasifikaci.

01 · Přímá citace (s uvedením zdroje)

Uvozovky + citace v závorkách nebo poznámka pod čarou. Počítá se očekávaně; vynechává se ze skóre. Více citačních stylů rozpoznáno automaticky (MLA / APA / Chicago / Harvard / Vancouver / IEEE).

02 · Bloková citace

Odsazený úsek o 40+ slovech s citací na konci. Počítá se očekávaně. 1,27 cm odsazení + citace se rozpozná, chybějící odsazení značí formátovací odchylku.

03 · Parafráze (s citací)

Shoda ve tvaru věty s uvedením zdroje někde v okolí. Počítá se sníženou vahou. „Smith (2023) uvádí…“ projde jako legitimní.

04 · Obecně známé

Fráze z více než 2 000 nezávislých zdrojů („Voda vaří při 100°C“, základní definice, známé vzorce). Nezapočítává se do shody. Prahová hodnota lze upravit podle oboru.

05 · Bibliografie

Seznam literatury rozpoznán podle nadpisu a formátu. Zcela vyloučen ze skóre. Reference nemají být původní tvorbou — jejich započítání by skóre zkreslilo.

06 · Parafráze bez citace

Shoda ve tvaru věty bez citace v okolí, bez uvozovek, bez formátování blokové citace. Ta hlavní kategorie, která by měla ovlivnit skóre. Počítá se plnou vahou, ostatní ne.

ODBORNÁ ZPRÁVA

Klasifikace po úsecích. URL každého zdroje. Auditovatelnost.

Každý nalezený úsek je opatřen DOI / URL zdroje, zařazenou kategorií, časovým razítkem indexu a verzí engine. Použitelné u peer-review, etické komise i IT auditu.

ZPRÁVA · 4 217 slov · 47 úseků klasifikovánoThe Modernist Novel: A Reassessment · Kapitola 3
Titul · 8,2%Engine · v0.4.2
#NALEZENÝ ÚSEK · ZDROJKLASIFIKACE
12

Modernismus je spíše konstelací odmítnutí (realismu, pokroku, jednotného Já...) než uceleným hnutím. (Eysteinsson, 1990, s.117).

doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990
CITACE · UVEDENÁ
18

Eliotův důraz na neosobnost přetváří lyriku na záměrně konstruovaný artefakt místo spontánní výpovědi.

Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…
PARAFRÁZE · CITOVÁNO
23

Román vzniká z převážně měšťanského pohledu, který se formoval v osmnáctém století.

openalex.org/W12345678 · Watt (1957) — shoda bez citace
BEZ CITACE
31

Joyceův proud vědomí vychází z Jamesovy psychologie vnitřního trvání.

James, W. (1890). The Principles of Psychology, kap. IX (uvedeno v seznamu literatury)
PARAFRÁZE · CITOVÁNO
34

Vlastní dříve publikovaná disertační práce autora, kapitola 1.

ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · self-citace bez uvedení v tomto odstavci
SELF-CITE
41

Všechny odkazy: Eysteinsson, Eliot, Joyce, James, Watt a dalších 32.

Sekce bibliografie, s. 38–41
REFERENCOVÁNO · VYLOUČENO
Hodnota 8,2 % = parafráze bez citace + self-cite; citované úseky a bibliografie ze skóre vyjmuty.
  • 700M+indexovaných odborných prací
  • 6citace automaticky rozpoznané
  • 5jazyky kalibrované při spuštění
  • 3%zbytkové ESL zkreslení (zdokumentováno)
  • Apache2.0 · ověřitelné etickou komisí
OBHÁJITELNÉ V RECENZNÍM ŘÍZENÍ

Tři věci, které uzavřený systém před komisí neobhájí.

01 · REPRODUKOVATELNÉ SKÓRE

Znovu spustit stejný text na stejné verzi

Každá zpráva uvádí X-Engine-Commit i čas snímku korpusu. Můžete kdykoliv prověřit stejný rukopis na téže verzi engine — stejné vstupy, stejný výsledek. Uzavřené systémy mohou tichou aktualizací změnit výsledek, aniž byste si toho všimli.

Reprodukovatelnost je základ integrity akademického posuzování, na kterém stavíme.
02 · AUDITOVATELNÝ ALGORITMUS

Apache 2.0 open-source na GitHubu — přineste na schůzku

Když bude dostupná detekce AI (již brzy, je na roadmapě v1.2) a student napadne výsledek před komisí, můžete doložit konkrétní verzi engine a ukázat i řádek kódu, který výsledek vyhodnotil — včetně dokumentace ESL kalibrace. Ne jen screenshot podpory.

github.com/NoplagLabs/noplag-engine — veřejné, indexováno Google Scholar.
03 · ESL-UVĚDOMĚLÉ HODNOCENÍ

Liang a kol. 2023 zdokumentovali; mitigace je v plánu

Stanford 2023 naměřil 61,3 % FPR u TOEFL esejí na naivních detektorech. Jakmile bude spuštěna detekce AI v Noplagu (již brzy, v1.2 roadmapa), výsledek bude obsahovat pásmo upravené podle ESL, pokud lexikální profil naznačí nerodilého mluvčího angličtiny. Zbytková chybovost bude zdokumentována, nebude tvrzeno, že je nulová. Přepsání výsledku bude zaznamenáno s číslem commitu enginu a důvodem.

/docs/developers/benchmarks — metodika a výsledky podle PAN-PC-11.
PRO VEŘEJNÉ ZADAVATELE

Apache 2.0 engine, který vaše IT skutečně zkontroluje před podpisem.

Klasické institucionální hodnocení plagiátorských nástrojů obvykle vázne na stejných otázkách: kam text odešlete, jak funguje algoritmus porovnání, kdo má přístup k datům, jak se lze odvolat na právo na výmaz, jestli lze ověřit marketingová čísla přesnosti. U uzavřených systémů je odpovědí schůzka s prodejcem. U Apache 2.0 může vaše IT stáhnout repozitář, spustit engine na sandboxu, projít datový tok, ověřit proces výmazu i nezávisle přeměřit F1 skóre na vlastním vzorku. Nejde o levnější audit — ale o audit, který IT skutečně dokončí. Proto vysoké školy, které dřív odolávaly novým plagiátorským systémům, tento podepisují.

Přečtěte si návod pro zadavatele
FAQ

Otázky, které reálně zaznívají v akademii.

Nahrazuje to iThenticate před odevzdáním článku?

Většinou ne — pokud časopis trvá na iThenticate (Elsevier, Springer, Wiley, IEEE), ten se spustí při odeslání automaticky. Noplag nahrazuje kontrolu napříč revizemi před tímto odevzdáním. iThenticate stojí $125/dokument a pro 4+ verzí je to už drahé; flat-rate Pro tohle neřeší. Srovnání se všemi rozdíly na noplag.com/vs-ithenticate.

A co disertace z ProQuestu? Nemáte k nim přístup?

Správně — tahle mezera existuje. ProQuest má disertační databázi uzavřenou, placenou, není v OpenAlex/CORE. Pokrýváme 700M open-access odborných publikací, což je širší záběr pro post-Plan-S práce (hlavní časopisy od 2018 dál); užší pokud hledáte konkrétně starší disertace z paywalled databáze. Potřebujete-li porovnat konkrétně s US PhD disertacemi, iThenticate je lepší nástroj.

Co zvládne engine s méně obvyklými citačními styly?

MLA, APA, Chicago / Turabian, Harvard, Vancouver a IEEE detekuje podle formátu bibliografie. U méně častých stylů (ACS, AMA, ASA, Bluebook, Oxford) engine rozpoznává uvozovky + přilehlé závorky, styl-specifická validace je na roadmapě v1.2. Self-host může další styly doplnit v modulu alignment/.

Jaká je míra falešných pozitiv na rozsáhlých rešerších?

Nižší, než překvapí recenzenty, protože klasifikace vylučuje citované části ze skóre. Běžně ~3,4% false-positive na subsetu PAN-PC-11 (většina jsou legitimní citace). Uzavřené konkurence, co neodlišují citované úseky, hlásí na stejném korpusu 12–18%.

Mohu vyjmout své předchozí publikace?

Tarif Pro — přidejte allowlist (váš ORCID, vlastní DOI, institucionální repozitář). Shody s allowlist dokumenty označíme jako SELF-CITE, nepočítají se do skóre. Funguje hlavně u grantů, které navazují na vaše dřívější práce; vlastnost opakování s citací je tu očekávaná, není to plagiát.

Jaké je reálné pokrytí jazyků?

Detekce je při spuštění kalibrovaná pro angličtinu, španělštinu, portugalštinu, polštinu a ukrajinštinu; další jazyky budou přibývat. Kvalita detekce je měřena podle PAN-PC-11; vyhodnocení po jednotlivých jazycích je v plánu. Nejvyšší přesnost u evropských jazyků s nejdelší historií validace; novější jazyky jsou nasazovány, jakmile je jejich kalibrace dostatečná.

Co znamená „Apache 2.0“ pro institucionální zadavatele?

Vaše IT / DPO / IRB může naklonovat github.com/NoplagLabs/noplag-engine, spustit engine v sandboxu, prověřit tok dat, ověřit funkčnost práva na výmaz a reprodukovat naše zveřejněné výsledky na vlastním testovacím korpusu. Bez podpisu, bez NDA, bez spoléhání na marketing. Pro instituce, které vyžadují takto hlubokou kontrolu v rámci nákupu, je to řešení.

Funguje AI detekce i na Claude-3 + Gemini, nebo jen na GPT?

Detekce AI bude brzy dostupná — je na roadmapě v1.2, při spuštění není aktivní. Použitý přístup je Binoculars (Hans et al. 2024), modelově nezávislý: netrénuje se na konkrétní LLM, porovnává perplexitu malého referenčního modelu s testovaným textem, což je zobecnitelné. Přesnost bude zveřejněna až po dokončení vyhodnocení, ne předem, na smíšeném LLM obsahu (oproti ~70 % na Claude-3 u detektorů trénovaných na GPT). Metodický článek dokumentuje selhání; nejsou zatajována.

Co když můj školitel zpochybní hlášení plagiátu?

Každý označený úsek nese DOI zdroje, čas snímku korpusu, engine commit a důvod klasifikace. Proveďte kontrolu znovu na téže verzi engine — výsledek je pokaždé stejný. Na schůzce předložte papírový report; citace jsou proklikatelné. Nemáme režim „věřte skóre“, takové mají black-box detektory.

Jak funguje nasazení v medicíně / klinických studiích s HIPAA?

Apache 2.0 + Docker — běží zcela uvnitř vaší sítě. PostgreSQL + Redis na vlastní infrastruktuře, žádná data neopouští VPC. Osvědčuje se pro klinické zprávy, kazuistiky i výzkumné návrhy, které nesmí z pracoviště. Enterprise zákazníkům lze dodat korpus jako vlastní index.

Spusťte kapitolu proti 700M+ odborných prací.

Vložte kapitolu disertace, grantovou žádost nebo koncept rukopisu. Zpráva s rozpoznáním citací ukáže, co se očekává, co musíte doplnit, co je vaše. Do 2 500 slov zdarma. Apache 2.0 použijte, pokud vaše etická komise potřebuje zkontrolovat algoritmus.

Kontrola plagiátů pro akademiky s podporou citací