AKADĒMISKS700M+ zinātnisko darbu · Apache 2.0

Akadēmiskā plaģiāta pārbaude ar citātu atpazīšanu

Plaģiāta pārbaude, kas pielāgota zinātniskiem darbiem — pārbauda pret 700M+ akadēmiskiem darbiem OpenAlex, CORE, arXiv, PubMed Central un Crossref avotos. Citēšanas atpazīšana. Apache 2.0 dzinējs — pārbaudāms jebkuras institūcijas IT auditā.

0 / 1,500 words
700M+ zinātnisko darbuCitēšanas atpazīšanaApache 2.0 · pārbaudāms institucionāli
ZINĀTNISKAIS KORPUSS

Pieci avoti. 700M+ darbi. Visi atvērtās piekļuves vai ar DOI.

Nav maksas vai slēgta satura — izmanto tikai atvērtās piekļuves indeksus. Mūsdienu (Plan-S) pētniecībai aptvere plašāka; senākiem maksas žurnāliem — šaurāka.

01 · INDEKSSmēneša

OpenAlex

250M+ darbi

Atvērtās zinātnes indekss — aizvieto veco Microsoft Academic Graph. Aptver rakstus, konferences materiālus, datu kopas, grāmatas visās nozarēs.

02 · ATVĒRTĀ PIEKĻUVEiknedēļas

CORE

290M+ publikāciju

Lielākais atvērtās piekļuves pētniecības apkopotājs. Tekstu pilns indekss no 11 000+ repozitoriju. Laba pārklājuma Eiropā un Lielbritānijā.

03 · PRIEKŠPUBLICĒJUMIikdienas

arXiv

2,4M+ priekšpublicējumu

Fizika, matemātika, datorzinātne, kvantitatīvā bioloģija, statistika, ekonomika. Pārbauda pret to versiju, kuru recenzents jau ir redzējis arXiv.

04 · BIOMEDICĪNAiknedēļas

PubMed Central

10M+ publikāciju

Atvērts biomedicīnas / dzīvības zinātņu arhīvs. Pilnīgs teksts + metadati. NIH pētījumi un žurnālu spoguļi.

Crossref · 150M+ DOI reģistrētu darbu · izmanto kanoniskās atrisināšanas un citēšanas tīkla traversēšanai
AKADĒMISKIE DARBA PLŪSMAS

Trīs darba scenāriji. Viens rīks.

Vai gatavojat rakstu žurnālam, aizstāvat disertācijas nodaļu vai piesakāties finansējumam — pārbaudes rīks pielāgojas Jūsu procesam, nevis otrādi.

01

01 · Pirmsiesnieguma žurnāla pārbaude

Pārbaudiet manuskriptu pret atvērtās piekļuves avotiem pirms to ierauga žurnāls. iThenticate / Crossref Similarity Check tiks pielietots iesniegšanas brīdī jebkurā gadījumā — Jums jāzina, ko redzēs redaktors. Fiksēta Pro maksa ļauj pārbaudīt vairākas versijas bez dokumentu kvotu dedzināšanas.

02

02 · Disertācija / nodaļa

Pārbaudiet pa nodaļām vai visu darbu kopā. Pašcitēšana starp nodaļām tiek atzīmēta, bet uzskatīta par atsevišķu (disertācijās tā ir pieļaujama). Literatūras saraksts no līdzības rādītāja izslēgts. Versiju vēsture salīdzina, kas mainīts starp mēnešiem.

03

03 · Finansējuma pieteikums / literatūras apskats

Teksti no iepriekšējām pieteikuma versijām, ko paši rakstījāt, nebūtu jāuzskata par plaģiātu. Pareizi citēta literatūra arī nē. Klasifikācija nodala saprātīgu atkārtotu izmantošanu (ar atsauci) no nejaušas kopēšanas. Rādītājs atspoguļo, kas ir problēma, nevis neizbēgamas atkārtošanās.

CITĒŠANAS ATPAZĪŠANA

Sešas kategorijas. Katrs atrastais fragments saņem vienu.

28% līdzības atskaite literatūras apskatam ar daudz citātiem nozīmē citu nekā 28% uz neminētu pārstāstījumu. Klasifikācija to izšķir.

01 · Tiešs citāts (ar atsauci)

Pēdiņas + atsauce pēc teksta VAI zemsvītras piezīme. Uzskata par normālu, no kopējā rādītāja izslēdz. Automātiski atpazīst vairākus citēšanas stilus (MLA / APA / Chicago / Harvard / Vancouver / IEEE).

02 · Blokcitāts

Ievilkts fragments (40+ vārdi) ar beigās atsauci. Uzskata par normālu. Atpazīst modeli '0,5 collu kreisais atkāpi + atsauce'; ja nav atkāpes, atzīmē kā formatējuma nobīdi.

03 · Parafrazējums (ar atsauci)

Līdzīga teikuma struktūra ar atsauci tuvējā rindkopā. Skaita ar samazinātu svaru. 'Smith (2023) apgalvo...' uzskatāms par korektu atsauci.

04 · Vispārzināmas zināšanas

Frāzes, kas atrodamas 2 000+ neatkarīgos avotos ('Ūdens vārās pie 100°C', standarta definīcijas, zināmas formulas). Netiek rēķinātas līdzībā. Slieksni var pielāgot laukiem ar blīvu terminoloģiju.

05 · Literatūras saraksts

Atsauču sarakstu atrod pēc virsraksta un formas. Pilnībā izslēdz no rādītāja. Atsauces pašas nav jābūt oriģinālas — to iekļaušana rādītājā tikai to palielina bez iemesla.

06 · Necitēts parafrāzējums

Teikuma struktūras sakritība bez atsauces, bez pēdiņām vai blokcitāta formatējuma tuvējā kontekstā. Šī ir kategorija, kura jāskaita rādītājā pilnā apjomā. Pārējās tiek svērtas mazāk.

ZINĀTNISKAIS ATSKAITE

Klasificēts katrs fragments. Katram savs avots. Pilnībā pārbaudāms.

Katram saskaņotam fragmentam norāda avota DOI / URL, klasifikācijas kategoriju, avota izgriezuma datumu un dzinēja versiju. Pārbaudāms recenzentu diskusijās, integritātes komisijās vai iepirkumu auditos.

ATSKAITE · 4 217 vārdu · 47 fragmenti klasificētiModernisma romāns: Pārvērtējums · 3. nodaļa
Galvenais · 8,2%Dzinējs · v0.4.2
#SASKAŅOTAIS FRAGMENTS · AVOTSKLASIFIKĀCIJA
12

Modernisms ir mazāk saliedēta kustība, vairāk noliegumu kopa — reālisma, progresa, vienotā es... (Eysteinsson, 1990, 117.lpp.).

doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990
CITĒTS
18

Eliota uzsvars uz bezpersoniskumu pārrada liriku kā konstruētu artefaktu, nevis atklātu izteiksmi.

Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…
PARAFRĀZE · CITĒTA
23

Romāns veidojas no pamatā buržuāziskas pasaules uzskata, kas izveidojās XVIII gs.

openalex.org/W12345678 · Watt (1957) — necitēta sakritība
NECITĒTS
31

Džoisas apziņas plūsma lielā mērā balstīta uz Viljama Džeimsa "iekšējā ilguma" psiholoģiju.

James, W. (1890). The Principles of Psychology, ch.IX (pieminēts atsauču sarakstā)
PARAFRĀZE · CITĒTA
34

Paša autors iepriekš publicētā doktora disertācija, 1. nodaļa.

ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · pašcitēšana, nav atsauces šajā rindkopā
PAŠCITĀTS
41

Visas atsauces — Eysteinsson, Eliot, Joyce, James, Watt un vēl 32.

Atsauču sadaļa, 38.–41.lpp.
ATSAUCES · IZSLĒGTS
Galvenais 8,2% = necitēti parafrāzētie fragmenti + pašcitēšana; citētie un atsauces fragmenti nav ieskaitīti.
  • 700M+indeksēti zinātniskie darbi
  • 6atklāti citēšanas stili
  • 5valodas kalibrētas palaišanas brīdī
  • 3%ESL-nobīde (dokumentēta)
  • Apache2.0 · IRB pārbaudāms
PIERĀDĀMI RECENZENTU PRIEKŠĀ

Trīs lietas, kuru dēļ 'melnās kastes' pārbaudītājs nenostrādās fakultātes komisijā.

01 · ATKĀRTOJAMS RĀDĪTĀJS

Pārbaudiet to pašu darbu pret to pašu dzinēja versiju

Katrs ziņojums satur X-Engine-Commit un datumu, kad atjaunināts korpuss. Jūs pēc mēnešiem varat atkal pārbaudīt to pašu manuskriptu ar to dzinēja versiju, kas deva sākotnējo rezultātu — tas pats fails, tas pats algoritms, tas pats rādītājs. Slēgta koda pārbaudītāji klusībā pārtrenējas un Janvāra rādītājs var neatkārtoties Maijā.

Atkārtojamība bija mūsu akadēmiskā integritātes minimums.
02 · AUDITĒJAMS ALGORITMS

Apache 2.0 kods GitHub — atnesiet uz sēdi

Kad būs AI noteikšana (drīzumā, v1.2 ceļakartē) un students apstrīd AI rezultātu komisijā, Jūs varēsiet norādīt dzinēja commit, kodā to vietu, kas noteica slieksni, un ESL kalibrācijas dokumentāciju. Nevis ekrānšāviņu no klientu atbalsta.

github.com/NoplagLabs/noplag-engine — publisks, indeksē Google Scholar.
03 · ESL-JUTĪGS SPRIEDUMS

Liang u.c. 2023 dokumentēja; riska mazināšana ir iekļauta plānā

Stanford 2023 konstatēja 61,3% kļūdaini pozitīvu rezultātu TOEFL esejām, izmantojot naivus detektorus. Kad Noplag AI satura noteikšana tiks ieviesta (drīzumā, v1.2 plānā), rezultātam būs ESL pielāgota josla, ja leksiskais paraksts norāda uz nerunātāju. Atlikušā kļūda tiks dokumentēta, nevis uzskatīta par nulli. Pārrakstīšanas ceļš tiek reģistrēts ar dzinēja izmaiņu un pamatojumu.

/docs/developers/benchmarks — PAN-PC-11 metodoloģija un rezultāti.
PIEGĀDES AUDITAM

Apache 2.0 dzinējs, ko Jūsu IT tiešām var pārskatīt pirms līguma.

Lielākā daļa institūciju iepirkumos uzdod tos pašus jautājumus: kur dokuments glabājas pēc iesniegšanas, kāds ir atbilstības algoritms, kurš piekļūst datiem, kā īstenots tiesībaizmirst, vai var atkārtot precizitātes apgalvojumu. Slēgta koda piegādātājam tos atbild pārdevējs. Pie Apache 2.0 Jūsu IT var klonēt repozitoriju, darbināt dzinēju sandbox VMā, pārbaudīt datu plūsmu, pārliecināties par tiesībaizmirst, un testēt F1 uz savas korpusa kopijas. Mēs neapgalvojam, ka process būs lētāks — apgalvojam, ka IT komanda to tiešām var izdarīt līdz galam. Tāpēc universitātes, kas iepriekš slēdza ceļu jauniem pārbaudītājiem, izmanto šo.

Lasīt iepirkuma instrukciju
BUJ

Akadēmiķu aktuālie jautājumi.

Vai ar šo var aizvietot iThenticate žurnālu pirmsiesniegumā?

Lielākoties nē — ja mērķa izdevējs prasa iThenticate (Elsevier, Springer, Wiley, IEEE), to jebkurā gadījumā pārbaudīs pēc Jūsu iesnieguma. Noplag vietā ir domāts pašpārbaudēm starp melnraksta versijām pirms iesnieguma. iThenticate par $125/dokuments kļūst neizdevīgs jau pēc 4. pārrakstīšanas; Pro tarifikācijas nav šāda limita. Salīdzinājums ar iThenticate — noplag.com/vs-ithenticate.

Kā ar ProQuest disertācijām? Tās nav pieejamas?

Pareizi — tāda plaisa ir. ProQuest disertācijas ir maksas, neietvertas ne OpenAlex, ne CORE. Piedāvājam aptuveni 700M atvērtās piekļuves akadēmisko darbu — modernai pētniecībai apjoms plašāks nekā ProQuest (lielākā daļa žurnālu no 2018.g. ir atvērti); bet senākām maksas disertācijām aptvere ir šaurāka. Ja galvenā prasība ir ASV doktora disertāciju pārbaude — šim nolūkam iThenticate ir piemērotāks.

Kā dzinējs atpazīst nestandarta citēšanas stilus?

MLA, APA, Chicago / Turabian, Harvard, Vancouver, IEEE tiek atklāti automātiski pēc literatūras saraksta formāta. Mazāk izplatītiem (ACS, AMA, ASA, Bluebook, Oxford) dzinējs joprojām atpazīst pēc pēdiņām un līdzās esošas atsauces, bet tiešai stila validācijai jāgaida v1.2. Pašu hostēšanas gadījumā var papildināt ar vajadzīgajiem stiliem alignment/ modulī.

Kāds viltus pozitīvo rādītājs literatūras apskatos ar daudz atsaucēm?

Zemāks nekā pārbaudītāji, kas nenošķir necitētus parafrāzējumus. Izdalot korekti citētos fragmentus, 'false positive' ir ap ~3,4% (PAN-PC-11 akadēmisko tekstu apakškopā, kur bieži citē). Konkurenti, kas neizdala citētos, rāda 12–18% uz to pašu kopu.

Vai var izslēgt manus iepriekšējos darbus?

Pro līmenī — var pievienot allowlist (Jūsu ORCID, DOI, iestādes repozitorija URL). Atrasti sakritības ar šiem tiek atzīmēti kā PAŠCITĀTI, un tos neieliek kopējā rādītājā. Noder, ja Jūsu pieteikumi balstās uz iepriekš publicēto. Ar norādi uz avotu tas nav plaģiāts.

Kāda ir daudzvalodu pārklājuma realitāte?

Noteikšana kalibrēta angļu, spāņu, portugāļu, poļu un ukraiņu valodai palaišanas brīdī; vēl citas valodas tiks pievienotas. Kvalitāte tiek vērtēta pēc PAN-PC-11; katras valodas atsevišķa novērtēšana ir plānā. Precīzākā uz Eiropas valodām ar ilgāku validācijas vēsturi; jaunākās tiek pievienotas, kad to kalibrācija ir pabeigta.

Ko Apache 2.0 nozīmē institucionālajam iepirkumam?

Jūsu IT / DPO / IRB var klonēt github.com/NoplagLabs/noplag-engine, palaist dzinēju izolētā vidē, pārbaudīt datu plūsmu, pārliecināties, ka tiesības uz dzēšanu darbojas pilnā apjomā, un atkārtot mūsu publicētos rezultātus uz sava testa korpusa. Bez līguma, bez NDA, bez uzticēšanās mūsu mārketingam. Institūcijām, kurām iepirkuma procesā nepieciešama šāda pārbaude, tas ir risinājums.

Vai AI detektors atpazīs Claude-3, Gemini tekstus vai tikai GPT?

AI satura noteikšana drīzumā — tā ir v1.2 plānā, palaišanas brīdī nav pieejama. Pieeja: Binoculars (Hans u.c. 2024), modelim neatkarīga — nav jātrenē katram LLM, salīdzina neliela etalona modeļa izbrīnījumu ar pārbaudāmo tekstu, kas ļauj vispārināt. Precizitātes rādītāji tiks publicēti pēc funkcijas izvērtēšanas, nevis iepriekš, uz jaukta LLM satura (salīdzinājumam ~70% Claude-3, lietojot GPT trenētus detektorus). Metodoloģijas rakstā aprakstītas kļūdu situācijas; mēs tās neslēpjam.

Ja manu darbu atzīmē, bet vadītājs nepiekrīt?

Katram atzīmētam fragmentam ir avota DOI, datums, dzinēja commit un klasifikācijas iemesls. Atkal pārbaudiet pret šo dzinēja versiju — rādītājs nemainīsies. Ziņojumu var izdrukāt un paņemt uz sēdi; ceļi uz avotiem ir klikšķināmi. “Uzticieties rādītājam” režīma nav, tā ir melnās kastes pārbaudītāju pieeja.

Kā par pašhostēšanu medicīnas / klīniskajā pētījumā ar HIPAA prasībām?

Apache 2.0 + Docker — pilnībā strādā Jūsu tīklā. Savienojams ar PostgreSQL un Redis iekšējā infrastruktūrā; dati nepamet VPC. Der klīniskiem projektiem, pacientu aprakstiem vai nepublicējamiem pētījumiem. Lieliem lietotājiem korpuss nododams kā indekss.

Pārbaudiet nodaļu pret 700M+ zinātniskiem darbiem.

Ielīmējiet disertācijas nodaļu, finansējuma pieteikumu vai raksta melnrakstu. Ziņojumā redzams, kas ir sagaidāms, kas jāatzīmē ar atsauci, kas ir Jūsu paša teksts. Bez maksas līdz 2 500 vārdiem. Ja IRB prasa algoritma pārskatīšanu — Apache 2.0.

Akadēmiskā plaģiāta pārbaude ar citātu atpazīšanu