Verificare plagiat academică pentru cercetare
Detecție de plagiat pentru scriere științifică — verificare în peste 700M de lucrări academice din OpenAlex, CORE, arXiv, PubMed Central și Crossref. Clasificare după citare. Motor Apache 2.0 auditat de orice departament IT instituțional.
Cinci surse. Peste 700M lucrări. Doar open-access sau înregistrate DOI.
Niciun conținut cu plată — folosim exclusiv indexuri open-access. Acoperire mai largă pentru cercetarea post-Plan-S; mai îngustă pentru arhive vechi de reviste cu plată.
OpenAlex
Peste 250M lucrăriIndex academic open-access — înlocuiește vechiul Microsoft Academic Graph. Include articole, lucrări de conferință, seturi de date, cărți din orice domeniu.
CORE
Peste 290M lucrăriCel mai mare agregator de cercetare open-access. Indexare full-text din peste 11.000 de repozitoare. Accent puternic pe cercetarea europeană și britanică.
arXiv
Peste 2.4M preprinturiFizică, matematică, informatică, biologie cantitativă, statistică, economie. Verificare și cu versiunea încărcată recent pe arXiv.
PubMed Central
Peste 10M lucrăriArhivă open biomedical/științe ale vieții. Full-text indexat plus metadate. Studii publicate prin NIH și fluxuri de reviste în oglindă.
Trei fluxuri. Un singur produs.
Indiferent dacă pregătiți un manuscris pentru o revistă, susțineți un capitol de teză sau finalizați o propunere de grant — verificatorul se adaptează etapei, nu invers.
01 · Verificare înainte de trimiterea la revistă
Rulați manuscrisul prin open-access înainte ca revista să o facă. iThenticate / Crossref Similarity Check va rula oricum la trimitere — vedeți ceea ce vede editorul, înainte de editor. Pro la tarif fix înseamnă versiuni multiple fără să se adune costul per document.
02 · Capitol de disertație / teză
Verificați pe capitole sau pentru întreaga teză. Autocitarea între capitole este semnalată, dar tratată separat (este legitimă la nivel de teză). Bibliografia este exclusă automat din scor. Istoricul de versiuni compară capitolul din ianuarie cu revizia din mai — vedeți ce s-a schimbat, ce s-a îmbunătățit, ce e nou.
03 · Propunere de grant / revizie literatură
Materialul reutilizat din granturi anterioare co-semnate nu trebuie să fie semnalat ca plagiat. Revizia literaturii, dacă este corect citată, nu ar trebui să fie semnalată nici ea. Modelul de clasificare tratează reutilizarea legitimă (propria lucrare anterioară, cu citare) diferit de copierea accidentală. Scorul reflectă doar problemele reale.
Șase categorii. Fiecare interval găsit este încadrat.
Un raport cu 28% similaritate la un review de literatură foarte citat este altceva față de 28% pe parafrazare fără citare. Diferența o face clasificarea.
01 · Citat direct (cu citare)
Ghilimele plus citare paranteză SAU notă de subsol. Considerat așteptat; exclus din scor. Detectare automată a mai multor stiluri de citare (MLA / APA / Chicago / Harvard / Vancouver / IEEE).
02 · Bloc de citat
Pasaj indentat 40+ cuvinte urmat de citare. Considerat corect. Se recunoaște indentarea de 0,5 inch + citare; lipsa indentării semnalează modificări de formatare a citatului.
03 · Parafrază (cu citare)
Potrivire la nivel de structură frază cu atribuire în același paragraf. Calculat cu greutate redusă. “Smith (2023) susține...” e considerată atribuire validă.
04 · Cunoștință comună
Apariții în peste 2.000 surse independente (“Apa fierbe la 100°C”, definiții tehnice standard, formule cunoscute). Excluse din similaritate. Pragul este reglabil pentru domenii cu terminologie densă.
05 · Bibliografie
Lista referințelor detectată automat după titlu și format. Complet exclusă din scor. Referințele nu trebuie să fie originale — semnalarea lor umflă scorul inutil.
06 · Parafrază fără citare
Potrivire la nivel de structură frază fără citare în context, fără ghilimele, fără formatare de bloc. Aceasta este categoria care trebuie să conteze cel mai mult la scorul de similaritate. Numărată la greutate maximă; restul nu.
Clasificare pe interval. URL sursă. Audit complet.
Fiecare interval găsit are atașat DOI / URL sursă, categorie de clasificare, momentul snapshot-ului corpusului și commitul motorului. Defendabil la referate, consilii de etică sau audit IT.
Modernismul este mai degrabă o constelație de respingeri decât o mișcare coerentă — a realismului, a progresului, a sinelui unitar... (Eysteinsson, 1990, p.117).
doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990Accentul pus de Eliot pe impersonalitate redefinește liricul ca artefact construit, nu ca revărsare confesională.
Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…Romanul apare dintr-o perspectivă burgheză ce a luat formă în secolul XVIII.
openalex.org/W12345678 · Watt (1957) — potrivire fără citareFluxul conștiinței la Joyce datorează mult psihologiei duratei interne la William James.
James, W. (1890). The Principles of Psychology, ch.IX (menționat în lista de citări)Propria disertație doctorală publicată anterior, Capitolul 1.
ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · autocitare, fără atribuire acest paragrafToate referințele — Eysteinsson, Eliot, Joyce, James, Watt și alți 32.
Secțiunea bibliografie, pp. 38–41- Peste 700Mlucrări științifice indexate
- 6stiluri de citare detectate automat
- 5limbi calibrate la lansare
- 3%rezidual bias ESL (documentat)
- Apache2.0 · validabil etic
Trei motive pentru care un verificator black-box nu rezistă la comisia de facultate.
Rulați același articol cu același commit
Fiecare raport conține X-Engine-Commit și timestampul snapshotului corpusului. Peste luni, puteți re-verifica același manuscris cu aceeași versiune — aceiași parametri, același rezultat. Verificatoarele closed-source pot schimba algoritmul în fundal, scorul din ianuarie nu se mai reproduce în mai.
Apache 2.0 sursă pe GitHub — aduceți-l la ședință
Când detectarea AI apare (curând, pe v1.2 roadmap) și un student contestă verdictul AI, veți cita commitul, puteți arăta linia de cod pentru decizia de prag și documentația de calibrare ESL pe limbă. Nu capturi de ecran cu răspunsuri de la suport.
Liang et al. 2023 a documentat; măsuri de mitigare sunt pe roadmap
Studiul Stanford 2023 a raportat 61,3% rată de fals pozitiv pe eseuri TOEFL pentru detectoarele naive. Când detecția AI de la Noplag va fi lansată (în curând, pe roadmap v1.2), verdictul va include o bandă ajustată pentru ESL dacă semnătura lexicală indică engleză non-nativă. Eroarea reziduală va fi documentată, nu declarată ca fiind zero. Orice suprascriere este înregistrată cu commitul engine-ului și motivul.
Motor Apache 2.0 pe care IT-ul instituției chiar îl poate verifica înainte de contractare.
Majoritatea reviziilor IT pentru software de plagiat se blochează pe aceleași întrebări: unde merge documentul după trimitere, care e algoritmul de matching, cine accesează datele, cum se procesează cererile de ștergere, se poate proba acuratețea declarată de vânzător. La un vendor closed-source, răspunsurile vin în call de vânzări. Cu Apache 2.0, IT poate clona repo-ul, rula motorul pe VM sandbox, audita fluxul de date, verifica procesul de ștergere și reproduce F1 publicat pe propriul set. Nu argumentăm pentru un review ieftin — ci pentru unul pe care IT îl termină. Așa au semnat universități care până acum refuzau vendorii noi de plagiat.
Citiți ghidul de achizițiiÎntrebările adresate de obicei de către academici.
Înlocuiește acesta iThenticate pentru verificare înainte de trimitere la revistă?
În majoritatea cazurilor, nu — dacă revista cere iThenticate (Elsevier, Springer, Wiley, IEEE), ei îl vor rula oricum la trimitere. Noplag înlocuiește autocontrolul pe parcursul versiunilor înainte de trimitere. La 125$ pe document, iThenticate devine prohibitiv după 4 revizii; Pro la tarif fix nu. Comparația detaliată la noplag.com/vs-ithenticate.
Dar despre teze ProQuest? Nu le aveți?
Corect — lipsa există. Baza de date de teze ProQuest e proprietară, cu plată, nu se află în OpenAlex/CORE. Acoperim cele ~700M open-access, mai larg decât ProQuest pentru cercetare post-Plan-S (majoritatea revistelor după 2018); mai îngust pentru teze vechi cu plată. Dacă pentru dumneavoastră verificarea doctoratelor din SUA e esențială, iThenticate rămâne alegerea potrivită acolo.
Cum gestionează motorul alte stiluri de citare decât cele mari 6?
MLA, APA, Chicago/Turabian, Harvard, Vancouver, IEEE — detectează automat pe formatul bibliografiei. La stiluri mai rare (ACS, AMA, ASA, Bluebook, Oxford), motorul marchează în continuare pe ghilimele + citare apropiată, dar validatorul de stil e pe roadmap v1.2. La self-host puteți adăuga stiluri noi prin modulele de aliniere.
Care e rata de fals-pozitiv la reviews cu multă citare?
Mai mică decât cred reviewerii obișnuiți cu parafrazări fără citare, deoarece modelul elimină intervalele corect citate din scorul principal. Avem aprox. 3,4% fals pozitiv pe subsetul PAN-PC-11 (unde majoritatea coincid legitime). Competiția closed-source care nu clasifică citatele raportează 12–18% pe același corpus.
Pot exclude publicațiile mele anterioare?
Pro permite adăugarea unei liste de autocitare (ORCID, DOIs proprii, URL instituțional). Potrivirile cu lista marcată ca AUTOCITARE nu contează la scor. Util pentru granturi bazate pe rezultate anterioare proprii; reciclarea cu citare nu e plagiat.
Cum e acoperirea pe alte limbi?
Detecția este calibrată pentru engleză, spaniolă, portugheză, poloneză și ucraineană la lansare, cu alte limbi în curs de adăugare. Calitatea detecției este evaluată pe PAN-PC-11; evaluarea pe fiecare limbă este pe roadmap. Cea mai robustă pe limbile europene cu istoric lung de validare; noile limbi sunt lansate pe măsură ce calibrarea lor avansează.
Ce aduce “Apache 2.0” pentru achiziția instituțională?
Echipa IT / DPO / IRB poate clona github.com/NoplagLabs/noplag-engine, rula engine-ul într-un sandbox, audita fluxul de date, verifica funcționarea dreptului la ștergere cap-coadă și reproduce scorurile noastre publicate pe propriul corpus de test. Fără semnarea vreunui document, fără NDA, fără a se baza pe marketingul nostru. Pentru instituțiile unde achiziția cere acest nivel de verificare, acesta este avantajul.
Detectorul AI merge pe Claude-3 + Gemini sau doar GPT?
Detecția AI va fi disponibilă în curând — este pe roadmap v1.2, nu este activă la lansare. Abordarea este Binoculars (Hans et al. 2024), model-agnostică: nu antrenează separat pentru fiecare LLM, ci compară perplexitatea unui model de referință mic cu textul testat, ceea ce permite generalizare. Valorile de acuratețe vor fi publicate după finalizarea evaluării, nu înainte, pe conținut mixt LLM (față de ~70% pe Claude-3 pentru detectorii antrenați pe GPT). Articolul metodologic documentează limitele; nu le ascundem.
Dacă un coordonator contestă un flag?
Orice interval semnalat vine cu DOI sursă, timestamp corpus, commit engine, motiv de clasificare. Re-verificarea cu același commit dă același rezultat. La ședință se poate prezenta raportul tipărit; căile de citare sunt accesibile. Nu avem mod “crede scorul”, asta fac doar black-boxurile.
Ce fac pentru self-host la proiecte medicale/clinice HIPAA?
Apache 2.0 + Docker — complet intern în rețea. Pair cu PostgreSQL + Redis pe infrastructura proprie; fără trafic extern. Pentru drafturi clinice, studii de pacienți sau orice pre-publicare unde nu se acceptă third-party cloud. Pentru clienți enterprise, corpusul se poate primi ca bundle indexabil.
Rulați un capitol pe peste 700M lucrări științifice.
Introduceți un capitol de disertație, propunere de grant sau draft de manuscris. Raportul cu recunoaștere citări arată ce e așteptat, ce necesită citare, ce e al dumneavoastră. Gratuit până la 2.500 cuvinte. Apache 2.0 dacă IRB cere audit algoritm.