Antiplagio accademico con citazioni
Rilevamento del plagio progettato per la scrittura scientifica — verifica su oltre 700 milioni di lavori accademici tra OpenAlex, CORE, arXiv, PubMed Central e Crossref. Classificazione sensibile alle citazioni. Motore Apache 2.0 verificabile da qualunque IT di ente.
Cinque fonti. Oltre 700 milioni di lavori. Tutti open access o registrati DOI.
Nessun contenuto dietro paywall — lavoriamo solo su indici open access. Copertura più ampia per la ricerca post-Plan-S; più ristretta per retro-cataloghi chiusi.
OpenAlex
Oltre 250 milioni di lavoriIndice scientifico open access — sostituisce il vecchio Microsoft Academic Graph. Copre articoli, atti conferenze, dataset, libri in tutte le discipline.
CORE
Oltre 290 milioni di articoliIl più grande aggregatore di ricerca open access. Testi integrali da oltre 11.000 archivi. Molto forte su pubblicazioni europee e UK.
arXiv
Oltre 2,4 milioni di preprintFisica, matematica, informatica, biologia quantitativa, statistica, economia. Confronta contro la versione vista dal revisore su arXiv.
PubMed Central
Oltre 10 milioni di articoliArchivio open access biomedico e life sciences. Testi integrali e metadati indicizzati. Ricerca depositata NIH + mirror dei giornali.
Tre flussi. Un prodotto.
Che stia preparando una sottomissione a rivista, difendendo un capitolo di tesi o finalizzando una proposta di finanziamento — il controllo si adatta alla fase, non il contrario.
01 · Controllo pre-sottomissione
Verifichi il manoscritto sull'universo open access prima che lo faccia la rivista. iThenticate / Crossref Similarity Check lo verificherà comunque alla sottomissione — deve vedere ciò che vedrà l'editore, prima dell'editore. Pro flat-rate permette di iterare le bozze senza consumare crediti per documento.
02 · Capitolo di tesi / dissertazione
Controllo per capitolo o test di tutta la tesi. L'autocitazione tra capitoli viene segnalata ma classificata separatamente (legittima su scala tesi). Bibliografia esclusa dal punteggio. Cronologia versioni: confronto tra il capitolo di gennaio e la revisione di maggio — vede le modifiche, cosa è cambiato, cosa è nuovo.
03 · Proposta di finanziamento / review
Template ripreso da finanziamenti precedenti non deve essere segnalato come plagio. Una review citata correttamente non dovrebbe flaggare. Il modello classifica il riuso accademico lecito (sue opere precedenti, con citazione) diversamente dalla copia accidentale. Il punteggio riflette solo le effettive criticità.
Sei categorie. Ogni intervallo ricade in una.
Un rapporto di similarità 28% su una review molto citata è diverso da un 28% su parafrasi non citate. La classificazione è la differenza.
01 · Citazione diretta (citata)
Virgolette + citazione parentetica O nota a piè pagina. Classificato atteso; escluso dal punteggio. Più stili di citazione rilevati automaticamente (MLA / APA / Chicago / Harvard / Vancouver / IEEE).
02 · Citazione estesa
Passaggio rientrato di almeno 40 parole seguito da citazione. Classificato atteso. Schema di 1,2 cm rientro sinistro + citazione riconosciuto; mancanza di rientro segnalata come errore di formattazione.
03 · Parafrasi (citata)
Frase con struttura simile e riferimento nella parte circostante. Conteggiata a peso ridotto. Accetta anche “Smith (2023) sostiene...” come attribuzione lecita.
04 · Conoscenza comune
Frasi in oltre 2.000 fonti indipendenti (“L’acqua bolle a 100°C”, definizioni tecniche standard, formule note). Escluse dalla similarità. Soglia regolabile per settori tecnici.
05 · Bibliografia
Sezione riferimenti rilevata da intestazione + format. Esclusa dal punteggio. I riferimenti NON devono essere originali — segnalarli gonfia il punteggio inutilmente.
06 · Parafrasi non attribuita
Adattamento frasale senza citazione vicina, né virgolette né formattazione “block quote”. Categoria che deve pesare sul punteggio. Pesa a pieno; le altre categorie no.
Classificazione per intervallo. URL per fonte. Auditabile end-to-end.
Ogni intervallo include DOI/URL fonte, categoria di classificazione, data snapshot corpus, commit del motore. Difendibile in riunioni di revisione tra pari, commissioni di integrità o audit IT.
Il modernismo è più una costellazione di rifiuti — di realismo, di progresso, di un sé unitario... (Eysteinsson, 1990, p.117).
doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990L’insistenza di Eliot sull’impersonalità ridefinisce la lirica come artefatto costruito piuttosto che sfogo confessionale.
Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…Il romanzo emerge da una visione fondamentalmente borghese che si afferma nel XVIII secolo.
openalex.org/W12345678 · Watt (1957) — mancata citazioneIl flusso di coscienza joyciano deve molto alla psicologia della durata interiore di William James.
James, W. (1890). The Principles of Psychology, cap.IX (presente in bibliografia)La precedente tesi di dottorato pubblicata dall’autore, Capitolo 1.
ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · autocitazione, nessuna attribuzione in questo paragrafoTutti i riferimenti — Eysteinsson, Eliot, Joyce, James, Watt, e altri 32.
Sezione bibliografia, pp. 38–41- Oltre 700 milionilavori accademici indicizzati
- 6stili di citazione riconosciuti
- 5lingue calibrate al lancio
- 3%Bias per ESL residuo (documentato)
- Apache2.0 · Valutabile da IRB
Tre cose che un checker opaco non regge davanti a una commissione.
Riesegua lo stesso testo contro lo stesso commit
Ogni rapporto include commit motore e data snapshot corpus. Anche mesi dopo, può ricontrollare il manoscritto contro lo stesso motore — stesso input, stesso algoritmo, stesso risultato. I checker chiusi possono cambiare modello a sua insaputa, e il suo punteggio di gennaio non è replicabile a maggio.
Codice Apache 2.0 su GitHub — porti in sede
Quando arriverà il rilevamento AI (roadmap v1.2), e uno studente contesterà il verdetto AI, potrà citare lo specifico commit motore, mostrare la riga di codice della decisione soglia e la documentazione della calibrazione linguistica. Non uno screenshot di una email vendor.
Liang et al. 2023 documentato; mitigazione prevista nella roadmap
Stanford 2023 ha rilevato un 61,3% di FPR su saggi TOEFL con rilevatori ingenui. Quando la rilevazione AI di Noplag sarà disponibile (prossimamente, roadmap v1.2), il risultato includerà una fascia adattata per ESL se la firma lessicale suggerisce inglese non nativo. L’errore residuo sarà documentato, non dichiarato nullo. Il percorso di override viene registrato con commit dell’engine e motivazione.
Un motore Apache 2.0 che l’IT può davvero valutare prima di firmare.
La maggior parte delle valutazioni di software antiplagio dagli enti si blocca sulle stesse domande: dove va il documento dopo l’invio, qual è l’algoritmo di matching, chi accede ai dati, che succede col diritto a cancellazione, è replicabile il claim sull’accuratezza. Con i fornitori closed-source, le risposte si sentono in call commerciale. Con Apache 2.0, l’IT può clonare il repo, testare il motore in VM, ispezionare il flusso dati, verificare la rimozione, e replicare i nostri F1 su dati propri. Non puntiamo a una review meno onerosa — puntiamo a una review che il team IT possa effettivamente chiudere. Così università prima riluttanti aggiungono questo vendor.
Legga la guida all’appaltoLe domande reali dal mondo accademico.
Sostituisce iThenticate per pre-sottomissione?
Nella maggior parte dei casi no — se la rivista impone iThenticate (Elsevier, Springer, Wiley, IEEE), lo useranno comunque alla sottomissione. Noplag serve invece per i controlli iterativi sulle bozze prima della sottomissione. iThenticate a 125$/doc diventa proibitivo dopo la quarta revisione; Pro flat-rate no. Il confronto vs-iThenticate: noplag.com/vs-ithenticate.
E le tesi ProQuest? Non le avete?
Corretto — quel gap esiste. Il database tesi ProQuest è chiuso, a pagamento, non incluso in OpenAlex/CORE. Copriamo ~700M lavori open access, il che è più ampio di ProQuest per la ricerca post-Plan-S (riviste principali dal 2018); più stretto solo per vecchie tesi paywall. Se il controllo incrociato su dissertation PhD USA è requisito primario, iThenticate è la soluzione più adatta.
Come tratta stili citazionali diversi dai big six?
MLA, APA, Chicago / Turabian, Harvard, Vancouver, IEEE auto-rilevati dal formato bibliografia. Per stili meno comuni (ACS, AMA, ASA, Bluebook, Oxford), il motore classifica comunque in base a virgolettato / pattern parentetico vicino, ma la validazione specifica per stile è in roadmap v1.2. Su installazione locale si possono aggiungere plugin per altri stili.
Qual è il falso positivo su review molto citate?
Inferiore a quanto si aspetta chi valuta solo parafrasi non citate, perché il modello separa le citazioni dal punteggio principale. Valutiamo ~3,4% falso positivo sul sottoinsieme PAN-PC-11 (dove molte frasi sono citazioni legittime). I competitor chiusi che non classificano queste, segnalano 12–18% sullo stesso corpus.
Posso escludere le mie pubblicazioni?
Pro — aggiunga lista autocitazioni ammessa (il suo ORCID, i suoi DOI, URL archivio istituzionale). Coincidenze su questi documenti marcate come AUTOCITAZIONE e ignorate nel punteggio. Utile a chi ricicla proprie parti per progetti futuri; autocitazione con fonte è prevista, non plagio.
Com'è la copertura multilingue reale?
La rilevazione è calibrata per inglese, spagnolo, portoghese, polacco e ucraino al lancio; altre lingue saranno aggiunte progressivamente. La qualità della rilevazione è validata su PAN-PC-11; la valutazione per singola lingua è prevista in roadmap. Massima affidabilità sulle lingue europee con la validazione più estesa; le nuove lingue vengono rilasciate man mano che la calibrazione si consolida.
Apache 2.0 in appalto IT, cosa cambia?
Il tuo IT / DPO / IRB può clonare github.com/NoplagLabs/noplag-engine, eseguire l’engine in sandbox, verificare i flussi dati, controllare che il diritto alla cancellazione sia rispettato end-to-end e riprodurre i nostri benchmark pubblicati sul proprio corpus di test. Senza firmare nulla, senza NDA, senza dover credere al marketing. Per le istituzioni che richiedono questa profondità di revisione nei processi di procurement, questa è la soluzione.
Il rilevatore AI coprirà Claude-3+Gemini o solo GPT?
La rilevazione AI sarà disponibile prossimamente — è nella roadmap v1.2, non attiva al lancio. L’approccio è Binoculars (Hans et al. 2024), agnostico rispetto al modello: non addestra per ogni LLM, confronta la perplexity di un piccolo modello di riferimento con il testo da analizzare, il che consente generalizzazione. I dati di accuratezza saranno pubblicati solo dopo la valutazione della funzionalità, non prima, su contenuti generati da LLM misti (contro circa il 70% su Claude-3 per rilevatori addestrati su GPT). Il paper metodologico documenta i limiti; non vengono nascosti.
E se il mio relatore contesta un flag?
Ogni intervallo segnalato ha DOI fonte, data snapshot corpus, commit motore, motivo classificazione. Rilanciare il controllo su quello stesso commit dà lo stesso risultato. Si porta il rapporto in stampa alla riunione; i percorsi citazionali sono cliccabili. Nessuna “fiducia cieca nel punteggio” — quello lo fanno i checker opachi.
Self-host per ricerche mediche/cliniche HIPAA?
Apache 2.0 + Docker — gira interamente nella rete locale. Collabora con PostgreSQL + Redis su sua infrastruttura; nessun traffico fuori dal VPC. Utile per studi clinici, draft con dati pazienti, qualunque preprint che non può lasciare la struttura. Clienti enterprise ricevono corpus come bundle indicizzabile.
Controlli un capitolo su oltre 700 milioni di lavori accademici.
Incolli un capitolo di tesi, proposta o manoscritto. Il rapporto cita-attento mostra il previsto, ciò che richiede citazione e ciò che è suo. Gratuito fino a 2.500 parole. Apache 2.0 se il suo IRB esige revisione algoritmica.