Antiplagio per ricercatori pre-sottomissione
Controlli pre-submission del manoscritto su oltre 700M pubblicazioni scientifiche. My Folders monitora le Sue precedenti pubblicazioni personali affinché la legittima autocitazione non aumenti il punteggio. Endpoint con residenza UE disponibile per ricerche pre-pubblicazione sensibili. Motore Apache 2.0 — valutabile da IRB.
Quattro ruoli di ricerca. Un solo workflow di autocontrollo.
Pre-submission capitolo tesi
Iteri sui capitoli. Monitori l'autocitazione nelle versioni.
- Controllo per capitolo + cronologia delle versioni
- Allowlist autocitazione (il Suo ORCID + elenco DOI)
- Bibliografia esclusa automaticamente
Manoscritto prima dell'invio alla rivista
iThenticate interviene alla sottomissione; noi prima.
- Indice open-access di 700M pubblicazioni
- Classificazione citazioni (citato vs parafrasato senza citazione)
- Flat-rate Pro · iteri senza costo per credito
Revisione letteratura + controllo proposta
Riutilizzare boilerplate di grant precedenti è atteso — segnaliamolo.
- Riconosce le Sue pubblicazioni e grant precedenti
- Allowlist co-autori (produzione dei collaboratori)
- Esporti il report di classificazione in PDF per i collaboratori
QA pre-pubblicazione di tutto il laboratorio
Rileva problemi sulle submission del laboratorio in una coda unica.
- Cartella per progetto e per post-doc
- Residenza UE per dati clinici / primari sensibili
- Motore Apache 2.0 — difendibile a livello di IRB
Tre passaggi prima dell'invio del manoscritto al portale della rivista.
Esegua iterativamente. Identifichi intervalli autocitati così non aumentano il Suo punteggio iThenticate / Crossref alla sottomissione. I verdetti AI-detection stanno arrivando, così potrà vederli prima che lo segnali reviewer 2.
01 · Bozza + allowlist
Carichi il capitolo / bozza del manoscritto. Aggiunga ORCID e la lista dei Suoi DOI (allowlist): le Sue pubblicazioni precedenti sono marcate SELF-CITE, non plagio. DOI co-autori inclusi se ha collaborato; il motore riconosce il riuso legittimo.
02 · Esegua la cascade
L1 winnowing → live-web oggi, con L2 MinHash (v1.1) e L3 vector embeddings (v1.2) in arrivo. Rileva copie testuali e quasi testuali; la copertura del testo parafrasato sarà disponibile con L2 e L3. La classificazione delle citazioni distingue tra materiale citato e parafrasi non citate. Multilingue, con rilevamento calibrato per inglese, spagnolo, portoghese, polacco e ucraino al lancio; altre lingue in arrivo. Tempo mediano per manoscritto: 47 secondi.
03 · Revisioni + iterazioni
Il report segnala intervalli per categoria: SELF-CITE (propri, attesi), CITED (citazioni con attribuzione, attesi), CITED-PARA (parafrasi con citazione, basso peso), UNCITED-PARA (da valutare), e AI-LIKELY (con soglia ESL) in arrivo. Riproducibile — commit del motore + istantanea corpus su ogni report.
Sei categorie di riuso lecito — nessuna dovrebbe aumentare il punteggio.
I checker black-box segnalano qualunque corrispondenza di testo come plagio. I ricercatori riutilizzano testo in modo legittimo. Ecco come il classificatore gestisce questi casi.
01 · PROPRIE PUBBLICAZIONI PRECEDENTI
Allowlist ORCID + DOI. I Suoi articoli precedenti vengono marcati SELF-CITE — non segnalati come plagio. Comune in revisioni (“come discusso in Chen 2023...”) e grant dove si costruisce su lavoro proprio.
02 · LAVORI COFIRMATI
Aggiunga gli ORCID dei collaboratori all'allowlist. Gli articoli co-firmati vengono marcati CO-CITE. Utile quando il manoscritto si basa su uno scritto insieme (es. metodi condivisi).
03 · TESTI LABORATORIO
Corpo condiviso PI-folder: metodi standard, protocolli di laboratorio, dichiarazioni etiche che si propagano tra pubblicazioni del laboratorio. Marcati LAB-CITE ed esclusi dal punteggio. Boilerplate IRB già approvato non va riscritto ogni volta.
04 · PRE-PRINT SOTTO EMBARGO
Il proprio pre-print arXiv / bioRxiv del manoscritto in submission. Il classificatore riconosce l’evoluzione pre-print → versione rivista e lo marca PREPRINT-SELF. Non conta sul punteggio. Le riviste che vietano pre-print possono usare regole più restrittive.
05 · CITAZIONI RITIRATE
Crossref Retraction Watch segnala passaggi che citano articoli ritirati. Non modifica il punteggio — ma è informazione utile prima della submission. Intercetta il caso “ho citato un paper ritirato il mese scorso” prima del reviewer.
06 · IRB / SENSIBILI
Endpoint con residenza UE (api.eu.noplag.com) mantiene il manoscritto in infrastruttura UE. Può autocontenere il motore nella propria rete per dati HIPAA / GDPR / pazienti. Apache 2.0 + Docker; nessun traffico lascia il Suo VPC.
Organizzato per progetto. Audit-trail per data.
Raggruppi i manoscritti per progetto, anno di laboratorio o ciclo grant. Può riaffrontare le bozze più tardi contro lo stesso commit motore — report riproducibili anche mesi dopo.
Tre requisiti per ricerca pre-pubblicazione sensibile in un checker.
I manoscritti non lasciano mai l’infrastruttura UE
Pro+ su api.eu.noplag.com. Hosting su datacenter Hetzner in UE (Falkenstein + Helsinki). Submission, fingerprint store e report rimangono in UE. GDPR by default; DPA su richiesta.
Esegua il motore all’interno della Sua istituzione
Apache 2.0 + Docker compose. Il pipeline completo gira solo sulla Sua infrastruttura. Porti il Suo Postgres + Redis; il corpus è fornito come bundle indicizzabile su Enterprise. Nessun traffico esce dal Suo VPC. La scelta giusta per trial clinici, case study pazienti, o ricerca primaria commerciale sensibile.
Cancellare ogni fingerprint conservata per Lei
Un click in Impostazioni. Entro 24h, ogni fingerprint, report, allowlist, metadato del Suo account viene cancellato. Conforme GDPR art. 17. Gli utenti self-host hanno accesso diretto al database; nel cloud c’è API di cancellazione documentata.
Un motore Apache 2.0 che il Suo IRB può davvero valutare prima di approvare.
La maggioranza dei software antiplagio rallenta in review per le stesse domande: dove va a finire il manoscritto, che algoritmo viene usato, i dati sensibili sono trasmessi, quale percorso per diritto all’oblio, e se la precisione dichiarata si può riprodurre. I vendor closed-source rispondono su call commerciali. Con Apache 2.0, il Suo IRB può clonare il repo, girare il motore su sandbox, auditare i dati, verificare diritto all’oblio end-to-end, e riprodurre gli F1 per lingua pubblicati su test set proprio. Non diciamo che la review sia veloce o facile — diciamo che il Suo IRB la può realmente concludere. Ecco perché uffici data research che prima rifiutavano nuovi vendor ora firmano questa soluzione.
Legga la guida review IRBLe domande dell’ufficio ricerca.
- Perché cambia la similarità se aggiungo ORCID + DOI?
- Perché il motore riclassifica ogni intervallo che corrisponde a una pubblicazione nell’allowlist come SELF-CITE invece di UNCITED-PARA. Le corrispondenze non spariscono — cambia la tag. SELF-CITE pesa quasi zero nel punteggio. Esempio: la Sua tesi cita due volte il proprio pre-print e una volta un co-autore; sono tre intervalli che da “contati” diventano “riuso atteso”.
- Il motore si allena sui manoscritti inviati?
- No. Il testo inviato viene fingerprinted (solo hash winnowing — firma non reversibile) e salvato sul Suo database tenant-isolated. Il testo è eliminato dopo 30 giorni salvo retention. Il rilevatore AI Binoculars (in arrivo) è pre-addestrato su corpora pubblici; non includiamo manoscritti degli utenti nel training. Tutto scritto in DPA.
- E il mio pre-print su arXiv / bioRxiv?
- Se inserisce il DOI del pre-print in allowlist, i match vengono marcati PREPRINT-SELF e non pesano sul punteggio. Il motore riconosce il passaggio pre-print → versione rivista. Le riviste che vietano pre-print (alcune ancora lo fanno) possono scegliere allowlist più restrittive — ma la maggior parte (Nature, Cell, NEJM, PLOS) accetta pre-print, e la gestione SELF-CITE riflette questa policy.
- Come gestirà l’AI detection i co-autori ESL?
- Il rilevamento di testi generati da AI sarà disponibile a breve — previsto nella roadmap v1.2. Al rilascio, utilizzerà una calibrazione per lingua con un verdetto adattato per ESL. Se la firma lessicale indica inglese non madrelingua (frequente nelle collaborazioni internazionali), il verdetto sarà ESL ADJ con un margine di errore documentato, invece di dichiarare assenza totale di rischio. L’articolo di Liang et al. 2023 ha rilevato un 61,3% di FPR su saggi TOEFL per i rilevatori non specializzati; la nostra metodologia di mitigazione è pubblicata su /docs/developers/benchmarks. I coautori ESL non vengono segnalati ingiustamente.
- Posso eseguire il motore su un cluster Slurm?
- Sì — Apache 2.0 + Docker. Esegui il container dell’engine sui nodi di calcolo del tuo cluster; importa dal filesystem condiviso; genera report in JSON dove la tua pipeline li legge. Utile per controlli batch su un anno di produzione di laboratorio rispetto all’ultimo snapshot del corpus. Script di esempio Slurm sbatch su github.com/NoplagLabs/noplag-engine.
- E per dati clinici / pazienti?
- Self-host nel Suo VPC. Nessun traffico esce dalla rete. Il motore non richiede internet per indexed-corpus (niente live-web, ma è opzionale). Deploy HIPAA-compatibile se l’infra è configurata; il Suo IT lo gestisce come qualsiasi altro servizio interno.
- Differenze con iThenticate alla submission?
- iThenticate interviene a submission e l’editor vede la valutazione — non c’è iterazione. Noplag è il Suo autocontrollo prima. La cascade è simile su open-access (anche più ampia post-Plan-S); più ristretta su paywall/subscription accademici dove iThenticate ha licenza. La gestione autocitazione è il bisogno reale per la maggioranza, e iThenticate non la fa bene.
- Compatibilità con reference manager (Zotero/Mendeley/EndNote)?
- Ingestione allowlist supporta BibTeX, RIS, e ORCID API. Carichi export Zotero o incolli ORCID; allowlist popolato con tutti i Suoi DOI. Sync real-time con Mendeley + EndNote in roadmap v1.2; ora percorso export.
- Coverage multilingue su riviste non inglesi?
- Il rilevamento è calibrato per inglese, spagnolo, portoghese, polacco e ucraino al lancio; altre lingue in arrivo. Maggiore accuratezza sulle lingue europee (lunga storia di calibrazione). La qualità del rilevamento è testata su PAN-PC-11; la valutazione per lingua è in roadmap. Particolarmente utile nei contesti accademici europei e sudamericani.
- E se una citazione viene ritirata dopo la submission?
- L’integrazione Crossref Retraction Watch la segnala a ogni nuovo controllo del manoscritto. Se ha già inviato, notifichi l’editor (alcune riviste richiedono gestione esplicita). Il punteggio non cambia, ma avrà l’informazione prima di reviewer 2.
Provi un capitolo col cascade. Veda il breakdown autocitazione.
Carichi una bozza di manoscritto, un capitolo di tesi, o una review grant. Inserisca il Suo ORCID. Veda quali intervalli sono SELF-CITE, CITED, UNCITED-PARA, e AI-LIKELY in arrivo. Gratuito fino a 2.500 parole. Pro+ con residenza UE per materiali pre-pubblicazione sensibili.