RESEARCHPre-submission · Gestione autocitazione · Residenza UE · IRB-reviewable

Antiplagio per ricercatori pre-sottomissione

Controlli pre-submission del manoscritto su oltre 700M pubblicazioni scientifiche. My Folders monitora le Sue precedenti pubblicazioni personali affinché la legittima autocitazione non aumenti il punteggio. Endpoint con residenza UE disponibile per ricerche pre-pubblicazione sensibili. Motore Apache 2.0 — valutabile da IRB.

Oltre 700M pubblicazioni scientificheAllowlist autocitazioneResidenza UE · valutabile da IRB
OVUNQUE SI TROVI NEL PIPELINE

Quattro ruoli di ricerca. Un solo workflow di autocontrollo.

PHD / DOTTORATO

Pre-submission capitolo tesi

Iteri sui capitoli. Monitori l'autocitazione nelle versioni.

  • Controllo per capitolo + cronologia delle versioni
  • Allowlist autocitazione (il Suo ORCID + elenco DOI)
  • Bibliografia esclusa automaticamente
POST-DOC

Manoscritto prima dell'invio alla rivista

iThenticate interviene alla sottomissione; noi prima.

  • Indice open-access di 700M pubblicazioni
  • Classificazione citazioni (citato vs parafrasato senza citazione)
  • Flat-rate Pro · iteri senza costo per credito
GRANT WRITER

Revisione letteratura + controllo proposta

Riutilizzare boilerplate di grant precedenti è atteso — segnaliamolo.

  • Riconosce le Sue pubblicazioni e grant precedenti
  • Allowlist co-autori (produzione dei collaboratori)
  • Esporti il report di classificazione in PDF per i collaboratori
LAB PI

QA pre-pubblicazione di tutto il laboratorio

Rileva problemi sulle submission del laboratorio in una coda unica.

  • Cartella per progetto e per post-doc
  • Residenza UE per dati clinici / primari sensibili
  • Motore Apache 2.0 — difendibile a livello di IRB
WORKFLOW PRE-SUBMISSION

Tre passaggi prima dell'invio del manoscritto al portale della rivista.

Esegua iterativamente. Identifichi intervalli autocitati così non aumentano il Suo punteggio iThenticate / Crossref alla sottomissione. I verdetti AI-detection stanno arrivando, così potrà vederli prima che lo segnali reviewer 2.

01

01 · Bozza + allowlist

Carichi il capitolo / bozza del manoscritto. Aggiunga ORCID e la lista dei Suoi DOI (allowlist): le Sue pubblicazioni precedenti sono marcate SELF-CITE, non plagio. DOI co-autori inclusi se ha collaborato; il motore riconosce il riuso legittimo.

02

02 · Esegua la cascade

L1 winnowing → live-web oggi, con L2 MinHash (v1.1) e L3 vector embeddings (v1.2) in arrivo. Rileva copie testuali e quasi testuali; la copertura del testo parafrasato sarà disponibile con L2 e L3. La classificazione delle citazioni distingue tra materiale citato e parafrasi non citate. Multilingue, con rilevamento calibrato per inglese, spagnolo, portoghese, polacco e ucraino al lancio; altre lingue in arrivo. Tempo mediano per manoscritto: 47 secondi.

03

03 · Revisioni + iterazioni

Il report segnala intervalli per categoria: SELF-CITE (propri, attesi), CITED (citazioni con attribuzione, attesi), CITED-PARA (parafrasi con citazione, basso peso), UNCITED-PARA (da valutare), e AI-LIKELY (con soglia ESL) in arrivo. Riproducibile — commit del motore + istantanea corpus su ogni report.

GESTIONE AUTOCITAZIONE

Sei categorie di riuso lecito — nessuna dovrebbe aumentare il punteggio.

I checker black-box segnalano qualunque corrispondenza di testo come plagio. I ricercatori riutilizzano testo in modo legittimo. Ecco come il classificatore gestisce questi casi.

01 · PROPRIE PUBBLICAZIONI PRECEDENTI

Allowlist ORCID + DOI. I Suoi articoli precedenti vengono marcati SELF-CITE — non segnalati come plagio. Comune in revisioni (“come discusso in Chen 2023...”) e grant dove si costruisce su lavoro proprio.

02 · LAVORI COFIRMATI

Aggiunga gli ORCID dei collaboratori all'allowlist. Gli articoli co-firmati vengono marcati CO-CITE. Utile quando il manoscritto si basa su uno scritto insieme (es. metodi condivisi).

03 · TESTI LABORATORIO

Corpo condiviso PI-folder: metodi standard, protocolli di laboratorio, dichiarazioni etiche che si propagano tra pubblicazioni del laboratorio. Marcati LAB-CITE ed esclusi dal punteggio. Boilerplate IRB già approvato non va riscritto ogni volta.

04 · PRE-PRINT SOTTO EMBARGO

Il proprio pre-print arXiv / bioRxiv del manoscritto in submission. Il classificatore riconosce l’evoluzione pre-print → versione rivista e lo marca PREPRINT-SELF. Non conta sul punteggio. Le riviste che vietano pre-print possono usare regole più restrittive.

05 · CITAZIONI RITIRATE

Crossref Retraction Watch segnala passaggi che citano articoli ritirati. Non modifica il punteggio — ma è informazione utile prima della submission. Intercetta il caso “ho citato un paper ritirato il mese scorso” prima del reviewer.

06 · IRB / SENSIBILI

Endpoint con residenza UE (api.eu.noplag.com) mantiene il manoscritto in infrastruttura UE. Può autocontenere il motore nella propria rete per dati HIPAA / GDPR / pazienti. Apache 2.0 + Docker; nessun traffico lascia il Suo VPC.

MY FOLDERS · VISTA LAB

Organizzato per progetto. Audit-trail per data.

Raggruppi i manoscritti per progetto, anno di laboratorio o ciclo grant. Può riaffrontare le bozze più tardi contro lo stesso commit motore — report riproducibili anche mesi dopo.

MY FOLDERS · Dr. Hirano lab · CompBio24 manoscritti · 6 progetti
RESIDENZA UENuova cartella
CARTELLADOCSULTIMA ATTIVITÀREGIONE
Progetto: coorte espressione PD-L18 manoscrittibozza v3 controllata · 2h faUE
Progetto: revisione sicurezza synthetic-bio5 manoscrittipronto per invio · ieriUE
Grant: rinnovo NIH R01 Y33 manoscrittilit-review v2 controllata · 2g faUE
Testo laboratorio: metodi + etica4 docs · condivisilab-allowlist aggiornato · 1 settimana faUE
Pre-print: arXiv in attesa2 manoscrittiPREPRINT-SELF marcato · 1 settimana faUE
Archivio (2022–2024)12 articoliset di riferimento autocitazioniUE
Tutte le cartelle residenza UE · cifrate at-rest · commit motore IRB-reviewable su ogni reportriproducibilità: motore v0.4.2 attivo
700M+pubblicazioni indicizzate
5lingue di detection al lancio, in espansione
UEendpoint con residenza UE
Apache2.0 · valutabile IRB
Crossref+ Retraction Watch integrato
PROTEZIONE DATI

Tre requisiti per ricerca pre-pubblicazione sensibile in un checker.

01 · RESIDENZA UE

I manoscritti non lasciano mai l’infrastruttura UE

Pro+ su api.eu.noplag.com. Hosting su datacenter Hetzner in UE (Falkenstein + Helsinki). Submission, fingerprint store e report rimangono in UE. GDPR by default; DPA su richiesta.

Utile per collaborazione con partner UE in Horizon Europe.
02 · SELF-HOST

Esegua il motore all’interno della Sua istituzione

Apache 2.0 + Docker compose. Il pipeline completo gira solo sulla Sua infrastruttura. Porti il Suo Postgres + Redis; il corpus è fornito come bundle indicizzabile su Enterprise. Nessun traffico esce dal Suo VPC. La scelta giusta per trial clinici, case study pazienti, o ricerca primaria commerciale sensibile.

Compatibile con cluster Slurm e autenticazione istituzionale esistente (SAML, LDAP, OIDC).
03 · DIRITTO ALLA CANCELLAZIONE

Cancellare ogni fingerprint conservata per Lei

Un click in Impostazioni. Entro 24h, ogni fingerprint, report, allowlist, metadato del Suo account viene cancellato. Conforme GDPR art. 17. Gli utenti self-host hanno accesso diretto al database; nel cloud c’è API di cancellazione documentata.

Log di cancellazione conservato per audit.
IRB-REVIEWABLE

Un motore Apache 2.0 che il Suo IRB può davvero valutare prima di approvare.

La maggioranza dei software antiplagio rallenta in review per le stesse domande: dove va a finire il manoscritto, che algoritmo viene usato, i dati sensibili sono trasmessi, quale percorso per diritto all’oblio, e se la precisione dichiarata si può riprodurre. I vendor closed-source rispondono su call commerciali. Con Apache 2.0, il Suo IRB può clonare il repo, girare il motore su sandbox, auditare i dati, verificare diritto all’oblio end-to-end, e riprodurre gli F1 per lingua pubblicati su test set proprio. Non diciamo che la review sia veloce o facile — diciamo che il Suo IRB la può realmente concludere. Ecco perché uffici data research che prima rifiutavano nuovi vendor ora firmano questa soluzione.

Legga la guida review IRB
DOMANDE IRB · RISPOSTE
Q1Dove va il manoscritto? — Postgres UE tenant-isolated se usa endpoint UE. Testo originale eliminato dopo 30 giorni salvo retention.
Q2Uso per training? — No. I manoscritti inviati non sono mai usati per train dei modelli. Esplicito nella DPA.
Q3Gestione dati sensibili/pazienti? — Esegua il motore solo nella Sua rete. Nessun traffico esce dal Suo VPC. Deploy compatibile HIPAA.
Q4Revisione dell’algoritmo? — Apache 2.0 su github.com/NoplagLabs/noplag-engine. Codice leggibile, verificabile, riproducibile.
Q5Accesso multi-istituzione? — Accesso basato su ruolo per tenant. Audit log su ogni lettura. O self-host così i dati non escono mai.
Q6Diritto all’oblio? — Un click in Impostazioni. Completato in 24 ore. Conforme GDPR art. 17. Log audit conservato.
FAQ

Le domande dell’ufficio ricerca.

Perché cambia la similarità se aggiungo ORCID + DOI?
Perché il motore riclassifica ogni intervallo che corrisponde a una pubblicazione nell’allowlist come SELF-CITE invece di UNCITED-PARA. Le corrispondenze non spariscono — cambia la tag. SELF-CITE pesa quasi zero nel punteggio. Esempio: la Sua tesi cita due volte il proprio pre-print e una volta un co-autore; sono tre intervalli che da “contati” diventano “riuso atteso”.
Il motore si allena sui manoscritti inviati?
No. Il testo inviato viene fingerprinted (solo hash winnowing — firma non reversibile) e salvato sul Suo database tenant-isolated. Il testo è eliminato dopo 30 giorni salvo retention. Il rilevatore AI Binoculars (in arrivo) è pre-addestrato su corpora pubblici; non includiamo manoscritti degli utenti nel training. Tutto scritto in DPA.
E il mio pre-print su arXiv / bioRxiv?
Se inserisce il DOI del pre-print in allowlist, i match vengono marcati PREPRINT-SELF e non pesano sul punteggio. Il motore riconosce il passaggio pre-print → versione rivista. Le riviste che vietano pre-print (alcune ancora lo fanno) possono scegliere allowlist più restrittive — ma la maggior parte (Nature, Cell, NEJM, PLOS) accetta pre-print, e la gestione SELF-CITE riflette questa policy.
Come gestirà l’AI detection i co-autori ESL?
Il rilevamento di testi generati da AI sarà disponibile a breve — previsto nella roadmap v1.2. Al rilascio, utilizzerà una calibrazione per lingua con un verdetto adattato per ESL. Se la firma lessicale indica inglese non madrelingua (frequente nelle collaborazioni internazionali), il verdetto sarà ESL ADJ con un margine di errore documentato, invece di dichiarare assenza totale di rischio. L’articolo di Liang et al. 2023 ha rilevato un 61,3% di FPR su saggi TOEFL per i rilevatori non specializzati; la nostra metodologia di mitigazione è pubblicata su /docs/developers/benchmarks. I coautori ESL non vengono segnalati ingiustamente.
Posso eseguire il motore su un cluster Slurm?
Sì — Apache 2.0 + Docker. Esegui il container dell’engine sui nodi di calcolo del tuo cluster; importa dal filesystem condiviso; genera report in JSON dove la tua pipeline li legge. Utile per controlli batch su un anno di produzione di laboratorio rispetto all’ultimo snapshot del corpus. Script di esempio Slurm sbatch su github.com/NoplagLabs/noplag-engine.
E per dati clinici / pazienti?
Self-host nel Suo VPC. Nessun traffico esce dalla rete. Il motore non richiede internet per indexed-corpus (niente live-web, ma è opzionale). Deploy HIPAA-compatibile se l’infra è configurata; il Suo IT lo gestisce come qualsiasi altro servizio interno.
Differenze con iThenticate alla submission?
iThenticate interviene a submission e l’editor vede la valutazione — non c’è iterazione. Noplag è il Suo autocontrollo prima. La cascade è simile su open-access (anche più ampia post-Plan-S); più ristretta su paywall/subscription accademici dove iThenticate ha licenza. La gestione autocitazione è il bisogno reale per la maggioranza, e iThenticate non la fa bene.
Compatibilità con reference manager (Zotero/Mendeley/EndNote)?
Ingestione allowlist supporta BibTeX, RIS, e ORCID API. Carichi export Zotero o incolli ORCID; allowlist popolato con tutti i Suoi DOI. Sync real-time con Mendeley + EndNote in roadmap v1.2; ora percorso export.
Coverage multilingue su riviste non inglesi?
Il rilevamento è calibrato per inglese, spagnolo, portoghese, polacco e ucraino al lancio; altre lingue in arrivo. Maggiore accuratezza sulle lingue europee (lunga storia di calibrazione). La qualità del rilevamento è testata su PAN-PC-11; la valutazione per lingua è in roadmap. Particolarmente utile nei contesti accademici europei e sudamericani.
E se una citazione viene ritirata dopo la submission?
L’integrazione Crossref Retraction Watch la segnala a ogni nuovo controllo del manoscritto. Se ha già inviato, notifichi l’editor (alcune riviste richiedono gestione esplicita). Il punteggio non cambia, ma avrà l’informazione prima di reviewer 2.

Provi un capitolo col cascade. Veda il breakdown autocitazione.

Carichi una bozza di manoscritto, un capitolo di tesi, o una review grant. Inserisca il Suo ORCID. Veda quali intervalli sono SELF-CITE, CITED, UNCITED-PARA, e AI-LIKELY in arrivo. Gratuito fino a 2.500 parole. Pro+ con residenza UE per materiali pre-pubblicazione sensibili.

Antiplagio per ricercatori pre-sottomissione