Statistiche sul plagio
Metodologia

Come calcoliamo questi dati.

Ogni dato presente su questo sito rappresenta un tasso di ritrattazione per plagio: quante ritrattazioni per plagio sono state registrate da un paese, istituzione o disciplina, divise per il numero di pubblicazioni prodotte. In questa pagina sono documentati in dettaglio il metodo di calcolo di ciascun dato, il livello di confidenza associato e i bias da considerare quando si cita il dato.

Fase 1

Come conteggiamo

Il numeratore proviene dal database Retraction Watch (ospitato da Crossref, circa 70 000 record). Consideriamo solo i record il cui motivo riporta il codice rigoroso plagiarism of/in — una constatazione esplicita di plagio, escludendo segnali meno chiari come "eufemismi per plagio" o duplicazione. Nel periodo 2015–2024 si tratta di 1,879 record distinti.

Il collegamento che conta

L'attribuzione a istituzione e disciplina avviene tramite collegamento del DOI dell'articolo su OpenAlex — mai tramite il campo di affiliazione testuale libero di Retraction Watch. OpenAlex ha già risolto le affiliazioni di ciascun lavoro agli identificativi canonici ROR e assegnato la disciplina, quindi una ricerca tramite DOI restituisce l'istituzione e il settore corretti. Risolvere invece la stringa di affiliazione testuale porta a partire dal dipartimento e ad associare erroneamente frammenti all'istituzione sbagliata — un'attribuzione errata che escludiamo esplicitamente.

Circa il 91% dei record di plagio riporta un DOI; circa il 90% di questi si collega a una istituzione ROR, quindi circa quattro record su cinque sono attribuiti a un'istituzione canonica.

FontiRetraction Watch (eventi di ritrattazione e motivazioni), OpenAlex (pubblicazioni, affiliazioni, discipline), Crossref (metadati DOI), ROR (identità delle istituzioni). Tutte fonti gratuite e con licenza open source.
DenominatoreConteggi delle pubblicazioni OpenAlex per la stessa entità e periodo. I conteggi per paese utilizzano il paese di affiliazione dell'autore; quelli per istituzione utilizzano l'identificativo ROR.
Fase 2

Come normalizziamo

I valori assoluti sono fuorvianti: i sistemi di ricerca ad alta produttività accumulano più revoche semplicemente perché pubblicano di più. Per conteggio assoluto China è in testa con 564; per tasso si attesta a 7.0 ogni 100k. Per questo motivo riportiamo i tassi e il sistema è progettato affinché non possa classificare le entità per numero assoluto.

Tasso per 100 000 pubblicazioniLa metrica principale per ogni entità. Comparabile tra entità di dimensioni molto diverse.
Intervalli di confidenza Wilson al 95%Ogni tasso è accompagnato da un intervallo. Numeratori piccoli producono intervalli ampi — un segnale a interpretare il tasso con cautela e non come una stima puntuale.
Finestre mobili, non singoli anniLe revoche seguono la pubblicazione originale con anni di ritardo, quindi un singolo anno è troppo scarso per essere rappresentativo. L’unità predefinita è una finestra pluriennale.
Soglia minima di volumeLe entità con meno di 100 000 pubblicazioni nella finestra sono escluse — un numero troppo basso rende il tasso statisticamente irrilevante.
Fase 3

Affidabilità della fonte, per ogni dato

Ogni statistica è accompagnata dall’indicazione della metodologia di produzione, così da poterla valutare prima di citarla.

Direct measurement

Counted from primary records (Retraction Watch).

Curated aggregate

Compiled from multiple primary sources.

Modeled / inferred

Statistical extrapolation with stated confidence.

Survey-based

Self-reported, with sampling limitations.

Leggere prima di consultare

Bias e limiti noti

Misuriamo il plagio rilevato, non quello commessoQueste sono revoche rilevate e registrate. Il divario tra tasso rilevato e reale esiste e non è misurato; non presentiamo mai questi dati come tassi totali di plagio.
Bias di indicizzazione verso la lingua ingleseRetraction Watch e OpenAlex sovrarappresentano le riviste in lingua inglese. Un paese con controlli rigorosi può rilevare (e quindi registrare) più casi, non necessariamente commetterne di più.
Copertura non uniformeLa copertura delle fonti varia a seconda della regione; escludiamo le entità la cui copertura è troppo limitata per consentire un coefficiente affidabile.
Il denominatore comprende tutte le pubblicazioni (per ora)L’attuale denominatore include tutte le pubblicazioni OpenAlex, non solo gli articoli di riviste, il che porta a una lieve sottostima dei coefficienti. È previsto un perfezionamento con un denominatore limitato ai soli articoli.
Per i ricercatori

Riproducilo autonomamente

L’intera procedura richiede solo due chiamate HTTP gratuite e senza chiavi, più una join. Nessuna API key, nessun livello a pagamento.

# 1. Database Retraction Watch (~65MB CSV)
curl "https://api.labs.crossref.org/data/retractionwatch?mailto=YOU@example.com" \
  -o retraction_watch.csv

# 2. Pubblicazioni OpenAlex per paese, 2015–2024 (il denominatore)
curl "https://api.openalex.org/works?filter=publication_year:2015-2024\
&group_by=authorships.institutions.country_code&per-page=200&mailto=YOU@example.com"

# 3. Mantieni solo i record con motivazione precisa 'plagiarism of/in', attribuisci tramite DOI,
#    dividi per il numero di pubblicazioni, ×100 000. Intervallo di Wilson per l’intervallo di confidenza.

L’implementazione di riferimento si trova nella pipeline stats/ del progetto.

Cita e riutilizza

I dati sono pubblicati con licenza CC-BY 4.0 — riutilizzo libero, anche a fini commerciali, con attribuzione a Noplag Plagiarism Statistics.

Torna ai dati
Come calcoliamo le statistiche sul plagio — metodologia