THÈSEVérification de 50 000 mots · gestion de l’auto-citation

Logiciel anti-plagiat de dissertation avec auto-citation

Vérifiez votre thèse avant la soutenance. L’offre Premium gère 50 000 mots en un passage. L’auto-citation entre chapitres est signalée comme SELF-CITE (standard à ce volume, pas de signalement). Prise en compte des embargos pour les chapitres déjà publiés comme articles. Hébergement UE pour la recherche sur sources primaires sensibles.

0 / 1,500 words
Jusqu’à 50 000 motsAuto-citation entre chapitresHébergement UE · audit IRB possible
POURQUOI UN TRAITEMENT SPÉCIFIQUE POUR LES THÈSES

Quatre aspects d’un doc de 60 000 mots qu’un outil d’essai standard traite mal.

Le classifieur est calibré pour un document scientifique long : l’auto-citation entre chapitres est attendue, l’exclusion automatique de la bibliographie est critique, et le rapport doit pouvoir être reproduit lorsque le jury le demande.

01 · LONGUEUR

Vérification de 50 000 mots d’un coup

L’offre Premium traite une thèse standard (60 000–80 000 mots) en blocs de 50 000 — en général, deux passages suffisent pour l’ensemble. Chapitre par chapitre est le flux de rédaction le plus courant. L’offre gratuite (2 500 mots) ne couvre qu’un extrait ; pratique pour une vérification rapide, pas pour la thèse entière.

02 · AUTO-CITATION

Votre travail antérieur est attendu

Les thèses cumulatives reprennent explicitement vos articles publiés comme chapitres. Ajoutez votre ORCID + liste de DOIs à la liste blanche ; le moteur signale ces intervalles comme SELF-CITE et les exclut du score principal. Idem pour les passages tirés du mémoire de master ou d’examens.

03 · EXCLUSION BIBLIO

Une bibliographie fournie ne gonflera pas le score

Exclusion automatique de la section références (détection par titre + format). À cette longueur, 150–400 sources citées est standard ; compter la bibliographie ferait monter l’affichage initial à 18–22% d’office. Ce n’est pas le cas ici.

04 · ÉCHELLE PLURIANNUELLE

Rédaction étalée sur 3 à 5 ans

Chaque rapport conserve l’identifiant du moteur + l’empreinte du corpus. Relancez un même chapitre sur la même version deux ans plus tard : le verdict est strictement identique. Votre auto-vérification de janvier 2024 et la soutenance en octobre 2026 aboutissent au même résultat : rapport auditable.

LE TEMPS DE RÉDACTION

Trois jalons. La vérification s’adapte à chaque étape.

La majorité des thèses suivent ce parcours : rédaction chapitre → assemblage complet → préparation soutenance. Le contrôle couvre un usage différent à chaque phase.

01

01 · Brouillons de chapitres (mois 1–24)

Vérifiez chaque chapitre au fil de sa rédaction. Repérez une paraphrase sans citation avant que votre directeur ne lise le chapitre 2 pour la 3e fois. Ajoutez la liste blanche (ORCID + DOIs co-auteurs) : l’auto-citation légitime ne gonflera pas le score. Révisez sans consommer de crédits par document — Premium à tarif fixe permet des dizaines de révisions sans surcoût.

02

02 · Assemblage de la thèse (mois 24–32)

Passez la thèse entière (Premium : 50 000 mots à la fois ; pour 80 000 mots, deux passages suffisent). Bibliographie automatiquement exclue. Les auto-citations transversales signalent les passages réutilisés (chapitre 5 repris du 2…) — parfois valide, parfois signal d’un brouillon à retravailler.

03

03 · Préparation soutenance (mois 33–36)

Relancez la version finale sur la même version moteur que vos anciens rapports — résultat strictement identique. Imprimez le rapport par intervalle ; apportez-le à la soutenance. Si le jury demande « ce passage ressemble à votre papier de 2022 », le rapport affiche SELF-CITE avec le DOI source. Reproductible même plusieurs mois après.

GESTION DE L’AUTO-PLAGIAT

Six cas de « recyclage de son propre texte » — aucun ne doit faire échouer une soutenance.

Il est légitime de réutiliser du texte d’articles précédents, de communications, d’examens, de mémoire. Le classifieur sépare les cas attendus de ceux qui exigent une vigilance.

01 · ARTICLES DÉJÀ PUBLIÉS

Vos propres articles (liste blanche ORCID + DOI). Les thèses cumulatives les reprennent en chapitres. Signalé comme SELF-CITE, exclu du score. Les droits du journal peuvent exiger un avertissement ; le classifieur vous indique si un préambule « ce chapitre se base sur… » est nécessaire.

02 · COMMUNICATIONS

Ajoutez les DOIs de congrès (ou URLs ACM/IEEE/ACL) à la liste blanche. Fréquent en doctorat : un papier de conférence devient un chapitre. Signalé SELF-CITE-CONF ; certaines fac autorisent tel quel, d’autres exigent une réécriture. Le rapport indique où se situe la réutilisation.

03 · MÉMOIRE DE MASTER

Ajoutez le lien vers votre mémoire (archive institutionnelle, ProQuest ou portail documentaire). Les revues de littérature sont souvent similaires du master au doctorat. Signalé comme SELF-CITE-MASTERS ; certaines institutions acceptent, d’autres demandent une mention explicite en préface.

04 · QUALIF/COMPS

Certaines facs autorisent d’inclure le dossier de qualification/prospectus ; d’autres exigent une réécriture complète. Le classifieur distingue ces passages recyclés et les signale ; la politique dépend de la direction de thèse. Le moteur ne prend pas la décision à votre place.

05 · CHAPITRES EN CO-RÉDACTION

Certaines thèses reprennent des papiers co-signés en chapitres. Ajoutez l’ORCID du co-auteur à la liste blanche ; les passages associés sont signalés comme CO-SELF-CITE. Il faut spécifier la contribution de chacun (souvent via déclaration CRediT). Le rapport précise les intervalles provenant d’une co-écriture.

06 · RECYCLAGE NON SIGNALÉ

Cas problématique : passages réutilisés sans attribution — y compris brouillons non publiés. Comptés entièrement dans le score principal. Même l’auto-recyclage exige une mention ; beaucoup d’universités considèrent l’auto-plagiat non déclaré comme un manquement à l’intégrité.

LE RAPPORT DE CHAPITRE

À quoi ressemble un rapport en phase de rédaction.

Classification paragraphe par paragraphe avec DOIs sources. Seules les catégories non attribuées alimentent le score. Reproductible sur la même version du moteur plusieurs mois après.

THÈSE · CHAPITRE 4 · 8 420 mots · 64 intervalles · liste blanche activeChapitre 4 : Apprentissage statistique sur graphes bruités
Score principal · 3,2 %SELF-CITE · 24 %v0.4.2
#INTERVALLE · SOURCECLASSIFICATION
08
Nous définissons un graphe bruité comme un triplet (V, E, p) où p attribue à chaque arête une probabilité indépendante de corruption.Votre papier NeurIPS 2023, §2.1 · ORCID + DOI dans la liste blanche · source de chapitre cumulatif
SELF-CITE
12
Les avancées récentes des GNN portent sur la stabilité aux perturbations structurelles (Kim et al. 2022).openalex.org/W93b · attribution + (Kim et al. 2022) présent
PARA·CITED
14
Le spectre du laplacien contrôle la diffusion de l’information à travers le réseau.Hammond et al. (2011), p.142 — cité 4 paragraphes plus haut, reconnaissance continue de l’attribution
PARA·CITED
19
Par convention, les poids des arêtes sont positifs et le graphe non orienté.Formule conventionnelle — correspond à 2 300+ articles de théorie des graphes — formulation standard
COMMON-KNOWLEDGE
23
La robustesse au bruit sur les labels est essentielle pour le déploiement réel des classifieurs semi-supervisés.ACL 2023 de Zhang, co-auteur · liste blanche via ORCID co-auteur · source chapitre co-écrit
CO-SELF-CITE
28
L’algorithme converge vers un minimum local en O(n log n) sous nos hypothèses.Votre tech report non publié (février 2024) — absent de la liste blanche, pas d’attribution
UNATTRIBUTED
41
Bibliographie — Kim, Hammond, Zhang, et 187 autres.Section Références, pp. 240–248
REFS · EXCLUDED
3,2 % = non attribué uniquement. SELF-CITE + CO-SELF-CITE + CITED + COMMON + REFS tous exclus.Moteur v0.4.2 · Export PDF · Reproductible à la soutenance
50 000mots par passage (Premium)
700M+documents scientifiques indexés
6catégories d’auto-citation
5langues détectées au lancement
UEhébergement · audit IRB possible
LÀ OÙ NOUS NE REMPLAÇONS PAS ITHENTICATE

Deux constats honnêtes pour doctorants.

01 · LACUNE PROQUEST

La base de thèses attendue dans votre discipline

iThenticate inclut la base de données de thèses ProQuest (~5M thèses US) ; nous n’y avons pas accès. Si votre jury exige la comparaison avec les thèses américaines antérieures, iThenticate est l’outil adapté pour ce point précis. Nous couvrons ~700M productions scientifiques en accès libre (plus large pour les articles, plus restreint pour les thèses passées). Reconnaissance honnête.

Lire la comparaison iThenticate
02 · OBLIGATIONS REVUES

Quand la revue exige iThenticate au dépôt

Certaines revues (Nature, Cell, NEJM, titres Elsevier) passent sur iThenticate via Crossref Similarity Check. Cela sera fait même si vous avez utilisé un autre outil au préalable — pas de substitut possible. Ce que permet Noplag : itérer en amont sur chaque brouillon, là où le crédit unitaire ($125/doc chez iThenticate) rend le suivi multi-version inaccessible. Les deux sont complémentaires.

Voir le guide de workflow
PRÊT POUR LA SOUTENANCE

Identique au fil des mois. Rapport imprimable pour la soutenance.

Chaque rapport indique le commit du moteur (par exemple v0.4.2) et la date du snapshot du corpus. Relancez le même chapitre avec ce commit deux ans plus tard : le résultat sera strictement identique — pas de réapprentissage discret, pas de surprise « l’algorithme a changé » en pleine soutenance. La classification de chaque intervalle est vérifiable : une étiquette SELF-CITE renvoie au DOI de la source ; une étiquette CITED pointe vers le paragraphe correspondant ; une étiquette UNATTRIBUTED mène à l’URL de la source originale. Apache 2.0 sur github.com/NoplagLabs/noplag-engine — votre jury peut consulter la logique des seuils, le calibrage IA, les règles de déduplication. Les outils propriétaires échouent à ce test : leur rapport dépend de l’état de leur algorithme le jour du contrôle ; si le modèle a été modifié depuis, le rapport présenté en soutenance peut ne plus être reproductible. Ce n’est pas le cas du nôtre.

Voir le guide de soutenance
CHECKLIST THÈSE
ALLOWAjoutez ORCID + DOIs de vos articles, communications, mémoire, co-auteurs
BIBBibliographie détectée automatiquement (titre + format). Complètement exclue. Les références ne gonflent jamais le score.
CHAPTPassez chapitre par chapitre pendant la rédaction. Passage intégral lors de l’assemblage. Vérification finale avant soutenance. Même moteur, même format de rapport.
COMMITChaque rapport intègre le commit moteur + corpus. Reproductible pour la soutenance, même longtemps après.
EUServeur EU pour la recherche primaire sensible. Auto-hébergement possible selon exigence IRB.
DOIChaque passage signalé mentionne DOI · URL canonique · date de capture. Vérifiable par tout membre du jury.
FAQ

Ce que demandent réellement les doctorants.

Puis-je passer la thèse en une fois ou dois-je la découper ?
Le niveau Premium permet jusqu’à 50 000 mots à la fois. Une thèse standard (60 000 à 80 000 mots) nécessite donc deux passes (ch. 1–4 puis 5–8) ou quatre si vous voulez le détail chapitre. Le plus classique est le contrôle par chapitre durant la rédaction ; le passage entier en phase assemblage / soutenance.
Comment la liste blanche d’auto-citation fonctionne-t-elle concrètement ?
Saisissez votre ORCID ; l’outil extrait vos DOIs via l’API publique ORCID. Ajoutez manuellement les DOIs spécifiques des communications / mémoire / co-auteurs. Les passages indexés dans la liste blanche sont tagués SELF-CITE, CO-SELF-CITE ou SELF-CITE-MASTERS — exclus du score principal. Plus d’argument à la soutenance sur « c’est mon texte à la base ».
Et les thèses ProQuest ? Vous ne les avez pas.
Correct, reconnaissance honnête. La base ProQuest (~5M thèses US) est propriétaire/ payante, pas dans OpenAlex/CORE. Si le comité veut absolument couvrir les thèses US, iThenticate a cette base. Nous couvrons ~700M documents Open Access (large pour articles, limité pour thèses anciennes).
Mes brouillons seront-ils stockés ou serviront-ils à entraîner l’IA ?
Non. Les brouillons sont « fingerprintés » (hachage winnowing, signature non réversible) et conservés en base isolée par client. Le texte est purgé après 30 jours sauf choix opt-in (option retenue par la majorité). Les modèles ne sont entraînés que sur corpus public ; aucun manuscrit doctorant n’est intégré. Repris explicitement dans le DPA.
Reproductibilité à la soutenance : concrètement ?
Chaque rapport comporte la version moteur (ex : v0.4.2) + empreinte corpus. Si vous conservez le rapport de janvier 2024 et relancez le chapitre sur v0.4.2 en octobre 2026, la décision sera strictement la même. Chaque intervalle est vérifiable : SELF-CITE → DOI source, CITED → paragraphe concerné, UNATTRIBUTED → URL origine. Les vérificateurs fermés échouent là car le rapport dépend de l’algo du jour.
Ma thèse inclut des données patients / classifiées. Puis-je auto-héberger ?
Oui. Apache 2.0 + Docker, exécution intégrale sur le réseau interne de l’institution. Aucun flux sortant du VPC. Adapté à la recherche clinique, données IRB, documents sous embargo/confidentiels. Le moteur n’a pas besoin d’accès Internet pour le corpus indexé ; la couche Web est facultative.
Comment le détecteur IA gérera un doc de 60 000 mots, mélange IA / humain ?
Détection IA « bientôt » — sur la feuille de route, pas disponible au lancement. Prévu : score de probabilité IA paragraphe par paragraphe (Binoculars, Hans et al. 2024). Le verdict sera par paragraphe, jamais global — un chapitre initialement rédigé avec Grammarly puis réécrit sera classé différemment section par section. Un biais ESL s’applique si la signature lexicale suggère de l’anglais non natif. Méthodologie publiée  : défendable en soutenance.
Et les thèses cumulatives — les chapitres articles sont acceptés ?
Beaucoup d’universités l’acceptent explicitement (fréquent en Allemagne, Pays-Bas, Scandinavie ; UK/US de plus en plus). Les contrats de publication admettent souvent la réutilisation du texte dans la thèse en citant l’article. Ajoutez les DOIs publiés à la liste blanche ; le moteur taggue en SELF-CITE. Reste à suivre la politique de la fac + des revues.
Si un directeur ou jury conteste un signalement ?
Chaque intervalle signalé est accompagné du DOI source, de l’URL canonique, de la date du snapshot et du commit du moteur. Affichez la source originale en parallèle ; exposez la logique de classification pour chaque intervalle. Le moteur est sous licence Apache 2.0 sur github.com/NoplagLabs/noplag-engine — votre comité peut examiner la logique des seuils, ligne par ligne. C’est cela, une approche réellement « défendable » : citation de la méthodologie, verdict reproductible, algorithme ouvert.
Quel coût pour 3 à 5 ans d’écriture ?
Premium $79/mois, usage illimité pendant la rédaction ; résiliable à tout moment, reprise ultérieure (vos dossiers restent stockés). La majorité des doctorants gardent Premium 6–12 mois sur 4 ans, en pause le reste. Le tarif fixe compte ici : à $125/doc (iThenticate), cent révisions coûteraient des milliers de dollars.

Testez un chapitre. Rapport reproductible pour la soutenance.

Collez un chapitre dans Noplag. Ajoutez votre ORCID. Obtenez les classifications SELF-CITE, CITED, UNATTRIBUTED. L’offre gratuite couvre 2 500 mots pour un extrait ; Premium $79/mois permet 50 000 mots pour la thèse complète.

Logiciel anti-plagiat de dissertation avec gestion citations