Logiciel anti-plagiat académique citation-aware
Détection de plagiat pensée pour la rédaction scientifique — analyse plus de 700 millions de travaux académiques via OpenAlex, CORE, arXiv, PubMed Central et Crossref. Classification tenant compte des citations. Moteur Apache 2.0 auditable par tout service informatique institutionnel.
Cinq sources. Plus de 700 millions de textes. Tous libres d’accès ou enregistrés DOI.
Aucun contenu sous abonnement payant — nous utilisons uniquement les index en libre accès. Couverture large pour la recherche post-Plan-S ; couverture plus faible des archives sous abonnement.
OpenAlex
250M+ travauxIndex scientifique ouvert — remplace l’ancien Microsoft Academic Graph. Couvre articles, actes, jeux de données, livres dans toutes les disciplines.
CORE
290M+ articlesLe plus grand agrégateur de recherche en accès ouvert. Texte intégral indexé depuis plus de 11 000 dépôts. Fort sur la production européenne et britannique.
arXiv
2,4M+ prépublicationsPhysique, mathématiques, informatique, biologie quantitative, statistiques, économie. Permet le contrôle croisé avec la version vue récemment par votre relecteur sur arXiv.
PubMed Central
10M+ articlesArchive ouverte biomédicale et sciences de la vie. Texte intégral indexé plus métadonnées. Travaux déposés par NIH et flux-miroir de revues.
Trois cas d’usage. Un produit.
Préparez une soumission à une revue, soutenez un chapitre de thèse ou finalisez une demande de subvention — le vérificateur s’adapte au contexte, pas l’inverse.
01 · Contrôle avant soumission à une revue
Scannez le manuscrit dans l’univers du libre accès avant que la revue ne le fasse. iThenticate / Crossref Similarity Check sera obligatoire à la soumission — il vaut mieux voir ce que voit l’éditeur, avant l’éditeur. Le forfait Pro permet de répéter sur plusieurs versions sans limite de crédits par document.
02 · Chapitre de thèse / mémoire
Scindez par chapitre ou collez toute la thèse. L’auto-citation entre chapitres est signalée mais classée séparément (légitime dans une thèse). La bibliographie est exclue du score. L’historique de version compare le chapitre de janvier à la version de mai — voyez ce qui change, ce qui s’améliore, ce qui apparaît.
03 · Proposition de subvention / revue de littérature
Les passages réutilisés de précédentes demandes co-rédigées ne devraient pas être signalés comme plagiat. Une revue de littérature correctement citée non plus. Le modèle classe différemment la réutilisation scientifique légitime (vos propres travaux passés, cités) et la reproduction involontaire. Le score reflète ce qui pose réellement problème, pas l’inévitable structurel.
Six catégories. Chaque passage trouvé en reçoit une.
Un rapport à 28 % sur une revue de littérature très citée n’a pas la même signification qu’un 28 % sur du paraphrasé sans source. La classification fait la différence.
01 · Citation directe (citée)
Guillemets + citation parenthétique OU note de bas de page. Comptée normalement ; exclue du score de similarité. Styles de citation détectés automatiquement (MLA / APA / Chicago / Harvard / Vancouver / IEEE).
02 · Citation en bloc
Passage en retrait de plus de 40 mots avec citation en fin. Compté normalement. Le motif retrait gauche 1,27 cm + citation est reconnu ; absence du retrait signale un écart de formatage.
03 · Paraphrase (citée)
Correspondance de structure de phrase avec attribution quelque part dans le paragraphe. Pondérée à la baisse. « Smith (2023) soutient… » est reconnue comme attribution légitime.
04 · Connaissance générale
Expressions figurant dans 2 000+ sources indépendantes (« L’eau bout à 100 °C », définitions techniques standards, formules connues). Exclues de la similarité. Seuil ajustable selon la densité terminologique.
05 · Bibliographie
Liste de références détectée par l’en-tête et le format. Exclue du score final. Les références ne sont PAS censées être originales — les signaler fausse le score.
06 · Paraphrase sans attribution
Correspondance structurelle sans citation ni guillemets ni mise en forme de citation en bloc. C’est LA catégorie qui devrait compter pour le score final. Pondérée au maximum ; les autres passages non.
Classification par passage. URL par source. Auditabilité complète.
Chaque passage signalé mentionne la source DOI / URL, la catégorie de classification, l’horodatage du corpus et le commit du moteur. Défendable en comité de relecture, commission d’intégrité ou audit informatique.
Le modernisme est moins un mouvement cohérent qu’une constellation de refus — du réalisme, du progrès, du soi unifié... (Eysteinsson, 1990, p.117).
doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990L’insistance d’Eliot sur l’impersonnalité reconfigure le lyrique comme artefact construit plutôt que déversement confessionnel.
Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…Le roman émerge d’une vision du monde fondamentalement bourgeoise née au XVIIIe siècle.
openalex.org/W12345678 · Watt (1957) — correspondance non citéeLe courant de conscience chez Joyce doit beaucoup à la psychologie de la durée intérieure de William James.
James, W. (1890). The Principles of Psychology, ch.IX (mentionné dans la liste des citations)Propre thèse de doctorat déjà publiée, chapitre 1.
ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · auto-citation, sans attribution dans ce paragrapheToutes références — Eysteinsson, Eliot, Joyce, James, Watt, et 32 autres.
Section bibliographie, pp. 38–41- 700M+travaux académiques indexés
- 6styles de citation reconnus
- 5langues calibrées au lancement
- 3%biais ESL résiduel (documenté)
- Apache2.0 · vérifiable par commission
Trois choses qu’un vérificateur opaque ne passe pas devant une commission.
Relancez le même texte, même commit
Chaque rapport mentionne X-Engine-Commit et l’horodatage du corpus. Plusieurs mois plus tard, vous pouvez refaire le contrôle avec la même version moteur — même entrée, même algorithme, même résultat. Les vérificateurs fermés recalibrent à la volée et votre score de janvier ne sera pas le même en mai.
Source Apache 2.0 sur GitHub — à amener en réunion
Quand la détection IA arrive (bientôt, sur la feuille de route v1.2) et qu’un étudiant conteste le verdict devant la commission, il sera possible de citer le commit moteur, de pointer la ligne de code qui produit la décision, et de montrer la doc de calibration ESL. Pas une capture d’écran d’un support technique.
Documenté par Liang et al. 2023 ; une mitigation est prévue sur la feuille de route
Stanford 2023 a mesuré 61,3 % de faux positifs sur des essais TOEFL avec des détecteurs naïfs. Lorsque la détection d’IA de Noplag sera disponible (bientôt, prévue v1.2), le verdict inclura une plage ajustée pour ESL si la signature lexicale indique un anglais non natif. L’erreur résiduelle sera documentée, sans prétendre qu’elle est nulle. Les dérogations sont enregistrées avec le commit de l’engine et la justification.
Un moteur Apache 2.0 que le SI de votre établissement peut vraiment relire avant signature.
La plupart des services achats stoppent les solutions de plagiat pour les mêmes questions : où va le document une fois soumis, quel est l’algorithme d’analyse, qui peut accéder aux données, comment fonctionne l’effacement sur demande, la précision annoncée est-elle reproductible ? Chez les acteurs fermés, ces questions n’ont de réponse qu’en call commercial. Avec Apache 2.0, la DSI peut cloner le dépôt, lancer le moteur sur VM, auditer les flux de données, vérifier l’effacement sur demande, et vérifier la performance F1 sur ses propres tests. Il ne s’agit pas d’un processus moins cher — c’est un processus que l’équipe SI peut vraiment conclure. C’est pourquoi des universités qui refusaient tout nouvel éditeur ajoutent celui-ci.
Lire le guide achatsLes vraies questions posées par les chercheurs.
Est-ce que cela remplace iThenticate avant soumission ?
Dans la plupart des cas non — si la revue exige iThenticate (Elsevier, Springer, Wiley, IEEE), il sera appliqué à la soumission, quoi qu’il arrive. Noplag sert pour l’auto-contrôle sur plusieurs versions avant cette soumission. iThenticate à 125 $/doc devient vite intenable après 4 versions ; le forfait Pro n’a pas ce blocage. Voir la comparaison complète sur noplag.com/vs-ithenticate.
Et les thèses ProQuest ? Vous ne les avez pas ?
C’est exact — ce manque existe. La base de thèses ProQuest est privative, payante, non dans OpenAlex/CORE. Nous couvrons les ~700M travaux scientifiques en accès ouvert, ce qui est plus large pour la recherche post-Plan-S (journaux majeurs depuis 2018) ; plus étroit pour les anciennes thèses payantes. Si le contrôle de thèses américaines est votre seul besoin, iThenticate reste la référence.
Comment le moteur gère-il les styles de citation hors les six principaux ?
MLA, APA, Chicago / Turabian, Harvard, Vancouver, IEEE sont reconnus par la bibliographie. Pour les styles moins courants (ACS, AMA, ASA, Bluebook, Oxford), le moteur classe quand même sur guillemets et parenthèses proches, mais le validateur spécifique sera livré sur la roadmap v1.2. En auto-hébergement, possibilité de patcher d’autres styles via alignment/.
Quel taux de faux positifs sur les revues très citées ?
Plus faible que l’attendu pour le paraphrasé sans source, car le modèle exclut les passages dûment cités du score principal. Nous mesurons ~3,4 % de faux-positifs sur le sous-échantillon PAN-PC-11 (où la majorité sont des citations légitimes). Les concurrents fermés qui ne distinguent pas les passages cités affichent 12–18 % sur le même corpus.
Puis-je exclure mes propres publications ?
Pro : ajoutez une liste blanche d’auto-citation (votre ORCID, DOIs, URL de dépôt institutionnel). Les correspondances identifiées sont taguées AUTO-CITATION et n’entrent pas dans le score. Utile pour chercheurs dont les demandes de financement s’appuient sur des travaux antérieurs. Réutilisation avec citation attendue, ce n’est pas du plagiat.
Quelle couverture multilingue réelle ?
La détection est calibrée pour l’anglais, l’espagnol, le portugais, le polonais et l’ukrainien au lancement, d’autres langues suivront. La qualité de détection est évaluée sur PAN-PC-11 ; l’évaluation par langue est prévue. Les performances sont les plus solides sur les langues européennes avec la plus longue validation ; les nouvelles langues sont ajoutées au fur et à mesure de leur calibration.
Que signifie « Apache 2.0 » pour l’achat institutionnel ?
Votre équipe IT / DPO / IRB peut cloner github.com/NoplagLabs/noplag-engine, exécuter l’engine sur un environnement de test, auditer les flux de données, vérifier l’effectivité du droit à l’effacement, et reproduire nos résultats de benchmarks publiés sur leur propre corpus de test. Sans signature, sans NDA, sans se fier à notre marketing. Pour les institutions dont la procédure d’achat exige ce niveau de contrôle, c’est la solution.
L’IA détectera-t-elle Claude-3 et Gemini ou seulement GPT ?
La détection d’IA arrive bientôt : prévue sur la feuille de route v1.2, non disponible au lancement. L’approche est Binoculars (Hans et al. 2024), indépendante du modèle : pas d’entraînement par LLM, mais comparaison de la perplexité d’un petit modèle de référence avec le texte testé, ce qui généralise. Les chiffres de précision seront publiés une fois la fonctionnalité validée, pas avant, sur des contenus issus de plusieurs LLM (contre ~70 % sur Claude-3 pour les détecteurs entraînés sur GPT). L’article de méthodologie documente les limites ; elles ne sont pas dissimulées.
Si mon directeur conteste une alerte ?
Chaque passage signalé indique DOI source, horodatage du corpus, commit moteur et motif de classification. Relancez la vérification avec ce commit : le résultat se reproduit à l’identique. Rapport imprimé à présenter en réunion ; parcours de citation cliquable. Nous n’avons pas de mode « faites confiance au score » — c’est propre aux boîtes noires.
Auto-hébergement pour recherche clinique / médicale avec HIPAA ?
Apache 2.0 + Docker — tout reste dans votre réseau. Associez PostgreSQL + Redis sur vos serveurs ; aucune donnée en dehors du VPC. Utile pour brouillons cliniques, cas patients, recherches pré-publication qui ne peuvent passer par le cloud. Les clients entreprise reçoivent le corpus comme bundle indexable.
Analysez un chapitre sur 700M+ travaux académiques.
Déposez un chapitre de thèse, une demande de subvention ou un brouillon. Le rapport sensible aux citations distingue ce qui est attendu, ce qui doit être cité et ce qui est de vous. Gratuit jusqu’à 2 500 mots. Apache 2.0 si vous devez montrer l’algorithme à votre DSI.