ACADÉMIQUE700M+ travaux académiques · Apache 2.0

Logiciel anti-plagiat académique citation-aware

Détection de plagiat pensée pour la rédaction scientifique — analyse plus de 700 millions de travaux académiques via OpenAlex, CORE, arXiv, PubMed Central et Crossref. Classification tenant compte des citations. Moteur Apache 2.0 auditable par tout service informatique institutionnel.

0 / 1,500 words
700M+ travaux académiquesClassification sensible aux citationsApache 2.0 · vérifiable par institution
LE CORPUS SCIENTIFIQUE

Cinq sources. Plus de 700 millions de textes. Tous libres d’accès ou enregistrés DOI.

Aucun contenu sous abonnement payant — nous utilisons uniquement les index en libre accès. Couverture large pour la recherche post-Plan-S ; couverture plus faible des archives sous abonnement.

01 · INDEXmensuelle

OpenAlex

250M+ travaux

Index scientifique ouvert — remplace l’ancien Microsoft Academic Graph. Couvre articles, actes, jeux de données, livres dans toutes les disciplines.

02 · ACCÈS OUVERThebdomadaire

CORE

290M+ articles

Le plus grand agrégateur de recherche en accès ouvert. Texte intégral indexé depuis plus de 11 000 dépôts. Fort sur la production européenne et britannique.

03 · PRÉPUBLICATIONquotidienne

arXiv

2,4M+ prépublications

Physique, mathématiques, informatique, biologie quantitative, statistiques, économie. Permet le contrôle croisé avec la version vue récemment par votre relecteur sur arXiv.

04 · BIOMÉDICALhebdomadaire

PubMed Central

10M+ articles

Archive ouverte biomédicale et sciences de la vie. Texte intégral indexé plus métadonnées. Travaux déposés par NIH et flux-miroir de revues.

Crossref · 150M+ travaux enregistrés DOI · utilisé pour la résolution canonique + parcours du graphe de citation
TRAVAILS ACADÉMIQUES

Trois cas d’usage. Un produit.

Préparez une soumission à une revue, soutenez un chapitre de thèse ou finalisez une demande de subvention — le vérificateur s’adapte au contexte, pas l’inverse.

01

01 · Contrôle avant soumission à une revue

Scannez le manuscrit dans l’univers du libre accès avant que la revue ne le fasse. iThenticate / Crossref Similarity Check sera obligatoire à la soumission — il vaut mieux voir ce que voit l’éditeur, avant l’éditeur. Le forfait Pro permet de répéter sur plusieurs versions sans limite de crédits par document.

02

02 · Chapitre de thèse / mémoire

Scindez par chapitre ou collez toute la thèse. L’auto-citation entre chapitres est signalée mais classée séparément (légitime dans une thèse). La bibliographie est exclue du score. L’historique de version compare le chapitre de janvier à la version de mai — voyez ce qui change, ce qui s’améliore, ce qui apparaît.

03

03 · Proposition de subvention / revue de littérature

Les passages réutilisés de précédentes demandes co-rédigées ne devraient pas être signalés comme plagiat. Une revue de littérature correctement citée non plus. Le modèle classe différemment la réutilisation scientifique légitime (vos propres travaux passés, cités) et la reproduction involontaire. Le score reflète ce qui pose réellement problème, pas l’inévitable structurel.

CLASSIFICATION SENSIBLE AUX CITATIONS

Six catégories. Chaque passage trouvé en reçoit une.

Un rapport à 28 % sur une revue de littérature très citée n’a pas la même signification qu’un 28 % sur du paraphrasé sans source. La classification fait la différence.

01 · Citation directe (citée)

Guillemets + citation parenthétique OU note de bas de page. Comptée normalement ; exclue du score de similarité. Styles de citation détectés automatiquement (MLA / APA / Chicago / Harvard / Vancouver / IEEE).

02 · Citation en bloc

Passage en retrait de plus de 40 mots avec citation en fin. Compté normalement. Le motif retrait gauche 1,27 cm + citation est reconnu ; absence du retrait signale un écart de formatage.

03 · Paraphrase (citée)

Correspondance de structure de phrase avec attribution quelque part dans le paragraphe. Pondérée à la baisse. « Smith (2023) soutient… » est reconnue comme attribution légitime.

04 · Connaissance générale

Expressions figurant dans 2 000+ sources indépendantes (« L’eau bout à 100 °C », définitions techniques standards, formules connues). Exclues de la similarité. Seuil ajustable selon la densité terminologique.

05 · Bibliographie

Liste de références détectée par l’en-tête et le format. Exclue du score final. Les références ne sont PAS censées être originales — les signaler fausse le score.

06 · Paraphrase sans attribution

Correspondance structurelle sans citation ni guillemets ni mise en forme de citation en bloc. C’est LA catégorie qui devrait compter pour le score final. Pondérée au maximum ; les autres passages non.

LE RAPPORT SCIENTIFIQUE

Classification par passage. URL par source. Auditabilité complète.

Chaque passage signalé mentionne la source DOI / URL, la catégorie de classification, l’horodatage du corpus et le commit du moteur. Défendable en comité de relecture, commission d’intégrité ou audit informatique.

RAPPORT · 4 217 mots · 47 passages classésLe roman moderniste : une réévaluation · Chapitre 3
Score · 8,2 %Moteur · v0.4.2
#PASSAGE CORRESPONDANT · SOURCECLASSIFICATION
12

Le modernisme est moins un mouvement cohérent qu’une constellation de refus — du réalisme, du progrès, du soi unifié... (Eysteinsson, 1990, p.117).

doi.org/10.7551/mitpress/4596.001.0001 · MIT Press, 1990
CITATION · CITÉE
18

L’insistance d’Eliot sur l’impersonnalité reconfigure le lyrique comme artefact construit plutôt que déversement confessionnel.

Eliot, T.S. (1919). Tradition and the Individual Talent · Egoist Press · doi.org/10.2307/24…
PARA · CITÉE
23

Le roman émerge d’une vision du monde fondamentalement bourgeoise née au XVIIIe siècle.

openalex.org/W12345678 · Watt (1957) — correspondance non citée
ABSENCE CITATION
31

Le courant de conscience chez Joyce doit beaucoup à la psychologie de la durée intérieure de William James.

James, W. (1890). The Principles of Psychology, ch.IX (mentionné dans la liste des citations)
PARA · CITÉE
34

Propre thèse de doctorat déjà publiée, chapitre 1.

ucl-discovery.com/dissertation/2024-Modernism-Chen.pdf · auto-citation, sans attribution dans ce paragraphe
AUTO-CITATION
41

Toutes références — Eysteinsson, Eliot, Joyce, James, Watt, et 32 autres.

Section bibliographie, pp. 38–41
REFS · EXCLUES
Score 8,2 % = poids des paraphrases sans attribution + auto-citations ; passages cités et bibliographie exclus.
  • 700M+travaux académiques indexés
  • 6styles de citation reconnus
  • 5langues calibrées au lancement
  • 3%biais ESL résiduel (documenté)
  • Apache2.0 · vérifiable par commission
DÉFENDABLE EN RELECTURE PAR PAIRS

Trois choses qu’un vérificateur opaque ne passe pas devant une commission.

01 · SCORE REPRODUCTIBLE

Relancez le même texte, même commit

Chaque rapport mentionne X-Engine-Commit et l’horodatage du corpus. Plusieurs mois plus tard, vous pouvez refaire le contrôle avec la même version moteur — même entrée, même algorithme, même résultat. Les vérificateurs fermés recalibrent à la volée et votre score de janvier ne sera pas le même en mai.

La reproductibilité est la base minimale attendue pour l’intégrité académique.
02 · ALGORYTHME AUDITABLE

Source Apache 2.0 sur GitHub — à amener en réunion

Quand la détection IA arrive (bientôt, sur la feuille de route v1.2) et qu’un étudiant conteste le verdict devant la commission, il sera possible de citer le commit moteur, de pointer la ligne de code qui produit la décision, et de montrer la doc de calibration ESL. Pas une capture d’écran d’un support technique.

github.com/NoplagLabs/noplag-engine — public, indexé par Google Scholar.
03 · VERDICT ADAPTÉ ESL

Documenté par Liang et al. 2023 ; une mitigation est prévue sur la feuille de route

Stanford 2023 a mesuré 61,3 % de faux positifs sur des essais TOEFL avec des détecteurs naïfs. Lorsque la détection d’IA de Noplag sera disponible (bientôt, prévue v1.2), le verdict inclura une plage ajustée pour ESL si la signature lexicale indique un anglais non natif. L’erreur résiduelle sera documentée, sans prétendre qu’elle est nulle. Les dérogations sont enregistrées avec le commit de l’engine et la justification.

/docs/developers/benchmarks — méthodologie et scores PAN-PC-11.
ADAPTÉ AUX ACHATS INSTITUTIONNELS

Un moteur Apache 2.0 que le SI de votre établissement peut vraiment relire avant signature.

La plupart des services achats stoppent les solutions de plagiat pour les mêmes questions : où va le document une fois soumis, quel est l’algorithme d’analyse, qui peut accéder aux données, comment fonctionne l’effacement sur demande, la précision annoncée est-elle reproductible ? Chez les acteurs fermés, ces questions n’ont de réponse qu’en call commercial. Avec Apache 2.0, la DSI peut cloner le dépôt, lancer le moteur sur VM, auditer les flux de données, vérifier l’effacement sur demande, et vérifier la performance F1 sur ses propres tests. Il ne s’agit pas d’un processus moins cher — c’est un processus que l’équipe SI peut vraiment conclure. C’est pourquoi des universités qui refusaient tout nouvel éditeur ajoutent celui-ci.

Lire le guide achats
FAQ

Les vraies questions posées par les chercheurs.

Est-ce que cela remplace iThenticate avant soumission ?

Dans la plupart des cas non — si la revue exige iThenticate (Elsevier, Springer, Wiley, IEEE), il sera appliqué à la soumission, quoi qu’il arrive. Noplag sert pour l’auto-contrôle sur plusieurs versions avant cette soumission. iThenticate à 125 $/doc devient vite intenable après 4 versions ; le forfait Pro n’a pas ce blocage. Voir la comparaison complète sur noplag.com/vs-ithenticate.

Et les thèses ProQuest ? Vous ne les avez pas ?

C’est exact — ce manque existe. La base de thèses ProQuest est privative, payante, non dans OpenAlex/CORE. Nous couvrons les ~700M travaux scientifiques en accès ouvert, ce qui est plus large pour la recherche post-Plan-S (journaux majeurs depuis 2018) ; plus étroit pour les anciennes thèses payantes. Si le contrôle de thèses américaines est votre seul besoin, iThenticate reste la référence.

Comment le moteur gère-il les styles de citation hors les six principaux ?

MLA, APA, Chicago / Turabian, Harvard, Vancouver, IEEE sont reconnus par la bibliographie. Pour les styles moins courants (ACS, AMA, ASA, Bluebook, Oxford), le moteur classe quand même sur guillemets et parenthèses proches, mais le validateur spécifique sera livré sur la roadmap v1.2. En auto-hébergement, possibilité de patcher d’autres styles via alignment/.

Quel taux de faux positifs sur les revues très citées ?

Plus faible que l’attendu pour le paraphrasé sans source, car le modèle exclut les passages dûment cités du score principal. Nous mesurons ~3,4 % de faux-positifs sur le sous-échantillon PAN-PC-11 (où la majorité sont des citations légitimes). Les concurrents fermés qui ne distinguent pas les passages cités affichent 12–18 % sur le même corpus.

Puis-je exclure mes propres publications ?

Pro : ajoutez une liste blanche d’auto-citation (votre ORCID, DOIs, URL de dépôt institutionnel). Les correspondances identifiées sont taguées AUTO-CITATION et n’entrent pas dans le score. Utile pour chercheurs dont les demandes de financement s’appuient sur des travaux antérieurs. Réutilisation avec citation attendue, ce n’est pas du plagiat.

Quelle couverture multilingue réelle ?

La détection est calibrée pour l’anglais, l’espagnol, le portugais, le polonais et l’ukrainien au lancement, d’autres langues suivront. La qualité de détection est évaluée sur PAN-PC-11 ; l’évaluation par langue est prévue. Les performances sont les plus solides sur les langues européennes avec la plus longue validation ; les nouvelles langues sont ajoutées au fur et à mesure de leur calibration.

Que signifie « Apache 2.0 » pour l’achat institutionnel ?

Votre équipe IT / DPO / IRB peut cloner github.com/NoplagLabs/noplag-engine, exécuter l’engine sur un environnement de test, auditer les flux de données, vérifier l’effectivité du droit à l’effacement, et reproduire nos résultats de benchmarks publiés sur leur propre corpus de test. Sans signature, sans NDA, sans se fier à notre marketing. Pour les institutions dont la procédure d’achat exige ce niveau de contrôle, c’est la solution.

L’IA détectera-t-elle Claude-3 et Gemini ou seulement GPT ?

La détection d’IA arrive bientôt : prévue sur la feuille de route v1.2, non disponible au lancement. L’approche est Binoculars (Hans et al. 2024), indépendante du modèle : pas d’entraînement par LLM, mais comparaison de la perplexité d’un petit modèle de référence avec le texte testé, ce qui généralise. Les chiffres de précision seront publiés une fois la fonctionnalité validée, pas avant, sur des contenus issus de plusieurs LLM (contre ~70 % sur Claude-3 pour les détecteurs entraînés sur GPT). L’article de méthodologie documente les limites ; elles ne sont pas dissimulées.

Si mon directeur conteste une alerte ?

Chaque passage signalé indique DOI source, horodatage du corpus, commit moteur et motif de classification. Relancez la vérification avec ce commit : le résultat se reproduit à l’identique. Rapport imprimé à présenter en réunion ; parcours de citation cliquable. Nous n’avons pas de mode « faites confiance au score » — c’est propre aux boîtes noires.

Auto-hébergement pour recherche clinique / médicale avec HIPAA ?

Apache 2.0 + Docker — tout reste dans votre réseau. Associez PostgreSQL + Redis sur vos serveurs ; aucune donnée en dehors du VPC. Utile pour brouillons cliniques, cas patients, recherches pré-publication qui ne peuvent passer par le cloud. Les clients entreprise reçoivent le corpus comme bundle indexable.

Analysez un chapitre sur 700M+ travaux académiques.

Déposez un chapitre de thèse, une demande de subvention ou un brouillon. Le rapport sensible aux citations distingue ce qui est attendu, ce qui doit être cité et ce qui est de vous. Gratuit jusqu’à 2 500 mots. Apache 2.0 si vous devez montrer l’algorithme à votre DSI.

Logiciel anti-plagiat académique citation-aware