Logiciel anti-plagiat pour chercheurs pré-soumission
Vérification des manuscrits pré-soumission sur 700M+ travaux scientifiques. Mes Dossiers suit vos publications précédentes pour que l’auto-citation légitime n’augmente pas le score. Point d’accès résidence UE disponible pour la recherche sensible pré-publication. Moteur Apache 2.0 — vérifiable IRB.
Quatre rôles de recherche. Un seul workflow d’auto-vérification.
Pré-soumission de chapitre de thèse
Itérez sur chaque chapitre. Suivi des auto-citations à travers les versions.
- Vérification par chapitre + historique des versions
- Liste blanche d'auto-citation (votre ORCID + DOIs)
- Bibliographie exclue automatiquement
Manuscrit avant soumission à une revue
iThenticate agit à la soumission; nous intervenons avant.
- Index scientifique en libre accès : 700M+ travaux
- Classification de citation (cité vs paraphrase non citée)
- Tarif Pro fixe · itérations illimitées sans surcoût/crédit
Revue de littérature + validation de proposition
Recycler un argumentaire de subvention passé est courant — identifiez-le.
- Reconnaît vos publications + subventions antérieures
- Liste blanche de co-auteur (travaux antérieurs collaborateurs)
- Export du rapport de classification en PDF pour collaborateurs
Assurance qualité pré-publication au niveau du labo
Détectez les problèmes sur toutes les soumissions du laboratoire en une file.
- Dossier par projet + par postdoc
- Résidence UE pour données primaires cliniques/sensibles
- Moteur Apache 2.0 — défendable devant IRB
Trois étapes avant que le manuscrit n’atteigne la revue.
À itérer. Repérez les intervalles auto-cités pour qu’ils n’augmentent pas votre score iThenticate / Crossref lors de la soumission. Résultats IA en cours de déploiement, pour anticiper ce que le reviewer 2 pourrait relever.
01 · Brouillon + liste blanche
Téléchargez le brouillon du chapitre / manuscrit. Ajoutez votre ORCID + une liste de DOIs (la liste blanche) — vos publications précédentes sont taguées SELF-CITE, pas signalées comme plagiat. Ajoutez les DOIs des co-auteurs si vous avez collaboré ; le moteur reconnaît la réutilisation légitime.
02 · Lancez la cascade
L1 winnowing → web en direct aujourd'hui, L2 MinHash (v1.1) et L3 embeddings vectoriels (v1.2) à venir. Détecte le copier-coller mot à mot et quasi mot à mot ; la détection du plagiat par paraphrase arrive avec L2 et L3. La classification des citations distingue les passages cités des paraphrases non citées. Multilingue, avec une détection calibrée pour l’anglais, l’espagnol, le portugais, le polonais et l’ukrainien au lancement ; d’autres langues suivront. Médiane de 47 secondes par manuscrit.
03 · Revue + itération
Le rapport classe chaque intervalle : SELF-CITE (le vôtre, attendu), CITED (cité avec attribution, attendu), CITED-PARA (paraphrasé avec citation, faible poids), UNCITED-PARA (celui à examiner), et AI-LIKELY (bande ajustée ESL) bientôt disponible. Reproductible — empreinte moteur + copie instantanée du corpus inscrits sur chaque rapport.
Six cas de réutilisation légitime — aucun ne doit augmenter votre score.
Les vérificateurs boîte noire signalent toute concordance comme plagiat. Les chercheurs réutilisent du texte légitimement tout le temps. Voici comment le moteur les traite.
01 · VOS PROPRES TRAVAUX
Liste blanche ORCID + DOIs. Vos articles publiés précédemment sont tagués SELF-CITE lors d'une correspondance — pas signalés comme plagiat. Classique dans les revues de littérature (“comme montré dans Chen 2023…”) et les propositions de subvention fondées sur vos travaux.
02 · TRAVAUX CO-AUTORISÉS
Ajoutez les ORCID des collaborateurs à la liste blanche. Articles co-écrits tagués CO-CITE. Utile si le manuscrit reprend un article co-rédigé — les méthodes types sont partagées légitimement.
03 · TEXTE HÉRITÉ DU LABO
Corpus partagé du PI : protocoles, méthodes standards, énoncés d’éthique qui apparaissent dans les publications du labo. Tagués LAB-CITE, exclus du score. Aucun besoin de réécrire les passages validés par IRB.
04 · PRÉPUBLICATIONS SOUS EMBARGO
Votre propre prépublication arXiv / bioRxiv du manuscrit soumis. Le moteur reconnaît l'évolution préprint → version revue et tag PREPRINT-SELF. Non comptabilisé au score. Pour les revues qui interdisent les préprints, configuration stricte possible.
05 · CITATIONS RÉTRACTÉES
Crossref reçoit les données Retraction Watch et signale tout intervalle qui cite un article rétracté. N'affecte pas votre score de similarité — mais cela vous avertit avant la soumission. Détecte le problème “article cité récemment rétracté” avant qu’un reviewer ne le pointe.
06 · IRB / SENSIBLE
Point d’accès résidence UE (api.eu.noplag.com) garde le manuscrit dans l’infrastructure européenne. Hébergez le moteur en interne pour manuscrits HIPAA / GDPR / données-patients. Apache 2.0 + Docker ; rien ne quitte votre VPC.
Par projet. Traçabilité par date.
Classez vos manuscrits par projet, année, ou cycle de subvention. Relancez des brouillons ultérieurement sur le même moteur — rapports reproductibles même après plusieurs mois.
Trois attentes minimales pour la recherche sensible sur un vérificateur.
Les manuscrits restent sur l’infrastructure UE
Pro+ hébergé sur api.eu.noplag.com. Centres de données Hetzner basés UE (Falkenstein + Helsinki). Soumission, empreintes et rapports restent dans l’UE. Conforme RGPD par défaut ; DPA sur demande.
Exécutez le moteur dans votre institution
Apache 2.0 + Docker compose. Pipeline complet entièrement sur votre infrastructure. Utilisez votre propre Postgres + Redis ; le corpus est fourni en bundle indexable sur l’Enterprise. Aucun trafic en dehors de votre VPC. La bonne réponse pour données cliniques ou recherches sensibles.
Supprimez chaque empreinte détenue
Un clic dans les paramètres. Sous 24h, tous vos rapports, listes blanches et métadonnées sont effacés. Conforme RGPD art. 17. Version auto-hébergée : accès direct à la base. Version cloud : endpoint API documenté.
Un moteur Apache 2.0 vraiment audit-able par votre IRB avant validation.
La plupart des comités institutionnels se bloquent sur ces questions : où va le manuscrit après soumission, que fait l'algorithme de comparaison, les données sensibles transitent-elles, comment fonctionne la suppression des données, la précision annoncée est-elle reproductible ? Chez les fournisseurs fermés, ces réponses arrivent via une démo commerciale. Avec Apache 2.0, votre IRB clone le dépôt, teste le moteur, audite les flux, vérifie l'effacement, reproduit les F1 publiés sur ses propres données. On ne promet pas moins d’effort — on promet une revue réalisable côté IRB. C’est pourquoi des services de données jusque-là opposés à tout vérificateur signent ici.
Lire le guide vérification IRBLes points vérifiés par le bureau recherche.
- Pourquoi mon score change si j’ajoute ma liste ORCID + DOIs ?
- Parce que le moteur reclasse chaque intervalle trouvé dans votre liste blanche comme SELF-CITE au lieu de UNCITED-PARA. Les concordances restent — seulement taguées différemment. Les intervals SELF-CITE ont un poids quasi-nul dans le score affiché. Exemple : si votre chapitre cite deux fois votre propre préprint et une fois un co-auteur, ce sont trois intervalles qui passent de « compté » à « réutilisation attendue ».
- Le moteur s’entraîne-t-il sur les manuscrits soumis ?
- Non. Le texte soumis est fingerprinté (hashes winnowing seulement — signature non réversible) et stocké dans votre base isolée. Texte purgé après 30j sauf si rétention activée. L'IA (Binoculars) à venir sera pré-entraînée sur corpus public ; on n’ajoute pas vos textes. C’est précisé dans le DPA.
- Et mon préprint arXiv/bioRxiv ?
- Si vous ajoutez le DOI à la liste blanche, les concordances sont taguées PREPRINT-SELF et n’entrent pas dans le score. Le moteur sait que l’évolution vers version revue est normale. Pour les revues interdisant les préprints, on peut adapter la liste blanche. La plupart des revues majeures (Nature, Cell, NEJM, PLOS) acceptent les préprints, et le tag SELF reflète cette politique.
- Comment le détecteur IA gérera-t-il les co-auteurs ESL ?
- La détection de contenu généré par IA arrive bientôt — prévue dans la feuille de route v1.2. À sa sortie, elle utilisera une calibration par langue avec un verdict ajusté pour les textes rédigés par des non-natifs. Si la signature lexicale indique un anglais non natif (fréquent dans les collaborations internationales), le verdict sera notifié comme ESL ADJ avec une erreur résiduelle documentée, et non comme absence totale de risque. L’article de Liang et al. 2023 a mesuré 61,3 % de faux positifs sur des essais TOEFL pour les détecteurs naïfs ; notre méthodologie de mitigation est publiée sur /docs/developers/benchmarks. Les co-auteurs ESL ne sont pas signalés à tort.
- Peut-on lancer le moteur sur un cluster Slurm ?
- Oui — Apache 2.0 + Docker. Exécutez le conteneur du moteur sur les nœuds de calcul de votre cluster ; ingestion depuis votre système de fichiers partagé ; génération des rapports au format JSON vers l’emplacement de votre pipeline. Utile pour vérifier en lot la production d’un an de laboratoire contre le dernier instantané du corpus. Exemple de script Slurm sbatch sur github.com/NoplagLabs/noplag-engine.
- Pour les manuscrits en données patients ?
- Auto-hébergez dans votre VPC. Aucun trafic sortant. Le moteur n’a pas besoin d’internet pour indexés (perd seulement la couche vérification web-live, optionnelle). Déploiement HIPAA possible si infra adaptée ; à traiter comme tout service interne.
- Différences avec iThenticate lors de la soumission ?
- iThenticate agit à la soumission, l’éditeur le voit — pas de possibilité d’itérer. Noplag est l’auto-vérification avant cette étape. La cascade compare sur contenu open-access (plus large après Plan-S) ; couverture moindre sur contenus academic paywall où iThenticate a la licence. Gestion des auto-citations ici, un vrai besoin chercheur absent d’iThenticate.
- S’intègre à mon gestionnaire de références (Zotero / Mendeley / EndNote) ?
- Import des listes blanches : BibTeX, RIS, API ORCID directe. Importez l’export Zotero ou votre ORCID ; la liste inclut vos DOIs automatiquement. Sync avec Mendeley + EndNote prévu (feuille de route v1.2) ; pour l’instant, export manuel.
- Couverture multilingue pour articles de revues non-anglophones ?
- La détection est calibrée pour l’anglais, l’espagnol, le portugais, le polonais et l’ukrainien au lancement ; d’autres langues suivront. Les performances sont les plus solides sur les langues européennes (calibration historique étendue). La qualité de détection est évaluée sur PAN-PC-11 ; l’évaluation par langue est prévue. Particulièrement adapté aux contextes académiques européens et sud-américains.
- Quid si un article cité est rétracté après soumission ?
- Crossref détecte cela à chaque re-vérification via Retraction Watch. Si déjà soumis, informez l’éditeur (certaines revues l’exigent explicitement). Ne modifie pas votre score, mais vous le saurez avant le reviewer.
Testez un chapitre sur la cascade. Analysez l’auto-citation.
Déposez un manuscrit, un chapitre ou une revue littéraire. Ajoutez votre ORCID. Intervalles SELF-CITE, CITED et UNCITED-PARA visibles, IA-LIKELY bientôt disponible. Gratuit jusqu’à 2 500 mots. Résidence UE en Pro+ pour pré-publications sensibles.