Logiciel anti-plagiat pour éditeurs
Contrôles pré-publication des soumissions freelance, audits de syndication pour les contenus republiés, et une API REST à brancher dans votre CMS. Moteur détecteur : Apache 2.0 — lisible avant adoption, pas après.
Quatre rédactions. Un seul workflow.
Valider une proposition freelance avant affectation
10 minutes par soumission, avant d’engager le budget d’édition.
- Coller un texte ou extrait, voir les versions déjà publiées
- Probabilité IA par paragraphe (à venir), tenant compte de l’ESL
- Éviter les allers-retours sur « est-ce original ? »
Contrôler la file d’articles avant publication
Scan en masse des articles du jour avant la mise en file d’attente sur le CMS.
- Vue file triée par similarité + score IA
- Seuils par rubrique (opinion, actu, critique)
- Historique d’audit par journaliste pour le pôle standards
Examiner une soumission contestée
Lire d’abord l’algorithme, puis les passages concernés.
- Reproductibilité X-Engine-Commit
- Annotez la décision avec le motif documenté
- Apache 2.0 — opposable lors d’une relecture sur la page corrections
Auditer les partenaires qui vous republient
Suivi du statut des balises canoniques sur le réseau de syndication.
- Détection tenant compte de la canonique (ORIGIN / SYND OK / LEAK)
- Rapport différentiel hebdomadaire par partenaire
- Dossier de preuve DMCA sur demande
Trois étapes avant que l’article n’atteigne la file de publication du CMS.
Intégré à votre flux éditorial via API, exécuté en passe groupée avant mise sous presse, ou unitaire depuis le tableau de bord. Moteur unique, même format de rapport, s’adapte au poste.
01 · Réception
La soumission arrive dans la file de votre CMS : glissez-déposez le .docx / .gdoc / collez, ou le CMS pousse via webhook. Métadonnées auteur + rubrique + éditeur assigné transmises avec le document pour le journal d’audit.
02 · Analyse + classification
Cascade vérifiée sur le Web ouvert + Common Crawl + (option) votre propre corpus d’archives. La classification distingue citations (attribuées) et paraphrase sans source. Probabilité IA par paragraphe (à venir), ESL pris en compte. Médiane : 42 s par article.
03 · Décider + publier
L’éditeur voit : similarité du titre, détails par catégorie, sources triables (le score IA ajusté ESL arrive). Trois actions : publier, renvoyer avec notes, escalader au pôle standards. Décision journalisée avec commit moteur + instantané du corpus.
Quatre CMS, un seul contrat REST.
Branchez Noplag dans le CMS que vos journalistes utilisent déjà. L’API est identique : seule l’intégration change (hooks WordPress, actions Ghost, events Drupal, ou vos propres webhooks).
Plugin officiel sur WordPress.org. Compatible Gutenberg.
- Meta-box pré-publication sur tous les types de post
- Mise en surbrillance, niveau bloc dans l’éditeur
- Journal d’audit via WP REST API
Webhook + consommateur Admin API. Compatible contenu-membre.
- Webhook pré-publication déclenché sur save_draft
- Politique de scan par tag selon le type de contenu
- Auto-hébergeable (Noplag auto-hébergé + Ghost auto-hébergé)
Module contrib sur drupal.org. Attaché via l’API champ.
- Champ plagiat par type de contenu
- Intégration au workflow avec modération de contenu
- Configuration multi-sites prise en charge
Webhooks + spéc. OpenAPI 3.0. Pour CMS headless, système interne, ou autre.
- POST /v1/checks depuis n’importe quel hook CMS
- Callbacks webhook signés HMAC
- SDK Python + Node générés depuis la spéc OpenAPI
La file de publication du jour. Triable, auditée.
Lignes par article : journaliste, rubrique, similarité, score IA, accès direct au rapport surligné. Triable. Approuvez en masse, escaladez le reste.
Voyez qui vous republie — et si la balise canonique pointe chez vous.
Suivi de votre réseau de distribution
Ajoutez les domaines syndiqués (Medium, LinkedIn, Substack, vos partenaires) à une liste blanche. Les rapports hebdo listent qui pointe le rel=canonical vers vous (ORIGIN crédit), qui l’omit (fuite SEO), qui republie sans permission (SCRAPED).
Sur quel blog manque votre signature ?
Scans diff mensuels du Web ouvert révèlent les domaines hors liste publiant des passages similaires. Concordance datée avec capture d’écran — preuve DMCA datée dès l’apparition. Nous ne déposons pas la DMCA — on vous fournit le dossier.
Duplication interne sur vos pages
Scan pro par dossier : déposez votre corpus dans un dossier, le moteur produit une matrice de similitude sur chaque couple. Repère les 47 pages-ville avec le même paragraphe. Risque Helpful Content Update à anticiper.
Trois politiques que votre pôle standards exigera avant le contrat.
Premièrement — les articles soumis ne servent jamais à entraîner un modèle. Ni le nôtre, ni celui d’un tiers. Le texte soumis est empreinté, indexé dans votre espace locataire, puis supprimé après 30 jours sauf conservation explicite. Deuxièmement — le verdict IA (à venir, prévu sur la feuille de route) sera donné par paragraphe, pas par article, et portera l’identifiant du commit du moteur ainsi que l’horodatage du snapshot du corpus. Un signalement IA contesté pourra être reproduit des mois plus tard avec le même commit. Aucun réentraînement silencieux. Troisièmement — la licence Apache 2.0 permet à votre équipe technique de cloner github.com/NoplagLabs/noplag-engine, de l’exécuter sur votre propre infrastructure, d’auditer les flux de données et de vérifier l’effacement des données de bout en bout. La plupart des audits d’achat institutionnels de logiciels de détection de plagiat bloquent sur ces trois points ; nous avons voulu y répondre d’emblée.
Lire le guide du pôle standardsLes vraies questions du pôle standards avant choix logiciel.
- Vos articles serviront-ils à entraîner votre IA ?
- Non. Articles soumis : seules empreintes (hash winnowing), indexés dans une base isolée par tenant. Texte supprimé après 30 jours sauf choix explicite de conservation. Le modèle IA — Binoculars-based (Hans et al. 2024), sur feuille de route — sera pré-entraîné sur corpus publics ; jamais sur des contenus clients. C’est dans le DPA.
- Comment le verdict IA par paragraphe résiste-t-il en cas de litige ?
- La détection de contenu IA arrive bientôt — prévue sur la feuille de route v1.2, non disponible au lancement. Lorsqu’elle sera en ligne, chaque paragraphe signalé portera l’identifiant du commit du moteur et du snapshot du corpus. Relancer le même paragraphe avec ce commit reproduira exactement le verdict. L’algorithme est ouvert sur github.com/NoplagLabs/noplag-engine (Apache 2.0), le seuil de perplexité est documenté, ainsi que l’ajustement pour ESL. Il n’existe pas de mode « faites confiance au score ».
- Et les freelances sur réseaux lents ?
- La détection est calibrée pour l’anglais, l’espagnol, le portugais, le polonais et l’ukrainien au lancement ; d’autres langues suivront. La qualité de détection est évaluée sur PAN-PC-11 ; l’évaluation par langue est prévue sur la feuille de route. Les verdicts IA ajustés pour ESL signalent un anglais non natif comme ESL ADJ au lieu de LIKELY-AI lorsque la signature lexicale l’indique.
- Auto-hébergement possible, interne newsroom ?
- Oui — Apache 2.0 + Docker. Tourne totalement sur votre réseau. Couplé à vos Postgres + Redis internes ; rien ne sort du VPC. Intérêt : protection source stricte ou confidentialité avant publication.
- CMS supportés ?
- WordPress (plugin officiel), Ghost (Admin API + webhooks), Drupal (module contrib). Autre : CMS interne, headless : REST + OpenAPI 3.0 pour bâtir un hook pré-publication en moins d’une journée. SDK Python, Node fournis.
- À quoi sert vraiment l’audit de syndication ?
- Ajoutez vos domaines de distribution sur liste blanche (medium.com/@vous, domaines partenaires). Rapport hebdo : statut de canonique — ORIGIN (pointe chez vous), SYND OK (par un partenaire), LEAK (pointe ailleurs ou absent), SCRAPED (copie conforme, domaine hors liste). Pour SCRAPED : extrait avec capture datée, preuve DMCA.
- Tarif newsroom 30 journalistes ?
- Premium : 79 $/mois, 5 000 mots/contrôle, 5 000 articles/mois, API complète + CMS. Volume élevé (> 10 000 articles/mois) : contrat entreprise — tarif sur corpus + infra dédiée. Pas de licence par siège ; le volume compte.
- Et les tribunes, syndication, extraits, où la réutilisation est permise ?
- Seuils personnalisés par section sur Pro+ : sensibilité selon actu, opinion, critique, extrait syndiqué. Une tribune citant un discours parlementaire mot pour mot n’a pas à déclencher l’alerte comme une actu recopiée. La classification distingue citation légitime et réutilisation accidentelle.
- Impact sur le flux de publication ?
- Médiane : 47 sec par article (1 500–4 000 mots). Le hook CMS est async : déclenché dès save_draft, verdict affiché après relecture. Format long (+8 000 mots) : environ 90 s, possible en tâche pré-publication.
- Ajout de l’archive maison au corpus possible ?
- Oui — niveau Enterprise. Import en masse de contenu archivé dans corpus privé par tenant : le moteur vérifie chaque nouvelle soumission contre l’archive. Détecte l’auto-recyclage (légitime parfois), et la réutilisation intentionnelle sous nouvelle signature.
Testez un brouillon dans la file. Voyez la vue par article.
Déposez un document Word, Google Doc ou article exporté du CMS. Rapport par paragraphe en 47 secondes. Gratuit jusqu’à 2 500 mots ; plan Pro pour le volume ; Enterprise pour corpus + infra dédiée.