WEB250 M+ pages · sensible au canonique

Logiciel anti-plagiat pour contenu dupliqué en ligne

Repérez du contenu dupliqué sur le web en direct, dans vos dossiers, et dans la bibliothèque de contenu de votre équipe. Sensible au canonique : distingue syndication légitime et copies récupérées. Gratuit jusqu’à 2 500 mots ; examen par dossier avec Pro.

0 / 1,500 words
Web + Common Crawl indexéDétection quasi-identique + contenu filéAnalyse bibliothèque par dossier
TYPES DE DOUBLONS

Quatre types de doublons. Traitement spécifique, correction différente.

La plupart des “détecteurs” n’identifient que les copies exactes. Nous classons chaque correspondance dans une des quatre catégories : ignorer (citation légitime), à canonicaliser (syndication), ou à réécrire (récupéré ou filé).

01 · EXACT

Mot à mot

Chaînes identiques de 30+ caractères. Comprend copier-coller, articles syndiqués republication verbatim, pages récupérées.

Corriger : canonicaliser, réécrire, ou accepter (si c’est votre syndication).
02 · QUASI-DUP

Légèrement reformulé

Structure préservée, synonymes ou adjectifs interchangés. Typique de “spinning”. Repère ce que Copyscape ignore.

Corriger : réécriture complète — l’argument de fond doit être le vôtre.
03 · FILÉ

Paraphrasé agressivement

Paraphrase au niveau de la phrase : propositions réordonnées, temps changés, ajout de remplissages. Souvent généré par des outils IA ou des fermes de contenu externalisées.

Corriger : vérifier l’intention. Est-ce une reformulation réelle ou une copie cachée ?
04 · GABARIT

Récurrent inter-page

Même avertissement, biographie, ou description produit présente sur des centaines de vos pages — véritable préoccupation de Google côté doublons.

Corriger : extraire dans un modèle commun ; éviter l’indexation x800 par Google.
CE QUE GOOGLE COMPTE VRAIMENT COMME DUPLIQUÉ

Ce n’est pas simplement « copier-coller d’un autre site ».

Règles effectives de Google (Search Central) : trois motifs déclenchent le traitement doublon, la plupart concernent vos propres pages et non la concurrence.

01

Copie cross-domaine sans canonique

Même article sur plusieurs sites sans balise rel=canonical vers l’original. Inclut : mauvaise syndication, concurrents scrape non déclarés, duplication accidentelle si un auteur publie sur deux plateformes.

02

Contenu identique sous plusieurs URL sur votre site

/produit/foo, /produit/foo?utm_source=email, et /produit/foo/ slash final. Navigation à facettes (combinaisons de filtres produisant des pages identiques), versions « imprimables » sans canonique, URLs mobile/desktop séparées. Google regroupe, en garde une, ignore le reste.

03

Gabarit prenant la place du contenu

Catégorie e-commerce : 5 paragraphes identiques sur 1 200 fiches. Pages localisation : même texte « Notre équipe a 20 ans d’expérience » sur 47 villes. Doublon de contenu faible — Google met cela en avant dans Helpful Content Update.

CAS SEO

Six équipes exécutent cette vérif chaque semaine.

Même outil, six usages différents — du blogueur solo avant publication à l’agence pour vérif d’articles externalisés.

Article de blog avant publication

Comparez le brouillon au web en direct avant publication. Repère la réutilisation accidentelle de phrases de vos propres posts (auto-cannibalisation), des articles concurrents lus lors de recherches, et toute dérive d’IA-rédacteur.

Détection de scraping concurrent

Collez votre article, voyez qui le publie aussi. Utile en preuve DMCA : chaque correspondance donne l’URL source, l’intervalle correspondants, et une capture datée à archiver comme preuve.

Hygiène bibliothèque contenu

Analyse dossier avec Pro. Déposez tous les articles publiés de l’équipe dans un dossier : l’outil signale doublons inter-documents — même paragraphe dans trois articles, gabarits à mutualiser.

Audit syndication

Vous syndiquez un article sur Medium, LinkedIn et Substack. Ont-ils tous rel=canonical vers l’URL d’origine ? L’outil vérifie chacun, lit la balise canonique, vous indique lesquelles « fuient » du SEO.

Contrôle qualité rédacteur externe

Livrable du rédacteur freelance dans un seul volet. Vérifiez avant paiement. Repère la signature scrape-puis-spin, l’empreinte IA, et citations faites sans source.

Origine de contenu IA

Les assistants IA extraient du texte du web lors de la génération. L’outil affiche ces emprunts : à vous de choisir : citer, réécrire ou supprimer. Réduit le risque de pénalité Helpful Content Update.

EXAMEN DUPLIQUÉ PAR DOSSIER

Déposez votre bibliothèque. Voyez ce qui se recoupe.

Fonctionnalité Pro. Sélectionnez un dossier d’articles publiés : le moteur calcule une matrice de similarité sur chaque paire. Triable par recoupement, accès direct aux intervalles concernés.

DOSSIER / blog-2026-q16 articles · matrice similarité par paires
3 recoupements > 10%Exporter matrice
ARTICLEA1A2A3A4A5A6
A1 — Cinq modèles de tarification SaaS·4%3%38%6%2%
A2 — Rédiger une tarification SaaS4%·5%12%7%3%
A3 — Guide tarification product-led3%5%·8%6%4%
A4 — Playbook tarification SaaS38%12%8%·9%5%
A5 — Choisir son prix SaaS6%7%6%9%·4%
A6 — Tarification SaaS pour fondateurs2%3%4%5%4%·
Cliquez sur une case pour voir les intervalles qui se recoupent entre deux articles
  • 250 M+pages web indexées
  • 30jfréquence actualisation corpus
  • 94%taux détection canonique
  • 4niveaux de classification dupliqué
  • 2014indexation Common Crawl
VS OUTILS DUPLIQUÉ BASIQUES

Trois choses ignorées par les outils navigateur et suites SEO.

OUTILS TYPE COPYSCAPE

Concordance stricte uniquement (Copyscape standard). Une phrase reformulée passe pour « unique » — et le contenu filé passe sans problème. Utile pour détecter un simple copier-coller, inutile en contrôle qualité.

Noplag : 4 niveaux de classification (Exact / Quasi-dup / Filé / Gabarit) avec indices d’intention — utilisable, pas juste une alerte booléenne.

SUITES SEO

“Vérif unicité” incluse avec abonnement à $99-499/mois. Limité à l’appariement basique de n-gram ; pas d’index Common Crawl ; pas d’analyse inter-documents sur dossier.

Noplag : autonome, Gratuit jusqu'à 2 500 mots. Pro ($23/mois) : matrice dossier et index web complet sans outil SEO imposé à $400.

VÉRIFIEURS EN LIGNE GRATUITS

Boîte noire. Impossible de savoir QUELLE source a fait concordance, juste un score. Limites à 1 000 mots fréquentes. Index rarement à jour : vérifie du web de 2021.

Noplag : chaque doublon affiche l’URL source + canonique + intervalles trouvés + date du corpus. Apache 2.0 — vous pouvez auditer l’algorithme.

DÉTECTION SENSIBLE AU CANONIQUE

Un article republié avec rel=canonical n'est pas un “doublon”. Nous le traitons comme tel.

Lorsqu’un article figure à plusieurs URLs, la question SEO n'est pas « identiques ? » mais « tous déclarent-ils le même canonique ? ». Si votre post Medium pointe rel=canonical vers la source, Google groupe et attribue le classement à l’original, les autres comptent comme syndication légitime. Sinon, vous vous concurrencez vous-même. L’outil va chercher chaque doublon, lit la balise <link rel="canonical"> et étiquette les résultats : ORIGIN, SYNDICATED-OK, SYNDICATED-LEAK, ou SCRAPED.

Lire la logique canonique
FAQ

Les questions posées avant d’intégrer.

Quelle couverture vs Copyscape ou SEMrush ?

250 M+ de pages indexées via Common Crawl + domaines SEO pertinents et traffic élevé, actualisés tous les 30 jours. Index plus large que Copyscape (exact-match : ~120 M, axé sur boilerplate plagié), plus restreint que l’intégralité de Google mais couverture documentée et cycle d’actualisation publié. L’offre Pro permet d’ajouter votre propre dossier comme corpus privé.

Concrètement, comment fonctionne la détection canonique ?

Pour chaque page trouvée, le moteur récupère l’URL source (cache ou live), lit le <head>, extrait rel=canonical. Ensuite, étiquette : ORIGIN (canonique sur soi), SYND-OK (canonique sur une autre page connue à vous), LEAK (canonique manquant/autre sur un de vos sites), ou SCRAPED (pas de canonique + domaine hors réseau). La classification est visible pour chaque doublon.

Le système détecte-t-il le contenu AI recopié ?

Oui : les assistants IA reprennent parfois du texte de pages web, qui apparaît comme quasi-dup ou filé. On montre l’URL source, à vous de choisir : citer, réécrire ou retirer. La détection de contenu AI (signal à part) sera une fonctionnalité future — pas disponible ici, seule la vérification de doublon est traitée.

Taille max d’un doc à analyser ?

2 500 mots avec la version gratuite, 50 000 sur Premium, 250 000+ sur Enterprise (aucune limite si auto-hébergé). Pour l'examen dossier, un dossier peut contenir jusqu’à 2 000 docs ; matrice calculée en moins de 5 min sur ce volume.

Ce service repèrera-t-il les concurrents ayant copié mes contenus ?

Si la copie apparaît dans l’index web (site public, crawlable), oui : l’URL est dans la liste avec une capture datée. Cette capture est recevable DMCA : datée, hashée, intervalles surlignés. Nous ne faisons pas d’envoi DMCA auto, nous donnons les éléments.

Peut-on exclure mon réseau de syndication de la vérif ?

Niveau Pro : ajoutez une liste blanche de domaines (medium.com/@vous, linkedin.com/in/vous, substack.com/p/vous). Les matchs avec cette liste sont tagués SYND-OK et ne comptent pas dans le score. Seul le « dupliqué inattendu » est reporté.

Comment la matrice inter-documents est-elle gérée pour 500 articles ?

Recherche O(n log n) par paire — empreintes réduisent les candidats via hashs 60 bits, l’alignement complet ne lance que sur ces cas. 500 articles → 124 750 paires calculées en ~4 min (4 cœurs). Export CSV : libre usage.

Le moteur est-il réellement open source ?

Oui — github.com/NoplagLabs/noplag-engine, Apache 2.0. Le découpage, l’empreinte, la cascade de recherche, l’alignement et la logique de classification des doublons sont tous dans le dépôt. Le niveau cloud ajoute le corpus + Common Crawl + un miroir de Wikipedia ; en auto-hébergement, vous fournissez le vôtre. Vérifiez l’algorithme avant de vous fier au score.

API pour intégrer dans un pipeline contenu ?

Point d’accès REST sur /v1/checks (SDK Python + Node). Soumettez un document, obtenez un rapport de doublons en réponse synchrone jusqu’à 8 secondes, puis rappel webhook au-delà. Utile pour les contrôles CI avant publication — refusez la fusion si le pourcentage de doublons dépasse le seuil de votre équipe. Documentation complète sur /docs/developers/api.

Et le contenu protégé (paywall ou auth) ?

Index de pages publiques seulement — Common Crawl, sitemap, robots autorisés. Paywalls (NYT, FT, académiques restrictifs) : pas d’index ; moteur ne les signale pas même si un extrait serait recopié. Pour articles scientifiques, OpenAlex / CORE (corpus séparé) couvre l’open-access.

Analysez un brouillon. Ou toute votre bibliothèque.

Le gratuit couvre 2 500 mots face à 250 M+ pages web. Pro (23 $/mois) : comparatif pairwise pour toute votre bibliothèque publiée. Apache 2.0 dispo si corpus en serveur privé.

Logiciel anti-plagiat pour contenu dupliqué en ligne gratuit