Cannibalisation SEO : ce que révèle l’audit de 49 contenus

J’ai comparé 49 contenus, 1 035 paires publiques, leurs promesses et leurs plans pour distinguer proximité utile et vraie cannibalisation SEO.

Une question mène à une réponse reliée à sa page source et à une preuve accessible.

Avant de choisir les sujets de cette publication, j’ai comparé les 49 contenus présents dans le dossier éditorial de ce site. Le corpus réunissait 46 articles publics, deux contenus en revue et un brouillon hors index. Le but n’était pas de chercher un score rassurant. Je voulais repérer les endroits où deux URL risquaient de promettre la même réponse au même lecteur.

Le résultat est moins spectaculaire qu’un outil qui colore la moitié du site en rouge, mais beaucoup plus utile. Sur les 1 035 paires formées par les 46 articles publics, huit dépassaient 30 % de proximité lexicale dans mon calcul. Aucune ne dépassait 20 % de similarité de plan. Aucun paragraphe substantiel identique n’a été trouvé. Les huit alertes demandaient donc une lecture éditoriale, pas une suppression automatique.

Réponse en bref

Une cannibalisation SEO ne se diagnostique pas avec un mot-clé commun ni avec un pourcentage isolé. Deux pages peuvent employer le même vocabulaire tout en répondant à des étapes différentes. À l’inverse, deux textes lexicalement éloignés peuvent poursuivre la même intention et conduire vers la même action.

Mon audit combine six éléments :

  1. l’intention principale ;
  2. la promesse faite dans le titre et l’introduction ;
  3. le persona ;
  4. la thèse ;
  5. le plan ;
  6. la prochaine action du lecteur.

La mesure lexicale sert de détecteur. La décision reste éditoriale.

Résultat observé avant cette publicationValeur
contenus inspectés, tous statuts49
articles publics46
paires d’articles publics1 035
paires à 30 % ou plus de proximité lexicale8
paires entre 20 % et moins de 30 %29
paires sous 20 %998
proximité lexicale médiane7,5 %
proximité lexicale maximale33,9 %
similarité de plan maximale18,4 %
paragraphes substantiels identiques0

Ces chiffres décrivent ce corpus et cette méthode au 29 juillet 2026. Ils ne constituent pas des seuils universels de Google.

Pourquoi un simple export de mots-clés ne suffit pas

Le mot « cannibalisation » mélange souvent trois problèmes différents.

Le premier est technique : plusieurs URL servent un contenu identique ou presque identique. Google décrit alors une logique de canonicalisation. Ses systèmes regroupent les URL proches et choisissent une version représentative. Les redirections, les balises rel="canonical", le sitemap et les liens internes peuvent contribuer à exprimer une préférence.

Le deuxième est éditorial : deux pages distinctes promettent la même réponse. Elles peuvent avoir des adresses propres et des textes différents, mais viser la même requête, la même personne et la même décision.

Le troisième est commercial : plusieurs pages conduisent vers une offre voisine, sans clarifier leur rôle dans le parcours. Ce n’est pas forcément un problème de moteur. Le lecteur, lui, peut hésiter entre deux destinations.

Un outil de mots-clés voit surtout le vocabulaire. Il ne connaît pas nécessairement le contrat de lecture de chaque URL. Pour décider, il faut revenir à ce contrat.

Le corpus réellement contrôlé

L’inventaire a porté sur tous les fichiers du dossier des articles, y compris ceux qui ne sont pas publiés. Cette précaution évite de préparer un nouveau texte qui répéterait un brouillon ou un contenu encore en revue.

Pour chaque fichier, j’ai extrait :

  • le slug ;
  • le titre ;
  • la catégorie ;
  • le statut ;
  • la description ;
  • la valeur originale annoncée ;
  • les titres H2 et H3 ;
  • le volume de mots ;
  • le début de la réponse ;
  • les mots récurrents après normalisation.

J’ai ensuite relu l’intention, le public, la promesse, la thèse et la prochaine action. Ces informations ne sont pas toutes stockées comme des champs séparés. Elles doivent parfois être déduites du texte complet.

Les pages d’offres et les 24 programmes de formation ont aussi été contrôlés. Un article peut être unique par rapport aux autres articles tout en répétant une page commerciale. Par exemple, un guide qui répond intégralement à « choisir une formation IA » ne doit pas reprendre la promesse d’une page destinée à présenter un programme et ses modalités.

Comment j’ai mesuré la proximité

La partie quantitative comporte trois tests. Ils ont été exécutés localement sur les fichiers du site, sans envoyer le corpus à un service externe.

Test 1 : proximité du vocabulaire

J’ai supprimé le frontmatter, les liens et les éléments de mise en forme. Le texte a été mis en minuscules, les accents ont été normalisés et les mots fonctionnels très fréquents ont été retirés.

Chaque article a ensuite été représenté par un vecteur TF-IDF. Ce calcul donne davantage de poids aux termes distinctifs du corpus et moins aux mots présents partout. La similarité cosinus entre deux vecteurs produit une valeur comprise entre zéro et un, présentée ici en pourcentage.

Ce pourcentage ne signifie pas « 33,9 % du texte est copié ». Il indique seulement que les deux documents occupent une zone lexicale proche selon ce traitement.

Test 2 : proximité des plans

Le même principe a été appliqué uniquement aux H2 et H3. Les titres obligatoires ou récurrents, comme « Réponse en bref », « Limites », « À propos de l’auteur » et « Articles liés », ont été écartés.

Ce retrait est important. Sans lui, deux articles structurés proprement paraissent artificiellement proches parce qu’ils partagent le même gabarit.

Test 3 : paragraphes substantiels identiques

Les paragraphes ont été normalisés puis comparés à l’identique lorsqu’ils dépassaient une longueur minimale. Le contrôle ne cherchait pas les petites expressions usuelles. Il visait les blocs assez longs pour signaler un recyclage réel.

Aucun doublon substantiel exact n’a été trouvé entre les articles publics.

Ce que montrent les huit alertes lexicales

Les huit paires au-dessus de 30 % ne forment pas huit cannibalisations. Elles appartiennent surtout à des familles où le vocabulaire technique est nécessairement partagé.

Guide GEO et apparition dans ChatGPT

La paire la plus proche atteint 33,9 % sur le vocabulaire, mais 7,8 % sur le plan.

Le guide GEO organise un diagnostic transversal autour du crawl, de la lisibilité, de l’attribution, de l’information et de la révision. L’article sur la manière d’apparaître dans ChatGPT répond à une question plus étroite : agents OpenAI, accès, unités de réponse, preuves et observation sur quatorze jours.

La prochaine action n’est pas la même. Le premier conduit à auditer une ressource pour plusieurs moteurs de réponse. Le second conduit à tester spécifiquement l’éligibilité et l’observation dans la recherche ChatGPT. Je conserve les deux.

ChatGPT et Perplexity

Les articles consacrés à ChatGPT et à Perplexity partagent 33,2 % de proximité lexicale et 18,1 % de proximité de plan. Ils parlent tous deux de robots, de réponses citables et de mesure.

Leur différence utile tient au produit et au contrôle demandé. L’un distingue OAI-SearchBot, GPTBot et ChatGPT-User. L’autre sépare PerplexityBot et Perplexity-User dans le cadre PACTE. Les configurations, les preuves d’accès et les diagnostics ne sont pas interchangeables.

Cette paire mérite un maillage réciproque et des introductions très explicites. Elle ne justifie pas une fusion qui produirait un long catalogue d’agents difficile à maintenir.

Entité numérique et données structurées

La proximité lexicale atteint 31,2 %, avec seulement 10,4 % sur le plan.

L’article sur l’entité numérique commence par un registre de faits et une page canonique d’identité. Celui sur les données structurées auteur et article construit un graphe Person, ProfilePage et Article aligné sur ce qui est visible.

La première prochaine action consiste à stabiliser les faits. La seconde consiste à représenter ces faits dans un balisage contrôlable. Le partage de vocabulaire est logique, car le balisage dépend de l’identité. Les promesses restent distinctes.

Deux contenus sur la formation en entreprise

La paire formée par « concevoir une formation ChatGPT en entreprise » et « construire un programme de formation IA utile » atteint 30,9 % sur le vocabulaire, mais 8,9 % sur le plan.

Le premier article part des rôles, des données et des usages situés de ChatGPT. Le second part d’un canevas tâche-risque-preuve applicable à un programme IA plus large. La proximité est réelle. Pour éviter qu’elle ne devienne une collision, les titres, exemples et liens doivent maintenir cette séparation.

Les quatre décisions possibles

Une alerte n’appelle pas automatiquement une fusion. J’utilise quatre décisions.

DécisionQuand l’utiliserContrôle après action
conserverintentions ou étapes réellement différentesrendre la distinction visible dès le début
différencierbonne raison de garder deux URL, promesses encore flouesréécrire titre, introduction, plan et prochaine action
fusionnermême intention, même persona et même réponse centralerediriger l’ancienne URL et corriger le maillage
retirercontenu sans preuve, sans utilité propre ni successeur pertinentsupprimer les liens, contrôler sitemap et index

La canonicalisation n’est pas un substitut à cette décision. Une balise canonical peut signaler une URL préférée pour des versions très proches. Elle ne répare pas deux articles mal positionnés qui restent tous deux proposés aux lecteurs.

Ma matrice de décision

Pour chaque paire signalée, je réponds à sept questions.

  1. La personne formule-t-elle la même question avant d’ouvrir les deux pages ?
  2. Les titres promettent-ils le même résultat ?
  3. Les introductions donnent-elles la même réponse ?
  4. Le corps utilise-t-il le même exemple central ?
  5. Les H2 suivent-ils la même progression ?
  6. La preuve originale est-elle différente ?
  7. La prochaine action est-elle différente ?

Deux réponses positives ne suffisent pas à conclure. En revanche, une paire qui cumule même question, même promesse, même plan et même action n’a généralement pas de raison de rester séparée.

J’ajoute ensuite des données réelles lorsqu’elles existent : requêtes Search Console, pages de destination, liens internes, backlinks, conversions et canonicals choisies. La similarité textuelle ne remplace pas ces signaux.

Comment les trois sujets du jour ont été filtrés

Le même audit a été appliqué avant rédaction aux trois nouveaux plans.

Le premier, celui que vous lisez, répond à « audit cannibalisation SEO » avec un corpus réel, des calculs et une matrice de décision. Le second analyse les compétences présentes dans 24 programmes de formation publiés. Le troisième documente un workflow éditorial réellement exécuté et ses contrôles de sortie.

Les personas diffèrent :

  • responsable SEO ou éditorial pour l’audit de cannibalisation ;
  • responsable formation, RH ou référent IA pour la cartographie de compétences ;
  • responsable contenu ou automatisation pour le workflow éditorial.

Les prochaines actions diffèrent aussi : trier des paires d’URL, bâtir une progression pédagogique, ou installer des gates de publication.

Sur les plans préparatoires, la plus forte proximité avec un contenu existant était de 11,5 %. La proximité maximale entre les trois nouveaux plans était de 5,4 %. Ces valeurs ont seulement servi de filtre initial. Un nouveau contrôle sur les textes complets est nécessaire avant la mise en ligne.

Résultat sur les textes complets

Le second calcul a été lancé après rédaction. L’audit de cannibalisation atteint au maximum 15,8 % de proximité lexicale avec un article antérieur. L’analyse des compétences atteint 24,7 %, face au grand dossier transversal sur l’IA en entreprise, mais seulement 4,9 % sur le plan. Le workflow éditorial atteint 15,3 % avec le brouillon d’exemple d’audit, et 5,1 % sur le plan.

Entre les trois nouveaux textes, la proximité lexicale maximale est de 19,6 %, entre cet audit et le workflow éditorial. Leur similarité de plan est de 3,9 %. Aucun nouveau texte ne franchit donc le seuil d’alerte de 30 %. Le contrôle confirme aussi que leurs prochaines actions restent distinctes.

Installer le contrôle sans créer une usine

Un petit site peut commencer avec un tableau. Une ligne correspond à une URL. Les colonnes indispensables sont :

  • intention propriétaire ;
  • public ;
  • promesse ;
  • preuve originale ;
  • thèse ;
  • plan résumé ;
  • prochaine action ;
  • statut ;
  • date de dernière vérification.

À chaque nouveau sujet, recherchez d’abord les pages qui partagent l’intention et la prochaine action. Comparez ensuite le plan. Le calcul lexical devient utile lorsque le corpus est trop grand pour une relecture intuitive.

Pour un corpus plus riche, le contrôle peut suivre cinq étapes :

  1. exporter toutes les métadonnées et les titres ;
  2. calculer les paires proches ;
  3. relire les alertes avec la matrice ;
  4. enregistrer la décision et son motif ;
  5. vérifier les liens, redirections, canonicals et sitemaps après modification.

Le registre évite de refaire la même discussion au prochain article.

Ce que l’audit change dans la cadence

Google définit l’abus de contenu à grande échelle par la création de nombreuses pages principalement destinées à manipuler les résultats et apportant peu de valeur. La règle ne dépend pas seulement de l’usage d’une IA. Elle concerne aussi une production humaine ou hybride sans utilité originale.

Pour cette raison, une cadence quotidienne ne peut pas devenir un objectif autonome. Le contrôle doit pouvoir répondre « aucun sujet ne passe aujourd’hui ». Dans ce cas, le bon résultat est de ne rien publier.

Le volume de mots n’est pas non plus un critère de qualité. La page officielle de Google sur les contenus utiles rappelle qu’il n’existe pas de longueur préférée à atteindre mécaniquement. Un audit sérieux examine l’information originale, la complétude utile, l’auteur, la méthode et la raison de publier.

Limites

Le TF-IDF dépend du nettoyage, de la langue, des mots exclus et de l’état du corpus. Un autre outil produira des valeurs différentes. Le seuil de 30 % utilisé ici est une alerte interne, pas une règle de moteur de recherche.

L’audit ne prouve pas qu’une paire se concurrence dans Google. Pour cela, il faut rapprocher les requêtes, les impressions, les clics, les canonicals choisies et les parcours réels. Il ne mesure pas non plus la qualité littéraire.

Enfin, les trois contenus non publics ont été inclus dans la prévention, mais leurs titres et leurs détails ne sont pas exposés dans cet article. Ils restent soumis à leur propre contrôle de preuve avant toute publication.

Prochaine étape

Commencez par dix URL stratégiques, pas par tout le site. Pour chacune, écrivez l’intention, la promesse et la prochaine action. Comparez ensuite les paires qui se ressemblent. Le guide sur l’autorité thématique aide à organiser le corpus ; la page consultant SEO et GEO décrit le périmètre d’un audit plus large.

Sources vérifiées

Rechercher

La recherche porte uniquement sur les contenus publiés. Entrée ouvre le premier résultat ; les flèches permettent de choisir.