Ce qu’il faut retenir :

Un score de visibilité IA n’est pas une mesure de température, c’est le résultat d’une formule propriétaire appliquée à un échantillon de questions choisi par l’éditeur. Changez d’outil et vous changez de formule et d’échantillon. Le chiffre bouge, votre visibilité non.

Vous testez deux outils en parallèle sur la même marque, la même semaine. L’un affiche 62 sur 100, l’autre 18. Vous en concluez que l’un des deux ment.

Ce n’est probablement le cas ni de l’un ni de l’autre. Je co-fonde Cockpyt AI, donc je suis partie prenante de ce marché, et je vais décrire ici le mécanisme qui produit ces écarts, en incluant mon propre score dans la démonstration.

Et votre marque, ChatGPT la recommande-t-il ?

Mesurez votre présence et identifiez les marques citées à votre place. Sans carte bancaire.

Tester 14 jours gratuits →

Pourquoi deux outils de visibilité IA ne donnent-ils jamais le même score ?

Parce qu’un score sur 100 n’est pas une mesure physique. C’est une formule propriétaire appliquée à un échantillon de questions que l’éditeur a choisi. Deux éditeurs n’ont ni la même formule, ni le même échantillon, ni les mêmes moteurs, ni la même fréquence.

Cinq causes se cumulent, et elles se classent par ordre d’impact.

La même marque, trois scores différents

Décrivez une situation réelle, puis regardez ce que trois familles de notation en font. Les écarts que vous obtenez ne sont pas des erreurs de mesure.

Sur 10 questions testées, dans combien de réponses votre marque apparaît-elle ? 3C'est votre présence réelle, la donnée brute.
Quand on parle de vous, la tonalité est-elle favorable ? 80 %Réputation perçue dans les réponses où vous apparaissez.
Votre marque est-elle connue dans son secteur ? 70 %Notoriété : les modèles savent qui vous êtes quand on les interroge sur vous.
Vos concurrents apparaissent en moyenne dans combien de réponses sur 10 ? 5Sert de référence aux scores relatifs.
Quand vous apparaissez, un lien vers votre site est présent dans combien de cas ? 50 %

Modèle pondéré perception

0/100

Ressenti 40, notoriété 20, qualité de présence 20, exposition et concurrence 20

Modèle relatif aux concurrents

0/100

Fréquence de mentions rapportée à la médiane des concurrents

Modèle présence et citation

0/100

Présence, position dans la réponse, présence d'un lien. Zéro sans citation

Ce simulateur reproduit la logique de trois familles de notation documentées publiquement par leurs éditeurs : une pondération majoritairement axée sur le ressenti, un score relatif à une médiane de concurrents, et un score fondé sur la présence et la citation. Il n'interroge aucun moteur, ne calcule aucun score réel et ne reproduit pas les formules exactes d'un éditeur donné. Son seul objet est de montrer pourquoi une même situation produit des chiffres très différents selon le modèle de calcul.

Cause 1 : ils ne mesurent pas les mêmes questions

C’est la cause la plus lourde, et la moins visible.

Certains outils partent d’une base agrégée. Ahrefs construit son index en extrayant des requêtes de sa base de mots-clés, en les transformant en questions via les « Autres questions posées » et l’expansion sémantique, puis en faisant passer ces prompts dans chaque plateforme. Semrush procède de façon comparable, à partir d’une base de plus de 300 millions de prompts issus de données de navigation et de son jeu de mots-clés Google.

D’autres partent de vos questions. Vous déclarez les requêtes que vos prospects tapent réellement, et l’outil mesure votre présence sur celles-là.

Les deux approches sont légitimes et répondent à des besoins différents. Mais elles ne peuvent pas produire le même chiffre. Un cabinet de conseil très bien décrit dans les questions génériques de son secteur obtiendra un bon score sur une base agrégée, et un score proche de zéro sur ses dix requêtes commerciales réelles.

Ahrefs le documente d’ailleurs honnêtement : son index fonctionne mieux pour les marques établies et à demande de recherche significative, et sa couverture peut être limitée pour les marques peu recherchées. Pour une PME française, ça change tout.

Cause 2 : ils ne pondèrent pas les mêmes choses

Deux scores sur 100 peuvent additionner des dimensions totalement différentes. Trois exemples publics le montrent.

Outil Composition du score Conséquence
HubSpot AI Search Grader Ressenti 40 points, qualité de présence 20, notoriété 20, exposition 10, concurrence 10 Plus de la moitié du total porte sur la façon dont on parle de vous
Semrush AI Visibility Score Fréquence de mentions rapportée à la médiane de concurrents identifiés automatiquement Score relatif : il bouge si vos concurrents bougent, même si vous ne changez rien
Cockpyt Score Présence dans la réponse, position dans la réponse, présence d’un lien. Zéro sans citation Score binaire à la base : vous êtes cité ou vous ne l’êtes pas

Prenez une marque respectée mais rarement proposée. Chez HubSpot, elle marque des points sur le ressenti et la notoriété, soit 60 points potentiels. Chez moi, elle tombe à zéro sur les questions où elle n’apparaît pas. Les deux chiffres décrivent correctement une réalité différente : l’un mesure la perception, l’autre la présence.

La distinction absolu contre relatif mérite une attention particulière. Un score relatif à une médiane de concurrents peut monter parce que vos concurrents ont reculé. C’est une information utile, mais ce n’est pas la même que « ma visibilité progresse ».

Cause 3 : ils n’interrogent ni les mêmes moteurs, ni les mêmes versions

Les périmètres diffèrent beaucoup plus qu’on ne le croit. Otterly inclut ChatGPT, AI Overviews, Perplexity et Copilot dans ses formules de base, et vend Gemini en supplément. D’autres outils incluent Gemini mais pas les surfaces Google. Un score calculé sur quatre moteurs et un score calculé sur trois moteurs différents ne portent pas sur le même objet.

La version du modèle compte tout autant, et presque personne ne la publie. HubSpot documente les siennes (donnée de septembre 2026) : GPT-5.2 pour OpenAI, le modèle Sonar pour Perplexity, et Gemini 2.0 Flash pour Google, une version allégée pensée pour la rapidité. Un relevé effectué sur un modèle léger ne décrit pas exactement ce que voit un utilisateur de l’application principale.

D’après moi, cette transparence sur les versions devrait être un standard du marché et elle ne l’est pas. Quand un éditeur ne la publie pas, vous ne pouvez pas savoir si son chiffre décrit l’expérience de vos clients ou celle d’un modèle de substitution moins coûteux à interroger.

Cause 4 : ils ne font pas le même nombre de passes

C’est la cause la plus technique, et elle se confond souvent avec la fréquence. Ce sont deux choses distinctes.

  • La fréquence détermine à quel rythme une nouvelle mesure est produite. Quotidienne chez certains, hebdomadaire chez d’autres, mensuelle pour l’index Ahrefs, retesté une fois par mois sur une fenêtre de 90 jours.
  • Le nombre de passes détermine combien d’interrogations sont moyennées pour produire une seule mesure. Meteoria annonce 15 à 30 passes par prompt. Cockpyt AI en fait une par question et par scan. Les outils facturés au check en font généralement une par mise à jour.

Un outil quotidien à une passe produit 30 mesures fragiles par mois. Un outil hebdomadaire à dix passes produit 4 mesures solides. Les deux peuvent afficher un score très différent pour la même marque, et le second sera plus stable sans être plus fréquent.

Cause 5 : le modèle lui-même ne répond pas deux fois pareil

Cette cause s’ajoute à toutes les autres, et elle est indépendante de l’outil.

Une étude publiée par SparkToro en janvier 2026 a fait tourner 12 prompts identiques près de 3 000 fois dans ChatGPT, Claude et l’IA de Google, via 600 volontaires. Les chances d’obtenir deux fois la même liste de marques ressortent sous 1 sur 100, et environ 1 sur 1 000 pour la même liste dans le même ordre.

Une étude de l’Association for Computational Linguistics publiée en décembre 2025 le confirme sur un autre terrain : cinq modèles configurés pour être déterministes, testés sur huit tâches et dix exécutions, présentent des écarts de performance allant jusqu’à 15 %, avec un écart maximal de 70 % entre le meilleur et le pire résultat.

Autrement dit, même si deux outils utilisaient les mêmes questions, la même pondération, les mêmes moteurs et le même nombre de passes, ils n’obtiendraient toujours pas exactement le même résultat.

Combien de répétitions faudrait-il ?

Un travail publié en septembre 2025 sur la fiabilité des évaluations de modèles apporte un chiffre rarement cité : deux répétitions suppriment environ 83 % des inversions de classement produites par une passe unique, et passer de une à trois répétitions ne réduit l’erreur type que d’environ 5 %.

Ce résultat n’arrange personne sur ce marché. Il montre qu’une passe unique est fragile dès qu’on veut classer, et que la course aux dizaines de passes quotidiennes achète une précision au rendement décroissant. Ces travaux portent sur l’évaluation de modèles, pas sur la citation de marque : la transposition est raisonnable, elle n’est pas démontrée.

Comment comparer deux outils honnêtement

Puisque les scores ne sont pas comparables, comparez ce qui l’est.

  • Prenez un dénominateur commun. Dix questions identiques, déclarées dans les deux outils, sur les mêmes moteurs. Tout le reste est du bruit méthodologique.
  • Comptez des observations brutes, pas des notes. Sur ces dix questions, dans combien de réponses votre marque apparaît-elle ? C’est la seule donnée que deux outils peuvent produire de façon comparable.
  • Relevez les concurrents cités. Si les deux outils vous renvoient les mêmes concurrents sur les mêmes questions, leurs relevés convergent, même si leurs scores divergent.
  • Donnez-leur trois semaines. Un écart entre deux relevés isolés ne prouve rien. Un écart de tendance sur six relevés en dit davantage.
  • Demandez la composition du score. Si un éditeur ne publie ni sa pondération ni ses versions de modèles, vous ne pouvez pas interpréter son chiffre. C’est une raison suffisante de l’écarter.

D’après moi, la règle la plus utile tient en une phrase : un score ne vaut que comparé à lui-même. Suivre l’évolution d’un même score sur douze semaines vous apprend quelque chose. Comparer deux scores issus de deux outils vous apprend seulement que les formules diffèrent.

Ce qu’il faut cesser d’attendre d’un score

Qu’il soit stable au jour le jour. Il ne peut pas l’être, quelle que soit la qualité de l’outil.

Qu’il désigne une position de classement fiable. Rand Fishkin conclut son étude sans détour : un outil qui annonce une position de classement dans l’IA raconte n’importe quoi. Ce qui reste mesurable est une fréquence d’apparition agrégée sur de nombreux passages. Cette réserve vaut pour tous les éditeurs, y compris pour la composante position du Cockpyt Score.

Qu’il se compare entre outils ou dans le temps après un changement d’outil. Si vous migrez, exportez vos données, gardez-les comme archive, et repartez d’une base zéro en annotant la date de bascule dans vos rapports.

Qu’il remplace une décision. Un score dit où vous en êtes. Il ne dit pas quoi corriger. C’est un diagnostic et un plan d’action qui le font.

Questions fréquentes

Quel score dois-je croire si deux outils me donnent 62 et 18 ?

Les deux, pour ce qu’ils mesurent. Regardez la composition de chaque score avant de trancher. Si l’un pondère fortement le ressenti et l’autre exige une citation, un écart de 44 points est normal pour une marque bien décrite mais peu proposée.

Un score relatif vaut-il mieux qu’un score absolu ?

Ni l’un ni l’autre, ils répondent à des questions différentes. Un score relatif à vos concurrents vous situe dans votre marché. Un score absolu mesure votre présence indépendamment des autres. Un score relatif peut monter sans que vous ayez rien amélioré.

Pourquoi mon score bouge-t-il alors que je n’ai rien changé ?

Parce que les modèles ne répondent pas deux fois pareil, que vos concurrents publient, et que les moteurs sont mis à jour. Un mouvement de quelques points d’une semaine sur l’autre relève de la variance. Lisez la tendance sur 3 à 8 semaines.

Combien de fois faut-il interroger une IA pour un résultat fiable ?

Aucun consensus n’existe. Les travaux académiques sur l’évaluation de modèles suggèrent que deux répétitions suppriment la majeure partie des inversions dues au hasard, avec un rendement qui décroît vite ensuite. Retenez surtout qu’une passe unique ne suffit jamais pour conclure sur une question isolée.

Peut-on additionner ou moyenner les scores de deux outils ?

Non. Ce serait moyenner deux formules différentes appliquées à deux échantillons différents. Le résultat n’aurait aucune signification.

Que vaut un score gratuit face à un score payant ?

Ça ne dépend pas du prix mais de la méthode. Un diagnostic gratuit bien documenté vaut mieux qu’un score payant dont on ignore la pondération. Demandez d’abord comment le chiffre est calculé.

Faut-il tester plusieurs outils avant de choisir ?

Oui, mais sur un jeu de questions identique et en comparant les observations brutes plutôt que les notes. C’est le seul protocole qui vous apprend quelque chose sur les outils plutôt que sur leurs formules.

Sources

  • Rand Fishkin et Patrick O’Donnell, New Research: AIs are Highly Inconsistent When Recommending Brands or Products, SparkToro, janvier 2026 — sparktoro.com
  • Berk Atıl et al., Non-Determinism of « Deterministic » LLM System Settings in Hosted Environments, Proceedings of the 5th Workshop on Evaluation and Comparison of NLP Systems, Association for Computational Linguistics, décembre 2025 — aclanthology.org/2025.eval4nlp-1.12
  • Miguel Angel Alvarado Gonzalez et al., Do Repetitions Matter? Strengthening Reliability in LLM Evaluations, arXiv:2509.24086, septembre 2025 — arxiv.org/abs/2509.24086
  • HubSpot, page AI Search Grader, dimensions du score et modèles interrogés, consultée le 2 septembre 2026 — hubspot.fr/ai-search-grader
  • Semrush, base de connaissances, AI Visibility Toolkit : calcul du score et sources de données, consultée le 2 septembre 2026 — semrush.com/kb/1493
  • Ahrefs, page Brand Radar, méthodologie de l’AI Visibility Index et fréquence de rafraîchissement, consultée le 2 septembre 2026 — ahrefs.com/brand-radar

Article rédigé avec assistance IA

Florian Zorgnotti

Co-fondateur de Cockpyt AI et consultant SEO à Nice depuis 2016. J’ai mené plus de 300 projets, avec une expertise sur WordPress, Shopify et le GEO pour développer la visibilité des marques sur les moteurs de recherche et les IA. Linkedin