RecoSignal

Comment nous mesurons la visibilité IA : la méthodologie complète

Mis à jour 17 juillet 2026 · équipe RecoSignal

À retenir

  • Nous mesurons une fréquence, pas un rang : sur 30 requêtes de style client par moteur, à quelle fréquence un assistant nomme-t-il votre entreprise ? La position à l’intérieur d’une réponse est enregistrée, mais pondérée à zéro dans le score, car l’ordre des noms dans les réponses d’IA est instable.
  • Un audit, c’est 138 mesures : 30 requêtes sur chacun de ChatGPT, Gemini et Perplexity, les 8 requêtes à plus forte intention étant posées trois fois chacune — 46 mesures par moteur.
  • Les pondérations des moteurs (ChatGPT 0.45, Gemini 0.30, Perplexity 0.25) et les seuils de verdict (≥40 visible, 10–39 faible, <10 invisible) sont des jugements, pas des mesures. Nous les publions pour que vous puissiez les contester et tout recalculer.
  • Ce que le score ne peut pas faire : prédire, garantir ou prouver une causalité. C’est un instantané de la façon dont trois moteurs ont répondu un jour donné, et le relancer un autre jour fera bouger le chiffre.
  • Chaque réponse brute est conservée. Tout chiffre d’un rapport RecoSignal peut être remonté jusqu’au texte d’une vraie réponse d’IA, ce qui est la seule raison d’en croire quoi que ce soit.

Pourquoi cette page existe

Un secteur qui vend des « scores de visibilité IA » sans publier leur mode de calcul mérite la méfiance qu’il inspire. Un score dont la méthode est secrète ne peut être ni vérifié, ni contesté, ni reproduit — ce qui le rend indiscernable d’un chiffre inventé pour vendre un abonnement.

Voici donc la méthode, en entier : les requêtes, les moteurs, l’arithmétique, les seuils, et les choses précises que ce chiffre ne prouve pas. Là où un choix relève du jugement plutôt que de la mesure, il est signalé comme tel. Là où la méthode a une limite qui joue contre nous, elle est énoncée ici plutôt que laissée à un concurrent qui la trouverait.

Cette page suit le code. Si la mesure change, cette page et la version de la méthodologie changent avec elle.

Ce que nous mesurons : la fréquence, pas le rang

La question centrale est simple : sur de nombreuses questions réalistes, formulées comme un client les formule, à quelle fréquence un assistant nomme-t-il votre entreprise ? Chaque mesure est binaire. Nommé dans la réponse : 1. Absent : 0. Rien d’autre n’entre dans le score.

Nous enregistrons bien à quel endroit de la réponse votre nom est apparu, mais ce rang est stocké à titre de diagnostic et pondéré à zéro. La raison en est que l’ordre des noms à l’intérieur d’une réponse d’IA n’est pas assez stable pour y bâtir une métrique : posez deux fois la même question et les mêmes entreprises peuvent revenir dans un ordre différent. Un prestataire qui vous rapporte votre « rang dans ChatGPT » vous rapporte du bruit avec une décimale posée dessus. Il n’existe, à l’intérieur de ces systèmes, aucune liste classée dans laquelle occuper une place.

Le score d’un moteur est donc un pourcentage : 100 × (mesures qui vous nomment ÷ mesures réussies sur ce moteur). Si vous avez été nommé dans 12 des 46 mesures réussies sur ChatGPT, votre score ChatGPT est de 26.1.

Les questions : 30 requêtes par moteur, cinq intentions

Les requêtes sont générées pour votre entreprise et votre ville, et elles sont écrites comme les clients écrivent, pas comme les marketeurs écrivent. Trente par moteur, réparties sur cinq intentions, chaque intention apparaissant sous deux formes : l’une qui nomme explicitement votre ville, l’autre formulée en « près de moi », la localisation étant transmise comme paramètre d’API au lieu d’être tapée dans la question.

  • best_of — « Qui est le meilleur dentiste implantologue à [city] ? »
  • near_me — « Bon med spa près de moi », la localisation étant transmise au moteur comme paramètre structuré lorsqu’il en accepte un, plutôt que tapée dans la question.
  • attribute — la question qui filtre sur un fait précis : un assureur accepté, un appareil utilisé, un service proposé, un prix.
  • comparison — « X ou Y à [city] : qui fait les deux, et à quel prix ? »
  • urgency — la question du jour même : une dent cassée ce soir, une canalisation qui a éclaté, un rendez-vous en urgence.

138 mesures par audit, et pourquoi la même question est posée trois fois

Les huit requêtes à plus forte intention — celles où le client est le plus près de réserver — sont posées trois fois chacune au lieu d’une. Cela transforme 30 requêtes en 46 mesures par moteur, et sur trois moteurs un audit représente 138 appels en direct à ChatGPT, Gemini et Perplexity.

La répétition n’est pas du remplissage ; c’est toute la raison pour laquelle le résultat signifie quelque chose. Ces systèmes sont non déterministes : la même question posée deux fois peut produire des noms d’entreprises différents. Une réponse isolée est une anecdote. Poser trois fois les questions qui comptent le plus, c’est ainsi qu’on distingue une mention ponctuelle d’une entreprise que le moteur nomme de façon fiable.

Cela fixe aussi le plafond honnête de la précision. Avec 46 mesures par moteur, une seule mention déplace le score de ce moteur d’environ 2.2 points. Un écart d’un point entre deux entreprises n’est pas un résultat, et nous ne le présentons pas comme tel.

Les moteurs que nous interrogeons — et la limite que nous n’enterrerons pas

Nous mesurons trois moteurs : ChatGPT, Google Gemini et Perplexity. Chacun est interrogé via son API officielle avec la recherche web activée, dans la configuration publiée dans notre code.

Voici la limite, énoncée sans détour : nous interrogeons les modèles par leur API, pas les applications grand public. La réponse qu’un patient obtient dans l’application ChatGPT de son téléphone — avec son historique de conversation, sa mémoire, son compte, son niveau d’abonnement et la version qu’OpenAI a livrée ce matin-là — n’est pas garantie identique à celle que notre mesure a reçue. Aucun prestataire de ce secteur ne peut mesurer l’application grand public à grande échelle, faute d’interface pour le faire ; quiconque laisse entendre le contraire vous vend une capture d’écran.

Ce qu’est notre mesure, précisément : un échantillon large, répété et reproductible de la façon dont les modèles sous-jacents répondent à des questions de recommandation locale avec recherche web en direct, dans votre ville. Ce qu’elle n’est pas : une écoute des téléphones de vos clients. Nous pensons que la première chose mérite d’être payée et que la seconde n’existe pas. Vous devez savoir laquelle vous achetez.

Géographie : comment on indique aux moteurs où se trouve le client

Une recommandation locale dépend entièrement de l’endroit où se tient le client, et les trois moteurs traitent ce fait différemment.

ChatGPT et Perplexity acceptent une localisation structurée — ville, région, pays — transmise à côté de la question, ce qui permet à nos requêtes « près de moi » d’être formulées exactement comme un client les formule, sans ville tapée dans le texte.

Gemini, lors de nos tests, n’a pas tenu compte d’une localisation fournie de cette manière. Pour Gemini, nous revenons donc à nommer la ville dans le texte même de la question. C’est une véritable asymétrie entre les moteurs, elle est fixée par un drapeau dans notre code plutôt que cachée dans une boîte noire, et elle signifie que les résultats « près de moi » de Gemini répondent à une question légèrement différente de ceux de ChatGPT. Nous préférons vous le dire plutôt que de prétendre que les trois moteurs ont été interrogés à l’identique.

Comment les trois scores de moteurs deviennent un seul chiffre

L’AI Visibility Score final est une moyenne pondérée des trois scores de moteurs : ChatGPT 0.45, Gemini 0.30, Perplexity 0.25.

Ces pondérations sont un jugement, pas une mesure. Elles sont notre estimation de la part du public utilisateur d’assistants que chaque moteur atteint réellement, et nous n’y tenons pas rigidement. Nous les publions exactement pour cette raison : vous pouvez prendre les scores par moteur figurant dans votre rapport, appliquer vos propres pondérations et obtenir votre propre chiffre. Rien n’est caché à l’intérieur de la moyenne.

Une règle mécanique protège la moyenne des données inutilisables. Si un moteur renvoie des réponses exploitables pour moins de la moitié de ses mesures — une panne, une limitation de débit, un modèle qui refuse de répondre — ce moteur est entièrement retiré du score et les pondérations restantes sont renormalisées, plutôt que de laisser un moteur défaillant tirer le chiffre vers le bas et faire passer cela pour de l’invisibilité. Si aucun moteur ne franchit ce seuil, l’audit ne rapporte aucun score au lieu d’en inventer un.

Les seuils de verdict, et le fait qu’ils relèvent du jugement

Un score de 40 ou plus se lit comme visible. Entre 10 et 39, comme faible. En dessous de 10 — y compris pour une entreprise qui n’a jamais été nommée — comme invisible.

Il n’y a aucune science derrière ces deux points de coupure. Ce sont les limites que nous avons choisies pour rendre un chiffre lisible par un dirigeant, et c’est la partie de cette méthodologie la plus ouverte à un désaccord raisonnable. Ce qu’elles ne sont pas, c’est un levier caché : vos pourcentages bruts par moteur sont dans le rapport, et si vous estimez que la frontière entre faible et visible se situe à 35 ou à 50, vous pouvez la tracer vous-même.

Pour donner l’échelle, à partir d’un marché réel : dans notre benchmark dentaire de Dallas de juillet 2026, le cabinet le mieux noté de toute l’agglomération a obtenu 27.0 sur 100 (le benchmark). Personne, sur ce marché, n’a franchi le seuil de visibilité. Un score de 40 est un seuil élevé, et c’est voulu.

Compter les mentions : comment un nom dans une phrase devient un chiffre

Chaque mention est extraite du texte d’une vraie réponse. Les noms d’entreprises sont normalisés (casse, ponctuation, suffixes comme « LLC » ou « DDS »). Deux graphies différentes ne sont comptées comme une seule entreprise que lorsque quelque chose dans les données montre qu’il s’agit bien de la même : graphie identique une fois les accents et la ponctuation retirés, même nom écrit dans un autre alphabet, ou les deux graphies apparaissant aux côtés de citations du même site d’entreprise. Des graphies qui surgissent dans une même réponse comme deux entrées distinctes ne sont jamais fusionnées — un assistant qui énumère des options ne nomme pas deux fois la même entreprise, c’est donc la preuve de deux entreprises, pas d’une. La même règle vaut pour votre propre entreprise et pour chaque concurrent, et une graphie que nous ne pouvons rattacher à rien reste sur sa propre ligne au lieu d’être fondue dans une autre sur une supposition. C’est délibéré : un palmarès qui coupe une entreprise en deux est bruyant, mais un palmarès qui fond deux entreprises en une est tout simplement faux.

Pour figurer au palmarès des concurrents, une entreprise doit compter au moins deux mentions indépendantes. Une mention isolée et passagère se situe dans le plancher de bruit d’un système non déterministe, et un palmarès rempli d’entreprises à une seule mention serait un palmarès de coïncidences. Deux exceptions sont délibérées : votre propre entreprise apparaît toujours, y compris quand la réponse honnête est un zéro — un zéro que vous avez demandé est un résultat, et l’escamoter discrètement serait un mensonge par omission. Les concurrents que vous avez nommés vous-même contournent le seuil des deux mentions dès une seule mention. Un concurrent que vous avez nommé et qu’aucun moteur n’a mentionné ne serait-ce qu’une fois n’apparaît pas actuellement comme une ligne à zéro dans le palmarès ; c’est une limite de la version actuelle, pas un jugement selon lequel ce fait serait sans importance, et c’est sur la liste des corrections à faire.

Le Share of Voice utilise un dénominateur plus large que le palmarès. Il compte chaque mention d’entreprise canonique distincte dans chaque réponse réussie, y compris les entreprises mentionnées une seule fois. Une même entreprise ne peut compter qu’une fois par réponse, même si le modèle répète son nom ou emploie plusieurs graphies. Votre Share of Voice vaut 100 × (paires réponse-entreprise qui vous appartiennent ÷ toutes les paires réponse-entreprise). C’est une part des mentions observées dans cet audit, pas une part de marché et pas du trafic de recherche.

Nous enregistrons aussi chaque domaine source cité par les moteurs. C’est ce qui a produit le constat le plus inconfortable que nous ayons publié : sur les trois marchés de Dallas que nous avons mesurés en juillet 2026, de 73 % à 79 % des sources derrière les recommandations de l’IA étaient les sites des entreprises elles-mêmes, pas des annuaires — un résultat qui va contre une grande partie de ce que ce secteur vend, et contre une grande partie de ce que nous écrivions nous-mêmes autrefois. Les détails par marché sont publiés sur les pages de benchmark.

Ce que ce score ne peut pas faire

Il ne peut pas prédire. Le score décrit la façon dont les moteurs ont répondu pendant la fenêtre de mesure. Ce n’est pas une prévision du mois prochain, et une mise à jour de modèle peut le faire bouger sans que rien ne change dans votre entreprise.

Il ne peut pas garantir. Personne ne peut promettre que ChatGPT vous recommandera, car il n’y a aucune position à acheter et aucune liste classée où entrer. Quiconque vend une place n° 1 garantie dans une réponse d’IA vend un emplacement qui n’existe pas.

Il ne peut pas prouver une causalité. Nous pouvons montrer que les entreprises qu’un moteur nomme sont plutôt celles dont les informations sont énoncées en texte lisible et répétées de façon cohérente partout où le moteur va vérifier. Nous n’avons pas mené d’expérience contrôlée prouvant que combler une lacune précise fait monter votre score — personne ne l’a fait, et un prestataire qui avance ici un chiffre de causalité devine. Ce que nous pouvons faire, c’est vous mesurer avant, vous mesurer à nouveau après, et vous dire honnêtement ce qui a bougé.

C’est une seule journée. Le benchmark de Dallas est un instantané du 7 juillet 2026. Posez les mêmes questions en octobre et les noms auront bougé. C’est un argument pour remesurer, pas pour traiter une mesure unique comme parole d’évangile — la nôtre comprise.

Reproductibilité

Chaque réponse brute d’IA collectée pendant un audit est conservée, avec la requête qui l’a produite, le moteur qui a répondu, l’horodatage et les domaines sources cités. Chaque chiffre d’un rapport RecoSignal remonte jusqu’à ce texte.

C’est la part qui sépare une mesure d’une affirmation marketing, et c’est la norme à laquelle nous aimerions que le reste de ce secteur soit tenu — y compris par quiconque lit cette page avec le rapport d’un concurrent ouvert dans un autre onglet. Si un chiffre de votre rapport vous semble faux, demandez-nous les réponses qui le sous-tendent. Elles existent.

Cette page décrit la version 1.2 de la méthodologie. Quand la méthode change, la version change, et les rapports indiquent quelle version les a produits.

Voyez-la tourner sur votre propre entreprise

La façon la plus rapide de juger une méthodologie, c’est de la regarder produire un résultat que vous pouvez vérifier. L’AI Visibility Snapshot gratuit applique à votre entreprise la mesure décrite ci-dessus et vous restitue votre score, votre part des recommandations face à vos concurrents et votre plus grande lacune — avec les réponses brutes derrière. Si le chiffre vous surprend, les réponses sont là pour qu’on en discute.

Questions fréquentes

Pourquoi mesurer la fréquence plutôt que mon rang dans ChatGPT ?
Parce qu’il n’y a pas de rang. Les assistants d’IA ne tiennent aucune liste classée d’entreprises ; ils génèrent une réponse, et l’ordre des noms à l’intérieur change d’une exécution à l’autre pour la même question. Nous enregistrons la position à titre de diagnostic et lui donnons une pondération nulle dans le score. Un prestataire qui vous vend un « rang dans ChatGPT » pose une décimale sur du bruit.
Mesurez-vous l’application ChatGPT que mes clients utilisent réellement ?
Non, et personne d’autre non plus. Nous interrogeons les modèles par leurs API officielles avec la recherche web activée. L’application grand public ajoute un historique de conversation, une mémoire de compte, un niveau d’abonnement et des changements côté application que nous ne pouvons ni voir ni reproduire : la réponse sur le téléphone d’un client peut donc différer de la nôtre. Ce que nous produisons, c’est un échantillon large, répétable et vérifiable de la façon dont les modèles sous-jacents répondent aux questions de recommandation locale dans votre ville — pas un enregistrement des écrans de vos clients.
D’où viennent les pondérations des moteurs ?
De notre jugement sur la part du public utilisateur d’assistants que chaque moteur atteint : ChatGPT 0.45, Gemini 0.30, Perplexity 0.25. Ce ne sont pas des mesures, et nous les publions précisément pour que vous puissiez les rejeter. Votre rapport contient les scores bruts par moteur ; appliquez vos propres pondérations et calculez votre propre chiffre si les nôtres ne collent pas à votre marché.
Pourquoi la limite du « visible » est-elle à 40 ?
Parce que nous l’avons tracée là. Les seuils (≥40 visible, 10–39 faible, <10 invisible) existent pour rendre le chiffre lisible par un dirigeant, pas parce qu’une étude aurait établi ces points de coupure. Pour situer : le cabinet dentaire le plus performant de tout notre benchmark sur l’agglomération de Dallas a obtenu 27.0 sur 100 — sur ce marché, personne n’a franchi le seuil.
Combien de mesures compte un seul audit ?
138 appels en direct : 30 requêtes de style client par moteur sur ChatGPT, Gemini et Perplexity, les 8 requêtes à plus forte intention étant posées trois fois chacune — 46 mesures par moteur. Les répétitions existent parce que ces systèmes sont non déterministes et qu’une réponse isolée est une anecdote plutôt qu’une mesure.
Si je comble les lacunes signalées dans mon rapport, mon score va-t-il monter ?
Cela devrait augmenter la probabilité que vous soyez nommé, et nous ne prétendrons pas en savoir davantage. Aucune étude contrôlée n’a prouvé qu’une correction précise cause une hausse précise du score — ni la nôtre, ni celle d’un concurrent. Ce que nous pouvons faire, c’est mesurer à nouveau après les changements et vous dire ce qui a réellement bougé, ce qui explique pourquoi remesurer compte plus que n’importe quel chiffre isolé.

Découvrez si l'IA recommande votre entreprise

Le Snapshot gratuit montre votre AI Visibility Score et qui ChatGPT, Gemini et Perplexity recommandent à votre place.

Lancer un AI Visibility Snapshot gratuit