Blog

Pourquoi la même question ne donne jamais deux fois la même réponse

Les assistants IA produisent des réponses différentes à une question identique. D'où vient cette variabilité, pourquoi un test manuel ne suffit pas, et comment distinguer un vrai changement du bruit.

2 octobre 2026 · 3 min de lecture

Faites l'essai : posez à ChatGPT la question « quel est le meilleur logiciel de facturation pour un indépendant ? », notez les noms cités, puis posez-la à nouveau dans une nouvelle conversation. La liste a toutes les chances d'être différente — un nom en plus, un autre en moins, un ordre changé. Ce n'est pas un défaut ponctuel. C'est le fonctionnement normal d'un modèle de langage, et c'est la donnée de départ de toute mesure de visibilité sérieuse.

D'où vient la variabilité

Un modèle de langage produit son texte mot par mot, en choisissant à chaque étape parmi plusieurs suites possibles, chacune avec une probabilité. Ce choix comporte une part de hasard, réglée par un paramètre que l'on appelle souvent la température. Deux tirages produisent deux textes, et une marque qui se trouve « à la limite » d'être citée le sera dans certaines réponses et pas dans d'autres.

D'autres facteurs s'ajoutent :

  • La recherche web. Un assistant qui consulte le web avant de répondre ne trouve pas toujours les mêmes pages, ni dans le même ordre.
  • Les mises à jour du modèle. Les fournisseurs font évoluer leurs modèles, parfois sans changer leur nom commercial.
  • La formulation. « Meilleur logiciel de facturation » et « logiciel de facturation recommandé » ne produisent pas la même distribution de réponses.
  • Le contexte. Dans une application grand public, l'historique de conversation, la langue ou la localisation de l'utilisateur peuvent influencer la réponse.

Pourquoi un test manuel ne prouve rien

Si votre marque est citée dans 30 % des réponses à une question donnée, un test unique vous montrera votre nom environ une fois sur trois. Vous pouvez donc conclure, selon le tirage, que « tout va bien » ou que « nous avons disparu » — à partir de la même réalité.

Le problème s'aggrave quand on compare deux moments. Une équipe qui teste dix questions un lundi, puis les mêmes dix questions le lundi suivant, observera presque toujours une différence. La plupart du temps, cette différence n'est que du bruit. Annoncer une progression sur cette base, c'est risquer de célébrer un hasard — ou de défaire une action qui fonctionnait.

Penser en échantillons, pas en mesures

La bonne manière de traiter ces réponses est celle d'un sondage. Chaque réponse est une observation ; l'ensemble des observations permet d'estimer une fréquence, avec une marge d'incertitude qui se resserre à mesure que l'on accumule des réponses.

Concrètement, un chiffre de visibilité devrait toujours être accompagné de deux informations : le nombre d'observations sur lequel il repose, et un intervalle de confiance — la fourchette dans laquelle la vraie valeur a de bonnes chances de se trouver. Un score de 35 avec un intervalle de 32 à 38 et un score de 35 avec un intervalle de 20 à 50 ne racontent pas du tout la même histoire.

Distinguer un vrai changement du bruit

Quand on compare deux périodes, la question à poser n'est pas « le chiffre a-t-il bougé ? » — il bouge toujours — mais « l'écart est-il plus grand que ce que le hasard produirait seul ? ». Il existe des méthodes statistiques pour répondre, dont certaines, comme le bootstrap, consistent à rééchantillonner les observations des milliers de fois pour voir quelle variation est normale.

L'important n'est pas la méthode exacte, mais la discipline qu'elle impose : ne rapporter un changement que lorsqu'il dépasse le bruit, et dire clairement « pas de changement significatif » le reste du temps. Un outil qui annonce une hausse ou une baisse chaque semaine crie au loup — et on finit par ne plus l'écouter.

Ce que cela implique en pratique

  1. Posez chaque question plusieurs fois et régulièrement, plutôt qu'une seule fois avec beaucoup de questions différentes.
  2. Gardez les formulations stables pour pouvoir comparer d'une période à l'autre ; ajoutez des variantes comme des questions distinctes.
  3. Séparez les moteurs et leurs variantes : un modèle connecté au web et le même modèle sans recherche forment deux séries différentes.
  4. Exigez la taille d'échantillon à côté de chaque chiffre, y compris dans les rapports que vous transmettez en interne.
  5. Laissez du temps : une action de fond (un article de presse, une page comparative) met souvent plusieurs semaines à produire un effet mesurable.

La variabilité n'est pas un obstacle à la mesure ; elle en est le sujet. Une fois qu'on l'accepte, on peut enfin poser la bonne question : non pas « suis-je cité ? », mais « à quelle fréquence, et est-ce que ça change vraiment ? ».