Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness
Cet article identifie et corrige deux facteurs de confusion critiques dans les comparaisons de valeur entre modèles : le déterminisme de la réponse, qui confond les véritables différences de valeur avec la netteté des engagements par choix forcé, et le harnais d'accès, où les couches clientes spécifiques au déploiement altèrent considérablement le profil de valeur apparent d'un modèle, faussant ainsi les classements basés sur des mesures à tirage unique.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de goûter deux marques différentes de crème glacée pour voir laquelle est la plus « sucrée ». Vous prenez une boule de la Marque A et une boule de la Marque B. La Marque A est à la vanille, et la Marque B est aussi à la vanille, mais la Marque B est servie dans un minuscule verre à shot super concentré, tandis que la Marque A est dans un bol géant et aérien. Si vous ne goûtez qu'une seule cuillerée, la Marque B pourrait sembler beaucoup plus sucrée simplement parce qu'elle est si intense et concentrée, et non parce que la crème glacée elle-même est fondamentalement différente.
C'est exactement ce que ce document découvre à propos des modèles d'Intelligence Artificielle (IA). Pendant longtemps, des chercheurs ont comparé différents modèles d'IA en leur posant une seule question : « Si tu devais choisir entre l'Option A et l'Option B, laquelle choisis-tu ? » Ils supposaient que si le Modèle X choisissait A et le Modèle Y choisissait B, les deux modèles avaient des « personnalités » ou des « valeurs » totalement différentes.
Les auteurs, Hong-In Won et Hyoseop Kim, disent : « Attendez une minute. Vous mesurez deux choses différentes à la fois, et vous les confondez. »
Les deux confusions
1. La confusion sur l'engagement (Déterminisme)
La première confusion concerne la manière dont un modèle s'engage nettement dans une réponse.
Imaginez deux personnes répondant à un quiz.
- La Personne A est sûre à 100 %. Elle hurle « A ! » chaque fois qu'on lui demande.
- La Personne B est un peu hésitante. Elle dit « A » 60 % du temps et « B » 40 % du temps.
Si vous leur posez la question une seule fois, et que la Personne A dit « A » et la Personne B dit « B », vous pourriez penser qu'elles sont totalement opposées. Mais elles ne le sont pas ! Toutes deux penchent vers le « A ». La Personne A est juste une fan de « A » bruyante et décisive, tandis que la Personne B est une fan de « A » calme et hésitante.
L'article montre que lorsque les chercheurs comparent les modèles d'IA en utilisant une seule réponse (un « tirage unique »), ils comptent accidentellement cette « force » ou « décisivité » comme une différence de valeurs.
- Le constat : Les auteurs ont testé neuf modèles d'IA différents. Ils ont découvert que certains modèles sont incroyablement décisifs (comme un modèle appelé GPT-5.5, qui était à 0,95 sur une échelle de certitude), tandis que d'autres sont beaucoup plus mous (comme le modèle « Opus » d'Anthropic, qui n'était qu'à 0,34 lorsqu'il était mesuré via une application spécifique).
- Le rebondissement : Cette « décisivité » n'est pas un trait de personnalité fixe que l'on peut deviner simplement en regardant le nom du modèle. Dans une famille de modèles, un modèle plus petit et moins cher était en fait plus décisif que le modèle phare, plus grand et plus coûteux. Dans une autre famille, le plus gros modèle était plus décisif. Les auteurs suggèrent que l'on ne peut pas supposer la « force » d'un modèle simplement en connaissant son fabricant ou sa taille ; il faut le mesurer à chaque utilisation.
2. La confusion du « camion de livraison » (Le harnais d'accès)
La seconde confusion est encore plus sournoise. Il ne s'agit pas de la crème glacée, mais du camion qui la livre.
Les auteurs ont réalisé que la façon dont vous posez une question à l'IA modifie la réponse. Ils appellent cela le « harnais d'accès » (access harness).
- Imaginez que vous commandiez une pizza. Si vous appelez directement la pizzeria (l'« API brute »), vous recevez la pizza exactement telle que le chef l'a préparée.
- Mais si vous commandez via une application de livraison spécifique (comme un « CLI » ou un outil d'abonnement), cette application peut ajouter une note à la cuisine : « Rendez-la extra épicée ! » ou « Ne laissez pas le client dire non ».
Les auteurs ont découvert que pour certains modèles d'IA, le « mode de livraison » (le logiciel utilisé pour parler à l'IA) changeait complètement la personnalité du modèle.
- La preuve : Ils ont pris le même modèle d'IA et lui ont posé les mêmes questions deux fois : une fois via la connexion directe et une fois via une application d'abonnement populaire.
- Le résultat : Via l'application d'abonnement, le modèle « Opus » paraissait très mou et incertain (0,34). Mais lorsqu'ils l'ont interrogé directement via la connexion brute, il était en fait assez décisif (0,66). L'application avait « aplati » sa personnalité.
- L'astuce du « refus » : Dans un cas, la connexion directe a montré que le modèle refusait de répondre 10 % du temps parce qu'il jugeait la question injuste. Mais l'application d'abonnement forçait le modèle à répondre à chaque fois, le faisant paraître complaisant. Les auteurs ont prouvé que cela était causé par un « prompt système » caché (un ensemble d'instructions que l'application envoie avec la question) qui disait au modèle : « Choisis juste une lettre, ne discute pas ».
Ce que cela signifie pour la « personnalité » de l'IA
Alors, qu'est-ce que l'article a réellement prouvé ?
- Il a prouvé que la « distance » que nous voyons entre les modèles d'IA est souvent fausse. C'est un mélange de leur niveau de force et du logiciel que nous avons utilisé pour leur parler.
- Il a prouvé que le logiciel que nous utilisons pour parler à l'IA (le « harnais ») n'est pas un tuyau neutre ; il façonne activement les valeurs de l'IA.
- Il suggère (mais ne résout pas totalement) que la « décisivité » varie considérablement d'un modèle à l'autre et ne suit pas une règle simple du type « les plus gros modèles sont les plus bruyants ».
Qu'est-ce qui n'est PAS la réponse ?
L'article exclut explicitement l'idée que nous puissions simplement regarder le nom d'un modèle pour connaître ses valeurs. Il exclut également l'idée que toutes les différences entre les modèles ne soient que du « bruit ».
- La bonne nouvelle : Même après avoir corrigé ces deux confusions, les auteurs ont constaté que certains modèles sont réellement en désaccord. Par exemple, un modèle appelé « Grok-3 » va réellement dans une direction différente des modèles d'OpenAI ou de Google sur environ 73 % à 88 % des questions. Ce sont de vraies différences, pas seulement des erreurs de mesure.
- La mauvaise nouvelle : La plupart des différences que nous pensions voir au sein d'une même famille d'entreprises (comme entre différents modèles d'Anthropic) étaient principalement dues à des différences de niveau de force, ou à la manière dont l'application utilisée les façonnait.
La conclusion à retenir
Si vous voulez savoir si deux modèles d'IA ont des valeurs différentes, vous ne pouvez pas simplement leur poser une question et voir ce qu'ils disent. Vous devez :
- Leur poser la même question de nombreuses fois pour voir s'ils sont juste « bruyants » ou réellement « différents ».
- Vous assurer que vous leur parlez par la même « porte » (le même logiciel de connexion), car la porte elle-même peut changer leur avis.
Les auteurs n'ont pas résolu le mystère des personnalités de l'IA pour toujours, mais ils ont construit un meilleur microscope pour les observer. Ils nous ont montré que ce que nous prenions pour un profond désaccord philosophique pourrait n'être qu'une IA qui crie et une autre qui murmure, ou une IA parlant à un patron autoritaire et une autre parlant à un ami calme. Les vraies différences existent, mais il faut éliminer le bruit pour les voir.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.