Model Selection as Policy Choice: Open-Weight LLMs Converge on Institutions but Diverge on Economic Policy
Cette étude démontre que les grands modèles de langage à poids ouverts ne sont pas des outils interchangeables pour l'analyse des politiques, car le choix du modèle — plutôt que la température d'échantillonnage — induit des divergences stables et structurées dans les préférences de politique économique tout en maintenant un consensus sur les questions institutionnelles et environnementales, faisant ainsi du choix du modèle une décision de gouvernance critique.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'idée principale : Tous les chefs IA ne cuisinent pas le même plat
Imaginez que vous êtes un responsable gouvernemental essayant de décider d'une nouvelle politique économique. Vous demandez conseil à une IA. La plupart des gens supposent que si vous posez la même question à cinq modèles d'IA différents, vous obtiendrez cinq versions légèrement différentes de la même réponse, comme si vous demandiez à cinq personnes différentes de réciter le même poème.
Cet article soutient que cette hypothèse est fausse.
Au lieu d'être des outils interchangeables, les auteurs ont découvert que les différents modèles d'IA sont comme des chefs différents dotés de personnalités et de philosophies politiques distinctes. Si vous leur posez la même question sur l'économie, ils ne se contentent pas de changer les mots ; ils choisissent souvent des recettes complètement différentes basées sur leurs propres « goûts » cachés.
L'expérience : Le test de goût de l'IA
Les chercheurs ont mis en place un immense test de goût.
- Le garde-manger : Ils ont rassemblé 40 modèles d'IA différents en « poids ouverts » (ce sont des modèles que n'importe qui peut télécharger et exécuter sur son propre ordinateur, contrairement aux modèles secrets détenus par les géants de la technologie).
- Le menu : Ils ont soumis à chaque modèle exactement le même questionnaire. Les questions couvraient des sujets difficiles comme l'inflation, le chômage, le logement et les relations internationales.
- Les règles : Pour chaque question, les modèles devaient évaluer quatre réponses possibles différentes (A, B, C ou D) sur une échelle de 0 à 100.
- La répétition : Pour s'assurer que les résultats n'étaient pas de simples bugs aléatoires, ils ont posé les mêmes questions à chaque modèle 100 fois chacune.
Ce qu'ils ont découvert
1. La « personnalité » est réelle, pas aléatoire
Quand vous lancez une pièce, le résultat est aléatoire. Quand vous posez une question à une IA, vous pourriez vous attendre à une certaine part d'aléatoire aussi. Les chercheurs ont découvert que l'aléatoire (le bruit) était en fait très faible.
- L'analogie : Imaginez une chorale. Si les chanteurs ne faisaient que des bruits aléatoires, le son serait un désordre total. Mais ici, les chercheurs ont trouvé que la « voix » de chaque chanteur (chaque modèle d'IA) était très distincte et stable.
- Le résultat : Environ 57 % des différences dans les réponses provenaient du quel modèle répondait. Changer la « température » (un réglage qui rend l'IA plus ou moins aléatoire) changeait à peine la réponse (moins de 2 %). Cela signifie que les modèles ont des biais intégrés et stables qui ne disparaissent pas simplement en modifiant un réglage.
2. Ils sont d'accord sur « qui commande », mais se disputent sur « comment dépenser l'argent »
Les chercheurs ont utilisé une carte statistique (comme un GPS pour les idées) pour voir où se situaient les modèles. Ils ont trouvé deux principales « lignes de faille » où les modèles divergeaient :
- La ligne de la « Confiance dans les institutions » (où ils sont globalement d'accord) : Presque tous les modèles s'accordent sur le fait que les organisations internationales, les règles et les institutions formelles sont importantes. Ils apprécient tous généralement l'idée de suivre les règles et de faire confiance aux experts.
- La ligne de la « Philosophie économique » (où ils se disputent) : C'est ici que les modèles se divisent.
- Groupe A (Les amoureux du marché) : Ces modèles préfèrent laisser le marché libre décider, réduire les réglementations et donner la priorité à la croissance.
- Groupe B (Les interventionnistes) : Ces modèles préfèrent que le gouvernement intervienne pour corriger les inégalités, contrôler les prix et protéger l'environnement, même si cela ralentit la croissance.
Le test de la « Stagflation » :
Les chercheurs ont posé une question classique et difficile : « Le pays connaît une inflation élevée ET un chômage élevé. Que faire ? »
- Certains modèles ont dit : « Écrasez l'inflation, même si les gens perdent leurs emplois. »
- D'autres ont dit : « Sauvez les emplois, même si les prix augmentent. »
- D'autres ont dit : « Mettez en place des règles strictes pour les deux. »
- D'autres ont dit : « Utilisez un mélange de contrôles expérimentaux bizarres. »
- Le choc : Chacune de ces quatre réponses était le « meilleur choix » pour au moins certains des modèles. Il n'y avait pas de « réponse IA » unique.
3. Le piège de la « Confiance »
L'une des découvertes les plus intéressantes concernait la confiance.
- Certains modèles étaient très timides et disaient : « Je ne suis pas sûr » (scores de confiance faibles).
- D'autres étaient très bruyants et disaient : « Je connais la réponse ! » (scores de confiance élevés).
- Le rebondissement : La confiance d'un modèle ne dépendait pas de la difficulté de la question. Elle dépendait entièrement de quel modèle il était.
- L'analogie : C'est comme un étudiant qui obtient toujours un C mais qui dit « Je suis sûr à 100 % d'avoir raison », tandis qu'un autre étudiant obtient un A mais dit « Je n'en suis sûr qu'à 50 % ». Si vous êtes un décideur politique, vous pourriez être trompé en faisant confiance au modèle bruyant et confiant, même s'il est tout aussi biaisé que le modèle silencieux.
4. La taille ne signifie pas « meilleure » politique
On pourrait penser qu'une IA plus grande, plus intelligente (avec plus de « puissance cérébrale »), aurait une vision politique plus équilibrée ou « correcte ».
- La conclusion : Les modèles plus grands étaient légèrement plus cohérents (moins de bruit), mais ils n'avaient pas une opinion politique différente des modèles plus petits.
- L'analogie : Un robot géant et super intelligent et un petit robot simple peuvent être tous deux des « Amoureux du marché » ou tous deux des « Interventionnistes ». Vous ne pouvez pas deviner le biais politique d'un modèle simplement en regardant sa taille ou son nom de marque.
L'essentiel : Choisir un modèle est un choix politique
L'article conclut que choisir quel IA utiliser n'est pas un détail technique ; c'est une décision de politique publique.
- La métaphore : Si vous engagez un consultant pour rédiger un rapport sur l'économie, vous engagez une personne ayant une vision du monde spécifique. Si vous engagez le Modèle d'IA X, vous engagez un « Conservateur de marché ». Si vous engagez le Modèle d'IA Y, vous engagez un « Interventionniste gouvernemental ».
- Le danger : Si vous ne le savez pas, vous pourriez penser que l'IA vous donne un fait neutre et objectif. Mais en réalité, l'IA injecte discrètement ses propres valeurs cachées dans vos décisions politiques.
À retenir :
Avant d'utiliser l'IA pour aider à prendre des décisions gouvernementales, nous devons la traiter comme un expert humain : Vérifiez leur parcours, connaissez leurs biais, et ne vous contentez pas de faire confiance à l'opinion d'une seule personne. Nous devons interroger plusieurs IA différentes et comparer leurs réponses pour voir l'image complète, plutôt que de laisser un seul modèle « par défaut » décider de notre avenir à notre place.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.