When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences
Cet article introduit un cadre expérimental fondé sur la symétrie pour mesurer systématiquement comment les modèles de langage de grande taille résolvent les conflits entre des spécifications concurrentes, révélant une hiérarchie de préférences constante où les langages formels et les langages formels naturalisés sont privilégiés par rapport au langage naturel pur et aux exemples d'entrées-sorties à travers divers domaines.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous demandiez l'aide d'un ami très intelligent et très cultivé pour résoudre un casse-tête difficile. Mais voici le hic : votre ami a reçu deux manuels d'instructions différents pour le même casse-tête, et les manuels se contredisent. L'un dit : « Tournez le bouton rouge vers la gauche », tandis que l'autre insiste : « Tournez le bouton rouge vers la droite ». Dans le monde de l'intelligence artificielle, ces « amis » sont des modèles de langage étendus (LLM) — de gigantesques programmes informatiques entraînés sur la quasi-totalité du texte présent sur Internet. Ils sont incroyables pour écrire des histoires, résoudre des problèmes mathématiques ou même coder, mais ils se trompent souvent lorsque les informations qu'ils reçoivent sont désordonnées ou contradictoires.
Ce document explore un recoin spécifique de la science de l'IA : la Résolution de Conflits. Il pose une question simple mais profonde : lorsqu'une IA reçoit deux instructions contradictoires, laquelle écoute-t-elle réellement ? Préfère-t-elle une formule mathématique stricte ? Une phrase décontractée en anglais courant ? Une liste d'exemples ? Ou un extrait de code formel ? Comprendre cela est crucial car, à mesure que nous commençons à utiliser l'IA pour des tâches importantes — comme écrire du code informatique, diagnostiquer des problèmes médicaux ou prendre des décisions juridiques — nous devons savoir si l'IA suit les « règles dures » ou si elle se contente de deviner en fonction de la sonorité des mots. Si nous ne savons pas quelle instruction l'IA privilégie, nous ne pouvons pas faire confiance à ses réponses.
Le Grand Duel des Instructions
Les chercheurs de l'University College London ont décidé de traiter ce problème comme une expérience de foire scientifique. Au lieu de simplement poser des questions aléatoires à l'IA, ils ont construit une arène contrôlée où ils pouvaient forcer l'IA à choisir entre deux règles spécifiques et contradictoires. Ils ont appelé cela un « cadre basé sur la symétrie », ce qui est une façon sophistiquée de dire qu'ils ont configuré le jeu de manière si parfaite que seule la manière dont les règles étaient écrites changeait, et non les règles elles-mêmes.
Pour ce faire, ils ont créé une immense « Arène de Bataille Mathématique » comprenant 550 scénarios de conflit différents. Dans chaque scénario, l'IA devait résoudre un problème mathématique (comme calculer une séquence ou trouver un chemin sur un graphe) mais se voyait donner deux manières différentes de décrire la solution. Ils ont testé quatre « langages » d'instruction distincts :
- Langage Naturel Pur : Juste des phrases régulières en anglais (ex. : « Additionnez les nombres ensemble. »).
- Langage Formel : Symboles et équations mathématiques stricts (ex. : ).
- Langage Formel Naturalisé : Un mélange, utilisant des symboles mathématiques enveloppés dans des phrases en anglais (ex. : « La fonction est définie comme . »).
- Exemples Entrée-Sortie : Une liste d'exemples montrant des entrées et leurs résultats (ex. : « Si 2 entre, 3 sort. Si 5 entre, 6 sort. »).
L'IA devait choisir l'une de ces descriptions pour résoudre une question de test spécifique. Les chercheurs ont ensuite observé quelle description l'IA « faisaitait assez confiance » pour la suivre.
Les Résultats : La Hiérarchie de la Confiance
Les conclusions ont été étonnamment cohérentes. L'IA ne choisissait pas au hasard ; elle avait un favori très clair. Il s'avère que les modèles d'IA adorent la structure et détestent l'ambiguïté.
Les chercheurs ont découvert une « hiérarchie de confiance » stricte :
- Niveau Supérieur : Les langages Formels et Formels Naturalisés étaient les grands gagnants. L'IA suivait ces règles environ 87 % à 93 % du temps lorsqu'elles étaient opposées à l'anglais pur ou à des exemples. Il semble que lorsque l'IA voit une formule mathématique propre, elle la traite comme la « loi ».
- Niveau Intermédiaire : Le Langage Naturel Pur arrivait en deuxième position. Il était plus fiable que les exemples, mais moins que les mathématiques. L'IA suivait ces instructions environ 78 % du temps lorsqu'elles étaient en compétition avec des exemples.
- Niveau Inférieur : Les Exemples Entrée-Sortie étaient les moins dignes de confiance. Lorsque l'IA devait choisir entre une liste d'exemples et une règle claire, elle ignorait presque toujours les exemples.
Voyez cela ainsi : si vous dites à un robot : « Voici une liste de fois où j'ai déjeuné : 12h00, 12h15, 12h30 », il pourrait deviner que vous déjeunez à 12h45. Mais si vous lui dites : « Je déjeune à 12h00 tous les jours », il s'en tiendra à 12h00. L'IA préfère la règle explicite au modèle qu'elle doit deviner.
Ce n'est pas seulement des maths : Les tests en conditions réelles
L'équipe ne s'est pas arrêtée aux mathématiques. Ils voulaient voir si cette « hiérarchie de confiance » tenait bon dans des situations plus désordonnées et réelles. Ils ont testé l'IA dans trois autres domaines :
- Algèbre de Boole (Portes Logiques) : Ils ont opposé une formule mathématique compacte à une immense « Table de Vérité » (une liste massive de tous les résultats possibles). Même si la Table de Vérité était exhaustive et impossible à errer, l'IA préférait quand même la formule compacte 88 % du temps. Il semble que l'IA préfère les raccourcis « intelligents » aux listes de « force brute ».
- Génération de Code : Ils ont donné à l'IA un conflit entre une description écrite de ce qu'un programme informatique devrait faire et un ensemble de tests automatisés (du code qui vérifie si le programme fonctionne). Ici, les résultats dépendaient de la « puissance cérébrale » de l'IA. Les modèles plus petits et moins capables avaient tendance à suivre la description écrite, tandis que les modèles les plus puissants préféraient fortement les tests automatisés, les suivant jusqu'à 97 % du temps. Cela suggère qu'à mesure que l'IA devient plus intelligente, elle apprend à faire confiance aux « preuves concrètes » des tests de code plutôt qu'aux descriptions humaines.
- Règles Cliniques (Conseils Médicaux) : Ils ont testé l'IA avec de vraies règles médicales concernant les dosages de médicaments. Curieusement, l'IA ne se souciait pas du format (anglais vs exemples) autant qu'elle se souciait du contenu. Dans ce domaine, l'IA choisissait systématiquement la règle la plus stricte (celle qui disait « ne faites pas ceci ») plutôt que la plus permissive, quel que soit le mode de rédaction de la règle. Cela suggère que dans les domaines à enjeux élevés, l'IA possède un biais intrinsèque vers la sécurité.
Ce que cela signifie pour nous
Le papier conclut que l'IA n'est pas un simple devineur aléatoire ; elle possède une manière systématique de décider quelles instructions suivre. Elle préfère généralement les règles explicites et structurées (comme les formules mathématiques) aux modèles implicites (comme les exemples).
Cependant, les chercheurs ont également découvert que ce n'est pas une loi parfaite et immuable. La préférence de l'IA peut changer selon l'intelligence du modèle et le type de tâche effectuée. Par exemple, dans les tests médicaux, l'IA a ignoré le format pour se concentrer uniquement sur la réponse la plus « sûre ».
Cette étude nous donne un nouvel outil pour mesurer comment l'IA réfléchit. En comprenant que l'IA a un « type de prédilection » pour les instructions, nous pouvons concevoir de meilleurs systèmes. Si nous voulons qu'une IA suive une règle spécifique, nous devrions probablement l'écrire sous la forme d'un énoncé formel et clair plutôt que d'espérer qu'elle la déduise d'une liste d'exemples. C'est un rappel que, bien que l'IA devienne plus intelligente, elle a toujours besoin que nous parlions son langage clairement — surtout lorsque les instructions sont en conflit.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.