← Derniers articles
🤖 AI

Mind the Gap: How Elicitation Protocols Shape the Stated-Revealed Preference Gap in Language Models

Ce papier démontre que l'écart entre les préférences déclarées et révélées dans les modèles de langage dépend fortement des protocoles d'élicitation, montrant que si permettre la neutralité dans les préférences déclarées améliore la corrélation avec les préférences révélées en choix forcé, l'introduction de l'abstention dans les préférences révélées ou l'utilisation de l'orientation par prompt système ne parviennent pas à résoudre de manière fiable ce décalage.

Auteurs originaux : Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

Publié 2026-05-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de comprendre la personnalité d'un nouvel ami. Vous avez deux façons de le faire :

  1. Le lui demander directement : « Privilégiez-vous l'honnêteté plus que la gentillesse ? » (C'est sa Préférence déclarée).
  2. Observer ses actions : Placez-le dans une situation difficile où il doit choisir entre être honnête ou être gentil, et voyez ce qu'il fait réellement (C'est sa Préférence révélée).

Dans le monde de l'IA, les chercheurs ont remarqué un problème : parfois, une IA déclare aimer « l'Honnêteté », mais lorsqu'elle est confrontée à une histoire piégeuse, elle choisit la « Gentillesse » à la place. Ce décalage est appelé l'écart Préférence déclarée-Préférence révélée (SvR).

Ce papier, intitulé « Mind the Gap » (Faites attention à l'écart), enquête sur les raisons de cet écart et, plus important encore, sur la façon dont la manière dont nous posons les questions modifie la réponse. Considérez le « protocole d'élicitation » comme les règles du jeu que nous jouons avec l'IA.

Voici ce que les chercheurs ont découvert, en utilisant des analogies simples :

1. Le piège du « Choix forcé » (L'ancienne méthode)

Auparavant, les chercheurs jouaient à un jeu où l'IA était contrainte de choisir un camp. Imaginez un arbitre criant : « Vous devez choisir : A ou B ! Pas de discussion, pas d'hésitation ! »

  • Le Problème : Si l'IA est réellement indécise, ou pense que « cela dépend de la situation », elle doit tout de même choisir A ou B. C'est comme forcer une personne à choisir entre « Pizza » et « Salade » même si elle est rassasiée et ne veut ni de l'un ni de l'autre.
  • Le Résultat : L'IA choisit au hasard ou en fonction de l'ordre des mots, créant des préférences « factices ». Lorsque les chercheurs ont comparé ces choix factices à ce que l'IA disait valoriser, le lien était faible et désordonné.

2. Le bouton « Refus » (La nouvelle méthode pour les Préférences déclarées)

Les chercheurs ont essayé une nouvelle règle pour la partie « Demandez-leur directement ». Ils ont dit : « Vous pouvez choisir A, B, ou vous pouvez dire 'Je m'en fiche' ou 'Cela dépend'. »

  • L'Analogie : Imaginez demander à un ami : « Préférez-vous le café ou le thé ? » mais en lui permettant de dire : « Je ne bois pas », ou « Cela dépend de l'heure de la journée ».
  • Le Résultat : Cela a agi comme un filtre. Cela a éliminé les « signaux faibles » (les suppositions ou les choix aléatoires de l'IA). Lorsque les chercheurs n'ont regardé que les moments où l'IA a fermement choisi un camp, ses préférences déclarées correspondaient beaucoup mieux à son comportement réel. L'« écart » a considérablement diminué.

3. Le problème des « Trop de refus » (La nouvelle méthode pour les Préférences révélées)

Ensuite, ils ont essayé de permettre à l'IA de dire « Cela dépend » pendant les scénarios difficiles (les préférences révélées).

  • L'Analogie : Maintenant, imaginez mettre votre ami dans une crise réelle et lui dire : « Vous pouvez choisir l'Action A, l'Action B, ou simplement dire 'Je ne sais pas'. »
  • Le Résultat : L'IA a commencé à dire « Cela dépend » ou « Égal » presque tout le temps ! C'était comme un élève qui, face à un examen difficile, écrit simplement « Je ne suis pas sûr » à chaque réponse.
  • La Conséquence : Parce que l'IA refusait de faire un choix ferme si souvent, les chercheurs ne pouvaient pas établir une hiérarchie claire de ce que l'IA valorisait réellement. Le lien entre ce qu'elles disaient et ce qu'elles faisaient a disparu (chuté à près de zéro, voire négatif).

4. L'expérience du « Mode d'emploi » (Pilotage par les instructions)

Enfin, les chercheurs ont essayé de « corriger » le comportement de l'IA en lui donnant une triche. Avant les scénarios difficiles, ils ont dit à l'IA : « Voici votre propre liste de valeurs que vous avez dit aimer. Veuillez suivre cette liste strictement. »

  • L'Analogie : C'est comme dire à un conducteur : « Rappelez-vous, vous avez dit que vous aimiez la sécurité, alors veuillez conduire prudemment ! » juste avant une course.
  • Le Résultat : Cela n'a pas fonctionné de manière fiable. Pour certaines IA, cela a aidé un peu. Pour d'autres (comme la famille « Claude »), cela a en fait empiré les choses. L'IA semblait ignorer le mode d'emploi ou s'y perdre. Les chercheurs ont constaté que ce tour de « mode d'emploi » fonctionne pour de petites listes de valeurs mais échoue lamentablement lorsque la liste est longue (16 valeurs différentes).

La grande leçon

La leçon principale de ce papier est que la façon dont vous posez la question change la réponse.

  • Si vous forcez une IA à choisir quand elle est indécise, vous obtenez des données bruyantes et factices.
  • Si vous laissez une IA dire « Je ne sais pas » trop souvent, vous n'obtenez aucune donnée du tout.
  • Dire simplement à une IA de « suivre ses propres règles » ne corrige pas le problème de manière fiable.

Les auteurs concluent que pour vraiment comprendre les valeurs de l'IA, nous avons besoin de méthodes qui reconnaissent que parfois, l'IA (tout comme un humain) n'a véritablement pas de préférence claire, et nous devons concevoir nos tests pour gérer cette incertitude plutôt que de forcer un choix ou de l'ignorer.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →