Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents
Cet article présente Harness-IF, un nouveau benchmark qui évalue les véritables capacités de suivi d'instructions des agents de codage à travers diverses surfaces en distinguant la conformité réelle de la coïncidence grâce à une nouvelle métrique appelée Against-Prior Accuracy (AP-Acc), révélant que les benchmarks existants surestiment les performances et que la priorité des règles ne suit pas strictement la profondeur du prompt.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous enseigniez à un robot chef comment cuisiner un repas complexe. Vous ne vous contentez pas de crier une seule commande comme « Fais des pâtes ! » à la toute fin. Au lieu de cela, vous avez une pile d'instructions : un livre de règles sur le mur (le prompt système), une note sur la fiche de recette (le fichier du projet), une description du fonctionnement du couteau (la description de l'outil), et enfin, votre demande spécifique au chef (l'instruction de l'utilisateur). Pendant longtemps, les scientifiques testant ces chefs IA ne se souciaient que d'une chose : est-ce que le chef a servi les pâtes ? Si l'assiette était belle, ils lui donnaient une étoile d'or. Mais ils ne vérifiaient jamais quelles instructions le chef avait réellement écoutées. Peut-être que le chef a ignoré la règle du livre sur le « sans ail » parce qu'il aimait de toute façon les pâtes sans ail. C'est ce coin délicat de l'intelligence artificielle que nous explorons : le suivi d'instructions (Instruction Following). Il ne s'agit pas seulement d'obtenir la bonne réponse ; il s'agit de prouver que le robot a suivi les règles spécifiques que vous lui avez données, même quand ces règles vont à l'encontre de ce que le robot aurait fait naturellement.
Ce document, intitulé « Harness-IF », est comme une agence de détectives pour les chefs IA. Les chercheurs ont réalisé que les tests existants étaient trop faciles car ils ne regardaient que le plat final. Ils voulaient savoir si le robot obéissait réellement aux règles ou s'il avait simplement de la chance. Ils ont donc construit un nouveau test super détaillé appelé Harness-IF. Au lieu de simplement demander : « As-tu fait les pâtes ? », ils ont mis en place 60 scénarios de codage réalistes où l'IA devait suivre 256 petites règles différentes. Ces règles étaient cachées à différents endroits dans le « cerveau » du robot — certaines dans le prompt système, d'autres dans les fichiers de projet, d'autres dans les descriptions d'outils, et d'autres dans le chat direct de l'utilisateur.
Voici la grande surprise que les détectives ont découverte : les modèles d'IA sont bien meilleurs pour suivre des règles qui correspondent à ce qu'ils auraient fait de toute façon que des règles qui vont à l'encontre de leurs habitudes naturelles. Les chercheurs appellent cela le test « Against-Prior ». Ils ont découvert que lorsqu'une règle forçait l'IA à faire quelque chose de différent de son comportement par défaut, le taux de réussite de l'IA chutait considérablement. En moyenne, les modèles étaient environ 5,8 points de pourcentage moins performants pour suivre des règles qui allaient à l'encontre de leur nature. C'est comme un étudiant qui obtient un A à un examen de mathématiques parce qu'il adore les mathématiques, mais qui obtient un C lorsque le professeur lui demande de résoudre un problème en utilisant une méthode qu'il déteste. Le document suggère que si nous ne regardons que la note finale (le succès de la tâche), nous nous trompons en pensant que l'étudiant est un génie des mathématiques, alors qu'il se repose peut-être simplement sur son talent naturel.
L'étude a également examiné où les règles étaient placées. Vous pourriez penser que la règle prononcée en dernier (l'instruction de l'utilisateur) serait la plus importante, comme si la dernière personne à parler dans une réunion est généralement celle qui gagne. Mais les données ont montré quelque chose de différent. Les règles trouvées dans le prompt système, les fichiers de projet et les instructions de l'utilisateur se sont toutes partagé la première place en termes d'importance, tandis que les règles enfouies dans les descriptions d'outils ou de compétences étaient souvent ignorées. Il s'avère que l'IA prête attention aux règles de la « vue d'ensemble » plus qu'aux détails minutieux du fonctionnement d'un outil spécifique.
En résumé, ce document ne prétend pas avoir résolu le problème de la création d'une IA parfaite. Au lieu de cela, il nous donne une meilleure règle pour mesurer la capacité de l'IA à écouter réellement. Il montre que les modèles d'IA actuels sont excellents pour faire ce qu'ils veulent faire, mais qu'ils luttent encore lorsqu'on leur demande de faire quelque chose qu'ils ne choisiraient pas naturellement. En séparant la « conformité chanceuse » de la « véritable obéissance », les chercheurs espèrent construire de meilleurs tests pour rendre nos assistants IA plus fiables, et non pas seulement plus performants en apparence.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.