← Derniers articles
💻 computer science

Rethinking the Evaluation of Harness Evolution for Agents

Cet article critique les protocoles d'évaluation actuels pour l'évolution automatique de harnais pour les agents LLM en démontrant que, lorsqu'on les compare équitablement à une mise à l'échelle simple au moment de l'exécution sous des budgets équivalents et sur des tâches non vues, l'évolution de harnais n'offre aucun gain de performance constant et présente une généralisation limitée.

Auteurs originaux : Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

Publié 2026-07-15
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un assistant robotique super intelligent (un agent IA) qui doit résoudre des énigmes informatiques complexes. Pour l'aider, vous lui donnez un « harnais » — un ensemble sophistiqué d'instructions, d'outils et de règles qui lui indiquent comment parler à l'ordinateur, quels boutons presser et comment vérifier son travail.

Pendant un certain temps, les chercheurs ont pensé que la meilleure façon d'améliorer ces robots était de construire un « mécanicien de robot » qui ajusterait et améliorerait automatiquement le harnais de manière répétée. Ce mécanicien observerait l'échec du robot, se dirait : « Hmm, peut-être que si je change cette règle », testerait un nouveau harnais, et recommencerait jusqu'à trouver la configuration parfaite. Ils ont appelé cela l'Évolution Automatique du Harnais.

Mais dans ce nouvel article, une équipe de chercheurs a décidé de réexaminer si ce « mécanicien de robot » fait réellement quelque chose de spécial, ou s'il nous trompe simplement. Ils ont organisé une course équitable pour voir si le mécanicien concevait vraiment de meilleurs outils, ou s'il avait simplement de la chance en faisant beaucoup de tentatives.

La Grande Course : Évolution contre Tentatives Accrue

Les chercheurs ont mis en place une compétition sur un ensemble de puzzles célèbres appelé Terminal-Bench 2.1, qui contient 89 tâches de terminal différentes. Ils ont utilisé trois des modèles d'IA les plus intelligents disponibles : Claude Opus 4.6, GPT-5.4 et GPT-5.4 mini.

Ils ont comparé quatre stratégies différentes, toutes dotées de la même quantité de « temps de réflexion » (budget de calcul) :

  1. Échantillonnage Parallèle : Imaginez demander au robot d'essayer de résoudre l'énigme 5 fois différentes en même temps, puis de choisir la meilleure réponse. C'est comme lancer un dé 5 fois en espérant obtenir un six.
  2. Raffinement Séquentiel : Imaginez que le robot essaie une fois, voit où il s'est trompé, corrige sa réflexion, et réessaie. C'est comme réviser le brouillon d'une dissertation.
  3. Évolution du Harnais : C'est le « mécanicien de robot ». Il essaie de réécrire le manuel d'instructions du robot en se basant sur les échecs passés, dans l'espoir de créer un meilleur outil pour tout le monde.
  4. Mise à l'échelle du Harnais (Harness Scaling) : C'est comme si le mécanicien réécrivait les instructions juste pour ce puzzle spécifique pendant que le robot essaie de le résoudre.

Les Résultats Choc

L'article a révélé que le « mécanicien de robot » (Évolution du Harnais) n'a pas systématiquement gagné la course. En fait, il a souvent perdu face à des méthodes plus simples.

Lorsqu'il n'y avait pas de « clés de réponse » (Tests Unitaires) :
Si le robot devait deviner de lui-même s'il avait raison ou tort, le « mécanicien de robot » a en fait aggravé les choses.

  • La méthode simple de « essayer 5 fois » (Échantillonnage Parallèle) a augmenté le score moyen de 68,2 à 72,3.
  • Le « mécanicien de robot » (Évolution du Harnais) n'a atteint que 67,4, ce qui est en fait inférieur à l'utilisation des instructions originales sans aucun changement !
  • Les auteurs suggèrent que sans une « clé de réponse » claire pour dire au robot ce qui est juste, le mécanicien a commencé à faire des changements bruyants et confus qui ont nui aux performances du robot.

Lorsqu'il y avait des « clés de réponse » (Tests Unitaires) :
Même quand le robot pouvait vérifier son travail par rapport à une solution parfaite, le mécanicien ne s'est toujours pas illustré.

  • La méthode « essayer 5 fois » a atteint un score moyen de 86,0.
  • Le « mécanicien de robot » n'a atteint que 75,8.
  • Les auteurs ont remarqué quelque chose d'étrange : les améliorations du mécanicien n'apparaissaient que lorsqu'on lui permettait de choisir le meilleur de 5 essais (pass@5). Lorsqu'ils devaient réussir dès le premier essai (pass@1), le mécanicien n'améliorait presque rien. Cela suggère que le mécanicien ne concevait pas réellement un meilleur outil ; il aidait simplement le robot à faire plus de tentatives.

Le Piège du « Surapprentissage » (Overfitting)

La plus grande surprise est venue lorsque les chercheurs ont testé si le « mécanicien de robot » pouvait apprendre une leçon applicable à de nouveaux puzzles. Ils ont laissé le mécanicien s'entraîner sur 45 tâches d'entraînement, puis l'ont testé sur 34 tâches totalement nouvelles qu'il n'avait jamais vues.

Le résultat ? Le mécanicien a à peine fait bouger l'aiguille.

  • Sur les nouvelles tâches, le score n'a augmenté que de 0,6 point en moyenne.
  • Pour un modèle (GPT-5.4), le score n'a pas changé du tout (72,1 à 72,1).

L'article suggère que le mécanicien n'apprenait pas de règles générales pour être un bon robot. Au lieu de cela, il « mémorisait des raccourcis » pour les puzzles spécifiques sur lesquels il s'entraînait. C'était comme un étudiant qui mémorise les réponses d'un examen blanc mais échoue à l'examen réel parce qu'il n'a pas réellement appris la matière.

Quel est donc le Verdict ?

L'article soutient que nous devons cesser de célébrer l'« Évolution Automatique du Harnais » comme une solution miracle simplement parce qu'elle obtient des scores plus élevés sur les mêmes puzzles sur lesquels elle s'est exercée.

  • Ce qu'il écarte : Il écarte l'idée que ces méthodes d'évolution sont actuellement supérieures au simple fait d'essayer plus fort (augmenter le calcul au moment de l'exécution/test-time computation).
  • Ce qu'il suggère : Il suggère que les gains observés pourraient simplement être le résultat du robot qui essaie plus de fois, et non parce que la conception du harnais est devenue plus intelligente.
  • À retenir : Les auteurs proposent que pour que l'évolution du harnais soit réellement utile, nous devons la tester sur des puzzles suffisamment difficiles pour nécessiter une véritable mise à niveau des outils, et nous devons la tester sur de nouveaux puzzles pour nous assurer qu'elle ne triche pas en mémorisant les anciens.

En bref, le « mécanicien de robot » est encore un travail en cours. Pour l'instant, il semble plus doué pour ajuster les instructions pour un seul puzzle que pour inventer un outil universel qui fonctionne pour tout le monde. L'article suggère que nous avons besoin de tests plus équitables avant de déclarer cette méthode gagnante.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →