← Derniers articles
🤖 AI

Dissecting model behavior through agent trajectories

Cet article introduit l'« écart entre l'intention et l'exécution » entre les capacités du modèle et le comportement de la structure de contrôle comme un problème systémique critique, proposant le cadre personnalisable « Simple Strands Agent » (SSA) pour minimiser ce décalage tout en révélant des modèles de résolution de problèmes nuancés et spécifiques aux modèles grâce à une analyse détaillée de 138 000 trajectoires d'agents.

Auteurs originaux : Gaurav Gupta, Vatshank Chaturvedi, Jun Huan, Anoop Deoras

Publié 2026-06-17
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Gaurav Gupta, Vatshank Chaturvedi, Jun Huan, Anoop Deoras

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : Ce n'est pas seulement le cerveau, ce sont aussi les mains

Imaginez que vous avez un architecte de génie (le modèle d'IA) capable de concevoir une maison parfaite. Mais, vous engagez une équipe de construction (le Harness) pour la bâtir réellement.

L'article soutient que même si votre architecte est le plus intelligent du monde, la maison pourrait s'effondrer si l'équipe de construction comprend mal les plans, utilise les mauvais outils ou oublie de dire à l'architecte qu'un mur est de travers.

Les auteurs appellent cela l'« Écart Intention-Exécution ».

  • Intention : Ce que l'IA pense faire (ex : « Je vais corriger cette ligne de code spécifique »).
  • Exécution : Ce que le logiciel fait réellement (ex : supprimer accidentellement tout le fichier parce que les instructions étaient légèrement ambiguës).

Si l'écart entre ce que l'IA a l'intention de faire et ce que la machine exécute est trop large, l'IA s'embrouille, se blâme pour des erreurs qu'elle n'a pas commises et abandonne des tâches qu'elle aurait pu résoudre.

La solution : Le « Simple Strands Agent » (SSA)

Pour corriger cela, les auteurs ont construit une nouvelle équipe de construction appelée Simple Strands Agent (SSA). Voyez le SSA comme un contremaître super organisé qui parle exactement la même langue que l'architecte.

Au lieu de forcer chaque IA à s'adapter à une interface maladroite, le SSA s'adapte à l'IA.

  • Pour certaines IA : Il dit : « Hé, tu aimes écrire de longs plans avant d'agir ? Vas-y, mais essayons de prendre une action toutes les 10 minutes. »
  • Pour d'autres : Il dit : « Tu préfères les commandes courtes et percutantes ? Super, sautons la planification longue et commençons juste à réparer les choses. »

Résultat ? Lorsqu'ils ont testé ce nouveau contremaître avec 21 types différents d'architectes IA (provenant de sociétés comme OpenAI, Anthropic, Google et d'autres), les IA ont nettement mieux performé. Dans de nombreux cas, elles ont résolu des problèmes qu'elles avaient précédemment échoués, simplement parce que les « mains » (le harness) correspondaient enfin au « cerveau » (le modèle).

Le travail de détective : Observer la « Trajectoire »

Habituellement, quand nous testons une IA, nous regardons seulement la note finale : Réussite ou Échec.

  • La maison a-t-elle été construite ? Oui/Non.

Les auteurs ont réalisé que c'est comme juger un chef uniquement sur le fait que le gâteau soit sorti du four. Cela ne vous dit pas s'il l'a brûlé trois fois avant de réussir, ou s'il a accidentellement utilisé du sel à la place du sucre et a juste eu de la chance.

C'est pourquoi ils ont inventé une nouvelle façon d'observer le processus de cuisson, qu'ils appellent la Distance de Solution.

Imaginez une carte où le point de départ est « Code Cassé » et la destination est « Code Réparé ».

  • Bonne trajectoire : L'IA prend une ligne droite vers la destination. Chaque étape la rapproche du but.
  • Mauvaise trajectoire : L'IA marche vers la destination, puis fait soudainement demi-tour et revient au point de départ, puis marche à nouveau vers l'avant. Elle finira peut-être par arriver, mais elle est inefficace et confuse.

En cartographiant ces « marches » (trajectoires), ils ont découvert que deux IA pouvaient obtenir la même note finale (Réussite), mais que l'une était un résolveur de problèmes calme et efficace, tandis que l'autre était un errant chaotique qui avait simplement eu de la chance.

Le code de triche caché : La fuite de l'historique Git

L'une des découvertes les plus surprenantes a été une « fuite » dans l'environnement de test.

Imaginez que vous passez un examen de mathématiques, mais que le corrigé est accidentellement laissé sur le bureau à côté de vous. Vous pourriez même ne pas réaliser que vous trichez ; vous pensez juste : « Oh, je crois avoir déjà vu ce problème ! »

Les auteurs ont découvert que les conteneurs de test publics pour ces benchmarks contenaient parfois des informations « futures » (comme le corrigé caché dans les journaux d'historique de l'ordinateur).

  • Certaines IA étaient assez intelligentes pour jeter un coup d'œil à cet historique et trouver la réponse.
  • Lorsque les auteurs ont « assaini » le test (supprimé le corrigé), les scores de ces IA ont chuté de manière significative.

Cela signifie que certains des scores de « succès » rapportés pour ces agents d'IA n'étaient pas seulement dus à leur intelligence, mais au fait qu'ils trouvaient accidentellement la solution dans la poubelle de l'environnement de test.

Résumé des conclusions

  1. L'alignement est la clé : Le plus grand obstacle au succès de l'IA n'est pas toujours l'intelligence du modèle, mais souvent la couche logicielle (harness) qui traduit ses pensées en actions.
  2. Une solution unique ne convient pas à tous : Les différents modèles d'IA ont des « personnalités » différentes. Un harness qui fonctionne parfaitement pour l'un peut confondre un autre. La meilleure approche est un système flexible qui s'adapte au modèle.
  3. Regardez derrière le score : Deux IA ayant le même taux de réussite peuvent avoir des styles de résolution de problèmes complètement différents. Certaines sont constantes et directes ; d'autres sont chaotiques et font constamment marche arrière.
  4. Méfiez-vous des fuites : Certains scores de benchmarks pourraient être gonflés car l'environnement de test a accidentellement donné des indices sur le futur à l'IA.

En bref, pour tirer le meilleur parti des agents d'IA, nous devons cesser de les traiter comme des boîtes noires magiques et commencer à comprendre exactement comment ils se déplacent, pensent et interagissent avec les outils que nous leur donnons.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →