← Derniers articles
🤖 AI

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

Cette enquête propose un cadre de type « model-harness » pour les agents basés sur les LLM qui déplace l'attention de la réponse passive aux questions vers l'accomplissement actif de tâches en analysant comment le couplage entre les modèles de fondation et les environages d'exécution — comprenant six responsabilités clés — détermine la performance, la fiabilité et la généralisation du système.

Auteurs originaux : Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yu
Publié 2026-06-23
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : Ce n'est pas seulement une question de cerveau

Imaginez que vous engagiez un chef de classe mondiale, brillant et talentueux (le Modèle d'IA), pour cuisiner un repas complexe à plusieurs services pour un dîner de gala. Par le passé, les gens pensaient que la seule chose qui importait était l'intelligence du chef. Si le chef connaissait toutes les recettes, le repas serait parfait.

Mais ce papier soutient que le chef n'est que la moitié de l'histoire.

Si vous donnez à ce chef un four cassé, aucun ingrédient, un menu confus et personne pour lui dire quand la soupe brûle, le repas sera un échec — même si le chef est un génie. Le « four », les « ingrédients » et le « chef de cuisine » sont ce que les auteurs appellent le Harness (le Harnais/l'Environnement).

La thèse principale du papier est la suivante : la performance d'un agent ne dépend pas seulement de l'intelligence de l'IA ; elle dépend de la qualité de l'association entre l'IA et la « cuisine » (le Harness) dans laquelle elle travaille.


Les quatre étapes de la croissance

Les auteurs décrivent comment nous avons construit ces « agents » d'IA à travers quatre étapes distinctes, comme la croissance d'un enfant :

  1. Phase 1 : L'Ingénieur de Prompt (L'étape du « S'il vous plaît, soyez gentil »)

    • L'analogie : Vous essayez d'obtenir une réponse d'un étudiant intelligent mais timide. Vous testez différentes façons de poser la question : « S'il vous plaît, expliquez ceci », « Voici un exemple », ou « Réfléchissez étape par étape ».
    • La limite : Vous ne pouvez pas seulement poser des questions polies. Si l'étudiant ne connaît pas la réponse, ou si la question nécessite d'aller à la bibliothèque, d'ouvrir un livre et de rédiger un rapport, le fait de demander gentiment ne servira à rien.
  2. Phase 2 : L'Ingénieur de Contexte (L'étape de l'« Assistant de bibliothèque »)

    • L'analogie : Vous réalisez maintenant que l'étudiant a besoin d'aide pour trouver les bons livres. Vous construisez un système qui récupère les bonnes pages, les résume et les tend à l'étudiant avant qu'il ne réponde.
    • La limite : Vous ne faites que lui donner de l'information. Si l'étudiant commence à écrire n'importe quoi, ou s'il est distrait, vous n'avez pas de système pour l'arrêter, vérifier son travail ou corriger ses erreurs.
  3. Phase 3 : L'Ingénieur de Harness (L'étape du « Chef de projet »)

    • L'analogie : C'est le grand changement. Vous ne vous contentez plus de donner des instructions, vous construisez un système d'exploitation complet autour de l'étudiant.
      • Observation : Vous lui donnez une caméra pour voir ce qui se passe.
      • Contrôle : Vous avez un minuteur et un bouton d'arrêt.
      • Action : Vous lui donnez un clavier et une souris.
      • Vérification : Vous avez un professeur qui vérifie chaque étape. Si l'étudiant écrit un code qui casse tout, le système l'annule automatiquement et dit : « Réessayez ».
    • Le résultat : Le papier montre qu'en redessinant simplement cette « cuisine » (le Harness), vous pouvez faire cuisiner un repas 5 étoiles à un chef médiocre, ou faire cuisiner encore mieux un chef génial.
  4. Phase 4 : La Co-évolution (L'étape de « L'équipe qui s'améliore mutuellement »)

    • L'analogie : Maintenant, l'étudiant et le chef de cuisine apprennent l'un de l'autre. L'étudiant devient meilleur en cuisine en pratiquant dans cette cuisine spécifique, et le chef de cuisine devient meilleur en gestion en observant comment l'étudiant cuisine. Ils évoluent ensemble.

Les six parties de la « Cuisine » (L'anatomie du Harness)

Le papier décompose ce « Harness » en six tâches spécifiques, comme une brigade de cuisine bien organisée :

  1. Observation (Les Yeux) : Comment l'IA voit-elle le monde ? Regarde-t-elle une capture d'écran floue ou une liste de données claire et organisée ?
  2. Contexte (La Mémoire) : Quelles informations l'IA retient-elle ? Lui transmet-on tout l'historique de la conversation, ou seulement les notes les plus importantes ?
  3. Contrôle (Le Chef d'orchestre) : Qui décide de la suite ? Est-ce que l'IA continue jusqu'à l'épuisement, ou est-ce qu'un manager lui dit quand s'arrêter, quand demander de l'aide ou quand changer de tâche ?
  4. Action (Les Mains) : Comment l'IA fait-elle concrètement les choses ? Peut-elle cliquer sur un bouton, ou se contente-t-elle de dire « J'ai cliqué » ? Le harness transforme les mots de l'IA en actions réelles.
  5. État / State (Le Classeur) : Où l'IA stocke-t-elle son travail ? Si elle écrit un brouillon, est-il sauvegardé dans un fichier ou est-il perdu lors du rafraîchissement de l'écran ?
  6. Vérification (L'Inspecteur de sécurité) : C'est crucial. Avant que l'IA n'envoie un fichier à un client, un contrôle de sécurité est-il effectué ? Si l'IA fait une action dangereuse, le système l'arrête-t-il ?

Pourquoi cela importe : Le déplacement du « Goulot d'étranglement »

Le papier a examiné de nombreux tests (benchmarks) où l'IA tente d'accomplir de vraies tâches, comme réparer du code informatique ou naviguer sur le Web.

  • L'ancienne vision : Nous pensions que si nous rendions simplement le « cerveau » de l'IA plus grand et plus intelligent, cela résoudrait tout.
  • La nouvelle vision : Le papier a découvert que le « cerveau » a atteint une limite. Rendre le cerveau plus gros n'apporte que des améliorations minimes. Le véritable goulot d'étranglement est désormais le Harness.

La preuve :

  • Dans les tests de codage, le même modèle d'IA obtenait un taux de réussite de 23 % avec un harness simple, mais de 72 % avec un harness mieux conçu.
  • C'est comme avoir un moteur de Ferrari (l'IA) mais le mettre dans un cadre de bicyclette (un mauvais harness). Il n'ira pas vite. Mettez ce même moteur dans un châssis de voiture de course (un bon harness), et il gagne la course.

Ce qu'il faut retenir

Nous passons de l'idée de l'IA comme un simple « chatbot » qui répond à des questions à celle d'un travailleur autonome.

Pour construire un travailleur fiable, vous ne pouvez pas simplement choisir le cerveau le plus intelligent. Vous devez concevoir l'environnement entier dans lequel il travaille :

  • Que voit-il ?
  • De quels outils dispose-t-il ?
  • Qui vérifie son travail ?
  • Comment se rétablit-il lorsqu'il commet une erreur ?

Le papier conclut que l'avenir de l'IA ne réside pas seulement dans des modèles plus grands, mais dans une meilleure ingénierie des systèmes qui entourent ces modèles. La qualité de l'agent provient du partenariat entre le modèle et son harness.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →