← Derniers articles
🤖 AI

GOAT: A Training Framework for Goal-Oriented Agent with Tools

Le papier présente GOAT, un nouveau cadre d'entraînement permettant le fine-tuning d'agents LLM open source pour l'utilisation complexe d'outils sans annotation humaine, en synthétisant automatiquement des données d'exécution d'API orientées vers un objectif à partir de la documentation, et atteignant des performances de pointe sur des benchmarks existants ainsi que sur un nouveau benchmark nommé GOATBench.

Auteurs originaux : Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

Publié 2026-05-06
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez une bibliothécaire très intelligente et bien informée (l'IA) qui sait lire des livres et écrire des histoires. Cependant, si vous demandez à cette bibliothécaire d'aller dans la salle arrière de la bibliothèque, de trouver une boîte spécifique de vieilles cartes, d'en extraire une page précise, puis d'utiliser cette page pour trouver une recette spécifique dans un livre de cuisine, elle se perd souvent. Elle pourrait deviner la mauvaise boîte, ouvrir le mauvais livre, ou oublier d'apporter la page de la carte à la cuisine.

C'est le problème des agents IA actuels lorsqu'ils tentent d'utiliser des « outils » (comme les API, qui sont des connexions numériques vers des bases de données, des services météorologiques ou des listes de films). Ils sont excellents pour discuter, mais terribles pour planifier une mission à multiples étapes où une étape dépend entièrement du résultat de la précédente.

L'article présente GOAT (Goal-Oriented Agent with Tools), une nouvelle méthode d'entraînement conçue pour transformer cette bibliothécaire perplexe en un détective maître. Voici comment cela fonctionne, en utilisant des analogies simples :

Le Problème : Le « Jeu de Devinettes »

Habituellement, pour enseigner à une IA comment utiliser des outils, les chercheurs doivent engager des humains pour rédiger des milliers d'exemples comme : « D'abord, demandez à l'API météo s'il va pleuvoir. Ensuite, prenez cette réponse 'pluie' et demandez à l'API vêtements un imperméable. »
C'est coûteux et lent. Sans ces exemples rédigés par des humains, les modèles d'IA devinent simplement. Ils échouent souvent dans des tâches complexes nécessitant de chaîner plusieurs étapes.

La Solution : La Cuisine de « Réingénierie Inverse »

Les auteurs de GOAT ont réalisé qu'ils n'avaient pas besoin d'humains pour rédiger les instructions. Ils avaient déjà le « livre de cuisine » (la documentation des API). Au lieu de demander à l'IA de deviner la recette à partir d'un plat fini, ils ont décidé de préparer le plat d'abord, puis de décrire la recette.

Ils utilisent une stratégie « Appel en Premier » :

  1. Cartographier la Cuisine : D'abord, le système lit tous les manuels d'API et dessine une carte de la façon dont les outils sont connectés. (Par exemple : « La sortie de l'outil 'Météo' s'intègre parfaitement dans l'entrée de l'outil 'Parapluie' »).
  2. Cuisiner le Repas (L'Étape Appel en Premier) : Le système choisit un chemin sur cette carte et exécute réellement les outils. Il demande des données à l'outil météo, obtient le résultat, puis utilise immédiatement ce résultat pour interroger l'outil parapluie. Il ne devine pas ; il exécute de vraies étapes et obtient de vraies réponses.
  3. Écrire la Recette (L'Étape d'Abstraction) : Après que les outils ont effectué le travail, l'IA examine la chaîne d'événements terminée et rédige une requête utilisateur qui correspond. Elle dit essentiellement : « Oh, je viens de faire toutes ces étapes pour trouver un imperméable. Donc, un utilisateur demandant 'Que devrais-je porter s'il pleut ?' est ce que je viens de résoudre. »

En procédant ainsi à l'envers (Action \rightarrow Question), l'IA apprend la logique correcte de la connexion des outils sans qu'un humain ait à rédiger les instructions. Elle apprend en faisant le travail d'abord, puis en expliquant ce qu'elle a fait.

Le Résultat : Un Super-Assistant

L'article a testé ces nouveaux agents entraînés avec GOAT sur plusieurs défis :

  • RestBench & API-Bank : Ce sont comme des examens où l'IA doit trouver des critiques de films ou des recommandations musicales en utilisant une chaîne d'outils.
  • GOAT-Bench : Les auteurs ont créé un tout nouvel examen, plus vaste, spécifiquement pour ce type de tâches complexes à multiples étapes.

Les conclusions étaient claires :

  • Modèles Open Source : Avant GOAT, les petits modèles d'IA open source (gratuits et accessibles à tous) étaient presque inutiles pour ces tâches complexes. Ils échouaient dans près de 100 % des cas.
  • Après GOAT : Une fois entraînés avec cette nouvelle méthode, ces mêmes modèles open source sont devenus incroyablement bons dans ces tâches. Dans certains cas, ils ont surpassé des modèles propriétaires coûteux (comme GPT-4) qui dominent habituellement ces tests.
  • Aucun Humain Nécessaire : L'ensemble du jeu de données d'entraînement a été construit automatiquement par le système en utilisant les manuels d'API. Aucun humain n'a dû s'asseoir et rédiger les instructions étape par étape.

La Conclusion

GOAT est une méthode pour enseigner aux agents IA comment planifier et utiliser des outils en leur permettant de pratiquer le travail réel d'abord, puis en leur apprenant à décrire l'objectif. Elle transforme les modèles d'IA open source de « devineurs sans repères » en « planificateurs fiables » sans nécessiter d'enseignants humains coûteux. Les auteurs ont rendu leur code et leur nouvelle suite de tests (GOAT-Bench) disponibles pour que d'autres puissent les utiliser.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →