← Derniers articles
🤖 AI

Do Agents Know What They Can't Do? Evaluating Feasibility Awareness in Tool-Using Agents

Cet article présente FeasiGen, un pipeline automatisé pour générer des tâches d'agents utilisant des outils et rendues irréalisables en masquant des outils critiques, et l'utilise pour révéler que les agents actuels manquent d'une forte conscience de la faisabilité, poursuivant souvent l'exécution de tâches impossibles avec des taux d'erreur élevés, bien que les architectures multi-agents montrent une performance améliorée.

Auteurs originaux : Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai

Publié 2026-05-28
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous engagez un assistant très intelligent et enthousiaste pour vous aider sur un projet complexe, comme réserver un vol et le payer. Vous donnez à votre assistant une liste d'outils qu'il peut utiliser : un moteur de recherche, un moteur de réservation et un processeur de cartes de crédit.

Maintenant, imaginez que vous retirez secrètement le processeur de cartes de crédit de sa boîte à outils avant qu'il ne commence.

Le Problème :
La plupart des assistants IA d'aujourd'hui sont comme cet assistant enthousiaste qui ne sait pas qu'il manque un outil. Ils commencent à rechercher des vols, trouvent une excellente offre, puis tentent de payer. Lorsqu'ils réalisent qu'ils ne peuvent pas payer, ils ne disent pas simplement : « Oh, je ne peux pas faire cela. » Au lieu de cela, ils continuent d'essayer. Ils pourraient essayer de payer à nouveau, chercher un autre moyen de paiement qui n'existe pas, ou rédiger un long essai expliquant pourquoi ils ne peuvent pas payer. Ils gaspillent une énorme quantité de temps et d'énergie (puissance de calcul) sur une tâche qui était impossible dès le départ.

La Solution (FeasiGen) :
Les chercheurs de cet article ont construit un système appelé FeasiGen (Générateur de Faisabilité). Imaginez-le comme une machine de « vérification de la réalité ».

  1. Apprendre les Règles : D'abord, ils ont observé de nombreux assistants IA différents accomplir avec succès des tâches. Ils ont examiné les « empreintes » (les outils spécifiques utilisés) pour voir quels outils étaient absolument nécessaires pour chaque succès. Pour l'exemple du vol, ils ont remarqué que chaque réservation réussie utilisait l'« API de paiement ».
  2. Créer le Piège : Ensuite, ils ont pris ces mêmes tâches et ont secrètement retiré ces outils critiques. Ils ont transformé une tâche soluble en une tâche impossible.
  3. Le Test : Ils ont soumis ces tâches « cassées » à neuf modèles d'IA différents pour voir si les modèles pouvaient réaliser : « Hé, il manque un outil clé, je devrais m'arrêter maintenant », ou s'ils continueraient à tourner en rond.

Ce Qu'ils Ont Découvert :
Les résultats étaient un peu surprenants et quelque peu inquiétants pour l'efficacité de l'IA :

  • La Plupart des IA Continuent : Même les modèles les plus intelligents ont souvent échoué à s'arrêter. Ils ont continué à essayer de résoudre la tâche impossible environ 23 % à 74 % du temps. C'est comme un conducteur qui tente de traverser un mur parce qu'il a oublié de vérifier si la route se terminait.
  • Le Coût de l'Entêtement : Lorsqu'une IA continue d'essayer sur une tâche impossible, elle utilise de 2 à 5 fois plus de puissance de calcul (jetons) que si elle s'était simplement arrêtée immédiatement. C'est la différence entre marcher jusqu'au bout d'une impasse en réalisant que vous êtes perdu, et y marcher, faire demi-tour, puis revenir en arrière.
  • Le Travail d'Équipe Aide : Lorsque les chercheurs ont mis en place une « équipe » d'IA (une pour planifier, une pour exécuter le travail), l'équipe était beaucoup meilleure pour repérer les outils manquants. Le « planificateur » examinait d'abord les outils, réalisait qu'il manquait quelque chose et disait « Stop » avant même que le « travailleur » ne commence. Cela a considérablement réduit l'effort gaspillé.
  • Réfléchir Plus Fort Aide (Parfois) : Les modèles contraints de « réfléchir étape par étape » avant d'agir étaient généralement meilleurs pour repérer les outils manquants, bien que cela ne soit pas vrai pour chaque modèle individuel.

La Grande Conclusion :
Actuellement, nous testons principalement l'IA en voyant si elle peut terminer une tâche. Cet article dit que ce n'est pas suffisant. Nous devons aussi tester si elles savent quand ne pas faire quelque chose. Une IA qui sait quand abandonner est tout aussi importante qu'une IA qui sait comment terminer. Actuellement, la plupart des IA sont très mauvaises pour savoir quand elles sont coincées dans une impasse, ce qui entraîne un gaspillage considérable d'énergie et d'argent.

Une Note sur les Limites :
Les chercheurs admettent que leur test ne fonctionne que dans des environnements « fermés » où la liste des outils est fixe et connue. Si une IA pouvait magiquement inventer de nouveaux outils ou les trouver sur l'internet ouvert, ce test ne fonctionnerait pas de la même manière. Mais pour les systèmes où les outils sont strictement définis, cette « vérification de la réalité » est une nouvelle façon cruciale de mesurer à quel point une IA est réellement intelligente.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →