LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries
Ce papier présente LiveMCP-101, une référence de 101 requêtes du monde réel conçue pour tester la résistance des agents compatibles MCP grâce à un cadre d'évaluation parallèle, révélant que même les modèles de langage de pointe peinent à orchestrer des outils complexes en plusieurs étapes et identifiant sept modes d'échec spécifiques pour orienter les améliorations futures.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La vue d'ensemble : L'essai routier « en direct »
Imaginez que vous testez une nouvelle voiture autonome. La plupart des tests précédents ont été réalisés dans un jeu vidéo ou sur un parking fermé où les feux de circulation ne changent jamais et où la route est toujours libre. La voiture pouvait mémoriser l'itinéraire et paraître parfaite.
Mais dans le monde réel, les feux de circulation changent, des piétons sortent de manière inattendue et les conditions routières évoluent à chaque seconde.
Ce papier présente LiveMCP-101, qui est comme un test de circulation réel et en direct pour les agents IA. Au lieu de demander à une IA de résoudre un problème mathématique tiré d'un manuel, les chercheurs lui demandent d'utiliser un « couteau suisse » d'outils numériques (comme vérifier les prix des billets d'avion, rechercher du code sur GitHub ou consulter la météo) pour résoudre des problèmes complexes à multiples étapes qui évoluent pendant que l'IA y travaille.
Le problème : La « carte statique » vs le « GPS en direct »
- L'ancienne méthode (Outils statiques) : Imaginez qu'un agent IA se voit remettre une carte imprimée d'une ville. Il sait exactement où se trouve le café parce que la carte l'indique. Mais si le café a déménagé hier, l'IA est perdue. C'est ainsi que fonctionnent la plupart des outils IA actuels ; ils reposent sur des instructions fixes.
- La nouvelle méthode (MCP) : Le papier utilise ce qu'on appelle le Protocole de Contexte de Modèle (MCP). Pensez-y comme un GPS en direct. L'IA n'a pas de carte préimprimée ; elle doit demander au GPS : « Quels outils sont disponibles en ce moment ? » puis déterminer comment les utiliser. Le problème est que les données du « GPS en direct » changent chaque seconde. Le prix d'un billet d'avion peut augmenter, ou un titre d'actualité peut changer, pendant que l'IA réfléchit.
La solution : La « course parallèle »
Comment évaluer une IA lors d'un examen où les réponses changent pendant qu'elle passe l'examen ?
Les chercheurs ont mis en place un système de Course Parallèle :
- Le coureur de référence : Un robot ultra-intelligent, guidé par un humain, exécute exactement la même tâche au même moment que l'IA testée. Il suit un plan strict et préapprouvé pour obtenir la « bonne » réponse pour ce moment précis.
- Le coureur de test : L'IA testée essaie de déterminer le plan par elle-même.
- Le juge : À la ligne d'arrivée, un juge (une autre IA) compare le résultat du coureur de test à celui du coureur de référence.
Cela garantit que l'IA n'est pas pénalisée parce que la météo a changé ou qu'un cours boursier a bougé ; elle n'est pénalisée que si elle n'a pas réussi à naviguer correctement dans ces changements.
Les résultats : Même les « plus intelligents » ont du mal
Les chercheurs ont testé 18 modèles d'IA différents (y compris les plus intelligents comme GPT-5 et Claude).
- Le score : Même les meilleurs modèles d'IA n'ont réussi qu'environ 58 % des tâches.
- L'analogie : Imaginez donner à un groupe d'étudiants doctorants une chasse au trésor complexe où ils doivent appeler 5 personnes différentes, vérifier 3 sites web différents et rédiger un rapport, le tout pendant que les indices changent. Même les étudiants les plus brillants ont échoué plus de 40 % du temps.
Les « sept péchés capitaux » (Modes d'échec)
Le papier a analysé pourquoi l'IA a échoué et a identifié sept erreurs courantes, regroupées en trois catégories principales :
1. Échecs de planification (Le « conducteur perdu »)
- Ignorer la carte : L'IA manque complètement une partie des instructions (par exemple, « Trouvez la deuxième vidéo la plus populaire » mais elle trouve la première).
- Excès de confiance : L'IA pense connaître la réponse grâce à sa propre mémoire et refuse d'utiliser les outils, ce qui conduit à des hallucinations (inventer des choses).
- Parler sans marcher : L'IA rédige un plan parfait dans ses « pensées » mais ne clique jamais sur les boutons pour l'exécuter.
- Mauvais outil : L'IA choisit le bon outil mais l'utilise mal (par exemple, utiliser un outil « Recherche » quand elle a besoin d'une « Calculatrice »).
2. Erreurs de paramètres (Le problème de la « faute de frappe »)
- Erreurs de syntaxe : L'IA parle mal le langage de l'outil. Elle dit « 1 » (un mot) alors que l'outil a besoin de
1(un nombre). L'outil rejette immédiatement la demande. - Erreurs sémantiques : L'IA parle correctement le langage mais se trompe sur le sens. Elle demande « la météo à New York » alors que l'utilisateur voulait en réalité « la météo à New York City », ou elle demande une date qui n'existe pas.
3. Traitement de la sortie (Le problème du « dernier kilomètre »)
- Erreurs d'analyse : L'outil fournit les bonnes données à l'IA (comme un fichier JSON avec des nombres), mais l'IA échoue à les lire correctement. Elle pourrait calculer la moyenne de manière erronée ou manquer un chiffre clé, ruinant le rapport final.
La conclusion
Le papier conclut que, bien que l'IA s'améliore dans la communication avec les outils, elle n'est pas encore assez fiable pour des emplois complexes et réels où les choses changent en temps réel.
- Les modèles propriétaires (comme GPT-5) sont meilleurs dans la planification mais ont toujours du mal avec le « dernier kilomètre » de la lecture correcte des données.
- Les modèles open-source restent souvent bloqués dans des boucles, gaspillant du temps et des jetons sans faire de progrès.
En résumé : Nous avons construit un gymnase très strict et réel (LiveMCP-101) pour tester l'IA. Les résultats montrent que même nos athlètes IA les plus puissants trébuchent actuellement sur leurs propres lacets lorsqu'on leur demande de courir un marathon avec une carte en direct et changeante. Il reste encore un long chemin à parcourir avant de pouvoir leur faire confiance pour travailler de manière autonome dans le monde réel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.