← Derniers articles
🤖 AI

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

Cet article introduit Long-Horizon-Terminal-Bench, un nouveau benchmark comprenant 46 tâches de terminal complexes s'étalant sur plusieurs heures avec une notation de récompense dense et fine, afin de mieux évaluer et exposer les limitations significatives des agents IA actuels en matière de planification à long terme et de résolution itérative de problèmes.

Auteurs originaux : Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang

Publié 2026-07-13
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, LeoweiLiang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé Technique : Long-Horizon-Terminal-Bench

Énoncé du Problème

Les agents IA actuels, basés sur des modèles de langage étendus (LLM), ont démontré une certaine compétence dans les tâches de terminal à horizon court et bien délimitées (par exemple, corriger un problème de code spécifique ou émettre quelques commandes shell). Cependant, les benchmarks de terminal existants (tels que Terminal-Bench et SWE-Bench) se concentrent largement sur ces problèmes à horizon court, évalués typiquement en quelques minutes et notés uniquement selon un résultat binaire « succès/échec ». Ce paradigme d'évaluation crée deux lacunes critiques :

  1. Sous-estimation de la difficulté : Les horizons courts ne parviennent pas à capturer la complexité des flux de travail réels qui nécessitent des centaines d'étapes, une planification soutenue sur plusieurs heures et un débogage itératif.
  2. Signaux de récompense éparses : La notation binaire ignore les progrès intermédiaires. Un agent qui accomplit 90 % d'un flux de travail complexe mais échoue à la dernière étape reçoit le même score qu'un agent qui échoue immédiatement, ce qui occulte la capacité réelle de l'agent et rend difficile le diagnostic des modes de défaillance spécifiques (par exemple, arrêt prématuré versus dépassement de délai).

Méthodologie

Les auteurs introduisent le Long-Horizon-Terminal-Bench (LHTB), un benchmark conçu pour tester la résistance des agents sur des tâches de terminal à long horizon et spécifiques à un domaine, en utilisant une notation par récompense dense basée sur le processus.

Construction des Tâches

  • Portée : Le benchmark se compose de 46 tâches réparties en neuf catégories, incluant la reproduction d'expériences, le génie logiciel, l'analyse multimodale, les jeux interactifs et le calcul scientifique.
  • Format : Les tâches suivent la formulation de Terminal-Bench : un environnement Docker conteneurisé avec une instruction en langage naturel, des fichiers/outils pertinents et une solution oracle. Les agents interagissent entièrement via le terminal.
  • Complexité : Les tâches sont explicitement conçues pour nécessiter des centaines d'étapes et des temps d'exécution allant de quelques dizaines de minutes à plusieurs heures. Elles impliquent la lecture/modification de code, l'exécution de scripts longs et l'inspection de sorties partielles.
  • Calibrage de la difficulté : Les tâches ont été construites en créant des projets de terminal « délibérément cassés ». Pour éviter le surapprentissage, les vérifications publiques sont minimales (validant uniquement le comportement CLI et des exemples simples), tandis que la majeure partie de la récompense provient de cas de stress cachés (ex: manifestes imbriqués, variations de schémas, bruit injecté) qui nécessitent des solutions robustes et généralisables.

Mécanisme de Notation : Récompenses Denses

Contra[irement] à l'évaluation binaire, LHTB emploie un schéma de notation basé sur des sous-tâches :

  • Chaque tâche est décomposée en sous-tâches sémantiquement significatives (s1,,sKs_1, \dots, s_K).
  • Un évaluateur déterministe attribue un score normalisé rk[0,1]r_k \in [0, 1] à chaque sous-tâche sur la base de preuves objectives (fichiers, sorties, résultats de tests).
  • La récompense finale RR est une moyenne pondérée : R=wkrkwkR = \frac{\sum w_k r_k}{\sum w_k}.
  • Cela permet d'accorder un crédit partiel, capturant la progression de l'agent même s'il échoue à atteindre l'objectif final.

Configuration de l'Évaluation

  • Modèles : 15 modèles de pointe ont été évalués (incluant GPT-5.5, DeepSeek V4 Pro, Kimi K2.7 Code, etc.).
  • Harnais : Le harnais d'agent Terminus-2 a été utilisé pour la plupart des modèles, interagissant via une session de terminal unique à long horizon.
  • Contraintes : Les tâches ont un délai d'expiration de 90 minutes (temps réel).
  • Métriques : Pass@1 (aux seuils R0.9,0.95,1.0R \ge 0.9, 0.95, 1.0), récompense normalisée moyenne, épisodes par tâche, temps d'exécution et coût estimé.

Résultats Clés

L'évaluation révèle que l'exécution à long horizon reste un goulot d'étranglement significatif, même pour les modèles les plus avancés.

  • Taux de Succès Faibles : Même le modèle le plus fort, GPT-5.5, n'a atteint un taux de réussite que de 15,2 % au seuil R0,95R \ge 0,95 et de 10,9 % pour une complétion parfaite (R=1,0R=1,0). Le taux de réussite moyen de l'ensemble des 15 modèles n'est que de 4,3 % à R0,95R \ge 0,95.
  • Consommation de Ressources : Les tâches sont extrêmement exigeantes, avec une moyenne de 231 épisodes, 9,9 millions de tokens et 85,3 minutes de temps d'exécution par exécution.
  • Efficacité des Coûts : Il existe une grande variance dans l'efficacité des coûts. GPT-5.5 est le plus coûteux (21 $/tâche) mais aussi le plus efficace. Hy3 ancre la frontière des bas coûts (2,5 $/tâche) avec un succès modéré. De nombreux modèles engendrent des coûts élevés avec un succès négligeable, indiquant que l'augmentation des dépenses d'inférence ne résout pas seules les échecs à long horizon.
  • Modes de Défaillance :
    • Dépassements de Délai (Timeouts) : 79 % des exécutions non résolues se sont terminées par l'expiration du budget de 90 minutes alors que l'agent était encore en cours de travail, souvent avec des récompenses moyennes faibles (0,10–0,35).
    • Fins Prématurées (False Finishes) : Une proportion significative de « sorties anticipées » (agents s'arrêtant volontairement) s'est produite à des niveaux de récompense élevés (R0,75R \ge 0,75), où l'agent jugeait incorrectement la tâche comme terminée. Cela souligne une faiblesse dans l'auto-vérification et les critères d'arrêt.
    • Binaire vs Dense : Sous une notation binaire stricte (R1,0R \ge 1,0), 10 des 15 modèles n'ont résolu aucune tâche. La notation dense a révélé que 62,8 % des exécutions ont réalisé un progrès partiel significatif, distinguant les modèles qui étaient « proches » de ceux qui ont échoué immédiatement.

Signification et Revendications

L'article affirme que le Long-Horizon-Terminal-Bench est nécessaire pour dépasser les limites de l'évaluation basée uniquement sur le résultat. Ses principales contributions sont :

  1. Révéler le Progrès Caché : Les récompenses denses exposent les « quasi-succès » et les progrès partiels que la notation binaire occulte, offrant une vue plus nuancée des capacités des agents.
  2. Identifier le Goulot d'Étranglement : Les résultats suggèrent que la limitation principale des agents actuels n'est pas la justesse du raisonnement local (que les benchmarks courts mesurent) mais la complétion fiable à long horizon. Les agents peinent à budgéter le temps, à maintenir l'état sur de longues trajectoires et à calibrer les décisions d'arrêt.
  3. Évaluer la Réalité : En exigeant des centaines d'étapes et des heures d'exécution, LHTB fournit un test de résistance plus réaliste pour les agents autonomes que les benchmarks précédents, montrant une marge de progression substantielle.
  4. Ressource pour Travaux Futurs : Les auteurs publient le benchmark et le harnais d'évaluation pour soutenir le développement d'agents capables de planifier, vérifier et exécuter de manière fiable sur des horizons étendus.

Les auteurs concluent que, bien que les agents actuels puissent effectuer correctement des étapes locales, ils manquent de robustesse pour soutenir le progrès et vérifier la complétion sur les longs horizons requis pour les flux de travail pratiques du monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →