Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
Este artículo presenta Long-Horizon-Terminal-Bench, un nuevo benchmark que comprende 46 tareas de terminal complejas y de varias horas con una calificación de recompensa densa y detallada para evaluar mejor y exponer las limitaciones significativas de los agentes de IA actuales en la planificación de largo alcance y la resolución iterativa de problemas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Long-Horizon-Terminal-Bench
Planteamiento del Problema
Los agentes de IA actuales, construidos sobre Modelos de Lenguaje Extensos (LLMs), han demostrado competencia en tareas de terminal cortas y bien delimitadas (por ejemplo, corregir un problema de código específico o emitir unos pocos comandos de shell). Sin embargo, los benchmarks de terminal existentes (como Terminal-Bench y SWE-Bench) se centran principalmente en estos problemas de horizonte corto, evaluados típicamente en cuestión de minutos y calificados únicamente mediante un resultado binario de "pasa/falla". Este paradigma de evaluación crea dos brechas críticas:
- Subestimación de la Dificultad: Los horizontes cortos no logran capturar la complejidad de los flujos de trabajo del mundo real que requieren cientos de pasos, una planificación sostenida durante horas y depuración iterativa.
- Señales de Recompensa Dispersas: La calificación binaria ignora el progreso intermedio. Un agente que completa el 90% de un flujo de trabajo complejo pero falla en el paso final recibe la misma puntuación que un agente que falla inmediatamente, lo que oscurece la capacidad real del agente y dificulta el diagnóstico de modos de falla específicos (por ejemplo, detención prematura frente a tiempo de espera agotado).
Metodología
Los autores introducen Long-Horizon-Terminal-Bench (LHTB), un benchmark diseñado para poner a prueba a los agentes en tareas de terminal de largo horizonte y dominio específico, utilizando una calificación de recompensa basada en procesos densos.
Construcción de Tareas
- Alcance: El benchmark consta de 46 tareas que abarcan nueve categorías, incluyendo reproducción de experimentos, ingeniería de software, análisis multimodal, juegos interactivos y computación científica.
- Formato: Las tareas siguen la formulación de Terminal-Bench: un entorno Docker contenedorizado con una instrucción en lenguaje natural, archivos/herramientas relevantes y una solución oráculo. Los agentes interactúan enteramente a través de la terminal.
- Complejidad: Las tareas están diseñadas explícitamente para requerir cientos de pasos y tiempos de ejecución que oscilan entre decenas de minutos y horas. Implican la lectura/modificación de código, la ejecución de scripts largos y la inspección de salidas parciales.
- Calibración de Dificultad: Las tareas se construyeron creando proyectos de solo terminal "deliberadamente rotos". Para evitar el sobreajuste, las verificaciones públicas son mínimas (validando solo el comportamiento de la CLI y ejemplos simples), mientras que la mayor parte de la recompensa se deriva de casos de estrés ocultos (por ejemplo, manifiestos anidados, variaciones de esquema, ruido inyectado) que requieren soluciones robustas y generalizables.
Mecanismo de Calificación: Recompensas Densas
A diferencia de la evaluación binaria, LHTB emplea un esquema de calificación basado en subtareas:
- Cada tarea se descompone en subtareas semánticamente significativas ().
- Un calificador determinista asigna una puntuación normalizada a cada subtarea basándose en evidencia objetiva (archivos, salidas, resultados de pruebas).
- La recompensa final es un promedio ponderado: .
- Esto permite el crédito parcial, capturando qué tan lejos progresa un agente incluso si falla en alcanzar la meta final.
Configuración de Evaluación
- Modelos: Se evaluaron 15 modelos de frontera (incluyendo GPT-5.5, DeepSeek V4 Pro, Kimi K2.7 Code, etc.).
- Harness: Se utilizó el harness de agente Terminus-2 para la mayoría de los modelos, interactuando a través de una única sesión de terminal de largo horizonte.
- Restricciones: Las tareas tienen un tiempo de espera de 90 minutos de tiempo de reloj.
- Métricas: Pass@1 (en los umbrales ), recompensa normalizada media, episodios por tarea, tiempo de ejecución y costo estimado.
Resultados Clave
La evaluación revela que la ejecución de largo horizonte sigue siendo un cuello de botella significativo incluso para los modelos más avanzados.
- Bajas Tasas de Éxito: Incluso el modelo más fuerte, GPT-5.5, logró una tasa de paso de solo el 15.2% en el umbral y del 10.9% en la completitud perfecta (). La tasa de paso media de los 15 modelos fue de apenas el 4.3% en .
- Consumo de Recursos: Las tareas son extremadamente exigentes, promediando 231 episodios, 9.9 millones de tokens y 85.3 minutos de tiempo de ejecución por ejecución.
- Eficiencia de Costos: Existe una amplia varianza en la eficiencia de costos. GPT-5.5 es el más costoso (
$21/tarea) pero también el más efectivo. Hy3 ancla la frontera de bajo costo ($2.5/tarea) con un éxito moderado. Muchos modelos incurren en altos costos con un éxito insignificante, lo que indica que aumentar el gasto en inferencia por sí solo no resuelve los fallos de largo horizonte. - Modos de Falla:
- Tiempos de Espera (Timeouts): El 79% de las ejecuciones no resueltas terminaron debido a la expiración del presupuesto de 90 minutos mientras el agente aún trabajaba, a menudo con recompensas medias bajas (0.10–0.35).
- Finalizaciones Falsas: Una parte significativa de las "salidas tempranas" (agentes que se detienen voluntariamente) ocurrió en niveles de recompensa altos () donde el agente juzgó incorrectamente que la tarea estaba completada. Esto resalta una debilidad en la autoverificación y los criterios de parada.
- Binario vs. Denso: Bajo una calificación binaria estricta (), 10 de los 15 modelos resolvieron cero tareas. La calificación densa reveló que el 62.8% de las ejecuciones realizaron un progreso parcial significativo, distinguiendo a los modelos que estaban "cerca" de aquellos que fallaron inmediatamente.
Significado y Reivindicaciones
El artículo sostiene que Long-Horizon-Terminal-Bench es necesario para ir más allá de las limitaciones de la evaluación basada solo en resultados. Sus principales contribuciones son:
- Revelar el Progreso Oculto: Las recompensas densas exponen los "casi aciertos" y el progreso parcial que la calificación binaria oculta, proporcionando una visión más matizada de las capacidades de los agentes.
2.Identificar el Cuello de Botella: Los resultados sugieren que la limitación principal para los agentes actuales no es la corrección del razonamiento local (que los benchmarks cortos miden), sino la completitud fiable de largo horizonte. Los agentes tienen dificultades para presupuestar el tiempo, mantener el estado a lo largo de trayectorias largas y calibrar las decisiones de parada. - Evaluar la Realidad: Al requerir cientos de pasos y horas de ejecución, LHTB proporciona una prueba de estrés más realista para los agentes autónomos que los benchmarks anteriores, mostrando un amplio margen de mejora.
- Recurso para Trabajos Futuros: Los autores lanzan el benchmark y el harness de evaluación para apoyar el desarrollo de agentes capaces de planificar, verificar y ejecutar de manera fiable durante horizontes extendidos.
Los autores concluyen que, si bien los agentes actuales pueden realizar pasos locales correctamente, carecen de la robustez para mantener el progreso y verificar la finalización durante los largos horizontes requeridos para los flujos de trabajo prácticos del mundo real.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.