← Últimos artículos
💻 computer science

TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

El artículo presenta TerminalWorld, un motor de datos escalable que reverse-engineers automáticamente 1.530 tareas de terminal de alta fidelidad a partir de 80.870 grabaciones del mundo real para evaluar agentes de IA, revelando que los modelos de vanguardia actuales luchan con flujos de trabajo auténticos y rinden pobremente en comparación con las existentes evaluaciones curadas por expertos.

Autores originales: Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li, Chao Peng, Peter O'Hearn, Earl T. Barr, Mark Harman, Federica Sarro, He Ye

Publicado 2026-05-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li, Chao Peng, Peter O'Hearn, Earl T. Barr, Mark Harman, Federica Sarro, He Ye

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot cómo usar la «línea de comandos» de una computadora: esa pantalla negra donde los programadores escriben comandos de texto en lugar de hacer clic en iconos. Durante mucho tiempo, la forma en que probábamos a estos robots era como darles un acertijo creado por un profesor estricto. El profesor diría: «Aquí hay un acertijo complicado; ¡resuélvelo!». Si el robot resolvía el acertijo, pensábamos que era inteligente.

Pero los autores de este artículo, TERMINALWORLD, se dieron cuenta de que había un problema: La vida real no es un acertijo. La vida real es desordenada, impredecible y está llena de herramientas específicas que las personas realmente usan todos los días. Un robot que puede resolver un acertijo podría seguir fallando cuando se le pide que realmente repare un servidor o organice archivos en una oficina real.

Así es como lo solucionaron, explicado de forma sencilla:

1. El enfoque del «Mosca en la pared»

En lugar de inventar tareas falsas, los investigadores acudieron a un sitio web público llamado asciinema. Esto es como un canal de YouTube, pero para pantallas de computadora. Los desarrolladores suben voluntariamente grabaciones de sus sesiones de trabajo reales.

  • La analogía: Imagina que quieres enseñar a un estudiante a cocinar. En lugar de escribir un libro de recetas desde cero (que podría ser demasiado perfecto o extraño), vas a una cocina, grabas 80.000 horas de chefs reales cocinando comidas reales y luego preguntas: «¿Qué acabaron de hacer?».
  • El resultado: Recopilaron 80.870 grabaciones reales de desarrolladores trabajando.

2. El motor del «Chef robot»

Las grabaciones crudas son desordenadas. Tienen errores tipográficos, intentos fallidos y largas listas de mensajes del sistema que no importan. Los investigadores construyeron un «motor de datos» especial (un sistema de software inteligente) para limpiar esto.

  • Paso 1: Entender el objetivo. El motor examina una grabación desordenada y le pregunta a una IA superinteligente: «¿Qué intentaba lograr realmente esta persona?». Convierte un registro desordenado en una instrucción clara: «Bloquea estas direcciones IP malas y guarda la lista en este archivo».
  • Paso 2: Construir la cocina. La grabación no te dice qué herramientas tenía el chef. El motor debe adivinar qué software y archivos eran necesarios, construir una copia digital perfecta de ese entorno informático (usando algo llamado «contenedor Docker») y asegurarse de que los comandos originales funcionaran realmente allí.
  • Paso 3: La red de seguridad. Como no hay un profesor que califique el trabajo, el motor crea su propio «examen». Ejecuta la solución y verifica: «¿Apareció el archivo? ¿Es correcta la lista?». Si la prueba falla, corrige la prueba hasta que sea perfecta.

3. El nuevo examen de «Mundo real»

De esas 80.000 grabaciones, crearon un enorme nuevo banco de pruebas llamado TERMINALWORLD.

  • Tiene 1.530 tareas validadas.
  • Cubre 18 tipos diferentes de trabajos reales, desde configurar servidores en la nube hasta corregir errores en bases de datos.
  • Utiliza 1.280 comandos de computadora diferentes, el 91 % de los cuales nunca se habían visto en pruebas anteriores.

También crearon una versión más pequeña y extremadamente difícil llamada TERMINALWORLD-VERIFIED (200 tareas) que fue revisada en doble por humanos para asegurar que fuera 100 % precisa.

4. Los resultados impactantes

Sometieron a este nuevo examen a los modelos de IA más inteligentes del mundo (como las versiones más recientes de Claude, GPT y Gemini) y a sus marcos de trabajo de «agentes» (el software que ayuda a la IA a usar la computadora).

Esto es lo que descubrieron:

  • La «Paradoja de la eficiencia»: Cuanto más inteligente es la IA, a veces más lucha. La mejor IA solo aprobó el 62,5 % de las tareas. Cuando fallaban, no se rendían; seguían intentándolo, desperdiciando enormes cantidades de tiempo y dinero explorando los caminos equivocados. Es como un estudiante que sigue releyendo el mismo párrafo confuso una y otra vez en lugar de pedir ayuda.
  • La brecha entre «Acertijo y realidad»: Casi no había conexión entre lo bien que le iba a una IA en las antiguas pruebas de «acertijos» (Terminal-Bench) y lo bien que le iba en esta nueva prueba de «vida real».
    • Analogía: Una IA podría ser campeona resolviendo puzzles de Sudoku (la prueba antigua) pero fallar completamente al conducir realmente un coche en el tráfico (la prueba nueva). Las pruebas antiguas eran simplemente demasiado diferentes del trabajo real.
  • Agentes frente a humanos: Cuando la IA resolvía una tarea, rara vez lo hacía de la misma manera que la persona en la grabación. Tomaban caminos diferentes para llegar al mismo destino. ¡Esto es realmente bueno! Significa que la IA no solo está copiando; está encontrando su propia manera, incluso si ese camino es más largo que el del humano.

La conclusión

El artículo argumenta que ya no podemos confiar en pruebas creadas por expertos en un laboratorio. Para saber si una IA está realmente lista para trabajar en el mundo real, debemos probarla con flujos de trabajo humanos reales que son desordenados, complejos y cambian constantemente.

TERMINALWORLD es una herramienta que convierte automáticamente el trabajo humano real en una prueba, asegurando que, a medida que los desarrolladores cambian su forma de trabajar, nuestras pruebas para la IA evolucionen junto con ellos. Es un paso de probar «¿puedes resolver un acertijo?» a «¿puedes hacer el trabajo?».

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →