: Benchmarking AI Agents for Long-Term Planning and Consistent Execution
Este artículo presenta , un nuevo benchmark de código abierto que evalúa la capacidad de los agentes de IA para la planificación a largo plazo y la ejecución consistente mediante la simulación de un año en la gestión de una startup, revelando que el uso de "scratchpads" es crucial para el éxito y que la detección de clientes adversarios es la principal causa de fracaso.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que has creado un videojuego muy complejo donde el objetivo no es solo ganar una partida rápida, sino dirigir una startup durante un año entero sin quebrar. Ese es el corazón de este nuevo estudio llamado YC-Bench.
Los investigadores querían responder una pregunta crucial: ¿Son realmente inteligentes las IAs actuales, o solo son buenos respondiendo preguntas cortas? Para averiguarlo, crearon un "campo de pruebas" donde la IA debe tomar cientos de decisiones seguidas, aprender de sus errores y mantener un plan a largo plazo.
Aquí te explico cómo funciona, usando analogías sencillas:
1. El Juego: "El Simulador de Startup"
Imagina que eres el CEO de una empresa. Tienes $200,000 dólares de capital inicial.
- El trabajo: Hay un mercado lleno de clientes que ofrecen proyectos (como "hacer una investigación" o "entrenar un modelo").
- El equipo: Tienes 8 empleados. Algunos son genios en investigación, otros son rápidos en datos, pero todos cobran un sueldo mensual.
- El problema: No puedes ver todo el futuro. Algunos clientes son estafadores. Te ofrecen mucho dinero por un trabajo, pero en realidad te piden el triple de esfuerzo del que dicen, haciéndote perder tiempo y dinero.
2. El Reto: La "Memoria de Pez" vs. La "Libreta de Notas"
Aquí está la trampa principal del juego:
- La IA tiene una memoria muy corta (como un pez de 7 segundos). Solo recuerda las últimas 20 conversaciones. Si el juego dura 365 días, la IA olvidará rápidamente qué clientes eran estafadores o qué empleados son los mejores.
- La solución: La única forma de recordar es usar una "Libreta de Notas" (Scratchpad). La IA debe escribir conscientemente: "Ojo, el cliente 'Vanguard' es un estafador, no le acepto más trabajos".
- El resultado: Las IAs que no usan esta libreta o no saben qué escribir en ella, olvidan sus errores y caen en las mismas trampas una y otra vez hasta que la empresa quiebra.
3. ¿Quién ganó la carrera?
Probaron a 12 de las IAs más famosas del mundo (como las de OpenAI, Google, Anthropic, etc.). El resultado fue sorprendente:
- La mayoría falló: 7 de cada 12 IAs terminaron en bancarrota. Se olvidaron de sus planes, aceptaron trabajos de estafadores o contrataron al personal equivocado.
- Los ganadores: Solo 3 modelos lograron hacer un gran negocio y terminar con más dinero del que empezaron.
- El campeón fue Claude Opus 4.6, que terminó con $1.27 millones.
- El segundo fue GLM-5, que logró casi lo mismo ($1.21 millones) pero gastó 11 veces menos dinero en computación. ¡Esto es como ganar la carrera de Fórmula 1 usando un coche híbrido en lugar de uno de combustible puro!
4. ¿Por qué fallaron las otras? (Los errores comunes)
El estudio descubrió tres formas principales en que las IAs se arruinaron:
- Ceguera ante los estafadores: La causa número uno de quiebra (47% de los casos). La IA aceptaba trabajos de clientes peligrosos una y otra vez porque no guardaba la información en su "Libreta de Notas".
- El error de "Hacerlo todo a la vez": Algunas IAs intentaron aceptar 10 proyectos simultáneamente. Como sus empleados no podían hacerlo todo a tiempo, fallaron en todos y perdieron prestigio.
- El "Sabio Inactivo": Algunas IAs eran muy inteligentes. Escribían en su libreta: "¡Cuidado! Estamos perdiendo dinero, no aceptes más trabajos de este cliente". Pero luego, hacían exactamente lo contrario. Sabían qué hacer, pero no podían obligarse a hacerlo.
5. La Lección Principal
Este estudio nos dice algo importante sobre la inteligencia artificial actual:
Las IAs son como genios con amnesia. Pueden resolver problemas difíciles si se les da el contexto al instante, pero les cuesta mucho mantener una estrategia coherente a lo largo del tiempo si no tienen una herramienta externa (como la libreta) para anotar sus aprendizajes.
En resumen:
YC-Bench es como un examen de conducción a largo plazo. No basta con saber conducir bien en una recta; tienes que saber navegar el tráfico, recordar dónde están los baches que ya pasaste y no chocar contra los mismos obstáculos dos veces. Hasta ahora, solo unos pocos conductores (modelos de IA) han demostrado tener la paciencia y la memoria necesarias para llegar al final del año sin chocar.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.