← Últimos artículos
🤖 AI

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

Argus es un entorno de ejecución agéntico de propósito general y peso fijo que logra un rendimiento de razonamiento de largo alcance superior a través de diversos bancos de pruebas mediante la utilización de un estado persistente y autoevolutivo gestionado por roles especializados para verificar, recuperar y refinar autónomamente las trayectorias de las misiones.

Autores originales: Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang
Publicado 2026-08-06
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El detective de larga distancia: Por qué la IA necesita memoria y un entrenador

Imagina que estás intentando resolver un misterio masivo de varios días, como descifrar cómo construir un robot funcional desde cero o escribir una novela que realmente tenga sentido. Si fueras un programa informático de hace unos años, podrías haber intentado resolverlo leyendo las instrucciones, lanzando una suposición y luego olvidando inmediatamente todo lo que acabas de hacer antes de volver a intentarlo. Así es como funcionaban muchos de los primeros "agentes" de IA: eran como un detective que resuelve una pista y luego sufre de amnesia total, y tiene que empezar toda la investigación desde el principio cada vez que llega a un callejón sin salida. Eran rápidos leyendo, pero terribles aprendiendo de sus propios errores durante un largo periodo.

El campo del "razonamiento de largo horizonte" trata precisamente de arreglar esto. Se pregunta: ¿Cómo puede una IA mantener un plan en marcha durante días o semanas, recordar lo que intentó ayer y cambiar su estrategia cuando se da cuenta de que va por el camino equivocado? La idea clave aquí es que ser inteligente no se trata solo de tener un cerebro grande (un modelo potente); se trata de tener un buen cuaderno (memoria persistente) y un entrenador estricto (verificación) que te impida mentirte a ti mismo cuando te quedas estancado. Este artículo aborda el problema de cómo construir un sistema de IA que no solo dé vueltas en círculos, sino que realmente evolucione sus propios métodos con el tiempo, mejorando en la resolución de problemas difíciles sin necesidad de ser reentrenado desde cero.


Conoce a Argus: La IA que aprende a pivotar

Conoce a Argus, un nuevo tipo de "runtime" de IA (piensa en ello como el sistema operativo o el motor que hace funcionar el cerebro de la IA). Los investigadores detrás de Argus, un equipo de Microsoft y varias universidades de primer nivel, se dieron cuenta de que, para que una IA aborde proyectos de largo plazo verdaderamente difíciles, no puede simplemente avanzar a ciegas. Si la IA intenta solucionar un error en una base de código de software gigante o demostrar un teorema matemático complejo, podría pasar horas siguiendo un camino que resulta ser un callejón sin salida. Una IA normal podría simplemente seguir insistiendo, desperdiciando tiempo y energía. Argus es diferente: está diseñado para pivotar.

Piensa en Argus como un equipo de investigación altamente organizado trabajando en una oficina compartida, en lugar de una sola persona trabajando sola. Este equipo tiene cuatro roles distintos, y nunca mezclan sus funciones:

  1. El Gerente: El jefe que tiene la visión general. Se asegura de que el equipo se mantenga enfocado en el objetivo original (como "construir un robot") incluso si el plan diario cambia.
  2. El Planificador: El estratega que desglosa el gran objetivo en tareas pequeñas y realizables para el día.
  3. El Ingeniero: El constructor que realmente escribe el código, realiza los experimentos o hace las matemáticas.
  4. El Revisor: El estricto inspector de control de calidad. Su trabajo es mirar lo que el Ingeniero construyó y decir: "Esto es bueno", "Esto necesita arreglo" o "Detente, este camino es un callejón sin salida".

La magia de Argus es que trata el fracaso como datos. Cuando el Ingeniero intenta un método y falla, el Revisor no se limita a decir "ups". Registra exactamente por qué falló. Este registro se guarda en un "estado del proyecto" permanente (el cuaderno compartido del equipo). Más tarde, si el equipo intenta ir por ese mismo camino sin salida otra vez, el sistema recuerda: "Oye, intentamos esto ayer y no funcionó", y pivota hacia una nueva idea. Esto se llama persistencia guiada por verificación. El sistema solo "aprende" (actualiza su memoria) si el Revisor verifica que la nueva información es realmente verdadera y útil.

Lo que encontraron: Mejor en la reparación de código y la escritura de artículos

El equipo probó Argus en desafíos increíblemente difíciles para ver si este enfoque de "equipo con memoria" realmente funciona.

1. La prueba de reparación de código (SWE-Bench Pro)
Le dieron a Argus 731 errores de software del mundo real para reparar. Esto es como darle a un programador una base de código desordenada y rota y pedirle que la arregle sin ayuda humana.

  • El Resultado: Argus reparó con éxito alrededor del 78% de los errores.
  • La Comparación: Una herramienta de IA estándar (Direct Copilot) logró reparar solo el 59% de ellos.
  • El Costo: Argus utilizó aproximadamente 1.41 veces más "tokens" de computadora (las unidades básicas de pensamiento) que la herramienta estándar.
  • La Conclusión: Argus fue significativamente más preciso, incluso aunque pensó un poco más. Demostró que tomarse el tiempo para revisar el trabajo y recordar los errores pasados vale la pena.

2. La prueba de "volverse más inteligente" (Autoevolución)
Esta es la parte más genial. Los investigadores observaron a Argus a lo largo del tiempo. No cambiaron el cerebro de la IA (los pesos del modelo se mantuvieron exactamente iguales). En su lugar, simplemente dejaron que el sistema construyera su "cuaderno" de habilidades y memorias.

  • El Resultado: A medida que el sistema realizaba más tareas y llenaba su cuaderno con habilidades verificadas, se volvía más rápido y económico. En las etapas finales de la prueba, Argus utilizó un 21% menos de tokens y un 15% menos de tiempo por tarea en comparación con cuando estaba empezando.
  • El Significado: La IA no necesitó ser reentrenada para mejorar; solo necesitaba recordar lo que aprendió. Evolucionó su propio "estado de ejecución" (runtime state), convirtiéndose en un trabajador más eficiente sin cambiar su cerebro fundamental.

3. La prueba de "No te mientas a ti mismo" (Intervención del Revisor)
El equipo rastreó cuántas veces intervino el Revisor. De 731 tareas, el Revisor fue llamado en 466 de ellas.

  • El Rescate: En 43 casos, el Revisor dijo: "Esto aún no está terminado, inténtalo de nuevo". Después de que el Ingeniero lo intentó de nuevo, 34 de esas tareas se repararon con éxito, y 22 se repararon tan bien que pasaron una segunda revisión más estricta.
  • El Bloqueo: El Revisor también detuvo al sistema de reclamar victoria en 35 tareas que en realidad eran imposibles o estaban rotas. Esto es enorme: significa que el sistema aprendió a decir "no puedo hacer esto" en lugar de alucinar una solución falsa.

Más allá del código: Matemáticas, Chips y Artículos

Argus no se detuvo solo en la reparación de código. El equipo demostró que podía manejar otras tareas de "largo horizonte":

  • Investigación Matemática: En una campaña para demostrar un teorema matemático complejo, Argus mantuvo un registro de un camino que se demostró falso (una "ruta falsificada"). En lugar de borrarlo, lo mantuvo como una señal de "no entrar". Esto ayudó al sistema a evitar ese callejón sin salida más tarde y a fortalecer con éxito los límites del teorema.
  • Escritura de Artículos: Ejecutaron seis proyectos de investigación diferentes para escribir artículos científicos. El sistema gestionó 254 misiones, sobrevivió a 16 retrocesos importantes (donde tuvo que volver atrás y cambiar todo su plan) y aun así logró terminar los seis artículos. Un proyecto incluso convirtió una idea fallida en un estudio exitoso de "resultados negativos", demostando que, a veces, descubrir lo que no funciona es un descubrimiento científico válido.
  • Diseño de Chips: En una prueba intimidante, Argus diseñó un chip de computadora (ACE-2). El sistema escribió el código, verificó los tiempos y el diseño final pasó todas las estrictas comprobaciones de hardware. El sistema incluso supo exactamente lo que no revisó (como si el chip funcionaría en la vida real) y enumeró esos límites claramente.

La conclusión fundamental

Argus demuestra que, para que la IA realice un trabajo real y a largo plazo, necesita más que un cerebro grande. Necesita un sistema que separe al "jefe" del "trabajador", mantenga un registro permanente de lo que funcionó y lo que no, y tenga un "revisor" estricto para evitar que invente respuestas.

El artículo sugiere que, mediante el uso de este enfoque de "verificación controlada", la IA puede resolver problemas más difíciles, volverse más eficiente con el tiempo sin necesidad de ser reentrenada e incluso admitir cuando está estancada. No es una varita mágica que lo soluciona todo instantáneamente, sino un paso masivo hacia una IA que realmente pueda trabajar con nosotros en proyectos complejos y de larga duración sin perderse o mentir sobre su progreso. Como señalan los autores, esto no se trata solo de obtener una puntuación más alta en una prueba; se trata de construir un sistema que pueda persistir, pivotar y evolucionar sus propios métodos para abordar los desafíos desordenados y de largo plazo del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →