← Últimos artículos
💬 NLP

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

Este artículo sostiene que representar las habilidades como programas ejecutables es la estrategia más rentable para adaptar agentes de LLM a nuevos dominios, demostrando a través del agente propuesto "SpeedRunner" que el aprendizaje incremental y la refactorización de estos programas a partir de trayectorias pasadas reduce significativamente los costos mientras mantiene la robustez en diversos entornos.

Autores originales: Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

Publicado 2026-08-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a navegar por un patio de juegos gigante y desordenado. Al principio, el robot es como un niño pequeño curioso: intenta caminar hacia adelante, choca contra una pared, se confunde, lo intenta de nuevo y tal vez aprende un poco. Así es como suelen trabajar los "agentes" de IA modernos. Son modelos de lenguaje potentes que pueden entender instrucciones y hablar con las computadoras, pero cuando se enfrentan a una tarea nueva y compleja, a menudo tienen que "pensar" cada uno de los pasos desde cero. Pueden intentar abrir una puerta, fallar, intentar de otra manera, fallar de nuevo, y seguir en un bucle hasta que lo logren. Si bien esto funciona, es lento y costoso. Cada vez que el robot "piensa", cuesta dinero y tiempo, tal como pagar por cada minuto que un humano pasa resolviendo un rompecabezas.

La gran pregunta que se hacen los investigadores es: ¿Cómo podemos enseñar a estos robots a mejorar sin que tengan que volver a aprender lo mismo una y otra vez? La respuesta suele implicar "habilidades". Piensa en una habilidad como un atajo o una receta ya preparada. En lugar de descubrir cómo hornear un pastel desde cero cada vez, simplemente sigues una receta que ya has escrito. Durante un tiempo, los científicos intentaron escribir estas recetas en inglés sencillo. Pero los autores de este artículo se preguntaron: ¿qué pasaría si escribiéramos las recetas en código? El código es como un manual de instrucciones súper preciso que una computadora puede seguir instantáneamente sin confundirse ni perder tiempo. La gran idea es que, si podemos convertir las experiencias de ensayo y error del robot en un código limpio y reutilizable, el robot podría volverse más rápido, más barato y mucho más inteligente.

Esto es exactamente lo que el equipo detrás del proyecto "SpeedRunner" se propuso probar. Querían ver si un agente de IA podía aprender a escribir sus propias habilidades basadas en código mientras trabajaba, en lugar de que simplemente se le dijera qué hacer. Construyeron un sistema donde la IA juega un juego, comete errores y luego un segundo "agente de codificación" especial observa el historial del robot. Este agente de codificación actúa como un detective y un programador al mismo tiempo. Escanea los intentos pasados del robot, encuentra patrones donde el robot falló repetidamente o repitió la misma secuencia larga de pasos, y luego escribe un nuevo fragmento de código para solucionarlo. Es como observar un video de alguien intentando atarse los cordones de los zapatos, darse cuenta de que siempre se le traban los cordones y luego escribir un manual de instrucciones pequeño y perfecto sobre cómo atárselos correctamente para que nunca más se traben.

Los investigadores probaron esta idea en tres mundos virtuales muy diferentes: un laboratorio de ciencias donde tienes que mezclar productos químicos, un mundo de cuadrícula donde tienes que seguir instrucciones para recoger objetos, y un juego de supervivencia donde tienes que reunir recursos y luchar contra zombies. En todos estos lugares, el agente "SpeedRunner" aprendió a escribir sus propias habilidades de código sobre la marcha. Los resultados fueron sorprendentes. Mientras que otros métodos o se quedaban atrapados en bucles o se volvían más caros a medida que aprendían más, SpeedRunner en realidad se volvió más barato y rápido cuanto más aprendía. Convirtió secuencias largas y complicadas de acciones en funciones de código cortas y reutilizables. Por ejemplo, en lugar de que el robot gaste mucho dinero pensando en cómo encontrar un árbol, aprendió un comando de código simple llamado "find_tree" (encontrar_árbol) que puede simplemente usar con un clic de forma instantánea.

El artículo sugiere que este enfoque es un cambio de paradigma en cuanto a costos. En una de las pruebas, el agente SpeedRunner utilizó aproximadamente una octava parte del dinero (en términos de potencia de procesamiento informático) que el método estándar utilizó para resolver el mismo problema. No solo ahorró dinero, sino que también mejoró en las tareas. La clave fue que el agente de codificación no solo memorizó lo que pasó; analizó por qué fallaron las cosas. Si el robot seguía fallando al encontrar un recurso porque no podía verlo, el agente de codificación escribió una nueva función para "barrer el área" antes de rendirse. Esto hizo que el agente fuera robusto, lo que significa que pudo manejar cambios aleatorios en el entorno, como la aparición repentina de zombies, sin entrar en pánico.

Sin embargo, los autores advierten cuidadosamente que esto no es una solución mágica para todas las situaciones. Descubrieron que si el robot ya es muy bueno en una tarea, obligarlo a usar código podría hacerlo un poco demasiado rígido, como un robot que sigue una receta tan estrictamente que no puede adaptarse si el horno se rompe. Pero para la mayoría de las tareas complejas y de largo plazo, convertir las experiencias desordenadas en código limpio parece ser la mejor manera de hacer que los agentes de IA sean tanto más inteligentes como más asequibles. El estudio muestra que, al permitir que los agentes escriban sus propios "atajos automatizados" mientras juegan, podemos construir sistemas que aprendan de manera eficiente sin necesidad de ser reentrenados desde cero cada vez que enfrentan un nuevo desafío.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →