MyAG: A Graph-Based Framework for Designing and Analyzing Composable LLM Agent Systems
El artículo presenta MyAG, un marco de trabajo de código abierto basado en grafos que descompone los sistemas de agentes de LLM componibles en grafos de componentes, flujos de trabajo y búsqueda para permitir un diseño flexible, composición jerárquica y análisis de rendimiento.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo donde las computadoras no solo responden preguntas, sino que realmente hacen cosas. Pueden navegar por la web, reservar vuelos o resolver acertijos complejos actuando como asistentes digitales. Este es el reino de los Agentes de IA. Piensa en ellos no como simples chatbots, sino como pequeños robots con un cerebro (un Modelo de Lenguaje Grande) y un conjunto de manos (herramientas para interactuar con el mundo). Pero aquí está la parte difícil: construir estos robots es caótico. Tienes que decidir qué herramientas tienen, cómo piensan paso a paso y qué hacen cuando se quedan estancados. Es como intentar construir un coche donde el motor, el volante y el GPS están todos pegados de una manera que hace imposible intercambiarlos. Si quieres cambiar la forma en que conduce el coche, es posible que tengas que reconstruir todo el motor. Los investigadores están tratando de descubrir cómo construir estos agentes para que sean flexibles, eficientes y fáciles de reparar, porque ahora mismo es difícil saber si un robot está fallando porque es "tonto" o porque las instrucciones estaban mal escritas.
Entra MyAG, un nuevo kit de herramientas creado por Zhisong Zhang de la Universidad de la Ciudad de Hong Kong. El artículo presenta a MyAG como un "marco basado en grafos", que es una forma elegante de decir que organiza el diseño del agente en tres planos distintos y claros en lugar de un gran desorden enredado. Los autores sugieren que, al separar el "quién" (los componentes), el "cómo" (el flujo de trabajo) y el "qué pasa si" (la estrategia de búsqueda), los desarrolladores pueden mezclar y combinar piezas como si fueran bloques de Lego. Descubrieron que esta separación facilita mucho la prueba de diferentes estrategias sin tener que reescribir todo el sistema. En sus experimentos, demostraron que este enfoque permite un análisis detallado de las compensaciones entre qué tan bien realiza un agente una tarea y cuánto tiempo o dinero cuesta hacerla. No pretendieron haber resuelto todos los problemas de la IA, pero sí demostraron que su método ayuda a los investigadores a ver exactamente dónde está gastando su tiempo un agente y dónde podría estar desperdiciando recursos.
Los Tres Planos de un Cerebro Digital
Para entender MyAG, imagina que estás dirigiendo una película. Tienes tres trabajos distintos, y MyAG insiste en que los mantengas separados para que puedas arreglar uno sin arruinar los demás.
1. El Grafo de Componentes: El Elenco y el Equipo
Esta es tu lista de quién está en la película. En el mundo de la IA, estos son los agentes (los actores que toman decisiones), los entornos (los escenarios donde actúan, como un navegador web) y las herramientas (los accesorios que usan). En MyAG, esto se dibuja como un mapa que muestra quién puede hablar con quién. Por ejemplo, un "Agente de Acción" podría estar conectado a un "Entorno de Navegador", lo que significa que el agente puede hacer clic en botones de una página web. Lo genial aquí es que puedes reutilizar el mismo actor para diferentes escenas. No necesitas construir un nuevo actor solo porque la escena cambie; simplemente le dices al existente qué hacer a continuación.
2. El Grafo de Flujo de Trabajo: El Guion
Este es el guion que le dice a los actores cuándo hablar y qué hacer después. Es el flujo de la historia. ¿El agente consulta el clima y luego reserva un boleto? ¿O regresa y lo intenta de nuevo si falla? MyAG te permite dibujar este guion como un diagrama de flujo. Puedes tener bucles, ramificaciones (si esto sucede, ve a la izquierda; si aquello sucede, ve a la derecha) y condiciones de parada. ¿Lo mejor de todo? Puedes mantener el mismo elenco (Grafo de Componentes) pero cambiar el guion (Grafo de Flujo de Trabajo) para ver si una estructura de historia diferente funciona mejor.
3. El Grafo de Búsqueda: Los Ensayos del "Qué pasaría si"
Aquí es donde se pone realmente interesante. A veces, un robot necesita explorar diferentes caminos antes de decidir cuál es el mejor. Tal vez intenta una puerta, se da cuenta de que está cerrada y luego intenta una ventana. El Grafo de Búsqueda registra todos estos escenarios de "qué pasaría si". Registra cada rama que toma el agente, cada callejón sin salida y cada camino exitoso. Esto permite que el sistema utilice estrategias como la "Búsqueda de Mejor Primera Opción" (siempre eligiendo el camino más prometedor) o el "Retroceso" (volver a un paso anterior si algo sale mal). Es como tener un director que puede decir: "¡Corte! Intentemos esa escena de nuevo, pero esta vez que el personaje corra en lugar de caminar", sin tener que reconstruir todo el set de la película.
Construyendo Torres con Bloques de Lego
Una de las grandes ideas del artículo es la Composición Jerárquica. Imagina que estás construyendo un robot gigante. En lugar de intentar diseñar cada pequeño tornillo y cable a la vez, construyes una mano, luego una pierna, luego una cabeza y finalmente los unes todos. MyAG te permite hacer esto con agentes de IA. Puedes construir un pequeño "Sistema de Navegación Web" que sea muy bueno encontrando artículos en internet. Luego, puedes envolver todo ese sistema y tratarlo como una única herramienta dentro de un sistema más grande de "Asistente de Investigación".
El artículo explica que estos "subsistemas" pueden ser sin estado (se reinician cada vez que se usan, como una calculadora) o con estado (recuerdan lo que sucedió antes, como un asistente humano que recuerda tus preferencias). Esta modularidad significa que puedes construir agentes complejos ensamblando piezas más pequeñas y ya probadas, en lugar de empezar desde cero cada vez.
El Cronómetro y la Cartera: Midiendo la Eficiencia
A los autores también les importa la eficiencia. Argumentan que el hecho de que un agente obtenga la respuesta correcta no significa que sea un buen agente; podría haber tomado 100 intentos y costado una fortuna en tiempo de computación.
Miden dos cosas principales:
- Costo de LLM (): Cuánto cuesta el "cerebro". Esto se calcula basándose en cuántas palabras (tokens) lee y escribe la IA. Utilizan una fórmula donde ponderan los tokens de entrada y salida, permitiendo a los usuarios establecer precios según lo costoso que sea el modelo de IA.
- Costo del Entorno (): Cuánto cuestan las "manos". Esto mide el tiempo que se tarda en hacer cosas en el mundo real, como esperar a que una página web cargue o desplazarse hacia abajo en una página.
Al rastrear estos costos, los investigadores pueden ver la compensación entre rendimiento y eficiencia. Por ejemplo, descubrieron que una estrategia "Codiciosa" (simplemente hacer lo primero que viene a la mente) es la más rápida y barata, porque no pierde tiempo revisando alternativas. Sin embargo, una estrategia de "Retroceso" (que permite al agente volver atrás e intentarlo de nuevo) puede ser ligeramente más costosa pero suele obtener un mejor resultado. La estrategia "Mejor de N" (intentar muchos caminos a la vez y elegir el mejor) puede ser muy precisa, pero es muy lenta y costosa.
Lo que Mostraron los Experimentos
El equipo probó MyAG en dos tareas del mundo real: responder preguntas complejas (usando el benchmark GAIA) y navegar por sitios web (usando Mind2Web-Live). Realizaron estas pruebas con diferentes estrategias para ver cómo se comparaban.
- Velocidad vs. Inteligencia: La estrategia Codiciosa fue la más eficiente, ya que tomó menos tiempo y utilizó menos tokens de computadora porque no perdió tiempo revisando alternativas.
- El Poder de las Segundas Oportunidades: La estrategia de Retroceso fue la que mejor funcionó en general cuando se le dio suficiente tiempo. Permitió que el agente admitiera errores e intentara de nuevo, lo que llevó a una mayor precisión, aunque costó un poco más en tiempo y tokens.
- El Costo de la Complejidad: Estrategias como Mejor Primera Opción y Mejor de N pudieron mejorar el rendimiento, pero trajeron consigo un alto precio. Requirieron mucha más potencia de cómputo y tiempo. El artículo señala que el éxito de estos métodos complejos depende fuertemente de tener un buen "juez" para decidir qué camino es el mejor.
También desglosaron exactamente dónde se gastó el tiempo. Para la navegación web, encontraron que el "desplazamiento" (scrolling) era sorprendentemente barato y rápido, mientras que "esperar" a que una página cargara era la acción más costosa, consumiendo una gran parte del tiempo a pesar de que ocurría con menos frecuencia. Este tipo de análisis detallado ayuda a los desarrolladores a saber exactamente dónde optimizar sus agentes.
La Conclusión
MyAG no es una varita mágica que resuelve todos los problemas de la IA, y los autores dejan claro que está diseñado como una herramienta de investigación, no como un producto terminado para construir aplicaciones comerciales con millones de usuarios. Aún no maneja aspectos como la seguridad o las redes distribuidas. Sin embargo, demuestra con éxito que separar el "quién", el "cómo" y el "qué pasaría si" hace que sea mucho más fácil diseñar, probar y comprender los agentes de IA. Al dar a los investigadores una forma clara de visualizar y medir sus agentes, MyAG les ayuda a determinar exactamente cómo construir asistentes digitales más inteligentes, rápidos y rentables. El artículo sugiere que este enfoque es un paso sólido hacia hacer que los sistemas de agentes de IA sean más transparentes y manejables.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.