← Últimos artículos
🤖 AI

Improving Language Agents through BREW: Bootstrapping expeRientially-learned Environmental knoWledge

El artículo presenta BREW, un marco de trabajo que mejora los agentes basados en LLM mediante la destilación de trayectorias de interacción pasadas en una base de conocimientos estructurada y recuperable de recetas en lenguaje natural utilizando un novedoso algoritmo de Búsqueda en Árbol de Monte Carlo de Expandir y Recopilar y el reetiquetado retrospectivo, lo que resulta en mejoras significativas en las tasas de éxito de las tareas y la eficiencia de ejecución a través de múltiples evaluaciones de referencia.

Autores originales: Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

Publicado 2026-07-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Shashank Kirtania, Param Biyani, Priyanshu Gupta, Yasharth Bajpai, Roshni Iyer, Sumit Gulwani, Gustavo Soares

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robot superinteligente que puede hacer clic en botones, abrir archivos y hablar contigo. Es increíblemente talentoso, pero tiene un fallo extraño en su memoria: cada vez que le pides que haga algo que ya ha hecho antes, actúa como si fuera la primerísima vez. Olvida que "Archivo > Exportar como PDF" es el hechizo mágico para guardar un documento, o que necesitas verificar el ID del usuario antes de procesar una devolución. Simplemente redescubre la solución desde cero, cometiendo a menudo los mismos errores que cometió ayer.

Los investigadores detrás de este artículo, BREW, decidieron solucionar esto dándole al robot un "libro de recetas" en lugar de solo un cerebro.

El Problema: El Robot con Amnesia

Piensa en un humano aprendiendo a cocinar. Después de hacer huevos revueltos varias veces, no memorizas cada segundo del proceso de cocción. En su lugar, interiorizas una receta: "Batir los huevos, calentar la sartén, añadir mantequilla, remover suavemente". Sabes cuándo usar esta receta (hora del desayuno), qué hacer y a qué prestar atención (no quemar la mantequilla).

Los agentes robóticos actuales son como chefs que olvidan la receta después de cada comida. Tienen que reinventar la rueda cada vez. Algunos científicos intentaron solucionar esto "entrenando" el cerebro del robot (cambiando sus pesos internos), pero eso es como intentar hornear un pastel reorganizando los átomos de la harina: hace que el comportamiento del robot sea una caja negra que nadie puede inspeccionar o arreglar fácilmente. Otros intentaron darle al robot una pila gigante de notas sin procesar (memorias), pero esas notas eran demasiado desordenadas (solo una lista de clics) o demasiado vagas ("ten cuidado").

La Solución: BREW (Bootstrapping expeRientially-learned Environmental knoWledge)

Los autores proponen BREW, un sistema que convierte las aventuras pasadas del robot en un libro de recetas estructurado y fácil de leer.

Así es como funciona, paso a paso:

  1. La Experiencia: El robot intenta realizar tareas (como organizar archivos o reservar vuelos). A veces tiene éxito; a veces falla.
  2. La Reflexión: Un agente especial llamado "Reflector" observa estos intentos. Si el robot falló, el reflector pregunta: "¿Qué salió mal?". Si tuvo éxito, pregunta: "¿Cuál fue el ingrediente secreto?".
  3. El Truco de la "Perspectiva" (Hindsight): Esta es la parte ingeniosa. A veces el robot falla porque estaba intentando realizar la tarea equivocada. El sistema utiliza una técnica llamada Hindsight Relabeling (Relabelado de Perspectiva). Observa un intento fallido y dice: "Espera, si el objetivo hubiera sido realmente esto en lugar de aquello, ¡las acciones del robot habrían sido perfectas!". Reetiqueta el fallo como un éxito para un objetivo ligeramente diferente. Esto convierte los "errores" en "nuevas recetas", duplicando la cantidad de conocimiento útil que el robot puede aprender.
  4. El Libro de Recetas (Base de Conocimientos): El sistema organiza estos conocimientos en una biblioteca limpia de recetas en lenguaje natural. Cada receta tiene un título (por ejemplo, "Comprimir y Extraer Archivos"), una sección de "Cuándo usar" y una sección de "Cómo realizarlo" con puntos clave. No es código; son instrucciones en inglés sencillo que cualquiera puede leer.
  5. La Búsqueda (EG-MCTS): Escribir un libro de recetas perfecto es difícil. Si escribes una receta demasiado específica, no ayudará con nuevas tareas. Si es demasiado vaga, el robot se confundirá. Los autores inventaron un algoritmo de búsqueda inteligente llamado Expand-and-Gather Monte Carlo Tree Search (EG-MCTS). Imagina a un detective tratando de encontrar la mejor versión de una receta probando miles de variaciones en paralelo, conservando las que funcionan mejor y descartando el resto. Esto asegura que el libro final sea tanto preciso como fácil de encontrar.

Los Resultados: ¿Funciona el Libro de Recetas?

Los investigadores probaron BREW en tres desafíos del mundo real:

  • OSWORLD: Una prueba donde el robot tiene que controlar una computadora (hacer clic en menús, mover archivos).
  • τ2-Bench: Una prueba donde el robot actúa como un agente de servicio al cliente para telecomunicaciones, comercio minorista y aerolíneas.
  • SpreadsheetBench: Una prueba donde el robot tiene que manipular hojas de cálculo complejas de Excel.

Los resultados fueron prometedores. Cuando usaban BREW, los robots:

  • Resolvieron entre un 10 y un 20% más de tareas con éxito que los robots sin el libro de recetas.
  • Realizaron entre un 10 y un 15% menos de pasos para terminar un trabajo.
  • Superaron a otros sistemas de memoria que, en ocasiones, hacían que los robots fueran incluso peores al alimentarles información incorrecta.

Por ejemplo, en la prueba de control de computadora, el robot con BREW mejoró su tasa de éxito del 53.30% al 61.70%. En la prueba de hojas de cálculo, saltó del 44.30% al 48.50%.

Lo que el Artículo Descarta

Los autores son muy claros sobre lo que no funciona. Argumentan contra el simple hecho de volcar registros brutos y desordenados de las acciones pasadas del robot en su memoria. Encontraron que los sistemas que solo almacenan "fragmentos de trayectoria transitorios" (registros de clics paso a paso) suelen confundir al robot, provocando un rendimiento incluso peor que si el robot no tuviera memoria alguna. También sugieren que el simple hecho de "ajustar finamente" (fine-tuning) el cerebro del robot (cambiando sus pesos internos) crea una "caja negra" difícil de inspeccionar o actualizar, mientras que el libro de recetas de BREW es transparente y editable.

¿Qué tan seguros estamos?

El artículo presenta estos hallazgos basados en resultados medidos de la ejecución de los agentes en estos bancos de pruebas específicos. Las mejoras (como la ganancia del 10–20%) son números medidos de los experimentos, no simples suposiciones. Los autores sugieren que este enfoque es una alternativa sólida al ajuste fino, pero también señalan que el éxito del sistema depende de la calidad de los datos de entrenamiento. No afirman que esto resuelva todos los problemas para todos los robots en todas partes, pero demuestran que, para estas tareas específicas y complejas, tener un libro de recetas estructurado y legible por humanos marca una diferencia significativa y medible.

En resumen, BREW enseña a los robots a dejar de reinventar la rueda y empezar a utilizar un manual de instrucciones bien organizado y apto para humanos que realmente puedan leer y entender.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →