← Últimos artículos
🤖 AI

BONSAI: Evolvability-Guided Tree Search over Skills

BONSAI es un novedoso marco de optimización de habilidades para agentes congelados que emplea una búsqueda de árbol de Monte Carlo guiada por la evolucionabilidad para distinguir entre picos de sobreajuste y mesetas mejorables, superando significativamente a los modelos de referencia existentes en precisión con datos no vistos.

Autores originales: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

Publicado 2026-08-10
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yash Priya Shastri, Anand Eswaran, Adnan Qidwai, Pankaj Thorat, Sachin Joshi

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot superinteligente a realizar un trabajo complejo, como arreglar una hoja de cálculo o resolver un problema matemático difícil. ¿El problema? El robot está "congelado". Su cerebro está bloqueado en su lugar; no puedes reentrenarlo, ni ajustar sus neuronas, ni dejar que aprenda de sus errores de la misma manera que lo hace un estudiante humano. La única forma de hacerlo mejor es escribirle un conjunto de instrucciones, una "habilidad", en lenguaje natural sencillo. Piensa en esta habilidad no como un comando simple, sino como un manual de campo detallado que le dice al robot exactamente qué herramientas tomar, qué trampas evitar y cómo verificar su trabajo antes de entregar la respuesta.

La gran pregunta que los científicos se hacen es: ¿Cómo se escribe el manual perfecto? Si solo intentas hacer unos pocos cambios, probarlos y conservar los que funcionan, podrías quedarte estancado. Es como escalar una montaña donde el mapa solo muestra tu altitud actual. Podrías llegar a un pico pequeño y afilado que parece alto, pero que es tan estrecho que el siguiente paso te lleva directo al abismo. O, podrías estar en una meseta amplia y suave donde cada paso hacia adelante te lleva a un terreno aún más alto, pero no puedes notar la diferencia simplemente mirando tu altura actual. Este artículo presenta una nueva forma de navegar este paisaje, utilizando un concepto tomado de la biología llamado "evolvabilidad": la capacidad de un camino para seguir produciendo buenos resultados incluso cuando cometes un error.


El Problema: La Trampa del "Pico Afilado"

Los investigadores de IBM Research notaron una falla en la forma en que solemos mejorar estos manuales de IA. El método estándar es simple: toma un manual, pide a la IA que lo reescriba, prueba la nueva versión y, si la puntuación sube, consérvala. Si baja, deséchala.

El problema es que este método es "ciego". Solo mira la puntuación del manual actual. No puede distinguir la diferencia entre un manual situado en una meseta amplia (un área segura y estable donde los pequeños cambios suelen conducir a resultados aún mejores) y un manual posicionado en un pico estrecho y sobreajustado (un pico frágil donde la puntuación es alta, pero cualquier pequeño cambio hace que la puntuación se desplome). Si estás en un pico, la siguiente edición podría corregir un pequeño error pero romper diez cosas más que funcionaban perfectamente. El método estándar camina hacia el abismo porque solo ve la puntuación alta, no el peligro.

La Solución: BONSAI y la Brújula de la "Evolvabilidad"

Para solucionar esto, el equipo creó un nuevo marco llamado BONSAI. En lugar de solo mirar qué tan bueno es un manual en este momento, BONSAI pregunta: "¿Qué tan bueno es el vecindario alrededor de este manual?".

Utilizan una ingeniosa metáfora de la naturaleza: la Evolvabilidad. En biología, una especie no se juzga solo por qué tan bien sobrevive hoy, sino por su capacidad de seguir produciendo descendencia útil en el futuro. Una especie en una "meseta amplia" puede mutar y seguir sobreviviendo; una especie en un "pico afilado" muere si cambia aunque sea un poco.

BONSAI trata la búsqueda del manual perfecto como el crecimiento de un árbol.

  1. El Árbol: Comienza con un manual "semilla".
  2. Las Ramas: Cada vez que la IA intenta reescribir el manual, hace crecer una nueva rama (un nodo hijo).
  3. La Brújula: Al decidir qué rama explorar a continuación, BONSAI no solo elige la rama con la puntuación más alta. Elige la rama que parece tener el mejor futuro. Calcula una puntuación llamada Evolvabilidad, que es básicamente el promedio de las puntuaciones de todos los pequeños cambios (mutaciones) realizados a ese manual.

Si un manual está en un "pico", sus vecinos tendrán puntuaciones terribles y la puntuación de evolvabilidad será baja. BONSAI lo evita. Si un manual está en una "meseta", sus vecinos también tendrán buenas puntuaciones y la puntuación de evolvabilidad será alta. BONSAI se sumerge profundamente en estas áreas seguras y productivas.

Cómo Funciona: El Truco del "Injerto"

Los investigadores añadieron una característica especial llamada GRAFT. Imagina que tienes dos ramas de un árbol: una rama aprendió a manejar "problemas matemáticos" y otra rama aprendió a manejar "hojas de cálculo". Están en caminos diferentes y nunca se comunican.

Normalmente, la IA no puede combinar estas habilidades porque solo analiza un manual a la vez. Pero GRAFT permite que la IA eche un vistazo a la rama de "matemáticas", vea un truco que funciona y copie ese truco en el manual de la "hoja de cálculo". Es como un jardinero que toma una rama fuerte de un árbol y la injerta en otro para darle nuevos poderes. Esto sucede sin romper la estructura del árbol, permitiendo que la IA mezcle y combine las mejores ideas de diferentes partes de su búsqueda.

Los Resultados: Escalando Más Alto

El equipo probó BONSAI en tres desafíos diferentes:

  1. SpreadsheetBench: Reparar archivos de Excel.
  2. SearchQA: Responder preguntas de cuestionarios utilizando resultados de búsqueda.
  3. LiveMathematicianBench: Resolver problemas matemáticos.

Utilizaron un agente de IA de 30 mil millones de parámetros congelado (el "ejecutor") y una IA separada para escribir los manuales (el "optimizador"). Compararon BONSAI con otros dos métodos, GEPA y SkillOpt, asegurándose de que todos utilizaran la misma cantidad de potencia de cómputo (el mismo "presupuesto").

Los resultados fueron claros:

  • En SpreadsheetBench, BONSAI mejoró la precisión en 5.71 puntos respecto al manual inicial y superó al mejor competidor (GEPA) por 2.14 puntos.
  • En SearchQA, mejoró en 6.57 puntos respecto al manual inicial.
  • En LiveMathematicianBench, la brecha fue enorme. BONSAI alcanzó un 64.91% de precisión, mientras que el manual inicial era de solo 28.23%, y el competidor GEPA estaba en 56.14%.

Los investigadores descubrieron que cuando desactivaban la brújula de "evolvabilidad" y simplemente dejaban que la IA buscara codiciosamente la puntuación más alta (como los métodos antiguos), la IA se quedaba estancada en esos "picos afilados" temprano y dejaba de mejorar. Sin embargo, BONSAI siguió encontrando mejores soluciones más profundamente en la búsqueda porque sabía qué caminos eran seguros para explorar.

La Conclusión

El artículo sugiere que para hacer que los agentes de IA congelados sean más inteligentes, no debemos buscar solo la puntuación más alta en este momento. Debemos buscar el vecindario más prometedor. Al utilizar un método de búsqueda en árbol que valora la estabilidad y el potencial futuro (evolvabilidad) por encima de las victorias inmediatas y frágiles, BONSAI encontró mejores instrucciones para que la IA las siguiera. No necesitó reentrenar el cerebro de la IA; solo necesitaba escribir un mejor manual de campo, y lo hizo sabiendo qué caminos eran seguros para recorrer.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →