← Últimos artículos
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO introduce un marco eficiente de destilación de habilidades en línea que permite a los agentes web multimodales mejorar el rendimiento y reducir el consumo de tokens mediante el mantenimiento de una biblioteca de habilidades estructurada y el empleo de técnicas como la reflexión sobre el progreso y la instrucción consciente de la caché, logrando una tasa de éxito del 58,3% en VisualWebArena con costos de inferencia significativamente menores en comparación con los métodos existentes.

Autores originales: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Publicado 2026-05-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: La Trampa del "Pago por Clic"

Imagina que contratas a un asistente muy inteligente, pero caro, para ayudarte a comprar en línea. Cada vez que miran una página web, piensan en qué hacer o hacen clic en un botón, debes pagarles una pequeña tarifa (llamada "token").

Actualmente, la mayoría de los agentes de IA intentan mejorar en sus trabajos gastando más dinero. Si fallan, lo intentan de nuevo. Si se quedan atascados, piden una segunda opinión. Ejecutan la misma tarea diez veces y eligen el mejor resultado. Esto funciona, pero es como pagar un viaje en taxi a la tienda de comestibles, luego pagar un segundo taxi para volver y revisar si olvidaste la cartera, y un tercer taxi para verificar dos veces el precio. Se hace el trabajo, pero es increíblemente costoso y lento.

Los autores de este artículo preguntaron: ¿Podemos crear un agente que se vuelva más barato y rápido a medida que trabaja más, en lugar de simplemente gastar más dinero cada vez?

La Solución: PANDO (El Agente "Gigante Aspen")

Los investigadores construyeron un agente llamado PANDO. Lo nombraron en honor al bosque de álamos "Pando" en Utah.

  • La Metáfora: Pando parece 47.000 árboles separados, pero en realidad todos están conectados por un solo sistema de raíces subterráneo. Cuando un árbol crece, comparte nutrientes con los demás. Cuando un árbol muere, el sistema de raíces lo recuerda y mantiene viva a todo el bosque.
  • La Versión de IA: PANDO es un agente de IA que tiene una "raíz de memoria" compartida (una Biblioteca de Habilidades). En lugar de tratar cada nueva tarea como un problema completamente nuevo, recuerda lo que aprendió de tareas anteriores y usa esas lecciones para resolver las nuevas.

Cómo Funciona PANDO (El Bucle de 4 Pasos)

PANDO no solo adivina y verifica. Sigue un ciclo: Planificar → Actuar → Reflexionar → Aprender.

  1. Planificar: El "Cerebro" (una IA inteligente y cara) divide una tarea grande (como "encontrar la guitarra más barata por menos de 500 dólares") en pequeños pasos.
  2. Actuar: Las "Manos" (una IA más barata y rápida) hacen realmente los clics en los botones.
  3. Reflexionar: Un "Gerente" verifica si los pasos funcionaron. ¿El filtro de precio cambió realmente la lista? Si no, ¿por qué?
  4. Aprender (La Parte Mágica): Aquí es donde PANDO se vuelve más inteligente.
    • Biblioteca de Habilidades: Si el agente encuentra con éxito una guitarra barata, escribe la receta: "Para encontrar artículos baratos, haz clic en 'Ordenar por precio' y luego 'De menor a mayor'". Guarda esto como una Regla o una Rutina.
    • Reutilización de Habilidades: La próxima vez que el agente necesite encontrar el artículo "más caro", no necesita pensar mucho. Solo mira su biblioteca, ve la regla y cambia el interruptor a "De mayor a menor".
    • Degradación (La Limpieza): Si una regla deja de funcionar (por ejemplo, un sitio web cambia su diseño), el agente la marca como "rota" y deja de usarla. Esto evita que el agente se quede atrapado en bucles intentando usar instrucciones antiguas y rotas.

Por Qué Es un Cambio de Juego

El artículo probó PANDO en 910 tareas web diferentes (compras, clasificados, Reddit). Esto es lo que sucedió:

  • Tasa de Éxito: PANDO tuvo éxito el 58,3% de las veces. Esto es mejor que los agentes principales actuales (que estaban alrededor del 54%).
  • Costo: Este es el gran triunfo. PANDO utilizó 58% menos tokens (dinero) que el siguiente mejor agente.
  • El Efecto "Almuerzo Gratis":
    • Al principio: PANDO es un poco lento porque está aprendiendo las reglas.
    • Más tarde: A medida que construye su biblioteca de habilidades, se vuelve más rápido y barato. Al final de la prueba, estaba resolviendo tareas con menos pasos y menos dinero de lo que comenzó.
    • Analogía: Imagina a un estudiante tomando un examen de matemáticas.
      • Agentes Antiguos: Cada vez que ven un problema nuevo, vuelven a derivar la fórmula desde cero. Toma una eternidad.
      • PANDO: La primera vez que ven un problema, lo resuelven y escriben la fórmula en una hoja de trucos. Las siguientes 99 veces, solo miran la hoja de trucos. Terminan el examen más rápido y con menos esfuerzo mental.

Los "Costos Ocultos" que PANDO Evita

El artículo señala que otros agentes ocultan sus costos de dos maneras:

  1. Descubrimiento de Pre-evaluación: Algunos agentes pasan semanas "entrenando" o "descubriendo" herramientas antes de que la prueba siquiera comience. PANDO aprende durante la prueba, por lo que no hay costos iniciales ocultos.
  2. Escalado de Despliegue: Algunos agentes simplemente intentan la tarea 10 veces y eligen al ganador. PANDO lo intenta una vez, pero usa su memoria para que ese único intento cuente.

La Conclusión

PANDO demuestra que no necesitas tirar más dinero a una IA para hacerla mejor. Al darle una memoria estructurada (una biblioteca de habilidades) y una forma de limpiar malos recuerdos (degradación), el agente se vuelve más eficiente a medida que trabaja más.

Es la diferencia entre un trabajador que olvida todo cada día y tiene que ser reentrenado constantemente, versus un trabajador que mantiene un cuaderno de "cómo hacer las cosas" y se vuelve más rápido cada día.

Conclusión Clave: PANDO no solo se vuelve más inteligente; se vuelve más barato de ejecutar a medida que gana experiencia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →