← Últimos artículos
🤖 AI

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

GRPO es un marco novedoso que mejora a los agentes con uso de herramientas mediante la combinación de un motor de datos reflexivos estructurados para el arranque en caliente con un algoritmo de Optimización de Política de Grupo Relativa aumentada por reflexión, permitiendo que los agentes aprendan eficazmente de los fallos por casi acierto y optimicen conjuntamente los tokens de reflexión y las acciones correctivas para superar a las líneas base existentes.

Autores originales: Binjie Zhang, Mike Zheng Shou

Publicado 2026-07-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Binjie Zhang, Mike Zheng Shou

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un robot asistente, muy inteligente pero un poco torpe, a resolver acertijos complejos utilizando una caja de herramientas con dispositivos digitales (como búsqueda web, lectores de imágenes o ejecutores de código). Este robot es un "Modelo de Lenguaje-Visión", lo que significa que puede ver imágenes y leer texto, pero a veces comete errores cuando intenta usar estas herramientas.

El artículo presenta un nuevo método de entrenamiento llamado ReGRPO (Optimización de Política Relativa de Grupo con Aumento de Reflexión). Así es como funciona, explicado mediante analogías sencillas:

El Problema: El Robot que no Sabe Cómo Reparar sus Erroos

Actualmente, cuando entrenamos a estos robots, la mayoría de las veces les mostramos ejemplos perfectos de cómo resolver una tarea. Es como mostrarle a un estudiante solo la clave de respuestas donde cada paso se realizó correctamente.

  • El Problema: Si el robot intenta usar una herramienta y falla (por ejemplo, intenta leer un recibo pero el ángulo de la cámara es incorrecto, por lo que no ve nada), no sabe qué hacer. Simplemente sigue adelante a ciegas o se rinde.
  • La Brecha: Los métodos de entrenamiento antiguos no le enseñan al robot cómo recuperarse de un error. Solo le enseñan cómo tener éxito cuando todo sale bien.

La Solución: El Bucle "Error-Reflexión-Corrección"

Los autores crearon un nuevo sistema que enseña al robot a detenerse, pensar y corregirse a sí mismo. Ellos llaman a esto Reflexión.

Piénsalo como un sistema de navegación GPS:

  1. El Error (Casi un acierto): El robot intenta tomar un giro, pero el camino está bloqueado (la herramienta falla).
  2. La Reflexión (El momento "¡Ahá!"): En lugar de simplemente chocar, el robot se detiene y pregunta: "¿Por qué falló esto? Ah, intenté leer el texto en la parte equivocada de la imagen. La evidencia es que el texto está vacío. Mi plan es mover el cuadro de la cámara hacia la derecha".
  3. La Corrección: El robot intenta inmediatamente el nuevo plan y tiene éxito.

Cómo lo Construyeron (El "Motor de Datos Estructurados")

Para enseñar al robot esta habilidad, los investigadores no se limitaron a esperar a que fallara naturalmente. Construyeron un laboratorio de simulación:

  • Tomaron una tarea perfecta y la rompieron intencionalmente (por ejemplo, le dijeron al robot que mirara la parte incorrecta de una foto).
  • Observaron al robot fallar y registraron exactamente qué salió mal.
  • Utilizaron un "IA Maestro" (un modelo muy inteligente) para escribir una nota estructurada para el robot. Esta nota tiene tres partes específicas:
    1. Tipo de Error: ¿Qué tipo de error fue? (ej. "Miré en el lugar equivero").
    2. Evidencia: ¿Qué lo demuestra? (ej. "El texto que leí estaba vacío").
    3. Plan de Corrección: ¿Cómo solucionarlo? (ej. "Mover el cuadro de la cámara hacia el texto").
  • Luego le mostraron al robot esta secuencia de "Error + Nota + Corrección" una y otra vez hasta que aprendió a hacerlo automáticamente.

El Juego de Entrenamiento (Optimización de Política Relativa de Grupo)

Una vez que el robot aprendió lo básico, lo pusieron en un juego de entrenamiento para mejorar aún más.

  • El Juego: Le piden al robot que resuelva el mismo acertijo 10 veces.
  • La Puntuación: Algunas veces tiene éxito de inmediato. Otras veces falla, hace una pausa para "reflexionar" y luego lo corrige.
  • La Recompensa: El robot gana puntos por resolver el acertijo, pero pierde algunos puntos si pasa demasiado tiempo "pensando" (reflexionando) innecesariamente.
  • El Objetivo: El robot aprende a detenerse y reflexionar solo cuando realmente lo necesita, y a hacer que sus reflexiones sean cortas y útiles. Aprende a comparar sus propios intentos: "Oye, la versión donde reflexioné y lo corregí obtuvo más puntos que la versión donde simplemente seguí avanzando a ciegas".

El Resultado: Un Robot más Inteligente y Capaz de Autorepararse

Los investigadores probaron este nuevo robot (ReGRPO) en dos desafíos difíciles:

  1. GTA: Tareas que implican leer recibos, gráficos y pantallas de interfaz de usuario (UI).
  2. GAIA: Tareas que implican documentos complejos como PDFs y hojas de cálculo.

El Resultado:

  • El nuevo robot fue significamente mejor resolviendo estas tareas que los robots de código abierto anteriores.
  • No solo mejoró en el uso de herramientas; mejoró en su capacidad de recuperarse cuando las herramientas fallaban.
  • Crucialmente, aprendió a hacer esto sin necesidad de un humano o de una segunda computadora que revisara su trabajo durante la prueba final. Aprendió a confiar en su propia "reflexión" para corregir errores sobre la marcha.

Resumen

En resumen, este artículo enseña a los agentes de IA a ser como un mecánico que se autocorrige. En lugar de solo saber conducir un coche perfectamente, el mecánico aprende a escuchar un ruido extraño, diagnosticar el problema y arreglarlo inmediatamente, todo sin detener el coche para llamar a un supervisor. Esto hace que la IA sea mucho más confiable en el mundo real, donde las cosas no siempre salen según lo planeado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →