← Últimos artículos
💬 NLP

Negative Advantage Is a Double-Edged Sword: Calibrating Advantage in GRPO for Deep Search

El artículo presenta CalibAdv, un método de calibración de ventajas diseñado para mejorar la estabilidad y el rendimiento de los agentes de búsqueda profunda entrenados con GRPO, al corregir el desequilibrio entre ventajas positivas y negativas y penalizar menos los pasos intermedios correctos cuando la respuesta final es errónea.

Autores originales: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

Publicado 2026-04-21
📖 1 min de lectura☕ Lectura para el café

Autores originales: Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Ming Gao, Xiang Li

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

o`). El método antiguo las trataba igual que el contenido, lo que causaba que el detective se enredara.
CalibAdv dice: "Estas etiquetas son solo el formato, no son parte del razonamiento. No las vamos a castigar ni premiar, solo las dejamos quietas para que el detective se concentre en lo importante: pensar y buscar."

3. ¿Qué Lograron?

Con este nuevo método, el detective:

  1. Aprende más rápido y mejor: Resuelve más acertijos correctamente (mejor puntuación en pruebas).
  2. No se vuelve loco: Nunca pierde su capacidad de hablar y escribir coherentemente.
  3. Es más estable: El entrenamiento no se detiene a mitad de camino por errores catastróficos.

En Resumen

El paper dice que el castigo es una espada de doble filo. Si castigas demasiado y sin discernimiento, el modelo (el detective) se rompe. CalibAdv es la herramienta que nos enseña a castigar con precisión quirúrgica:

  • Si hiciste algo bien en el camino, no te castigamos por el error final.
  • Si te estamos castigando demasiado, equilibramos la balanza para que no pierdas la cordura.

Gracias a esto, podemos crear agentes de IA que investiguen a fondo sin volverse locos en el intento.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →