← Últimos artículos
💬 NLP

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

El artículo introduce la Optimización de Políticas Vectoriales (VPO), un algoritmo de aprendizaje por refuerzo que entrena modelos de lenguaje para generar soluciones diversas aprovechando recompensas vectoriales, mejorando así significativamente su rendimiento en procedimientos de búsqueda en tiempo de prueba en comparación con la optimización estándar de recompensas escalares.

Autores originales: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

Publicado 2026-05-22
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un chef entrenando a un nuevo aprendiz para cocinar para un crítico gastronómico muy exigente. El crítico no solo quiere "una buena comida"; tiene un menú complejo de deseos específicos: quizás quiere el filete poco hecho, la salsa picante, las verduras crujientes y la presentación artística.

La Vieja Forma: El Chef "Talla Única"

En el pasado, al entrenar IA (como los Modelos de Lenguaje Grandes), utilizábamos un método llamado Optimización de Recompensa Escalar (representado en el artículo por GRPO).

Piensa en esto como decirle al aprendiz: "Tu objetivo es obtener la puntuación más alta posible basada en un solo número: 50% calidad del filete + 50% calidad de la salsa".

El aprendiz se da cuenta rápidamente de que, para obtener la puntuación más alta, debe dejar de experimentar. Cocinará exactamente la misma combinación "perfecta" de filete-salsa una y otra vez. Se convierte en un maestro de una sola comida específica.

  • El Problema: Cuando el crítico finalmente aparece, podría decir: "En realidad, hoy quiero el filete al punto y la salsa dulce". El aprendiz, habiendo practicado solo una receta específica, no tiene idea de qué hacer. Solo tiene una respuesta, y es la incorrecta para el estado de ánimo específico de hoy.

La Nueva Forma: Optimización de Política Vectorial (VPO)

El artículo propone un nuevo método de entrenamiento llamado Optimización de Política Vectorial (VPO).

En lugar de darle al aprendiz una sola puntuación, el entrenador dice: "Voy a darte una lista de diferentes objetivos. A veces quiero que te enfoques en el filete, a veces en la salsa, a veces en las verduras. Quiero que cocines un plato con diferentes comidas de una sola vez, donde cada plato sea una obra maestra de una combinación diferente".

El aprendiz aprende a crear un conjunto diverso de soluciones:

  1. Plato A: Filete perfecto, salsa simple.
  2. Plato B: Filete suave, salsa picante compleja.
  3. Plato C: Verduras crujientes, presentación artística.

No están tratando de encontrar el único plato mejor. Están tratando de cubrir todo el "mapa" de combinaciones deliciosas posibles (lo que el artículo llama la Frontera de Pareto).

La "Búsqueda en Tiempo de Prueba" (El Crítico Llega)

Aquí es donde ocurre la magia. El artículo argumenta que en los sistemas de IA modernos, la IA no solo lanza una respuesta y espera lo mejor. En cambio, el sistema actúa como un motor de búsqueda en el momento de uso (inferencia).

Cuando el crítico llega con su solicitud específica y única (por ejemplo, "quiero el filete poco hecho pero la salsa dulce"), el sistema no le pide a la IA que cocine un nuevo plato desde cero. En su lugar, mira el plato con comidas diversas que el aprendiz preparó durante el entrenamiento.

  • El Chef Viejo (GRPO): El crítico mira el plato. Está lleno de 100 platos idénticos "Filete-Salsa #1". El crítico no puede encontrar lo que quiere.
  • El Chef VPO: El crítico mira el plato. ¡Hay un plato con filete poco hecho y salsa dulce! El sistema elige ese.

Por Qué Esto Importa

El artículo probó esto en cuatro "cocinas" diferentes (tareas como resolver acertijos lógicos, navegar laberintos y escribir código).

  1. Más Candidatos = Mejores Resultados: A medida que se permitió al sistema mirar más platos (un "presupuesto de búsqueda" más grande), el chef VPO seguía mejorando cada vez más en encontrar la coincidencia perfecta. El rendimiento del chef viejo alcanzó un muro porque solo tenía un tipo de plato para ofrecer.
  2. Resolviendo lo Imposible: En un desafío de codificación muy difícil (LiveCodeBench), el chef viejo no pudo resolver el problema en absoluto, sin importar cuántas veces lo intentara. El chef VPO, sin embargo, tenía un conjunto diverso de "intentos" que, cuando se combinaban con una herramienta de búsqueda, lograron descifrar el problema.
  3. La "Trampa de la Diversidad": El artículo señala que si los objetivos son todos básicamente iguales (por ejemplo, "hazlo rojo" y "hazlo azul" donde el rojo y el azul son lo mismo), VPO no ayuda. Solo brilla cuando los objetivos son verdaderamente diferentes y requieren compensaciones.

La Conclusión

El artículo afirma que si planeas usar una IA dentro de un sistema que busca entre muchas opciones para encontrar la mejor, no debes entrenar a la IA para ser un "especialista" en una respuesta perfecta. En su lugar, debes entrenarla para ser un generalista que produce un portafolio diverso de opciones de alta calidad.

Al permitir que la IA explore diferentes "sabores" de soluciones durante el entrenamiento, le das al sistema de búsqueda en tiempo de prueba un menú mucho más rico para elegir, lo que conduce a resultados más inteligentes y adaptables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →