← Últimos artículos
🤖 AI

A Regret Minimization Framework on Preference Learning in Large Language Models

Este artículo presenta la Optimización de Preferencias basada en el Arrepentimiento (RePO), un nuevo marco que reformula el aprendizaje por refuerzo a partir de la retroalimentación humana mediante la minimización del arrepentimiento para capturar mejor la naturaleza prospectiva y contrafáctica de las preferencias humanas, lo que resulta en ganancias de rendimiento consistentes en los bancos de pruebas de razonamiento y preferencia.

Autores originales: Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Suhwan Kim, Taehyun Cho, Geon-Hyeong Kim, Yu Jin Kim, Youngsoo Jang, Moontae Lee, Jungwoo Lee

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a resolver un problema matemático o a escribir un correo electrónico útil. Quieres que el robot aprenda del feedback humano, pero los humanos no suelen decir: "Esta frase vale exactamente 7.5 puntos". En su lugar, decimos: "Prefiero esta respuesta sobre aquella otra".

Durante mucho tiempo, los científicos de la computación enseñaron a los robots a aprender intentando maximizar una puntuación. Trataban cada paso que daba el robot como si estuviera ganando puntos inmediatos, como si coleccionara monedas en un videojuego. Si el robot hacía un paso "bien", ganaba una moneda. Si lo hacía "mal", perdía una moneda. El objetivo del robot era simplemente recoger tantas monedas como fuera posible.

El problema con el enfoque del "coleccionista de monedas"
El artículo argumenta que esta mentalidad de "coleccionista de monedas" es en realidad una mala forma de entender cómo piensan los humanos. Los humanos no solo miramos el paso inmediato; miramos hacia adelante y miramos hacia atrás para ver qué podría haber pasado.

Los autores utilizan una gran analogía: El juego del "¿Qué pasaría si...?"

Imagina que estás observando a un jugador de ajedrez hacer un movimiento.

  • La forma antigua (Maximización de la recompensa): Miras ese único movimiento. ¿Capturó una pieza? Si es así, ¡bien! Si no, mal. Juzgas el movimiento de forma aislada.
  • La nueva forma (Minimización del arrepentimiento): Miras el movimiento y te preguntas: "Si hubiera hecho un diferente movimiento justo aquí, ¿habría ido mejor la partida?". O bien, "¿Si sigue jugando así, ganará en 10 movimientos?".

Los humanos somos pésimos juzgando un paso de forma aislada. Juzgamos basándonos en la anticipación prospectiva (lo que creemos que pasará después) y la comparación contrafáctica (qué más podría haber hecho).

La solución de los autores: "Optimización de Preferencias Basada en el Arrepentimiento" (RePO)
Los autores presentan un nuevo método llamado RePO. En lugar de intentar maximizar puntos, RePO enseña al robot a minimizar el arrepentimiento.

Piensa en el "Arrepentimiento" como esa sensación que tienes cuando dices: "Debería haber tomado el otro camino; habría evitado el tráfico".

  • En el método antiguo, al robot solo le importa si el camino que tomó fue fluido en este momento.
  • En el nuevo método (RePO), el robot se pregunta: "Comparado con el mejor camino posible que podría haber tomado, ¿cuánto metí la pata?".

Cómo funciona en lenguaje sencillo

  1. Mirar hacia adelante: Cuando un humano observa una respuesta parcial (como la primera mitad de una solución matemática), termina mentalmente el problema. Si piensa: "Oh, este camino lleva a una respuesta incorrecta eventualmente", le disgusta la primera mitad, incluso si la primera mitad parece estar bien. RePO imita esto simulando el futuro para ver si el paso actual conduce a un callejón sin salida.
  2. Comparar alternativas: Los humanos a menudo juzgan una acción comparándola con una versión "mejor" que no ocurrió. RePO calcula la "distancia" entre lo que hizo el robot y lo que habría hecho un robot "perfecto". Intenta reducir esa brecha.
  3. La puntuación de "Arrepentimiento": En lugar de una puntuación positiva por ser "bueno", RePO calcula una puntuación de "arrepentimiento". El objetivo es que este arrepentimiento sea lo más cercano a cero posible. Si el arrepentimiento es alto, significa que el robot tomó una decisión que llevó a un resultado peor de lo que podría haber sido.

Por qué esto es importante (según el artículo)
Los investigadores probaron esto en problemas matemáticos y tareas de conversación general. Descubrieron que los robots entrenados con RePO fueron mejores en:

  • Resolver matemáticas: Entendieron que un paso es "bueno" solo si conduce a la respuesta correcta final, no solo si el paso en sí mismo parece lógico.
  • Seguir el gusto humano: Se alinearon mejor con las preferencias humanas porque dejaron de intentar "engañar" al sistema para obtener puntos inmediatos y empezaron a pensar en todo el trayecto, tal como hacen los humanos.

El "truco de magia" (Eficiencia de muestreo)
Uno de los hallazgos más interesantes es que RePO es más "inteligente" en su forma de aprender.

  • Método antiguo (DPO): Si le muestras al robot un problema matemático donde la respuesta está oculta (enmascarada), el robot se confunde y tiene un desempeño deficiente. Necesita que se le muestre la respuesta completa y correcta muchas veces para aprender el patrón.
  • Nuevo método (RePO): Debido a que RePO está construido sobre la idea del "arrepentimiento" (pensar en lo que podría haber pasado), entiende naturalmente que una respuesta incompleta es sospechosa. No necesita tanto entrenamiento extra para comprender que los caminos incompletos son malos. "Internalizó" la lección de que "si no puedes ver la meta, probablemente tomaste un giro equivocado".

En resumen
El artículo dice: Deja de enseñar a los robots a ser coleccionistas de monedas codiciosos a los que solo les importa el siguiente paso. En su lugar, enséñales a ser viajeros reflexivos que se preguntan: "¿Tomé el mejor camino posible y cuánto me arrepiento de mis elecciones comparado con el camino no tomado?". Al hacer esto, los robots se vuelven mejores en razonamiento y se alinean mejor con la forma en que los humanos realmente pensamos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →