← Últimos artículos
💬 NLP

Likelihood-Based Reward Designs for General LLM Reasoning

Este artículo demuestra sistemáticamente que el uso de la log-probabilidad de la respuesta de referencia como señal de recompensa es un método superior y versátil para el ajuste fino de modelos de lenguaje de gran tamaño en el razonamiento de cadena de pensamiento, superando a las recompensas binarias en entornos verificables y equiparándose al ajuste fino supervisado en escenarios no verificables, al tiempo que evita las trampas de las alternativas basadas en probabilidades.

Autores originales: Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

Publicado 2026-02-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un estudiante muy inteligente pero inexperto (un Modelo de Lenguaje Grande) cómo resolver problemas complejos. El estudiante es muy bueno hablando, pero necesita aprender a "pensar en voz alta" (Cadena de Pensamiento o Chain-of-Thought) antes de dar una respuesta.

El artículo aborda un problema específico: ¿Cómo calificas a este estudiante cuando no tienes una clave de respuestas?

La forma antigua: El examen de "Aprobado/Suspenso"

Tradicionalmente, para enseñar a estos modelos, los investigadores utilizan un método similar al de un profesor de matemáticas estricto.

  1. El estudiante piensa en voz alta.
  2. El estudiante da una respuesta.
  3. El profesor revisa la clave de respuestas.
    • ¿Es correcto? Recibes una estrella de oro (Recompensa = 1).
    • ¿Es incorrecto? Recibes una X roja (Recompensa = 0).

El Problema: Esto funciona de maravilla para las matemáticas o la programación donde hay una única respuesta correcta. Pero, ¿qué pasa si le pides al estudiante que escriba una historia larga, un poema o una demostración compleja donde no hay una única respuesta correcta? No puedes dar una calificación simple de "Aprobado/Suspenso". Además, si el estudiante se equivoca el 99% de las veces, nunca recibe una estrella de oro y deja de aprender porque la señal es muy escasa.

La nueva idea: La puntuación de "Verosimilitud"

Los autores proponen una forma diferente de calificar. En lugar de comprobar si la respuesta es correcta, comprueban qué tan seguro está el estudiante de su propia respuesta.

Piénsalo de esta manera:

  • La forma antigua: "¿Acertaste la respuesta? Sí/No".
  • La nueva forma: "¿Qué tan probable era que dijeras exactamente esas palabras?".

Si el estudiante dice exactamente las mismas palabras que la respuesta de referencia en los datos de entrenamiento, el profesor le da una puntuación basada en la log-probabilidad (una forma matemática de decir "¿qué tan sorprendido estabas de que esto sucediera?").

  • Si el estudiante estaba muy seguro y dijo las palabras correctas, recibe una puntuación alta.
  • Si el estudiante estaba adivinando, recibe una puntuación baja.

El gran descubrimiento: La "Log-probabilidad" es la clave mágica

Los investigadores probaron muchas formas de usar esta puntuación de "confianza". Descubrieron que un método específico —usar la log-probabilidad de la respuesta de referencia— era el único que funcionaba en todas partes.

Aquí está el desglose de sus hallazgos usando analogías sencillas:

1. La prueba de "Respuesta Corta" (Matemáticas y Programación)

  • La configuración: Problemas cortos con una respuesta clara y correcta (como un examen de matemáticas).
  • El resultado: El método de "Log-probabilidad" funcionó tan bien como el antiguo método de "Aprobado/Suspenso" para obtener la respuesta correcta.
  • La bonificación: También hizo que las respuestas del estudiante fueran mucho más "naturales" y menos erráticas. Mientras que el método antiguo hacía que el estudiante adivinara salvajemente para obtener una estrella de oro, el nuevo método hacía que el estudiante sonara más seguro y fluido, incluso cuando se equivocaba.

2. La prueba del "Ensayo Largo" (Historias y Demostraciones)

  • La configuración: Tareas largas y abiertas donde no hay una única respuesta correcta.
  • El problema con otros métodos: Algunos métodos intentaban usar la "probabilidad" simple (solo la posibilidad bruta de estar en lo cierto). Pero para ensayos largos, la probabilidad de adivinar las palabras exactas es minúscula (como ganar la lotería). La puntuación se volvía tan pequeña que era básicamente cero, y el estudiante dejaba de aprender.
  • El ganador: El método de "Log-probabilidad" manejó esto perfectamente. No colapsó. Funcionó tan bien como si el profesor simplemente le hubiera mostrado la respuesta al estudiante y le hubiera dicho: "Memoriza esto".

3. La sorpresa de "Pensar Corto"

Uno de los hallazgos más interesantes fue sobre cuánto tiempo pensó el estudiante.

  • Cuando se usaba la nueva recompensa de "Log-probabilidad", el estudiante inicialmente empezó a pensar menos. Acortó su "Cadena de Pensamiento" (el proceso de pensamiento) a solo unas pocas palabras.
  • ¿Por qué? El modelo se dio cuenta de que, para los primeros pasos, un proceso de pensamiento más corto y simple en realidad conducía a una mejor puntuación que uno largo y complicado.
  • En Matemáticas: El estudiante eventualmente aprendió a pensar durante más tiempo de nuevo a medida que mejoraba.
  • En Ensayos: El estudiante se mantuvo breve. Básicamente dejó de "pensar en voz alta" y simplemente dio la respuesta directamente, actuando como un memorizador estándar. El artículo sugiere que, para tareas largas y abiertas, el modelo podría estar haciendo el "pensamiento" dentro de su propio cerebro (capas ocultas) en lugar de escribirlo, por lo que obligarlo a escribir una cadena de pensamiento larga en realidad perjudica el rendimiento.

La Conclusión

El artículo concluye que usar la log-probabilidad como recompensa es un "traductor universal" para el entrenamiento de IA.

  • Une la brecha entre tareas verificables (matemáticas) y tareas no verificables (escritura).
  • No requiere un "verificador" especial o una clave de respuestas.
  • Permite que la IA aprenda de cualquier conjunto de datos donde exista una respuesta de referencia, ya sea un problema matemático corto o una demostración larga.

En resumen, en lugar de preguntar a la IA "¿Lo hiciste bien?", preguntar "¿Qué tan seguro estabas de que dijiste esto?" es una forma más simple y poderosa de enseñar a la IA a razonar, cubriendo desde acertijos matemáticos hasta ensayos largos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →