← Últimos artículos
💬 NLP

On the Optimal Reasoning Length for RL-Trained Language Models

Este artículo demuestra que, para los modelos de lenguaje entrenados mediante aprendizaje por refuerzo, la precisión del razonamiento exhibe una relación no monotónica con la longitud de la salida, alcanzando un máximo en un valor intermedio debido al aumento de la dispersión alrededor de una tendencia central cada vez más correcta, incluso cuando la precisión de la moda continúa mejorando con cadenas de pensamiento más largas.

Autores originales: Daisuke Nohara, Taishi Nakamura, Rio Yokota

Publicado 2026-06-11
📖 3 min de lectura☕ Lectura para el café

Autores originales: Daisuke Nohara, Taishi Nakamura, Rio Yokota

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un estudiante muy inteligente pero hablador cómo resolver problemas matemáticos difíciles o escribir código de computadora. Has descubierto que si dejas que este estudiante piense en voz alta (un proceso llamado "Cadena de Pensamiento"), mejora mucho al resolver problemas complejos. Sin embargo, hay un inconveniente: cuanto más inteligente se vuelve, más tiende a hablar. Empieza a escribir ensayos en lugar de respuestas, lo que cuesta mucho tiempo y dinero generar.

Para solucionar esto, los investigadores intentaron enseñar al estudiante a ser conciso aplicándole una "penalización" por hablar demasiado. Esperaban que, si simplemente hacían que el estudiante hablara un poco menos, seguiría siendo inteligente, solo que más rápido.

La Gran Sorpresa
El artículo de Nohara y sus colegas encontró que la relación entre "cuánto habla el estudiante" y "qué tan inteligente es" no es una línea recta. Es más bien como una colina.

  • Demasiado corto: Si obligas al estudiante a ser demasiado breve, no tiene tiempo suficiente para pensar y obtiene la respuesta incorrecta.
  • Justo lo necesario: A medida que dejas que hable un poco más, su precisión aumenta. Existe un "punto ideal" donde es más preciso.
  • Demasiado largo: Si dejas que hable demasiado, su precisión comienza a caer de nuevo, aunque siga pensando intensamente.

Esto ocurrió en diferentes tipos de estudiantes (diferentes modelos de IA) y en diferentes materias (matemáticas y programación).

El "Centro Inteligente" vs. La "Multitud Errante"
¿Por qué cae la precisión cuando hablan demasiado? Los autores usaron una analogía ingeniosa para explicarlo. Imagina las respuestas del estudiante como una multitud de personas paradas en un campo.

  1. El "Centro" (Precisión de la Moda): A medida que el estudiante habla más, el centro de la multitud se mueve cada vez más cerca de la respuesta correcta. De hecho, si le pidieras al estudiante que generara 100 respuestas y eligieras la que apareciera con más frecuencia, esa "respuesta más común" sería cada vez más correcta a medida que el estudiante habla más. La idea central es que mejora.
  2. La "Dispersión" (Fuga de la Moda): Sin embargo, a medida que el estudiante habla más, las personas individuales en la multitud comienzan a alejarse más de ese centro. Se distraen, divagan o toman desvíos extraños.

El Resultado:
En la zona de "demasiado largo", el centro de la multitud está parado justo sobre la diana (la respuesta correcta), pero las personas individuales están tan dispersas que, si eliges una al azar, es probable que falles el blanco.

  • Respuestas cortas: La multitud aún no ha encontrado el objetivo.
  • Respuestas medias: La multitud está agrupada estrechamente alrededor del objetivo.
  • Respuestas largas: El centro de la multitud está perfectamente sobre la diana, pero las personas están corriendo en círculos por todo el campo.

La Conclusión
El artículo concluye que simplemente hacer que los modelos de IA hablen menos no siempre es la solución, pero dejar que hablen infinitamente también es contraproducente. Existe una longitud óptima donde el modelo es lo suficientemente enfocado para encontrar la respuesta correcta sin distraerse tanto por sus propios divagaciones como para perder la precisión. Los investigadores sugieren que las herramientas futuras deberían encontrar automáticamente este "punto ideal" por nosotros, en lugar de que nosotros tengamos que adivinar la configuración adecuada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →