← Últimos artículos
💬 NLP

Where does output diversity collapse in post-training?

El estudio demuestra que el colapso de la diversidad en los modelos de lenguaje post-entrenados se determina principalmente durante el entrenamiento por la composición de los datos, y no por el formato de generación o métodos de inferencia, lo que implica que este problema no puede resolverse únicamente en tiempo de inferencia.

Autores originales: Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

Publicado 2026-04-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un chef de cocina (el modelo de lenguaje) que es increíblemente creativo y sabe cocinar de todo. Al principio, si le pides un plato, puede darte mil versiones diferentes: una con salsa picante, otra con hierbas, otra con un toque de chocolate, etc. Es un chef muy versátil.

Pero, para que este chef sea más "útil" y "seguro" para los clientes, los dueños del restaurante deciden darle un entrenamiento especial (lo que los expertos llaman "post-entrenamiento"). Le enseñan recetas específicas, le dicen qué sabores gustan más a la gente y le corrigen cuando se equivoca.

El problema que descubren los autores de este estudio es que, después de este entrenamiento, el chef pierde su magia. Ahora, si le pides el mismo plato diez veces, te dará diez versiones casi idénticas. Ya no es creativo; es un robot que repite lo mismo. A esto los científicos lo llaman "colapso de la diversidad".

Aquí te explico cómo llegaron a esta conclusión y qué descubrieron, usando analogías sencillas:

1. ¿Dónde se rompió el chef? (El origen del problema)

Los investigadores probaron tres tipos de entrenamiento diferentes para ver cuál era el culpable:

  • El entrenamiento "Pensador" (Think): Aquí le enseñaron al chef a pensar paso a paso (como un razonamiento lógico) usando solo dos maestros muy estrictos.
  • El entrenamiento "Instruido" (Instruct): Aquí le enseñaron usando muchos maestros diferentes y de muchas fuentes distintas.
  • El entrenamiento "Cero" (RL-Zero): Aquí no le dieron maestros, solo le dijeron: "Haz lo que sea que te dé puntos".

El hallazgo clave:

  • En el grupo "Pensador", el chef perdió su creatividad casi de inmediato, justo cuando le enseñaron las recetas de los dos maestros estrictos. Fue como si le pusieran un corsé muy apretado al principio.
  • En el grupo "Instruido", el chef mantuvo un poco más de variedad al principio, pero la perdió más tarde, cuando le corrigieron las preferencias (DPO).
  • La lección: No importa cómo lo entrenes (la receta), sino qué ingredientes (datos) usas. Si los ingredientes son muy limitados (solo dos maestros), el chef se vuelve aburrido muy rápido.

2. ¿Es culpa de la forma de hablar? (El mito del "Pensamiento en voz alta")

Mucha gente pensaba que el chef se volvía aburrido porque le obligaban a "pensar en voz alta" (escribir todo su proceso de razonamiento antes de dar la respuesta). Pensaban que si le quitábamos esa parte, volvería a ser creativo.

La prueba:
Los investigadores le dijeron al chef: "Oye, no escribas tu proceso de pensamiento, solo dame la respuesta final".
El resultado: ¡No funcionó! El chef seguía siendo igual de aburrido.
La analogía: Imagina que tienes un actor que siempre actúa igual de mal. Si le quitas el guion y le dices "actúa sin leer", sigue actuando mal. El problema no es el guion (el formato de pensamiento), es que el actor ya ha aprendido a actuar así en su mente (en sus "pesos" o memoria). La falta de variedad está grabada en su cerebro, no en lo que escribe.

3. ¿Es malo perder variedad? (Depende del plato)

Aquí es donde se pone interesante. No toda la pérdida de variedad es mala.

  • En matemáticas o código: A veces, el chef daba 16 respuestas diferentes, pero 15 eran incorrectas y solo una era buena. Al entrenarlo, el chef aprendió a eliminar las 15 respuestas malas y quedarse con la buena. Aquí, el "colapso" es bueno: es como un filtro de calidad. El chef ahora es más preciso, aunque menos variado.
  • En creatividad o opiniones: Si le pides al chef que escriba una historia o que opine sobre un tema controvertido, el colapso es malo. Ahora, en lugar de darte 10 puntos de vista diferentes, te da 10 veces la misma opinión. Es como si el restaurante solo sirviera un solo tipo de pizza, aunque te pidan sabores distintos.

4. ¿Qué podemos hacer?

El estudio nos dice dos cosas importantes para el futuro:

  1. No intentes arreglarlo al final: No sirve de nada intentar que el chef sea más creativo en el momento de servir el plato (en la "inferencia"). El daño ya está hecho en la cocina (durante el entrenamiento).
  2. Mejora los ingredientes: Si quieres un chef creativo, no le des recetas de solo dos maestros. Dale recetas de muchos chefs diferentes, con estilos variados. Si mezclas bien los ingredientes desde el principio, el chef mantendrá su variedad.

En resumen

Este papel nos dice que cuando las IAs se vuelven "demasiado correctas" y aburridas, no es un error del sistema, es una consecuencia de cómo las alimentamos. Si les damos una dieta muy estrecha, se vuelven aburridas. Si queremos que sigan siendo creativas y útiles, necesitamos darles una dieta más variada desde el principio, no intentar arreglarlas después.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →