← Últimos artículos
💬 NLP

Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

Este trabajo identifica que el colapso de la diversidad en los modelos de lenguaje grandes se debe principalmente a una mala calibración del orden y la forma en sus distribuciones de probabilidad durante la decodificación, y no a limitaciones en las heurísticas de muestreo, lo que conduce a una compensación entre la validez y la diversidad de la salida.

Autores originales: Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

Publicado 2026-05-13
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le pides a un Modelo de Lenguaje Grande (LLM) que cuente una historia, escriba un poema o sugiera una ciudad al azar. Esperas una amplia variedad de respuestas creativas. En cambio, el modelo a menudo se queda atascado en un carril, dándote las mismas pocas frases hechas una y otra vez (como "Érase una vez..." o "Valparaíso, Chile").

Este artículo investiga por qué ocurre esto. Los autores argumentan que el problema no es solo que el modelo sea "aburrido" o que nuestras herramientas actuales para elegir palabras (métodos de muestreo) sean deficientes. Por el contrario, el problema está incrustado en la forma en que el modelo organiza su propio mapa de probabilidades interno. Lo denominan un "Cuello de Botella de Calibración".

Para explicar esto, imagina que el modelo es un Bibliotecario de pie frente a un muro masivo de libros (todas las palabras siguientes posibles). El Bibliotecario debe elegir la siguiente palabra para continuar una historia.

Los Dos Problemas Principales

El artículo identifica dos formas específicas en las que este Bibliotecario está "mal calibrado" (desalineado con la realidad), lo que provoca el colapso de la diversidad.

1. Calibración de Orden: El Bibliotecario No Puede Ordenar los Libros

La Analogía:
Imagina que le pides al Bibliotecario que elija un libro "bueno". Esperas que el Bibliotecario coloque todos los libros "buenos" en la parte superior de la estantería y todos los libros "malos" en la parte inferior.

  • Lo que hace el modelo: El Bibliotecario coloca algunos libros buenos en la parte superior, pero luego mezcla un montón de libros malos justo en el medio. Luego, más abajo en la estantería, hay más libros buenos escondidos entre los malos.
  • La Consecuencia: Si le dices al Bibliotecario: "Solo dame los 10 libros superiores", podrías obtener 5 buenos y 5 malos. Si dices: "Dame los 100 superiores para estar seguro", obtienes 90 libros malos.
  • La Afirmación del Artículo: El modelo falla en la Calibración de Orden. No puede clasificar de manera confiable las palabras "válidas" (correctas/significativas) por encima de las palabras "inválidas" (sin sentido). Dado que las palabras válidas e inválidas están mezcladas en la clasificación, cualquier herramienta que intente filtrar la lista (como "Top-K" o "Top-P") se ve obligada a tomar una decisión terrible: o bien cortar buenas ideas para evitar las malas, o incluir demasiadas malas ideas para salvar las buenas.

2. Calibración de Forma: El Bibliotecario Está Obsesionado con Un Solo Libro

La Analogía:
Ahora imagina que el Bibliotecario logra separar los libros buenos de los malos. Pero al mirar la pila de "Buenos", el Bibliotecario está obsesionado con un solo libro específico.

  • Lo que hace el modelo: El Bibliotecario pone el 90% de su atención en un libro "bueno" específico (por ejemplo, "Érase una vez"). Los otros 99 libros "buenos" reciben solo una pequeña, diminuta porción de atención. Mientras tanto, los libros "malos" están dispersos en una cola larga y delgada en la parte inferior.
  • La Consecuencia: Incluso si intentas agitar las cosas (usando "Temperatura", que es como decirle al Bibliotecario que sea más aleatorio), el Bibliotecario simplemente desplaza su obsesión ligeramente. Podría dejar de obsesionarse con "Érase una vez" y empezar a obsesionarse con "En un mundo donde...", pero aún ignora las otras 98 opciones buenas. Peor aún, hacer que el Bibliotecario sea más aleatorio a menudo simplemente lo lleva a elegir un libro "malo" de la cola larga en lugar de uno "bueno" raro.
  • La Afirmación del Artículo: El modelo falla en la Calibración de Forma. La probabilidad está demasiado concentrada en unas pocas opciones válidas específicas, dejando al resto de las opciones válidas hambrientas de atención.

El Efecto Dominó: Por Qué Un Error Se Convierte en un Desastre

El artículo explica que estos problemas empeoran cuanto más larga es la historia.

La Analogía:
Imagina que estás caminando por un laberinto.

  • Paso 1: En el primer giro, tienes un 90% de probabilidad de elegir el camino correcto y un 10% de probabilidad de elegir un callejón sin salida. Eso parece bien.
  • Paso 2: En el siguiente giro, nuevamente tienes un 90% de probabilidad de estar en lo correcto.
  • El Resultado: Si tienes que hacer 20 giros, la probabilidad de acertar todo el camino sin tropezar con un solo callejón sin salida cae a casi cero.

El artículo demuestra matemáticamente que, dado que el modelo comete pequeños errores en cada paso individual (elegir la mezcla incorrecta de palabras o enfocarse demasiado en una palabra), estos errores se acumulan. Para cuando el modelo termina una oración o un párrafo, la probabilidad de que haya explorado un camino verdaderamente diverso y válido es exponencialmente diminuta.

¿Qué Hicieron?

Los investigadores no solo adivinaron; construyeron un "kit de diagnóstico":

  1. Pruebas Controladas: Les dieron a los modelos tareas simples donde conocían la lista exacta de respuestas correctas (como generar números aleatorios o nombrar estados de EE. UU.).
  2. La Prueba del "Oráculo": Crearon un filtro perfecto que sabía exactamente qué palabras eran válidas. Incluso con este filtro perfecto, los modelos aún luchaban por ser diversos debido al problema de "Forma" (la obsesión con una palabra).
  3. El Veredicto: Probaron 14 modelos diferentes (desde pequeños hasta enormes). Descubrieron que los modelos más grandes no solucionaron el problema. Incluso los modelos más inteligentes aún tenían estos problemas de ordenamiento y concentración.

La Conclusión

El artículo concluye que la falta de diversidad en la IA no es solo un error en las herramientas de "selección" (como la temperatura o el muestreo top-k). Es un defecto fundamental en la forma en que el modelo distribuye su confianza.

  • No puede ordenar las palabras válidas por encima de las inválidas de manera confiable.
  • No puede distribuir su atención uniformemente entre todas las palabras válidas.

Hasta que el modelo aprenda a organizar su propia biblioteca interna de manera diferente, simplemente ajustar la configuración no desbloqueará la verdadera creatividad o diversidad. El "cuello de botella" es la propia distribución del modelo, no las herramientas que usamos para leerlo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →