← Últimos artículos
🤖 machine learning

On the Effect of Sampling Diversity in Scaling LLM Inference

Este artículo proporciona un análisis teórico y empírico sistemático que demuestra que la introducción de una diversidad de prompts significativa durante la inferencia de los LLM mejora significativamente el rendimiento de escalado de Best-of-NN al reducir las tasas de error, estableciendo al mismo tiempo un principio de compromiso entre diversidad y fidelidad para guiar estrategias de muestreo efectivas.

Autores originales: Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

Publicado 2026-08-11
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Tianchun Wang, Zichuan Liu, Yuanzhou Chen, Jonathan Light, Weiyang Liu, Haifeng Chen, Xiang Zhang, Wei Cheng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas realmente difícil, como un problema matemático complejo o escribiendo una pieza de código. Tienes un amigo robot superinteligente (un Modelo de Lenguaje Grande) que puede ayudarte. Pero aquí está el truco: si le haces al robot la misma pregunta exactamente de la misma manera diez veces, podría darte diez respuestas que se ven casi idénticas. Podrían estar todas mal de la misma manera, o podrían quedarse todas atrapadas en el mismo pequeño rincón del espacio de soluciones. Esto es como pedirle direcciones a un amigo diez veces y recibir el mismo giro equivocado cada vez porque está pensando en un bucle.

Para solucionar esto, los científicos han descubierto un truco llamado "escalado de inferencia". En lugar de solo preguntarle al robot una vez, le preguntas muchas veces y eliges la mejor respuesta. Pero para que esto funcione, necesitas que el robot explore diferentes caminos, no solo el mismo una y otra vez. Este artículo profundiza en una pregunta específica: ¿Cómo hacemos que las respuestas del robot sean más diferentes entre sí sin que empeoren? Los investigadores descubrieron que si empujas el pensamiento del robot con pistas ligeramente diferentes, pero aún relevantes, este explora un mundo mucho más amplio de posibilidades y encuentra la respuesta correcta con mucha más frecuencia. Sin embargo, también descubrieron una trampa: si intentas elegir la respuesta "más popular" entre todos los intentos, todo ese arduo trabajo de explorar nuevos caminos podría de hecho desvanecerse, y no obtendrás mejores resultados.


La búsqueda de la gran idea: Por qué mezclar las cosas ayuda a los robots a pensar mejor

Así que, tienes un robot de IA superinteligente. Es excelente escribiendo historias, resolviendo matemáticas y programando. Pero a veces, cuando le haces una pregunta difícil, se queda estancado en una rutina. Es como un perro persiguiendo su propia cola; sigue corriendo en el mismo círculo, generando el mismo tipo de respuesta una y otra vez. En el mundo de la IA, esto se llama falta de "diversidad".

Los investigadores detrás de este artículo querían saber: ¿Qué pasa si obligamos al robot a romper ese círculo? ¿Qué pasa si le hacemos la misma pregunta, pero retocamos la forma en que la planteamos solo un poco? Tal vez le decimos: "Imagina que eres un profesor de matemáticas estricto", o "Piensa como un escritor creativo", o incluso simplemente le damos una forma ligeramente diferente de plantear el problema. Esto se llama "muestreo de diversidad".

La gran idea es simple: Si le pides al robot que intente 100 formas diferentes de resolver un problema, y esas 100 formas son muy diferentes entre sí, tienes muchas más probabilidades de que al menos una de ellas sea la respuesta correcta. Esta es la estrategia "Best-of-N" (el mejor de N): intenta muchas cosas, elige la mejor. Pero la pregunta del millón es: ¿Cómo haces que esas 100 cosas sean diferentes sin que se vuelvan tontas o erróneas?

El punto ideal: Ni demasiado aburrido, ni demasiado raro

Los autores se lanzaron a la caza del "empujón" perfecto. Probaron diferentes formas de sacudir el pensamiento del robot.

Primero, probaron con ideas irrelevantes. Imagina pedirle a un robot que resuelva un problema matemático, pero le dices que primero piense en hornear un pastel. Eso es solo ruido. No ayuda. El robot se confunde y sus respuestas empeoran.

Luego, probaron con repeticiones exactas. Imagina hacerle la misma pregunta al robot diez veces con las mismas palabras exactas. Solo te da la misma respuesta diez veces. Sin ideas nuevas, sin mejores resultados.

Pero entonces, encontraron el Punto Ideal. Probaron dar al robot ideas "alineadas con la tarea". Para un problema de matemáticas, podrían decirle: "Piensa en dividir el problema en pasos más pequeños", o "Considera usar un teorema específico". Estas pistas eran lo suficientemente diferentes como para que el robot explorara nuevos caminos, pero seguían siendo sobre el problema matemático en sí.

Los resultados fueron asombrosos. Cuando usaron estas pistas "justo adecuadas", la tasa de éxito del robot aumentó significamente. Por ejemplo, en una prueba de programación llamada HumanEval, usar una estrategia llamada "Dual" (donde un segundo robot ayuda a generar ideas) mejoró la tasa de éxito en un 4.7% en comparación con simplemente preguntarle al robot normalmente. En una prueba de matemáticas llamada MATH, la mejora fue del 8.2%. En una prueba de razonamiento llamada MMLU-Pro, saltó un 10.8%.

El artículo sugiere que existe un "intercambio de diversidad-fidelidad". Quieres que las pistas sean lo suficientemente diferentes como para crear nuevos caminos (diversidad), pero no tanto como para arruinar la calidad de la respuesta (fidelidad). Es como añadir especias a una sopa: un poco la hace deliciosa, pero demasiada la hace incomible, y no poner nada de especias la hace aburrida.

La trampa: Por qué el "voto" puede matar tu éxito

Aquí es donde la historia da un giro. Los investigadores también analizaron cómo elegimos la respuesta final. Usualmente, cuando tienes 100 respuestas diferentes, podrías pensar: "¡Veamos en qué están de acuerdo la mayoría de las personas!". Esto se llama votación por mayoría. Si 51 de 100 robots dicen "La respuesta es 42", entonces 42 debe ser la correcta, ¿verdad?

El artículo dice: No tan rápido.

Demostraron matemáticamente que si utilizas la votación por mayoría, todo ese arduo trabajo que hiciste para hacer que las respuestas fueran diferentes podría ser en vano. ¿Por qué? Porque la votación por mayoría solo funciona si la respuesta más común es la correcta. Pero si haces que las respuestas sean diversas, podrías dispersar los votos. La respuesta correcta podría ser única y brillante, pero si solo aparece 5 veces de 100, y una respuesta incorrecta aparece 20 veces, la votación por mayoría elegirá la incorrecta.

En sus experimentos en el conjunto de datos MATH, descubrieron que cuando usaban la votación por mayoría, los trucos de diversidad sofisticados no ayudaban y, a veces, incluso empeoraban las cosas. El artículo descarta explícitamente la votación por mayoría como una buena estrategia cuando intentas usar la diversidad para encontrar una única respuesta correcta. Es como un jurado donde todos intentan ser únicos; si todos votan por cosas diferentes, nunca se llega a un veredicto.

¿Cuándo funciona esta magia?

Los investigadores no se detuvieron solo en encontrar el truco; lo probaron en todas partes para ver si se mantenía.

  • Temperatura: Probaron al robot cuando estaba "caliente" (muy aleatorio) y "frío" (muy estricto). Los trucos de diversidad funcionaron en ambos casos, dando impulsos extra sobre lo que la temperatura estaba haciendo.
  • Pasos de pensamiento: Lo probaron con "Cadena de Pensamiento" (Chain-of-Thought), donde el robot explica sus pasos. Los trucos siguieron funcionando, dando un impulso del 7.4% en una prueba de programación difícil.
  • ¿Quién es el "pensador"?: Utilizaron diferentes robots para generar las ideas. Descubrieron que un robot "pensador" más inteligente hacía que todo el sistema fuera mejor.
  • ¿Cuántas ideas?: Cuantas más ideas únicas inyectabas, mejor eran los resultados. Usar 100 ideas diferentes era mejor que usar solo 1.

Sin embargo, también notaron que este truco funciona mejor para robots más débiles. Si el robot ya es superinteligente (como los modelos más grandes y potentes), el impulso extra es menor. Es como darle un mapa a un genio; probablemente ya sabía el camino. Pero para un robot inteligente pero no genio, el mapa ayuda mucho.

La conclusión

Este artículo es una guía para cualquiera que intente sacar el máximo provecho de los robots de IA. Nos dice que:

  1. La diversidad es buena: Hacer que el robot intente diferentes enfoques ayuda a encontrar la respuesta correcta.
  2. Ten cuidado con el empujón: Las pistas que des deben ser relevantes. Demasiado raras, y fallas. Demasiado aburridas, y no ayudan.
  3. No solo votes: Si quieres encontrar una única respuesta correcta, no elijas simplemente la más popular. Elige la mejor respuesta única de todos los intentos diversos.
  4. Es una herramienta, no una varita mágica: Funciona mejor cuando tienes un presupuesto para potencia de cómputo y cuando lo usas en modelos que no son perfectos.

Los autores no solo adivinaron; realizaron cientos de experimentos y construyeron una teoría matemática para respaldarlo. Demostraron que, al mezclar cuidadosamente la forma en que hacemos las preguntas, podemos hacer que la IA sea más inteligente, más rápida y más confiable, sin necesidad de construir un robot más grande y costoso. Es un recordatorio de que, a veces, la mejor manera de encontrar la respuesta correcta es hacer la pregunta de cien maneras diferentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →