← Últimos artículos
💬 NLP

Human-Alignment and Calibration of Inference-Time Uncertainty in Large Language Models

Este artículo evalúa diversas medidas de incertidumbre en tiempo de inferencia en modelos de lenguaje de gran tamaño, encontrando que varias métricas demuestran una fuerte alineación con la incertidumbre humana y una calibración de moderada a fuerte en el modelo, incluso cuando no se correlacionan con las preferencias de respuesta humanas.

Autores originales: Kyle Moore, Jesse Roberts, Daryl Watson

Publicado 2026-06-01
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Kyle Moore, Jesse Roberts, Daryl Watson

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás haciendo una pregunta a un robot muy inteligente y culto. Quieres saber dos cosas:

  1. ¿Tiene razón el robot realmente? (Esto se llama calibración).
  2. ¿"Siente" la duda de la misma manera que lo haría un humano? (Esto se llama alineación).

Durante mucho tiempo, los investigadores han sido excelentes construyendo robots que saben cuándo están en lo cierto o en el error (calibración). Pero no han verificado realmente si el "sentimiento de duda" del robot coincide con cómo se siente un grupo de humanos. Este artículo es como una historia de detectives que intenta averiguar si el robot y los humanos están en la misma longitud de onda emocional respecto a la incertidumbre.

El trabajo de detective: Cómo lo probaron

Los investigadores trataron al robot como a un estudiante tomando un examen de opción múltiple. No solo le preguntaron por una respuesta; le pidieron que mostrara su "procedimiento" revelando qué tan seguro estaba de cada una de las posibles opciones de respuesta.

Utilizaron dos "aulas" principales (conjuntos de datos) para probarlo:

  • La Clase Pequeña: Un grupo diminuto de 3 পার 38 preguntas de una famosa organización de investigación (Pew Research).
  • La Clase Grande: Un grupo masivo de casi 3,000 preguntas de encuestas de opinión pública (Roper Center).

En estas clases, compararon las respuestas y los niveles de confianza del robot frente a lo que grupos de humanos reales dijeron.

La gran sorpresa: "Sentir" vs. "Pensar"

Aquí está el giro que descubrió el artículo, que es como descubrir que un estudiante y un profesor están tomando exámenes diferentes pero obteniendo la misma "vibra":

  • No están de acuerdo en la respuesta: Si le haces a un grupo de humanos y al robot la misma pregunta, a menudo eligen respuestas diferentes. El "orden de preferencia" del robot (qué respuesta le gusta más, la segunda mejor, etc.) suele ser totalmente diferente al de los humanos.
  • Pero SÍ están de acuerdo en el sentimiento: Aunque elijan respuestas distintas, el "medidor de incertidumbre" del robot a menudo sube y baja exactamente al mismo tiempo que la incertidumbre de los humanos.

La analogía: Imagina que tú y un amigo están adivinando el marcador de un partido de deportes. Ambos adivinan marcadores diferentes (tal vez tú dices 24-20, ellos dicen 21-19). Sin embargo, ambos se sienten igualmente nerviosos por sus cálculos. Ambos piensan: "No estoy seguro, podría ser cualquiera de los dos". El artículo encontró que los LLM son como ese amigo: pueden adivinar el marcador equivocado, pero su "nerviosismo" coincide perfectamente con el nerviosismo de los humanos.

Las herramientas que utilizaron (Los "medidores de incertidumbre")

Los investigadores probaron muchas formas diferentes de medir este "nerviosismo". Piensa en esto como diferentes tipos de termómetros para medir la ansiedad del robot:

  1. Probabilidad Top-1: "¿Qué tan seguro estoy de que mi primerísima suposición es correcta?" (Esto no funcionó bien como medidor de alineación humana).
  2. Entropía (El medidor de "Caos"): Esto mide qué tan dispersas están las suposiciones del robot. Si el robot está 90% seguro de una respuesta, está tranquilo (baja entropía). Si está dividido 25% entre cuatro respuestas, hay caos (alta entropía).
    • Los Ganadores: Encontraron que medir el "caos" específicamente entre las opciones de respuesta correctas (llamada Entropía de Elección) y observar las 10 suposiciones más probables (llamada Entropía Top-10) fueron los mejores para coincidir con los sentimientos humanos.
  3. Muestreo Top-P: Esto es como si el robot dijera: "Voy a tomar la parte superior de las respuestas que suman el 90% de mi confianza". El tamaño de ese fragmento nos dice qué tan inseguro está el robot.

¿Sabía el robot realmente cuándo estaba equivocado? (Calibración)

Solo porque el robot se sienta inseguro como un humano, no significa que tenga razón cuando se siente seguro. Los investigadores comprobaron esto usando una prueba estándar llamada MMLU (una enorme colección de preguntas difíciles de opción múltiple).

  • El Resultado: Los "medidores de incertidumbre" que coincidían con los sentimientos humanos (como la Entropía de Elección) también resultaron ser decentes para predecir cuándo el robot estaba realmente equivocado.
  • El Proble el detalle: El robot no era perfectamente calibrado. Era "moderadamente" bueno. Es como un pronóstico del tiempo que dice "50% de probabilidad de lluvia" y llueve la mitad de las veces: es útil, pero no es un cristal de la vidriera.

El momento "¡Ajá!"

El artículo hace una conexión inteligente que nadie había notado antes:

  • El muestreo Top-P (una forma común en que los robots generan texto) es matemáticamente muy similar a un concepto en estadística llamado "Conjunto de Credibilidad Bayesiano". Los autores se dieron cuenta de que este vínculo ayuda a explicar por qué observar el "tamaño" del grupo Top-P es una buena forma de medir la incertidumbre.

La conclusión final

Este artículo nos dice que los Modelos de Lenguaje Extensos (LLM) tienen un sentido de la incertidumbre "similar al humano", incluso si no siempre están de acuerdo con los humanos en la respuesta final.

  • Lo que mejor funciona: Medir qué tan "dispersa" está la confianza del robot entre las opciones de respuesta correctas (Entropía de Elección) o las 10 suposiciones principales.
  • Por qué es importante: Si podemos usar estos "medidores" específicos, podemos dar a los usuarios una señal que sea intuitiva. En lugar de un número confuso, el robot puede decir: "Me siento muy inseguro sobre esto", de una manera que coincida con cómo se sentiría un humano. Esto ayuda a construir la confianza, incluso si el robot no tiene la razón al 100%.

Lo que el artículo no hizo:

  • No probó esto en conversaciones abiertas (como escribir un poema), solo en preguntas de opción múltiple.
  • No lo probó en los modelos de supercomputadoras más grandes y costosos, solo en modelos con 8 mil millones de parámetros o menos.
  • No realizó un ensayo clínico o un estudio de usuario para ver si esto realmente hace que la gente sea más feliz; solo midió las matemáticas y la alineación.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →