← Últimos artículos
🤖 machine learning

The Computational Basis of Confidence in Large Language Models

Este artículo aplica el marco normativo de la confianza en la decisión estadística (SDC) para demostrar que los logits de respuesta en los modelos de lenguaje multimodales funcionan como lecturas monotónicas de una variable de decisión latente en lugar de puntuaciones de preferencia heurísticas, proporcionando así un relato computacional de la confianza que unifica la inteligencia biológica y la artificial.

Autores originales: Dharshan Kumaran, Viorica Patraucean, Maks Ovsanikov, Petar Veličković, Nathaniel Daw

Publicado 2026-07-15
📖 1 min de lectura☕ Lectura para el café

Autores originales: Dharshan Kumaran, Viorica Patraucean, Maks Ovsanikov, Petar Veličković, Nathaniel Daw

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: La Base Computacional de la Confianza en los Modelos de Lenguaje de Gran Tamaño

Planteamiento del Problema

La confianza fiable —la probabilidad de que la respuesta propia de un modelo sea correcta— es un requisito previo para el despliegue confiable de los Modelos de Lenguaje de Gran Tamaño (LLM). Si bien la literatura existente ha evaluado extensamente las señales de confianza basándose en su precisión predictiva (qué tan bien se correlacionan con la corrección) y su calibración (qué tan bien las probabilidades reportadas coinciden con las frecuencias empíricas), una pregunta fundamental permanece sin respuesta: ¿Qué representa computacionalmente la señal de confianza en sí misma?

Las señales actuales, como las probabilidades de los tokens de respuesta o los informes verbales, suelen tratarse como predictores empíricos de la corrección. Sin embargo, no está claro si estas señales son meramente puntuaciones de preferencia heurísticas que combinan evidencia de una manera no bayesiana, o si funcionan como una lectura monotónica de una variable de decisión latente. En la neurociencia computacional, una variable de decisión latente es una representación interna ruidosa de la evidencia que, bajo un modelo de proceso normativo, es suficiente para computar la probabilidad posterior de corrección (confianza de decisión estadística, o SDC, por sus siglas en inglés). Distinguir entre una puntuación heurística y una lectura normativa es crítico para comprender la mecánica interna de la confianza del modelo.

Metodología

Los autores emplean el marco de la Confianza de Decisión Estadística (SDC), un modelo normativo de la neurociencia computacional, para probar si los logits de respuesta en los LLM multimodales se comportan como lecturas de una variable de decisión latente. El estudio se centra en la diferencia de logits de respuesta (LD = AB\ell_A - \ell_B) como la candidata a lectura.

Para probar esto, los autores evalúan cuatro firmas cualitativas predichas por el marco SDC a través de tres regímenes de decisión distintos:

  1. Función Psicométrica: La probabilidad de elección debe aumentar monotonicamente con la fuerza del estímulo con signo.
  2. Codificación de Evidencia con Signo: El LD con signo debe variar monotonicamente con la fuerza del estímulo con signo.
  3. Confianza Específica por Ensayo (Predicción de Fuerza Fija): A una fuerza de estímulo objetiva fija, la magnitud de LD ($|LD|$) debe predecir la corrección. Esto pone a prueba si las fluctuaciones de ensayo a ensayo en el LD reflejan ruido interno en lugar de solo cambios en la dificultad objetiva.
  4. Patrón de X Plegada (Folded-X): A medida que la fuerza del estímulo aumenta, $|LD|$ debería aumentar en los ensayos correctos, pero disminuir en los ensayos erróneos. Esta firma geométrica surge porque los errores de alta fuerza ocurren solo cuando el ruido empuja la variable de decisión latente justo a través del límite de decisión.

Configuración Experimental:

  • Modelos: Tres modelos multimodales de no-razonamiento (Qwen2.5-VL 7B, Gemma 3 12B, Gemma 4 12B) y un modelo de razonamiento multimodal (Gemini Flash 3).
  • Tareas:
    • Discriminación Perceptual: Tres tareas visuales sintéticas (contraste, tamaño de objeto, categorización de forma) donde la fuerza del estímulo se controla experimentalmente. Para inducir la variación de ensayo a ensayo en modelos deterministas, los autores generaron múltiples ejemplares de estímulos en cada nivel de fuerza mediante la aleatorización de características irrelevantes para la tarea ("ruido" o nuisance features) (por ejemplo, fluctuación espacial, realización de puntos).
    • Decisión Basada en Memoria: Una tarea de comparación de población de ciudades que requiere la recuperación de conocimiento mundial.
    • Razonamiento Visual Complejo: Tareas CLEVR (igualdad de conteo, existencia de objetos) con desenfoque gaussiano paramétrico.
  • Validación Conductual: Se realizó una tarea de abstención donde se instruyó a los modelos para que se abstuvieran de responder si su confianza interna (derivada del LD) sugería una probabilidad de corrección inferior al 60%.

Resultados Clave

1. Codificación de Evidencia y Firmas de Variables Latentes en Tareas Perceptuales

A través de las tres tareas perceptuales, los modelos cumplieron con las cuatro firmas de SDC:

  • Psicométrica y Codificación con Signo: La probabilidad de elección y el LD con signo variaron monotonicamente con la fuerza del estímulo, confirmando que los modelos codifican evidencia relevante para la tarea.
  • Predicción de Fuerza Fija: Incluso cuando la dificultad del estímulo objetivo se mantenía constante, un $|LD|$ mayor predijo significativamente una mayor precisión (por ejemplo, en la tarea de contraste, añadir $|LD|$ a un modelo de fuerza de estímulo mejoró el AUROC de 0.864 a 0.907). Esto demuestra que el LD porta evidencia de decisión específica de cada ensayo más allá de la dificultad objetiva.
  • Patrón de X Plegada: La interacción entre la corrección y la fuerza del estímulo produjo la característica geometría de X plegada. En los ensayos correctos, $|LD|$ aumentó con la fuerza del estímulo; en los ensayos erróneos, $|LD|$ disminuyó. Esto se observó en Qwen, Gemma 3 y Gemma 4, con una única excepción menor (Gemma 3 en la tarea de contraste mostró una rama de error plana en lugar de invertida, aunque la predicción dentro de la fuerza se mantuvo fuerte).

2. Generalización a Memoria y Razonamiento

  • Decisiones Basadas en Memoria: En la tarea de población de ciudades, la función psicométrica fue superficial debido al alto ruido en el conocimiento recuperado. Sin embargo, las firmas de la variable de decisión latente se mantuvieron: $|LD|$ predijo la corrección dentro de los contenedores (bins) de evidencia de población fija, y el patrón de X plegada estaba presente (e incluso era más nítido en Gemma 3). Esto indica que el LD actúa como una lectura de la evidencia de decisión latente incluso cuando el eje del estímulo objetivo es un proxy ruidoso para la evidencia interna del modelo.
  • Razonamiento Visual Complejo (CLEVR): En las tareas CLEVR con desenfoque gaussiano, las dos primeras firmas (que dependen de un eje de evidencia con signo) no eran directamente aplicables ya que el desenfoque elimina información en lugar de favorecer una respuesta específica. Sin embargo, la tercera firma se mantuvo: $|LD|$ predijo la corrección más allá de la fuerza del desenfoque y los controles de la escena. El patrón de X plegada no se observó; las ramas de error fueron planas o positivas en lugar de negativas. Los autores atribuyen esto a la falta de un modelo de proceso normativo conocido para el razonamiento complejo, lo que impide la derivación de la firma geométrica específica.

3. Consecuencias Conductuales

En la tarea de abstención, los modelos se abstuvieron selectivamente de las respuestas de baja confianza basadas en la señal de LD.

  • Los modelos se abstuvieron en el 87.7% de los ensayos, comprometiéndose solo con respuestas de alta confianza.
  • La precisión en los ensayos comprometidos aumentó de un nivel base de 92.2% a un 99.95%.
  • La política de abstención rastreó la señal de LD interno mejor que la fuerza del estímulo objetivo, y el comportamiento resultante se aproximó estrechamente a un umbral idealizado sobre $|LD|$.

Significancia y Reivindicaciones

El artículo proporciona un relato computacional de la confianza en los LLM multimodales, yendo más allá de la observación empírica de que las señales de confianza predicen la corrección.

  • Lectura de la Variable de Decisión Latente: La reivindicación principal es que, en entornos donde se puede especificar un modelo de proceso normativo (tareas perceptuales simples y basadas en memoria), los logits de respuesta se comportan no meramente como puntuaciones de preferencia heurísticas, sino como lecturas monotónicas de una variable de decisión latente. Esta variable es, en principio, suficiente para computar la probabilidad posterior de que la elección actual sea correcta.
  • Marco Unificador: El estudio establece la Confianza de Decisión Estadística (SDC) como un marco computacional unificador para estudiar la confianza tanto en la inteligencia biológica como en la artificial. Delimita las condiciones bajo las cuales los logits de respuesta funcionan como lecturas normativas frente a puntuaciones heurísticas.
  • Limitaciones y Fronteras: Los autores señalan modestamente que la ausencia del patrón de X plegada en las tareas de razonamiento complejo (CLEVR) no implica necesariamente un fallo de SDC. En cambio, resalta la frontera actual del marco: sin un modelo de proceso normativo explícito para el razonamiento complejo, las firmas geométricas específicas no pueden derivarse ni probarse. Los resultados sugieren que, si bien el LD porta información de ensayo a ensayo sobre la corrección en tareas complejas, su estatus como variable latente normativa permanece sin resolver hasta que se desarrollen los modelos de proceso apropiados.

En resumen, el trabajo demuestra que, para decisiones simples y basadas en la memoria, la señal de confianza en los LLM es estructuralmente isomorfa a las variables de decisión latentes encontradas en los sistemas biológicos, proporcionando una base rigurosa para interpretar la confianza del modelo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →