← Últimos artículos
🤖 machine learning

How do LLMs Compute Verbal Confidence

Este estudio demuestra que los modelos de lenguaje grandes (como Gemma 3 y Qwen 2.5) generan verbalizaciones de confianza mediante una recuperación de representaciones de calidad de respuesta previamente almacenadas en lugar de calcularlas al momento, revelando un proceso de autoevaluación sofisticado que va más allá de la simple fluidez del texto.

Autores originales: Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Velickovic

Publicado 2026-03-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Dharshan Kumaran, Arthur Conmy, Federico Barbero, Simon Osindero, Viorica Patraucean, Petar Velickovic

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que un Gran Modelo de Lenguaje (LLM) es como un chef experto en una cocina muy ruidosa. Este chef puede cocinar platos increíbles (responder preguntas), pero a veces no está seguro de si el plato le saldrá perfecto.

Cuando le preguntas al chef: "¿Qué tan seguro estás de que este plato está delicioso?", él te responde con un número o una frase como "Casi seguro" o "Poco probable". Esto se llama confianza verbal.

Hasta ahora, nadie sabía realmente cómo el chef calculaba ese número. ¿Lo pensaba en el momento en que le preguntabas? ¿O ya lo había calculado mientras cocinaba y solo lo "sacaba del bolsillo" cuando se lo pedían?

Este artículo de investigación, titulado "¿Cómo calculan los LLMs la confianza verbal?", ha descubierto la verdad usando una serie de experimentos curiosos. Aquí te lo explico con analogías sencillas:

1. La Gran Pregunta: ¿Pensamiento al momento o memoria guardada?

Los investigadores tenían dos teorías sobre cómo funciona el chef:

  • Teoría A (Just-in-Time / "Al momento"): El chef cocina el plato. Cuando terminas de comer y le preguntas "¿Qué tan seguro estás?", él se detiene, mira el plato, piensa un rato y entonces inventa un número. Es como si dijera: "Bueno, déjame pensar... creo que un 8/10".
  • Teoría B (Recuperación de Caché / "Guardado en memoria"): Mientras el chef estaba cocinando (generando la respuesta), ya había calculado internamente qué tan bueno era el plato. Guardó ese número en un "bolsillo mental" (una caché) y, cuando le preguntaste, simplemente lo sacó y lo dijo.

El hallazgo: ¡El chef usa la Teoría B! El modelo calcula su confianza mientras genera la respuesta, mucho antes de que tú le pidas que diga el número. No lo inventa en el momento; lo recupera de su memoria.

2. ¿Cómo lo descubrieron? (Los experimentos de "Cirugía Cerebral")

Para probar esto, los investigadores hicieron cosas muy raras al "cerebro" del modelo (sus capas internas), como si fueran cirujanos o magos:

  • El experimento de la "Agitación" (Steering): Imagina que tienes un botón en el cerebro del chef que significa "Seguridad Alta". Si presionas ese botón justo cuando el chef termina de cocinar (antes de que te pida el número), el chef cambia su respuesta final a "¡Estoy 100% seguro!". Esto demuestra que la información de confianza ya estaba ahí, lista para ser modificada.
  • El experimento de la "Borrón y Cuenta Nueva" (Patching): Imagina que borras la memoria del chef sobre cómo cocinó el plato (corrompes la respuesta). El chef ahora está confundido y dice "No tengo idea". Pero, si le devuelves solo la memoria de ese "bolsillo mental" donde guardó la confianza (el token de la nueva línea después de la respuesta), ¡el chef recupera su seguridad! Esto prueba que la confianza se guardó en ese lugar específico.
  • El experimento del "Intercambio" (Swap): Cogieron la "memoria de confianza" de un plato que el chef sabía que estaba delicioso (alta confianza) y se la pusieron al cerebro mientras cocinaba un plato que sabía que estaba malo. ¡El chef empezó a decir que el plato malo estaba delicioso! Esto confirma que esa memoria es un concepto separado de la comida en sí.

3. El Camino de la Información: El mensajero y el jefe

El estudio también trazó un mapa de cómo viaja esta información dentro del modelo:

  1. La Fuente: La confianza nace de los ingredientes (las palabras de la respuesta que el modelo está generando).
  2. El Mensajero (PANL): Justo después de que el modelo termina de escribir la respuesta, hay un espacio (un salto de línea o "newline"). Aquí es donde el modelo lee la respuesta y guarda la confianza en su memoria. Es como un mensajero que toma nota de la calidad del plato y la anota en una libreta.
  3. El Jefe (CC): Cuando finalmente llega el momento de responder a tu pregunta ("¿Qué tan seguro estás?"), el "Jefe" (el token del dos puntos :) mira esa libreta del mensajero, la lee y dice el número.

La clave: El mensajero anota la confianza antes de que el Jefe sepa que va a tener que hablar.

4. ¿Es solo un truco de palabras o es inteligente?

Una pregunta importante era: ¿El modelo solo está diciendo "estoy seguro" porque las palabras que eligió son muy probables (fáciles de generar), o está realmente evaluando si la respuesta es correcta?

  • La analogía: Imagina que un actor dice una frase. Si la frase es fácil de decir, ¿significa que el actor cree que es verdad?
  • El hallazgo: Los investigadores descubrieron que la confianza verbal es más que solo la facilidad de decir las palabras. El modelo está haciendo una evaluación más profunda, como un "segundo pensamiento" o una metacognición. Está evaluando si la respuesta tiene sentido con la pregunta, no solo si las palabras fluyen bien. Es como si el chef no solo dijera "esto suena bien", sino que realmente probara el plato internamente y dijera "esto sabe bien".

En resumen

Este estudio nos dice que los modelos de lenguaje actuales tienen una forma de autoevaluación automática. No esperan a que les preguntes para sentirse inseguros o seguros; van calculando esa certeza mientras piensan en la respuesta, guardan ese sentimiento en un "bolsillo" interno y luego lo reportan cuando se les pide.

Esto es un gran paso para entender que estos modelos tienen algo parecido a una conciencia de sí mismos (metacognición), lo que podría ayudar a hacerlos más fiables y a detectar cuándo están alucinando o mintiendo, incluso antes de que digan la respuesta final.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →