← Últimos artículos
💻 computer science

On Verbalized Confidence Scores for LLMs

Este artículo investiga la fiabilidad de los Modelos de Lenguaje Grandes al verbalizar su propia incertidumbre mediante puntuaciones de confianza, demostrando que, aunque la eficacia varía según la estrategia de indicación, métodos específicos pueden producir una cuantificación de la incertidumbre bien calibrada, agnóstica del modelo y con baja sobrecarga.

Autores originales: Daniel Yang, Yao-Hung Hubert Tsai, Makoto Yamada

Publicado 2026-05-06
📖 4 min de lectura☕ Lectura para el café

Autores originales: Daniel Yang, Yao-Hung Hubert Tsai, Makoto Yamada

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le pides consejo a un amigo muy inteligente y bien informado. A veces están absolutamente seguros de su respuesta, y otras veces simplemente están adivinando. El problema con los Modelos de Lenguaje Grandes (LLM) actuales es que a menudo suenan seguros incluso cuando están equivocados. Son como un amigo que nunca dice: "No estoy seguro", incluso cuando no tiene idea de lo que está hablando.

Este artículo, "Sobre puntuaciones de confianza verbalizadas para LLMs", investiga una idea sencilla: ¿Y si simplemente le preguntamos a la IA qué tan segura está?

En lugar de examinar el código interno de la IA o ejecutarla cien veces para ver si da la misma respuesta, los investigadores simplemente pidieron a la IA que añadiera una "puntuación de confianza" a su respuesta, como diciendo: "La respuesta es X, y tengo un 85% de certeza".

Aquí tienes un desglose de sus hallazgos utilizando analogías cotidianas:

1. El Objetivo: Un "Medidor de Confianza"

Los investigadores querían ver si este "medidor de confianza" (la puntuación de confianza) realmente funciona. Buscaban un sistema que:

  • Sea Honesto: Si la IA dice que tiene un 90% de certeza, debería tener razón el 90% de las veces.
  • Sea Flexible: Debería funcionar sin importar qué pregunta hagas o qué modelo de IA utilices.
  • Sea Rápido: No debería requerir tiempo o potencia de computación adicionales para obtener la puntuación.

2. El Experimento: Probando Diferentes "Formas de Preguntar"

El equipo se dio cuenta de que cómo le preguntas a la IA importa mucho. Es como pedirle a un niño que adivine.

  • Si preguntas: "¿Cuál es la capital de Francia? ¡Adivina!", podrían simplemente decir "París" y sentirse seguros.
  • Si preguntas: "¿Cuál es la capital de Francia? Adivina, y dime qué tan seguro estás en una escala del 0 al 100", podrían pensar más a fondo.

Los investigadores probaron 17 formas diferentes de formular la pregunta (prompts) en 11 modelos de IA diferentes y 10 tipos de preguntas distintas (como trivia científica, acertijos de lógica y sentido común).

3. El Gran Descubrimiento: Depende del "Tamaño del Cerebro" de la IA

El hallazgo más interesante es que la mejor manera de obtener una respuesta honesta depende de lo "inteligente" (o grande) que sea el modelo de IA.

  • Para Modelos de IA "Pequeños" (Los Novatos):
    Piensa en ellos como estudiantes que aún están aprendiendo. Si les das un prompt complejo y sofisticado con muchos ejemplos e instrucciones, se confunden y empiezan a inventar cosas.

    • Hallazgo del Artículo: Los prompts simples funcionan mejor. Simplemente preguntarles: "¿Qué tan seguro estás?" funciona mejor que darles una larga lista de reglas.
  • Para Modelos de IA "Grandes" (Los Expertos):
    Piensa en ellos como graduados de doctorado. Tienen mucho conocimiento pero pueden ser excesivamente seguros. Si simplemente les preguntas de forma sencilla, podrían seguir adivinando con un 100% de confianza incluso cuando están equivocados.

    • Hallazgo del Artículo: Necesitan un "empujón" más complejo. Los investigadores descubrieron que combinar varias técnicas: darles algunos ejemplos de cómo responder, pedirles que expliquen su razonamiento y decirles explícitamente que consideren la dificultad de la tarea, los hacía mucho más honestos.
    • Resultado: Con el prompt complejo adecuado, estos modelos grandes podían producir puntuaciones de confianza que eran precisas dentro de aproximadamente un 7% de su tasa de éxito real. Esto es una gran mejora sobre simplemente adivinar.

4. El Prompt "Combo"

Los investigadores crearon un "super-prompt" (llamado combo) para los modelos grandes. Era como darle a la IA una lista de verificación:

  1. Piensa en la pregunta.
  2. Considera qué tan difícil es.
  3. Revisa tu propio conocimiento.
  4. Da tu mejor suposición.
  5. Da una puntuación de probabilidad (0.0 a 1.0).

Cuando usaron este prompt "combo", los modelos grandes mejoraron mucho en admitir cuando no estaban seguros.

5. Qué Significa Esto (Según el Artículo)

El artículo concluye que pedirle a una IA que "exprese su confianza" es una herramienta muy prometedora. Es:

  • Simple: No necesitas ver dentro del cerebro de la IA.
  • Rápida: Solo requiere unas pocas palabras adicionales para generarla.
  • Efectiva: Si sabes cómo hacer la pregunta correcta, la IA puede decirte cuándo está adivinando y cuándo conoce la respuesta.

Sin embargo, hay un truco: No puedes preguntarle a cualquier IA de cualquier manera. Tienes que adaptar la pregunta. Si le haces una pregunta compleja a una IA pequeña, fallará. Si le haces una pregunta simple a una IA grande, podría mentir sobre su confianza. Pero con la "receta" correcta para el prompt, podemos lograr que estos modelos sean mucho más confiables.

En resumen: La IA puede decirte qué tan segura está, pero tienes que saber cómo preguntarle de la manera correcta para obtener una respuesta veraz.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →