← Últimos artículos
💬 NLP

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

Este artículo identifica que los métodos de calibración de confianza existentes fallan para los modelos de lenguaje de gran tamaño cuando las preguntas tienen múltiples respuestas correctas debido a una subestimación sistemática, y propone un nuevo referente (MACE) y un método de Agregación de Confianza Semántica (SCA) para lograr una calibración robusta tanto en escenarios de respuesta única como de respuestas múltiples.

Autores originales: Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

Publicado 2026-06-03
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: Cuando "Tener la Razón" Parece "Estar Confundido"

Imagina que estás tomando un examen de trivia.

  • Escenario A: La pregunta es: "¿Quién escribió Hamlet?". Solo hay una respuesta correcta: Shakespeare. Si dices "Shakespeare", estás en lo cierto y te sientes muy seguro.
  • Escenario B: La pregunta es: "Nombra una fruta que sea roja". Hay muchas respuestas correctas: Manzana, Fresa, Cereza, Frambuesa.

El artículo argumenta que los modelos de lenguaje extensos (LLM) actuales se confunden con el Escenario B.

Cuando un modelo sabe que hay muchas respuestas correctas (como Manzana, Fresa y Cereza), tiende a "dividir su voto". Podría decir "Manzana" 6 veces, "Fresa" 6 veces y "Cereza" 6 veces de 20 intentos. Debido a que no eligió solo una respuesta cada vez, su medidor interno de "confianza" baja. Piensa: "Oh no, no estoy seguro de cuál elegir, así que debo estar inseguro".

La ironía: En realidad, el modelo tiene más probabilidades de acertar en el Escenario B (porque hay más formas de tener razón), pero su medidor de confianza marca un valor más bajo. Es como una persona que conoce tres rutas diferentes para llegar a la tienda, pero como no puede decidirse por una sola, se convence a sí misma de que está perdida.

La Nueva Herramienta: MACE (La Prueba de "Multi-Respuesta")

Para demostrar que este problema existe, los investigadores construyeron una nueva prueba llamada MACE. Piensa en MACE como un gimnasio especializado para probar qué tan bien manejan los modelos las preguntas con múltiples respuestas correctas.

  • La Configuración: Crearon 12,000 preguntas en seis temas (como Premios, Cargos Políticos y Ríos).
  • El Giro: Para cada tema, crearon preguntas con exactamente 1, 2, 4 o 6 respuestas correctas.
  • El Objetivo: Ver si las puntuaciones de confianza de los modelos se mantienen precisas cuando cambia el número de respuestas correctas.

Lo Que Encontraron: La Paradoja del "Gran Cerebro"

Probaron 15 formas diferentes de medir la confianza en cuatro familias diferentes de modelos de IA (desde pequeños hasta masivos). Esto fue lo que sucedió:

  1. La Precisión Sube, la Confianza Baja: A medida que aumentaba el número de respuestas correctas (de 1 a 6), los modelos acertaban más veces. Sin embargo, su confianza estimada cayó significamente.
  2. Los Modelos Más Grandes Sufren Más: Los modelos más grandes y brillantes (como los de 70 mil millones de parámetros) fueron los más confundidos. Debido a que saben tanto, pueden generar una variedad más amplia de respuestas correctas. Esta variedad los hace parecer "indecisos" ante los verificadores de confianza, causando que sus puntuaciones de confianza se desplomen.
  3. La "Crisis de Confianza": En una mezcla de preguntas del mundo real (algunas con 1 respuesta, otras con 6), los mejores métodos existentes fallaron. Marcarían una respuesta correcta como "poco fiable" solo porque el modelo ofreció algunas variaciones correctas distintas.

La Solución: SCA (El Método del "Voto en Equipo")

Los investigadores propusieron un nuevo método llamado Agregación de Confianza Semántica (SCA).

La Forma Antigua (El Enfoque del "Líder Único"):
La mayoría de los métodos observan la respuesta única más popular que dio el modelo. Si el modelo dio 20 respuestas y 10 fueron "Manzana" y 10 fueron "Fresa", el método antiguo dice: "Solo estuvieron de acuerdo el 50% de las veces. No tienen confianza".

La Nueva Forma (SCA - El "Voto en Equipo"):
SCA observa la probabilidad total de todas las respuestas correctas combinadas.

  • Agrupa las respuestas por significado (por ejemplo, todas las respuestas de "Manzana" son un grupo, todas las de "Fresa" son otro).
  • Suma las puntuaciones de confianza de todos los grupos correctos.
  • El Resultado: Incluso si el modelo dividió sus votos entre Manzana y Fresa, SCA ve que el voto total por "Frutas Rojas" es del 100%. Se da cuenta de: "Ah, el modelo tiene confianza, solo tiene algunas opciones válidas".

La Conclusión

  • El Problema: Las herramientas actuales de confianza de la IA piensan que tener múltiples respuestas correctas significa que la IA no está segura.
  • La Solución: El nuevo método SCA corrige esto al sumar la confianza de todas las respuestas válidas, no solo la más popular.
  • El Resultado: SCA funciona de maravilla en preguntas con muchas respuestas y no arruina las preguntas que tienen solo una. Ayuda a que la IA suene segura cuando realmente está segura, incluso cuando tiene razón de más de una manera.

En resumen, el artículo nos enseña que, para la IA, tener razón de muchas maneras no debería parecer falta de seguridad. Solo necesitamos una mejor forma de contar los votos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →