← Últimos artículos
🤖 machine learning

From token probabilities to calibrated confidence: An empirical study of mathematical question answering

Este estudio empírico investiga métodos para calibrar la confianza en los modelos de lenguaje de gran tamaño para la resolución de preguntas matemáticas, encontrando que si bien las probabilidades de los tokens de una sola pasada ofrecen una señal limitada, agregarlas y emplear estrategias de múltiples pasadas como la autoverificación o el Monte Carlo Dropout, seguidas de técnicas de calibración post-hoc, puede mejorar significativamente la alineación entre la confianza estimada y la precisión real.

Autores originales: Avery Ma, Lorne Schell, Vin Bhaskara, Leila Pishdad

Publicado 2026-08-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Avery Ma, Lorne Schell, Vin Bhaskara, Leila Pishdad

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás jugando una partida de trivia de alto nivel con un amigo robot superinteligente. Le haces una pregunta difícil y el robot zumba con una respuesta. Pero aquí está el truco: el robot es tan entusiasta por complacer que a menudo suena 100% seguro de sí mismo incluso cuando está completamente equivocado. En el mundo de la Inteligencia Artificial, esto se llama "sobreconfianza". Los científicos están intentando enseñar a estos robots a decir: "Estoy bastante seguro", o "No estoy tan seguro", para que sepamos cuándo confiar en ellos. Este es el desafío de la estimación de la confianza: averiguar qué tan probable es que la respuesta de un robot sea correcta. Para hacer esto, los investigadores observan los "susurros" internos del robot: números diminutos llamados probabilidades de tokens que muestran qué tan probable es que el robot elija la siguiente palabra en una oración. La gran pregunta es: ¿Podemos convertir estos susurros ruidosos en un "medidor de verdad" confiable que nos diga exactamente cuánto podemos confiar en el robot?

Un equipo de investigadores decidió poner esta idea a prueba, específicamente con problemas matemáticos. Trataron al IA como a un estudiante tomando un examen y se preguntaron: "Si escuchamos de cerca el proceso de pensamiento de un estudiante, ¿podemos saber si obtuvo la respuesta correcta incluso antes de que termine de escribirla?". Compararon dos formas principales de escuchar. La primera fue una escucha de "paso único", donde simplemente analizaron el problema matemático y la respuesta final que dio el robot de una sola vez. La segunda fue una escucha de "pasos múltiples", donde le pidieron al robot que revisara su trabajo o ejecutara el mismo problema a través de su cerebro varias veces con ligeras variaciones para ver si obtenía el mismo resultado.

Esto fue lo que descubrieron. Primero, encontraron que si solo escuchas las últimas palabras de la respuesta (el número final), el robot suena increíblemente confiado, incluso cuando está equivocado. Es como un estudiante que escribe "42" al final de un examen pero llegó ahí adivinando. Sin embargo, si escuchas toda la cadena de razonamiento —el proceso matemático paso a paso que hizo el robot para llegar allí— puedes detectar diferencias diminutas y consistentes entre las respuestas correctas e incorrectas. Al promediar estas señales diminutas a lo largo de todo el proceso de pensamiento, encontraron una forma de obtener un "medidor de verdad" mucho mejor sin necesidad de pedirle al robot que haga trabajo adicional.

Los investigadores también probaron algunos trucos sofisticados para obtener mejores señales. Un truco fue preguntar al robot: "¿Estás seguro de que esto es correcto?" (un método llamado autoverificación). Descubrieron que pedirle al robot que releyera su propia respuesta desde el principio era preciso pero muy lento y costoso, como hacer que un estudiante reescriba todo su ensayo solo para revisar una línea. Pero descubrieron un atajo inteligente: en lugar de reescribir todo, simplemente podían añadir la pregunta "¿Es esto correcto?" al final de la respuesta original. Este método "in-situ" era igual de preciso pero ahorraba un 88% del esfuerzo computacional, lo que supuso una gran victoria en eficiencia.

Otro truco involucró "pasos estocásticos", donde le pidieron al robot que resolviera el mismo problema varias veces con un poco de aleatoriedad (como lanzar un dado) para ver si cambiaba de opinión. Este método, llamado MC Dropout, era bueno para captar la incertidza, pero requería que el robot hiciera el trabajo muchas veces, lo cual es computacionalmente pesado. Los investigadores descubrieron que, si bien este método funcionaba, a menudo no valía la pena el costo adicional en comparación con el método más simple de "escuchar toda la historia".

Finalmente, probaron un paso de "calibración", que es como enseñarle al robot a ajustar su dial de confianza. Utilizaron dos herramientas matemáticas clásicas (escalado de Platt y regresión isotónica) para ajustar los puntajes de confianza del robot para que coincidieran mejor con la realidad. Encontraron que estas herramientas funcionaban de maravilla, especialmente con un pequeño conjunto de problemas de práctica (tan pocos como 50 ejemplos) para aprender de ellos. Sin embargo, también notaron que una calibración aprendida en problemas matemáticos fáciles no siempre funcionaba bien en los difíciles, y que una calibración aprendida en un tipo de robot no siempre se transfería a un tipo diferente.

En resumen, el artículo sugiere que no necesitamos hacer que el robot trabaje el doble de duro para saber si tiene razón. Simplemente prestando más atención a todo el camino de su razonamiento en lugar de solo a la respuesta final, y utilizando una forma inteligente y de bajo costo de pedirle que se revise a sí mismo, podemos construir medidores de confianza mucho más confiables. Estos hallazgos sugieren que, con el ajuste adecuado, podemos hacer que los sistemas de IA sean mucho más honestos sobre lo que saben y lo que no saben.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →