← Últimos artículos
💬 NLP

How Uncertainty Estimation Scales with Sampling in Reasoning Models

Este estudio demuestra que, aunque tanto la autoconsistencia como la confianza verbalizada mejoran la estimación de incertidumbre en modelos de razonamiento a medida que aumenta el muestreo, la combinación de ambas señales logra la mayor mejora en la precisión con solo dos muestras, especialmente en dominios matemáticos.

Autores originales: Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel

Publicado 2026-03-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Maksym Del, Markus Kängsepp, Marharyta Domnich, Ardi Tampuu, Lisa Yankovskaya, Meelis Kull, Mark Fishel

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que tienes un genio matemático (un modelo de lenguaje de razonamiento) al que le pides resolver problemas muy difíciles. A veces, el genio sabe la respuesta al 100%, pero otras veces está dudoso o incluso equivocado.

El problema es: ¿Cómo sabes si el genio está seguro de lo que dice o si está "adivinando"?

Este estudio de investigadores de la Universidad de Tartu (Estonia) investiga cómo podemos medir esa "seguridad" o incertidumbre cuando el genio piensa mucho antes de responder (lo que llaman "cadena de pensamiento").

Aquí tienes la explicación sencilla, con analogías de la vida real:

1. El Problema: Preguntar una sola vez no basta

Imagina que le preguntas al genio: "¿Cuál es la capital de Francia?" y te responde: "París, estoy 100% seguro".
Pero si le preguntas un problema de matemáticas muy complejo, podría decir: "Creo que es 42, estoy un 80% seguro".

El estudio descubre que pedirle al genio que piense una sola vez (una sola "muestra") es útil, pero no es lo mejor. Es como si le preguntaras a un solo testigo en un juicio. Puede que diga la verdad, pero también puede estar equivocado.

2. La Solución: El "Comité de Expertos" (Muestreo Paralelo)

En lugar de preguntar una sola vez, los investigadores probaron pedirle al genio que resuelva el mismo problema varias veces (digamos, 2, 5 o 8 veces) y veamos qué pasa.

Aquí surgieron dos formas de medir la confianza:

  • La "Voz Interior" (Confianza Verbalizada): Le preguntas al genio: "¿Qué tan seguro te sientes de tu respuesta?". El genio te da un número (del 0 al 100).
    • Analogía: Es como si el genio levantara la mano y dijera: "¡Estoy muy seguro!".
  • El "Acuerdo del Grupo" (Auto-consistencia): Ves las 8 respuestas diferentes que dio el genio. Si 7 de ellas dicen "42" y solo una dice "100", entonces el grupo está de acuerdo.
    • Analogía: Es como pedirle al genio que consulte a 7 de sus amigos imaginarios. Si todos piensan igual, es muy probable que tengan razón.

3. Los Descubrimientos Clave (Las Sorpresas)

A. El "Acuerdo del Grupo" es lento al principio

Si solo pides 2 respuestas, el "Acuerdo del Grupo" (ver si todos piensan igual) no es muy bueno. El genio necesita muchas más rondas para que sus respuestas se alineen.

  • Analogía: Si pides a dos personas que resuelvan un rompecabezas difícil, es probable que no coincidan al principio. Tienen que trabajar mucho más para ponerse de acuerdo.

B. La "Voz Interior" es buena, pero se queda corta

Pedirle al genio que diga qué tan seguro está funciona bien desde el principio, pero mejora poco si le das más tiempo para pensar.

  • Analogía: El genio sabe cuándo está seguro, pero si le das más tiempo, no necesariamente se vuelve más seguro, solo sigue diciendo lo mismo.

C. ¡La Magia está en la Combinación! (El Hallazgo Más Importante)

Aquí está la gran revelación: La mejor estrategia es mezclar las dos cosas.
Si pides al genio que resuelva el problema solo dos veces y luego combinas:

  1. Lo que él dice que siente (su confianza).
  2. Si sus dos respuestas coinciden.

¡El resultado es mucho mejor que pedirle 8 veces que piense solo una cosa!

  • Analogía: Imagina que eres un capitán de barco.
    • Opción A: Preguntar a un solo marinero si hay tormenta (1 vez).
    • Opción B: Preguntar a 8 marineros si hay tormenta (8 veces).
    • Opción C (La ganadora): Preguntar a 2 marineros si hay tormenta Y, además, preguntarles a ambos: "¿Qué tan seguros están de lo que ven?".
    • La Opción C te da una alerta de tormenta mucho más precisa y rápida que la Opción B, y con la mitad del trabajo.

4. Depende del Tema: Matemáticas vs. Historia

El estudio encontró que esta técnica funciona especialmente bien en Matemáticas.

  • Matemáticas: Es como un juego de ajedrez. Las reglas son claras. Si el genio piensa un poco más, sus respuestas y su confianza encajan perfectamente. Aquí, la combinación de señales es mágica.
  • Humanidades (Historia, Filosofía): Es como un debate. Hay muchas opiniones válidas. Aquí, pedirle al genio que piense más veces no ayuda tanto a reducir la duda, porque el problema en sí es más subjetivo.

5. Conclusión Práctica: ¿Qué debemos hacer?

Si quieres usar estos "genios" (modelos de IA) en situaciones importantes (como medicina o finanzas) y necesitas saber si puedes confiar en ellos:

  1. No te conformes con una sola respuesta.
  2. No gastes recursos pidiendo 100 respuestas. (Es demasiado costoso y lento).
  3. Hazlo simple: Pide al genio que resuelva el problema dos veces.
  4. Combina la información: Mira si las respuestas son iguales y escucha lo que dice sobre su propia seguridad.

En resumen: No necesitas un ejército de 100 genios pensando para saber si uno está equivocado. Con solo dos genios pensando y comparando sus "sentimientos" con sus "respuestas", obtienes una brújula de confianza mucho más precisa y eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →