← Últimos artículos
🤖 machine learning

"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification

Este artículo investiga la divergencia entre los humanos y los modelos de lenguaje de gran tamaño en la cuantificación de la incertidumbre verbal mediante la introducción de un algoritmo basado en la optimización, METHODNAME, el cual aprende mapeos de probabilidad óptimos para marcadores verbales directamente a partir de las salidas del modelo para revelar disparidades sistemáticas de confianza sin depender del muestreo repetido.

Autores originales: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

Publicado 2026-10-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jinhao Duan, Zicheng Liu, Zijie Liu, Kaidi Xu, Tianlong Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Cuando hablamos, a menudo moderamos nuestras afirmaciones. Decimos que algo es "probable", "posible" o "casi seguro", utilizando estas palabras para señalar cuánto sabemos realmente. Esta capacidad de expresar duda es una forma de metacognición, un chequeo mental donde reconocemos los límites de nuestro propio conocimiento. Es una parte crucial de la comunicación humana, que nos permite navegar la incertidumbre sin pretender tener respuestas que no poseemos. En el mundo de la inteligencia artificial, específicamente con los modelos de lenguaje extensos, esta misma capacidad se está convirtiendo en una característica de seguridad crítica. Estos modelos a veces pueden generar información que suena segura pero es fácticamente incorrecta, un fenómeno conocido como alucinación. Para confiar en estos sistemas, especialmente en campos sensibles como la medicina o el derecho, necesitamos saber cuándo no están seguros. El desafío radica en determinar si las palabras que una IA utiliza para expresar duda significan lo mismo para un oyente humano que para la propia máquina.

Un equipo de investigadores se propuso investigar si la incertidumbre verbal expresada por los modelos de lenguaje extensos se alinea con la comprensión humana. Comenzaron recopilando una colección masiva de cómo las personas interpretan frases como "muy probable" o "incierto". Basándose en décadas de investigación en psicología y ciencia de la decisión, compilaron una guía de referencia que mapea estas frases comunes con probabilidades numéricas específicas. Por ejemplo, en la mente humana, la frase "muy probable" corresponde a un alto grado de confianza, mientras que "posible" se sitúa en algún punto intermedio. Luego, los investigadores probaron varios modelos de lenguaje avanzados, pidiéndoles que respondieran preguntas y explicaran su confianza utilizando estas mismas frases de lenguaje natural. Compararon las respuestas de los modelos con la guía de referencia humana para ver si las máquinas estaban hablando el mismo idioma que sus usuarios.

Los resultados revelaron una desconexión significativa. Si bien los modelos podían usar las palabras, asignaban niveles de certeza diferentes a ellas de los que asignan los humanos. Por ejemplo, cuando un humano escucha "muy probable", lo interpreta como una probabilidad fuerte, pero los modelos en el estudio a menudo usaban esta frase para describir situaciones en las que en realidad estaban bastante inseguros. Por el contrario, los modelos podrían expresar un alto grado de confianza para frases que los humanos consideran meras conjeturas. Este desajuste significa que simplemente leer la salida de un modelo y asumir que sus señales verbales reflejan su estado interno puede ser engañoso. El estudio demostó que confiar en un diccionario de palabras de incertidumbre creado por humanos no era suficiente para calibrar con precisión la confianza de una máquina; los modelos tenían su propia lógica interna y distinta para lo que significaban esas palabras.

Para cerrar esta brecha, los investigadores desarrollaron un nuevo método llamado VOCAL. En lugar de obligar a los modelos a ajustarse a las definiciones humanas, este enfoque aprende el significado específico de las palabras de incertidumbre directamente del propio comportamiento del modelo. El sistema analiza miles de las respuestas del modelo, observando qué frases utiliza cuando acierta y cuáles utiliza cuando se equivoca. Luego construye un mapa personalizado que traduce los hábitos verbales específicos del modelo en puntuaciones de probabilidad precisas. Este proceso implica una optimización matemática que suaviza los datos, asegurando que las frases de sonido similar reciban puntuaciones similares, incluso si el modelo las usa raramente. Al adaptar la interpretación al modelo específico, el método crea una forma mucho más confiable de detectar cuándo el modelo no está seguro.

Los experimentos demostaron que este enfoque personalizado funciona significativamente mejor que intentar imponer un estándar humano a la máquina. En pruebas a través de varios conjuntos de datos, incluyendo problemas matemáticos complejos y preguntas médicas, el nuevo método fue mucho más preciso al predecir si la respuesta de un modelo era correcta o incorrecta en comparación con el uso de la guía de referencia humana por sí sola. En algunos casos, la mejora fue sustancial, convirtiendo un método que apenas funcionaba mejor que el azar en uno que podía detectar errores de manera confiable. Los investigadores encontraron que esta técnica podía lograr niveles de rendimiento comparables a métodos mucho más costosos que requieren que el modelo genere múltiples respuestas y las compare, pero sin el tiempo o la potencia de cómputo adicionales.

El estudio concluye que, si bien los modelos de lenguaje extensos pueden imitar los patrones del habla humana, su comprensión interna de la incertidumbre es fundamentalmente diferente de la nuestra. Una frase como "muy probable" no tiene el mismo peso para la máquina que para una persona. Para que estos sistemas sean verdaderamente confiables, no podemos simplemente pedirles que hablen como humanos y esperar que signifiquen lo mismo. En cambio, debemos aprender a leer su dialecto específico de incertidumbre. Al crear mapas personalizados que traduzcan las señales verbales únicas de un modelo en señales claras de confianza, podemos distinguir mejor entre una respuesta correcta y una alucinación segura, haciendo que la tecnología sea más segura y confiable para su uso en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →