← Últimos artículos
💬 NLP

Why Don't You Know? Evaluating the Impact of Uncertainty Sources on Uncertainty Quantification in LLMs

Este trabajo evalúa cómo las distintas fuentes de incertidumbre (como lagunas de conocimiento, variabilidad de salida y ambigüedad de entrada) afectan la eficacia de los métodos actuales de cuantificación de incertidumbre en modelos de lenguaje, demostrando que su rendimiento se degrada cuando la incertidumbre no proviene únicamente de limitaciones de conocimiento y proponiendo la necesidad de métodos que consideren explícitamente el origen de dicha incertidumbre.

Autores originales: Maiya Goloburda, Roman Vashurin, Fedor Chernogorsky, Nurkhan Laiyk, Daniil Orel, Preslav Nakov, Maxim Panov

Publicado 2026-04-14
📖 4 min de lectura☕ Lectura para el café

Autores originales: Maiya Goloburda, Roman Vashurin, Fedor Chernogorsky, Nurkhan Laiyk, Daniil Orel, Preslav Nakov, Maxim Panov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Hola! Imagina que los Modelos de Lenguaje Grandes (LLMs), como los que usamos para chatear o escribir, son como chefes de cocina muy talentosos pero un poco distraídos. A veces cocinan un plato delicioso, y otras veces... ¡pueden quemar la sopa o inventar ingredientes que no existen!

El problema es que, cuando el chef se equivoca, no siempre sabemos por qué. ¿Es que no conoce la receta? ¿Es que hay muchas formas de hacer el plato y no sabe cuál elegir? ¿O es que tú le pediste algo tan confuso que ni él entendió qué querías?

Este paper (artículo científico) quiere resolver ese misterio. Aquí te lo explico con analogías sencillas:

1. El Problema: "No sé si no sé"

Antes, los investigadores intentaban medir la "confianza" del chef con un solo número, como un semáforo.

  • Verde: "¡Seguro que está bueno!"
  • Rojo: "¡Cuidado, puede estar malo!"

Pero el semáforo es demasiado simple. Si el chef dice "Rojo", ¿es porque no sabe cocinar ese plato (falta de conocimiento), o porque hay 100 formas de hacerlo y no sabe cuál te gusta (variabilidad), o porque le preguntaste "¿Qué comemos?" sin decir si quieres desayuno o cena (ambigüedad)?

El artículo dice: "¡Oye! No todos los 'Rojo' son iguales. Necesitamos saber la causa del problema."

2. La Solución: Una Nueva "Caja de Herramientas"

Los autores crearon un nuevo banco de pruebas (un conjunto de preguntas) diseñado como un laboratorio de cocina. Dividieron las preguntas en tres tipos, como si fueran tres situaciones distintas:

  • Tipo 1: El Chef no sabe la receta (Falta de conocimiento).

    • Ejemplo: "¿Cuál es la capital de un país que no existe?"
    • Lo que pasa: El chef debería decir: "No lo sé".
    • El fallo: A veces los métodos actuales dicen "Rojo" (bien), pero a veces dicen "Verde" y se inventan una capital falsa. ¡Peligro!
  • Tipo 2: Hay muchas recetas buenas (Variabilidad de salida).

    • Ejemplo: "Nombra un animal del desierto". (Puedes decir camello, lagarto, escorpión... ¡todos son correctos!).
    • Lo que pasa: El chef está seguro, pero como hay muchas respuestas, los métodos antiguos se confunden y piensan: "¡Uy, no está seguro! ¡Ponle Rojo!".
    • El fallo: El método castiga al chef por ser creativo y tener opciones.
  • Tipo 3: La pregunta estaba mal hecha (Ambigüedad de entrada).

    • Ejemplo: "¿Quién ganó el partido?" (¿Cuál partido? ¿De qué deporte? ¿De qué año?).
    • Lo que pasa: El chef debería preguntar: "¿A qué partido te refieres?".
    • El fallo: En lugar de preguntar, el chef adivina una respuesta y actúa como si supiera todo. ¡Muy peligroso!

3. Lo que Descubrieron: "Un solo termómetro no sirve para todo"

Los autores probaron muchas herramientas diferentes (métodos matemáticos) para medir la confianza del chef en estas tres situaciones.

  • Descubrimiento 1: Cuando el problema es que el chef no sabe (Tipo 1), las herramientas funcionan genial.
  • Descubrimiento 2: Cuando hay múltiples respuestas posibles (Tipo 2) o la pregunta es confusa (Tipo 3), ¡las herramientas fallan estrepitosamente!
    • A veces dicen que el chef está seguro cuando en realidad está adivinando.
    • A veces dicen que está inseguro cuando en realidad tiene muchas buenas opciones.

Es como intentar medir la temperatura de un horno, la presión de un neumático y la humedad de una planta con el mismo termómetro. ¡No funciona!

4. ¿Por qué es importante esto?

Imagina que usas este chef para diagnosticar una enfermedad o darte consejos legales.

  • Si el chef no sabe la respuesta y tú crees que sí (porque el "semáforo" estaba verde), podrías tomar una decisión fatal.
  • Si el chef necesita aclarar tu pregunta pero te da una respuesta falsa con confianza, podrías perder dinero o tiempo.

Conclusión: El Futuro

El mensaje final del paper es: Dejemos de usar un solo número para medir la confianza.

Necesitamos sistemas que digan no solo "¿Qué tan seguro estás?", sino también "¿Por qué tienes dudas?":

  • "No sé la respuesta" -> Pregúntale a un experto.
  • "Hay muchas respuestas buenas" -> Dame varias opciones.
  • "Tu pregunta es confusa" -> Pregúntame para aclarar.

En resumen, este trabajo nos enseña que para usar la Inteligencia Artificial de forma segura, no basta con saber si el robot "cree" que sabe la respuesta; necesitamos entender por qué duda, para saber cómo actuar ante ese miedo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →