← Últimos artículos
💻 computer science

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

El artículo introduce FUSE, un marco bayesiano que fusiona analíticamente las incertidumbres aleatorias a nivel de incrustación y las incertidumbres epistémicas a nivel de modelo para producir una medida escalar para predecir con fiabilidad la corrección de la salida y lograr una calibración de vanguardia en modelos de visión y lenguaje.

Autores originales: Harry Zhang, Luca Carlone

Publicado 2026-06-16
📖 4 min de lectura☕ Lectura para el café

Autores originales: Harry Zhang, Luca Carlone

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le haces una pregunta a un asistente robótico muy inteligente, pero a veces demasiado confiado, sobre una imagen. Le preguntas: "¿De qué color es el sombrero del gato?". El robot mira la imagen y dice: "Negro". Pero, ¿qué pasa si la imagen está borrosa, o si el sombrero es en realidad azul pero parece negro debido a la sombra? ¿Cómo sabes si el robot está adivinando o si realmente está seguro?

Este es el problema que el artículo FUSE intenta resolver. Le da al robot una forma de decir: "No estoy seguro", antes de darte una respuesta incorrecta.

Así es como funciona FUSE, explicado mediante analogías sencillas:

Los dos tipos de "No estoy seguro"

Los autores se dieron cuenta de que un robot puede no estar seguro por dos razones muy diferentes. FUSE mide ambas y las combina en una sola puntuación.

1. El problema de la "Entrada Desordenada" (Incertidumbre Aleatoria)

  • La analogía: Imagina que intentas leer una nota escrita a mano, pero la tinta está corrida, el papel está arrugado y la letra es desordenada. Incluso si eres un lector de clase mundial, el input mismo es confuso.
  • En el artículo: Esto sucede cuando la imagen o la pregunta de texto son ambiguas. Tal vez la foto es oscura o la pregunta es vaga. FUSE observa los datos brutos (la imagen y el texto) y calcula qué tan "difusos" o ambiguos son. Si los datos están desordenados, el robot comienza con una "sospecha" de que podría estar equivocado.

2. El problema de la "Neblina Mental" (Incertidumbre Epistémica)

  • La analogía: Imagina que le haces una pregunta a un amigo. Si tiene confianza, te da una respuesta clara. Pero si no está seguro, podría decir: "Bueno, podría ser una taza, o tal vez un jarrón, o quizás un recipiente", y su voz vacila. La variedad de sus respuestas te indica que no sabe la verdad.
  • En el artículo: FUSE le hace la misma pregunta al robot 50 veces. Si el robot da 50 respuestas diferentes (por ejemplo, "taza", "jarrón", "caja"), esto demuestra que el robot está confundido. Si da 50 respuestas idénticas, tiene confianza. FUSE mide cuánto se "dispersan" o discrepan las respuestas entre sí.

El truco de magia: Fusión Bayesiana

Normalmente, la gente podría mirar solo la entrada desordenada O las respuestas dispersas. FUSE hace algo más inteligente: las combina utilizando una receta matemática llamada Fusión Bayesiana.

  • La analogía: Piensa en un detective resolviendo un crimen.
    • Pista A (El Input): La escena del crimen es muy brumosa (Entrada Desordenada). Esto hace que el detective sospeche que el caso es difícil.
    • Pista B (Las Respuestas): El testigo cambia constantemente su historia (Respuestas Dispersas). Esto hace que el detective sospeche que el testigo está mintiendo o confundido.
    • El Veredicto: FUSE toma ambas pistas y calcula una única "Puntuación de Confianza". Si la escena es brumosa y además el testigo cambia su historia, la puntuación dice: "¡Alta Incertidumbre! No confíes en esta respuesta". Si la escena es clara y el testigo es consistente, la puntuación dice: "¡Baja Incertidumbre! Esto es probablemente correcto".

Por qué esto es importante

El artículo muestra que FUSE es mucho mejor detectando mentiras (alucinaciones) que los métodos anteriores.

  • Métodos antiguos: A veces, un robot puede estar muy seguro pero equivocado. Podría decir "Negro" con un 99% de confianza incluso si el sombrero es en realidad azul, simplemente porque el robot es demasiado confiado.
  • FUSE: Al comprobar tanto la "difuminación" de la imagen como la "consistencia" de las respuestas, FUSE puede detectar estos errores.

El resultado: Una señal de "Pare"

El resultado final es un único número (una puntuación).

  • Puntuación baja: "Tengo confianza. Adelante, usa mi respuesta".
  • Puntuación alta: "Estoy confundido. La imagen es complicada y mis respuestas están por todas partes. Por favor, no confíes en mí en este caso".

El artículo probó esto en muchos conjuntos de datos de preguntas y respuestas visuales (como hacer preguntas sobre imágenes) y encontró que FUSE es el mejor para saber cuándo decir "no lo sé" y cuándo dar una respuesta correcta. Esto ayuda a que la IA sea más segura y fiable, especialmente en situaciones donde una respuesta incorrecta podría ser un gran problema.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →