SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs
Este artículo presenta SpurLens, un proceso automatizado que revela que los Modelos de Lenguaje de Gran Escala Multimodales (MLLM) sufren sesgos espurios significativos que provocan fallos en el reconocimiento de objetos y alucinaciones amplificadas, al tiempo que explora estrategias de mitigación para mejorar su fiabilidad.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: SpurLens: Detección Automática de Indicios Espurios en LLMs Multimodales
Planteamiento del Problema
Aunque se ha documentado bien que los modelos de visión unimodales dependen de correlaciones espurias (atributos de entrada no esenciales), el alcance de estos sesgos en los Modelos Grandes de Lenguaje Multimodales (MLLM) sigue siendo incierto, a pesar de su supervisión lingüística. Los autores plantean la hipótesis de que muchos fallos críticos en los MLLM, específicamente la alucinación de objetos (generar contenido fácticamente incorrecto) y los fallos de reconocimiento de objetos, derivan de una dependencia de indicios espurios en lugar de un verdadero reconocimiento de objetos.
Los métodos existentes para detectar estos sesgos suelen requerir supervisión humana, están limitados a características predefinidas o dependen de un análisis de coocurrencia de subtítulos computacionalmente costoso. Además, no está claro si estos sesgos son fundamentales del codificador de visión, del modelo de lenguaje o de su fusión, ni si las estrategias simples de prompting pueden mitigarlos.
Metodología: El Pipeline SpurLens
El artículo presenta SpurLens, un pipeline automatizado y no supervisado diseñado para identificar indicios visuales espurios y cuantificar su impacto en el rendimiento de los MLLM. El pipeline opera en tres etapas principales:
Propuesta de Características Espurias:
- Para un objeto objetivo dado, el sistema aprovecha GPT-4 para generar una lista de posibles indicios espurios (objetos o elementos de fondo) que coocurren comúnmentamente con .
- La lista generada se somete a un riguroso filtrado mediante GPT-4 para asegurar que las características sean:
- Físicas y visualmente discernibles.
- No formen parte del objeto objetivo en sí mismo (por ejemplo, "pantalla" no es un indicio para "computadora portátil").
- No sean inseparables del objeto objetivo.
- Detectables por detectores de objetos de conjunto abierto (open-set).
Identificación y Clasificación de Imágenes:
- Se utiliza un detector de objetos de conjunto abierto (OWLv2) para escanear un gran conjunto de imágenes en busca de la presencia de los indicios espurios propuestos.
- Las imágenes se clasifican según las puntuaciones de confianza de los indicios espurios detectados. Esto crea una clasificación de "espuriedad" para cada característica, permitiendo al sistema seleccionar imágenes con la mayor presencia de un indicio (Top-K) y la menor presencia (Bottom-K).
Cálculo de Brechas Espurias (Spurious Gaps):
- Las imágenes clasificadas se introducen en el MLLM objetivo con prompts binarios (por ejemplo, "¿Hay un [objeto objetivo] en la imagen?").
- Se calculan dos métricas principales:
- Brecha de Precisión de Percepción (PA Gap): La diferencia en la precisión de reconocimiento entre las imágenes que contienen el indicio espurio y aquellas que no lo contienen. Una brecha positiva grande indica una dependencia excesiva del indicio para el reconocimiento.
- Brecha de Tasa de Alucinación (HR Gap): La diferencia en las tasas de alucinación (falsos positivos) entre las imágenes que contienen el indicio y las imágenes de referencia. Una brecha positiva grande indica que el indicio dispara las alucinaciones.
- Se identifica la característica que genera la mayor brecha como el indicio espurio más influyente para esa clase.
Contribuciones Clave
- Descubrimiento Automatizado: A diferencia del trabajo previo que requiere anotación humana o conjuntos de características fijas, SpurLens descubre automáticamente indicios espurios interpretables a través de una amplia gama de objetos y conjuntos de datos sin supervisión humana.
- Análisis de Modo de Fallo Dual: El estudio cuantifica sistemáticamente dos modos de fallo distintos causados por el sesgo espurio:
- Dependencia excesiva: El rendimiento cae significativamente cuando se eliminan los indicios espurios.
- Amplificación de Alucinaciones: Los indicios espurios disparan las alucinaciones de objetos a tasas significativamente más altas que la línea base.
- Profundidad Diagnóstica: El marco aisla la fuente del sesgo mediante estudios de ablación, examinando si el sesgo se origina en el codificador de visión, el modelo de lenguaje o el proceso de fusión, y prueba la eficacia de diversas estrategias de mitigación.
Resultados Experimentales
Los autores evaluaron cinco MLLM (Qwen2-VL, Qwen-3.5, Llama-3.2, LLaVA-v1.6 y GPT-4o-mini) a través de tres conjuntos de datos (HardImageNet, ImageNet Subset y COCO).
1. Fallos de Reconocimiento de Objetos
- Eliminar los indicios espurios conduce a caídas significativas en la precisión en todos los modelos.
- Ejemplo: La precisión de GPT-4o-mini en COCO cayó del 88.0% (con indicios) al 67.6% (sin indicios), una disminución del 20.4%.
- La magnitud de la caída varía según el modelo y el conjunto de datos, siendo LLaVA-v1.6 el que muestra una brecha del 16.0% en COCO.
2. Alucinación de Objetos
- Los indicios espurios amplifican dramáticamente las tasas de alucinación.
- Ejemplo: En COCO, la tasa de alucinación para GPT-4o-mini aumentó del 1.4% (sin indicios) al 11.2% (con indicios), un aumento de 9.8x.
- En el subconjunto de ImageNet, el aumento fue aún más pronunciado, con algunos modelos mostrando hasta un aumento de 18 veces en las tasas de alucinación cuando los indicios espurios estaban presentes.
3. Estudios de Ablación y Mitigación
- Eliminación de Tokens (Token Dropping): Incluso cuando los tokens visuales correspondientes al objeto objetivo fueron eliminados artificialmente, los modelos continuaron alucinando la presencia del objeto a tasas elevadas (por ejemplo, HR > 30% para algunos modelos), lo que sugiere que el sesgo no depende únicamente de la evidencia visual.
- Aislamiento del Codificador de Visión: El entrenamiento de clasificadores binarios utilizando únicamente las incrustaciones (embeddings) del codificador de visión reveló brechas espurias significativas, lo que indica que el sesgo existe dentro de la propia representación visual, independientemente del modelo de lenguaje.
- Estrategias de Prompting: Los autores probaron varias técnicas de mitigación, incluyendo el ensamble de prompts, el razonamiento de Cadena de Pensamiento (CoT) e informar explícitamente al modelo sobre los posibles indicios espurios.
- Resultado: Aunque algunas estrategias ofrecieron mejoras situacionales menores, ninguna redujo significativamente la Brecha Espuria. Incluso el hecho de "hacer trampa" proporcionando al modelo el indicio espurio más fuerte identificado por SpurLens no logró eliminar el sesgo.
Significado y Reivindicaciones
El artículo afirma que el sesgo espurio es un problema profundamente arraigado y fundamental en los MLLM actuales que persiste a través de diferentes arquitecturas y conjuntos de datos. Los autores sostienen que:
- Los MLLM actuales son altamente susceptibles a las correlaciones espurias, lo que conduce a fallos sistemáticos tanto en el reconocimiento como en la generación.
- Las estrategias de mitigación simples son insuficientes. Las intervenciones basadas en el lenguaje (prompting) no pueden resolver completamente la dependencia subyacente de los indicios espurios, ya que el sesgo parece estar incrustado en el espacio de características del codificador de visión.
- Se necesita una evaluación rigurosa. La persistencia de estos sesgos exige métodos de evaluación más robustos y estrategias de mitigación que vayan más allá de las técnicas actuales de prompting para garantizar la fiabilidad de los MLLM en aplicaciones del mundo real.
El estudio concluye que SpurLens proporciona una herramienta escalable e interpretable para diagnosticar estos fallos, pero las causas raíz requieren algo más que ajustes superficiales en el prompting del modelo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.