← Últimos artículos
💻 computer science

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

Este artículo propone el Aprendizaje de Anclajes Visuales Espacio-Espectrales (SSVAL), un método que utiliza la Inyección de Prompts de Anclajes Visuales y pérdidas de alineación espacial-frecuencial auxiliares para mitigar la desviación de la representación y la degradación visual en los modelos de lenguaje de gran tamaño multimodales durante la inferencia.

Autores originales: Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

Publicado 2026-08-04
📖 4 min de lectura☕ Lectura para el café

Autores originales: Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras pueden "ver" y "hablar" al mismo tiempo. Este es el reino de los Modelos de Lenguaje Extensos Multimodales (MLLM, por sus siglas en inglés), un tipo de inteligencia artificial que combina la capacidad de entender imágenes con la capacidad de hablar el lenguaje humano. Piensa en esto como enseñarle a un robot a mirar la foto de una habitación desordenada y luego describir exactamente lo que está pasando, o responder preguntas como: "¿Cuántos gatos se esconden debajo del sofá?". Para hacer esto, la computadora utiliza un "codificador de visión" (sus ojos) para mirar la imagen y un "modelo de lenguaje extenso" (su cerebro) para procesar la información y hablar. El desafío es que estas dos partes no hablan naturalmente el mismo idioma, por lo que los científicos utilizan un traductor especial para cerrar la brecha. Aunque estos sistemas de IA se han vuelto increíblemente inteligentes, todavía luchan con un problema complicado: a medida que la computadora piensa más profundamente sobre una imagen, parece olvidar los detalles, de forma muy similar a como podrías perder el hilo de una historia si intentas recordarla durante demasiado tiempo sin un cuaderno.

Este artículo aborda ese problema específico de "olvido" en la visión de la IA. Los investigadores descubrieron que, aunque estos modelos comienzan con una imagen clara en sus "ojos", la información se vuelve borrosa y distorsionada a medida que viaja a través de las muchas capas del cerebro de la IA. Probaron una idea común: ¿qué pasaría si simplemente obligamos a la IA a seguir mirando una foto de referencia perfecta (de un modelo de visión externo potente) mientras piensa? Sorprendentemente, descubrieron que esto no funcionaba; la IA seguía confundiéndose y perdiendo los detalles, incluso con la foto de referencia justo ahí. En su lugar, propusieron un nuevo método llamado Aprendizaje de Anclaje Visual Espacial-Espectral (SSVAL). Piensa en esto como darle a la IA un conjunto de notas adhesivas mágicas (llamadas "Prompts de Anclaje Visual") que aprende a escribir durante el entrenamiento. Estas notas absorben los detalles perfectos de las fotos de referencia y luego actúan como una guía estable, o "ancla", manteniendo la atención de la IA fija mientras procesa la imagen, evitando que la información se desvíe.

Los investigadores, liderados por Qianlong Yang y su equipo, descubrieron que este enfoque de "nota adhesiva" funciona significativamente mejor que los métodos anteriores. Probaron su sistema en varios bancos de pruebas desafiantes, que son como exámenes estandarizados para la visión de la IA. Por ejemplo, al usar una configuración específica con un modelo de lenguaje de 7 mil millones de parámetros, su método mejoró la puntuación en una prueba visual de grano fino (CV-Bench2D) del 58.97% al 65.44%. En otra prueba diseñada para comprobar el razonamiento espacial (MMVP), la puntuación saltó del 33.47% al 41.33%. El artículo sugiere que, al usar estos prompts aprendidos como anclas, combinados con algunos controles de entrenamiento adicionales que observan la imagen desde diferentes "ángulos" (espaciales) y "frecuencias" (como la diferencia entre una pintura suave y un boceto dentado), la IA mantiene su memoria visual nítida hasta el final.

El descubrimiento clave aquí es que simplemente mostrarle a la IA una mejor imagen no es suficiente; necesita un punto de referencia interno estable que lleve consigo en cada paso de su proceso de pensamiento. El equipo demostró que su método, SSVAL, no solo ayuda a la IA a recordar mejor los detalles, sino que también lo hace sin hacer que la computadora sea mucho más lenta o pesada. De hecho, el "peso" adicional añadido al sistema durante la fase de pensamiento es diminuto, solo un 1.55% más de parámetros y un aumento insignificante en la potencia de cómputo. Esto significa que la IA puede ser más inteligente sobre lo que ve sin necesidad de un cerebro más grande o un procesador más rápido. Los resultados sugieren que este enfoque detiene eficazmente la degradación de la información visual, permitiendo que la IA responda preguntas complicadas sobre la ubicación y el conteo de objetos con una precisión mucho mayor que antes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →