← Últimos artículos
💬 NLP

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

Este artículo introduce la Destilación de Atribución Visual (VAD), un algoritmo contrafáctico que aísla las correcciones visualmente atribuibles de las señales mixtas del profesor en la destilación multimodal on-policy para reconstruir objetivos de entrenamiento más efectivos y alineados con la evidencia que superan a los métodos existentes en evaluaciones visuales de grano fino.

Autores originales: Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

Publicado 2026-07-31
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a ser un detective. Tienes a un profesor superinteligente que puede ver la escena del crimen perfectamente, y a un robot estudiante que está intentando aprender a resolver el caso. El profesor observa las pistas y dice: "¡El sospechoso lleva un sombrero rojo!". Pero a veces, el cerebro del profesor es un poco ruidoso. Tal vez el profesor también está pensando: "El sospechoso lleva un sombrero rojo, y además, me gustan mucho los sombreros rojos, y el clima es agradable hoy". Si simplemente copias las palabras exactas del profesor, el estudiante podría aprender a decir "sombrero rojo", pero también podría empezar a hablar accidentalmente sobre el clima o el color favorito del profesor. Este es el problema de la información de "fuente mixta": el estudiante recibe la respuesta correcta mezclada con ruido adicional y confuso.

En el mundo de la Inteligencia Artificial, específicamente en los Modelos de Lenguaje Grandes Multimodales (IA que puede ver imágenes y leer texto), los investigadores están tratando de enseñar a estos modelos a prestar más atención a los detalles visuales. Un método común se llama "Destilación On-Policy". Piensa en esto como un robot estudiante intentando resolver un rompecabezas, y cada vez que se queda atascado o hace una suposición, el profesor mira el mismo rompecabezas (pero con una visión más clara) y corrige el siguiente movimiento del estudiante. El objetivo es hacer al estudiante más inteligente mostrándole el camino correcto. Sin embargo, si la corrección del profesor es una mezcla desordenada de "mira este detalle específico" y "solo mi opinión general", el estudiante podría confundirse. Por eso a los investigadores les importa: quieren saber exactamente qué parte del consejo del profesor proviene de la evidencia visual (la imagen) y qué parte es solo los hábitos o trucos lingüísticos del propio profesor.

Aquí entra un nuevo método llamado VAD (Destilación de Atribución Visual), que actúa como un "filtro de verdad" para el consejo del profesor. En lugar de copiar ciegamente toda la corrección del profesor, VAD hace una pregunta inteligente de "qué pasaría si". Toma la suposición actual del estudiante y le pregunta dos cosas al profesor: "¿Qué dirías si te mostrara la foto completa y clara?" y "¿Qué dirías si emborronara la pista específica de la que estamos hablando?". Al comparar estas dos respuestas, VAD puede calcular exactamente cuánto cambió el consejo del profesor debido a la pista visual.

Imagina que el profesor es un chef corrigiendo la receta de la sopa de un estudiante. El profesor dice: "Añade más sal, y además, la sopa debe servirse en un cuenco azul". VAD es como una prueba mágica que pregunta: "Si ocultamos el cuenco azul, ¿el profesor sigue diciendo 'añade sal'?". Si el profesor todavía dice "añade sal" incluso sin el cuenco, VAD se da cuenta de que el comentario del "cuenco azul" era solo charla extra, no una necesidad visual. VAD entonces elimina la parte del "cuenco azul" y solo conserva la parte de "añade sal" para enseñar al estudiante. Reconstruye una lección más limpia y nítida que se enfoca puramente en lo que la imagen realmente demuestra.

Los investigadores probaron esta idea en dos modelos de IA de diferentes tamaños (uno con 4 mil millones de parámetros y otro con 9 mil millones) usando seis rompecabezas visuales diferentes, que van desde detectar detalles diminutos en fotos de alta resolución hasta reconocer objetos en escenas complejas del mundo real. Encontraron que VAD era significamente mejor que los métodos anteriores. Para el modelo de 4 mil millones, mejoró la precisión promedio en aproximadamente 2.4 puntos en comparación con el siguiente mejor método, y para el de 9 mil millones, mejoró en 2.8 puntos. De hecho, el modelo más pequeño de 4 mil millones entrenado con VAD funcionó mejor que algunos modelos masivos de código cerrado que son mucho más grandes y costosos.

El artículo sugiere que, al separar la "evidencia visual" del "ruido del profesor", la IA aprende a confiar más en la imagen y menos en los hábitos del profesor. Cuando el estudiante cometía un error (como suponer que un patrón era "ajedrezado" cuando en realidad era "a rayas"), VAD era particularmente bueno usando las pistas visuales para alejar al estudiante de la respuesta incorrecta y llevarlo hacia la correcta. El estudio muestra que este enfoque "contrafáctico" —comparar qué sucede con y sin la evidencia— crea un objetivo de aprendizaje mucho mejor que simplemente copiar la corrección completa y desordenada del profesor. Si bien el método no es una varita mágica perfecta (todavía depende de un único par de vistas y no puede separar perfectamente cada tipo de ruido), los resultados sugieren fuertemente que esta forma de filtrar y reconstruir el consejo del profesor es una herramienta poderosa para hacer la visión de la IA más aguda y confiable.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →