← Últimos artículos
💻 computer science

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

El artículo propone VADER, un marco de trabajo libre de entrenamiento que mitiga las alucinaciones en los modelos de lenguaje de gran tamaño para video mediante la reasignación dinámica de la atención a la evidencia de video y el borrado selectivo de tokens visuales para construir una rama de decodificación contrastiva robusta.

Autores originales: Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

Publicado 2026-08-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás hablando con un robot superinteligente que ha visto millones de películas y puede describirlas con frases perfectas. Este robot es un "Modelo de Lenguaje de Gran Escala para Video" (o VideoLLM). Es como un narrador que nunca se cansa, pero tiene un hábito problemático: a veces, se vuelve tan seguro de su propia voz que inventa detalles que en realidad no están ahí. Podría decirte que un personaje "saltó una valla" cuando el video solo lo mostraba caminando, simplemente porque es algo común que la gente hace en las películas. Esto se llama "alucinación".

El problema es especialmente difícil con los videos. A diferencia de una sola foto, un video es una larga secuencia de fotogramas. Si el robot pierde un detalle en un fotograma, a menudo puede inferirlo mirando los fotogramas justo antes o después, que suelen ser muy similares. Es como si te faltara una palabra en una canción, podrías adivinarla porque las siguientes palabras son casi las mismas. Debido a esto, los viejos trucos utilizados para evitar que los robots mientan —como simplemente desenfocar una parte de la imagen— suelen fallar. El robot simplemente rellena el hueco usando los fotogramas circundantes. Los científicos quieren solucionar esto sin tener que reenseñar al robot desde cero, lo que tomaría una eternidad y costaría una fortuna. Necesitan una forma de hacer que el robot preste más atención a lo que realmente está viendo, justo en el momento en que está hablando.

Aquí entra VADER, un nuevo método que actúa como un editor inteligente para estos robots de video. En lugar de obligar al robot a aprender nuevas reglas, VADER interviene durante la conversación para dar un suave empujón a la atención del robot. Utiliza dos trucos ingeniosos para evitar que el robot invente cosas.

Primero, utiliza una herramienta llamada Reasignación de Enfoque Visual (VFR). Piensa en el cerebro del robot como una cocina concurrida con muchos chefs (capas) trabajando al mismo tiempo. Algunos chefs están mirando el video, mientras que otros solo están charlando sobre la receta (el texto). A veces, los chefs que charlan se vuelven demasiado ruidosos y ahogan a los chefs que miran el video. VFR actúa como un control de volumen dinámico. Escucha el video y la pregunta específicos, identifica exactamente qué chefs están hablando del video y luego aumenta su volumen mientras baja el de la charla. No utiliza un ajuste fijo para cada video; en su lugar, diagnostica la situación y decide: "Está bien, para esta escena específica, necesitamos escuchar la evidencia del video un 20% más".

Segundo, VADER utiliza un truco llamado Borrado Selectivo de Evidencia (SEE). Aquí es donde se vuelve muy lúdico. Imagina que estás intentando adivinar la trama de una película, pero solo se te permite mirar el escenario de fondo, no a los actores principales. Si aun así adivinas la trama correctamente, significa que solo estabas adivinando basándote en lo que suele suceder en las películas (tu "sesgo previo"). Si te equivocas, demuestra que te apoyabas en los actores. VADER hace esto "borrando" secretamente las pistas visuales más importantes (como los actores principales) de la vista del robot dentamente de su propio cerebro, fotograma a fotograma. Crea una versión de la historia de "qué pasaría si" donde el robot tiene que adivinar sin la evidencia clave. Si el robot sigue dando la misma respuesta en esta versión "borrada", VADER sabe que el robot solo está adivinando basándose en hábitos, no en el video real.

Finalmente, VADER compara la respuesta "real" del robot con su respuesta "borrada". Si el robot está seguro en ambas, sabe que la respuesta es probablemente una alucinación y la suprime. Si la respuesta cambia cuando se elimina la evidencia, VADER sabe que el robot estaba prestando atención al video.

Los resultados son impresionantes. Cuando los investigadores probaron esto en un robot popular llamado LLaVA-Video-7B, este se volvió mucho mejor para detectar eventos reales y mantener la línea temporal. En una prueba específica llamada EventHallusion, la precisión del robot saltó al 72.60%. Esto es algo importante porque superó a otros métodos que requerían un reentrenamiento costoso. El artículo muestra que, con solo ajustar cómo el robot presta atención y probando sus propios sesgos sobre la marcha, podemos hacer que la IA de video sea mucho más honesta, sin necesidad de enseñarle un lenguaje completamente nuevo. Es un recordatorio de que, a veces, la mejor manera de detener a un mentiroso es pedirle que cuente la historia con los ojos cerrados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →