← Últimos artículos
🤖 AI

Distorted or Fabricated? A Survey on Hallucination in Video LLMs

Esta encuesta presenta una taxonomía sistemática de las alucinaciones en los modelos de lenguaje grandes para video (Vid-LLMs), clasificándolas en distorsión dinámica y fabricación de contenido, mientras analiza sus causas, métodos de evaluación y mitigación, y propone futuras direcciones de investigación para construir sistemas más robustos.

Autores originales: Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

Publicado 2026-04-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yiyang Huang, Yitian Zhang, Yizhou Wang, Mingyuan Zhang, Liang Shi, Huimin Zeng, Yun Fu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que los Modelos de Lenguaje Grande para Video (Vid-LLMs) son como un narrador de cuentos muy inteligente, pero que nunca ha visto la película en vivo. Solo tiene una cámara que le muestra fragmentos y un micrófono que le capta sonidos.

El problema es que este narrador a veces inventa cosas o cambia la historia sin darse cuenta. A esto los científicos le llaman "alucinación".

Este artículo es como un manual de detectives que explica por qué este narrador se equivoca, cómo clasificar sus errores y cómo arreglarlo. Aquí te lo explico con analogías sencillas:

1. El Problema: ¿Qué es una "Alucinación"?

Imagina que ves un video de un gato durmiendo en una alfombra roja.

  • La realidad: El gato está quieto.
  • La alucinación del modelo: El narrador dice: "¡Mira! El gato está bailando salsa sobre una alfombra azul".

El narrador suena muy seguro y la historia tiene sentido gramaticalmente, pero no coincide con lo que realmente pasó en el video. Esto es peligroso, especialmente si el modelo controla un coche autónomo o ayuda a un robot.

2. La Gran Clasificación: Dos Tipos de Errores

Los autores del artículo dicen que estos errores no son todos iguales. Los dividen en dos grandes categorías, como si fueran dos tipos de mentiras diferentes:

A. La "Distorsión Dinámica" (El Reloj y la Memoria Rotos)

Aquí, el narrador sí ve a los personajes y las escenas, pero se confunde con el tiempo o la identidad. Es como si alguien te contara una película pero se le olvidara el orden de los eventos o mezclara a dos personas.

  • El Reloj Roto (Dinámica Espaciotemporal):
    • Orden: Dice que el hombre se puso los zapatos antes de atarse los cordones (cuando en el video fue al revés).
    • Duración: Dice que el hombre corrió durante 10 minutos, cuando en el video solo corrió 10 segundos.
    • Frecuencia: Dice que el perro ladró una vez, cuando en realidad ladró cinco veces.
  • La Memoria Confusa (Inconsistencia Referencial):
    • Confusión de Personajes: En un video hay un hombre con camisa roja y otro con azul. El narrador dice: "El hombre de la camisa roja se quitó la camisa y ahora tiene la azul", cuando en realidad eran dos personas distintas.
    • Confusión de Escenas: Mezcla una escena de cocina con una de playa y dice que la gente está cocinando en la arena.

B. La "Fabricación de Contenido" (El Narrador que Inventa)

Aquí, el narrador no ve nada en el video que justifique lo que dice. Simplemente inventa basándose en lo que "cree" que debería pasar o en lo que escucha. Es como un actor que improvisa porque olvidó el guion.

  • Influencia del Contexto (Lo que "debería" pasar):
    • Si ve una pelota de fútbol, el narrador asume automáticamente que alguien está pateándola, aunque en el video la pelota esté quieta en el césped.
    • Si ve una cocina, asume que alguien está cocinando, aunque la cocina esté vacía.
    • Analogía: Es como si vieras una foto de un pastel y dijeras: "¡Alguien está comiendo el pastel!", aunque nadie esté en la foto.
  • Conflicto Audio-Visual (El sonido manda):
    • Si en el video se oye un trueno fuerte, pero no se ve ninguna tormenta, el narrador dice: "¡Mira, hay una tormenta!".
    • Si se oye una risa, dice: "La persona está feliz", aunque su cara esté triste. El sonido "ahoga" a la imagen.

3. ¿Por qué pasa esto? (Las Raíces del Problema)

Los autores explican que el narrador falla por dos razones principales:

  1. No entiende el movimiento: Los modelos actuales son muy buenos viendo fotos estáticas, pero son malos entendiendo cómo las cosas se mueven y cambian con el tiempo. Es como intentar entender una película viendo solo fotos sueltas.
  2. Confía demasiado en sus "prejuicios": El modelo ha leído millones de libros y sabe que "los perros ladran" o "en la cocina se cocina". Cuando ve una imagen borrosa, prefiere confiar en su conocimiento general que en lo que realmente está viendo.

4. ¿Cómo lo estamos arreglando? (Las Soluciones)

El artículo revisa varias herramientas que los científicos están probando:

  • Para el Reloj Roto: Crean modelos que aprenden a contar mejor, a ver la secuencia de los eventos y a recordar quién es quién a lo largo de todo el video (como tener una mejor memoria).
  • Para la Invención: Enseñan al modelo a decir "no sé" si no ve la evidencia. Usan trucos para que el modelo ignore lo que "cree" que debería pasar y se centre solo en lo que sus ojos (la cámara) ven.
  • Para el Sonido: Entrenan al modelo para que primero mire la imagen y luego escuche el sonido, para no dejarse engañar por el ruido.

5. ¿Qué sigue? (El Futuro)

Los autores sugieren que para tener narradores perfectos necesitamos:

  • Ojos más rápidos: Usar cámaras y sensores que entiendan el movimiento desde el principio, no solo fotos.
  • Una memoria más fuerte: Que el modelo pueda recordar detalles de hace 10 minutos en un video de una hora.
  • Pensamiento crítico: Enseñar al modelo a dudar de sus propias ideas si no hay pruebas visuales.

En resumen

Este artículo es un mapa para entender por qué la Inteligencia Artificial a veces "cuenta mentiras" cuando ve videos. Nos dice que el problema no es que el modelo sea tonto, sino que a veces confunde el tiempo, mezcla a las personas o inventa historias basadas en lo que cree que debería pasar. El objetivo final es crear sistemas que sean tan fiables como un testigo ocular honesto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →