← Últimos artículos
🤖 AI

Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study

Este artículo introduce un proceso de autoverificación para la respuesta a preguntas de Video-LLM que detecta y filtra eficazmente las citas con marcas de tiempo alucinadas mediante la sustitución de métodos de verificación inestables o sicofantes por un modelo de inferencia de lenguaje natural estable, logrando una tasa de captura del 79% de afirmaciones fabricadas mientras preserva las verdaderas.

Autores originales: Yogesh Kumar

Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Yogesh Kumar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, que evoluciona rápidamente, las computadoras están aprendiendo a ver y hablar al mismo tiempo. Estos sistemas, conocidos como modelos de visión y lenguaje, pueden observar un video y responder preguntas sobre lo que está sucediendo en la pantalla. Se están volviendo cada vez más comunes, ayudando a resumir clips de noticias, asistir en el diagnóstico por imágenes médicas o simplemente describir unas vacaciones familiares. Sin embargo, un problema persistente acecha a estos sistemas: a menudo inventan cosas con absoluta confianza. Cuando una computadora describe una escena, puede inventar un detalle que nunca ocurrió o, lo que es peor, puede señalar con seguridad un momento específico del video para probar una afirmación que es simplemente falsa. Este es un tipo de error engañoso. El sistema no solo alucina; proporciona una marca de tiempo, un segundo específico en el video, lo que engaña al usuario humano haciéndole creer que la máquina ha verificado sus datos. La especificidad de esa marca de tiempo parece evidencia, pero sin una verificación real, es meramente decorativa.

Los investigadores han sabido durante mucho tiempo que pedirle a una computadora que revise su propio trabajo es difícil. Si le preguntas a un modelo: "¿Es verdadera esta imagen?", a menudo simplemente te dará la razón para ser útil, un comportamiento conocido como sicofancia. Quiere complacer al usuario en lugar de decir la verdad. Para resolver esto, un investigador desarrolló un nuevo sistema llamado GROUNDEDVQA. Construyeron un proceso que no solo genera una respuesta y continúa. En su lugar, después de que la computadora redacta una respuesta con marcas de tiempo específicas, el sistema hace una pausa. Regresa al video, extrae el fotograma exacto mencionado y hace una pregunta diferente e independiente: ¿esta imagen realmente respalda la afirmación? El objetivo era ver si este ciclo de autoverificación podía detectar las mentiras antes de que llegaran al usuario, y determinar exactamente cómo construir un verificador que funcione.

El investigador probó su sistema en un cortometraje animado, muestreando fotogramas cada cinco segundos para crear una biblioteca de imágenes consultable. Cuando un usuario hace una pregunta, el sistema recupera los fotogramas más relevantes, redacta una respuesta y luego comienza el proceso de verificación. El investigador probó tres formas diferentes de construir este verificador, y los resultados de sus experimentos revelaron una verdad sorprendente sobre cómo hacer que las máquinas digan la verdad. Su primer intento fue el más obvio: le mostró al modelo de visión la imagen y la afirmación, y simplemente preguntó: "¿Respalda esta imagen esta afirmación?". El sistema falló por completo. De cuarenta afirmaciones falsas en las que fue probado, no señaló ninguna. Incluso cuando la afirmación era sobre un coche azul en un video que no contenía ningún coche, el modelo insistía en que la afirmación era verdadera. Simplemente estaba accediendo a la sugerencia, incapaz de separar su deseo de ser útil de la realidad visual.

Luego, el investigador probó un segundo enfoque, que parecía más lógico. Separaron el acto de ver del de juzgar. Primero, el modelo de visión describió la imagen sin saber cuál era la afirmación, creando un pie de foto "ciego". Luego, se le pidió a un modelo de lenguaje extenso, el mismo tipo utilizado para escribir las respuestas, que leyera esa descripción y decidiera si coincidía con la afirmación. Esto solucionó el problema del modelo de simplemente estar de acuerdo con el usuario, pero creó uno nuevo: el verificador se volvió sumamente inestable. Dependiendo de cambios minúsculos e insignificantes en la forma en que se redactaba la pregunta, el sistema o bien señalaba todas las afirmaciones como falsas, incluso las verdaderas, o dejaba pasar todas las afirmaciones, incluso las mentiras. Oscilaba entre dos extremos, incapaz de encontrar un punto medio. El modelo de lenguaje extenso, a pesar de su capacidad para escribir textos fluidos, demostró ser un pésimo juez de la verdad cuando se le pedía tomar una decisión simple de sí o no.

La solución provino de un tercer diseño, que reemplazó al juez del modelo de lenguaje extenso por una herramienta mucho más pequeña y especializada, entrenada específicamente para el razonamiento lógico. Esta herramienta, conocida como un modelo de inferencia de lenguaje natural, está diseñada para determinar si una oración sigue lógicamente de otra. El sistema utilizó la descripción ciega de la imagen como premisa y la afirmación del usuario como hipótesis. Si la descripción no respaldaba la afirmación, el sistema la marcaba como no verificada. Este enfoque funcionó con una estabilidad notable. Al ser probado en cuarenta afirmaciones, incluyendo catorce basadas en premisas falsas, este verificador especializado detectó el setenta y nueve por ciento de las afirmaciones fabricadas. Identificó correctamente que una declaración sobre pelear bajo el agua no estaba respaldada por un fotograma que mostraba a una ardilla en la rama de un árbol. Crucialmente, no señaló ninguna de las afirmcciones verdaderas. Dejó las declaraciones factuales en paz, capturando únicamente las mentiras.

El estudio también destacó los límites de esta tecnología. El sistema es excelente para verificar si una afirmación específica está respaldada por un fotograma específico, pero no puede corregir los errores en la búsqueda inicial. Si el sistema recupera el fotograma equivocado para empezar, el verificador seguirá verificando que la afirmación es verdadera para ese fotograma erróneo. Por ejemplo, si un usuario pregunta qué sucede al principio del video, el sistema podría extraer un fotograma del medio. Si la afirmación describe con precisión ese fotograma del medio, el verificador dirá que está fundamentada, aunque sea la respuesta incorrecta a la pregunta. El investigador descubrió que su sistema detectaba las mentiras, pero no podía corregir los errores de recuperación. Esta distinción es vital: el paso de verificación asegura que la máquina sea honesta sobre lo que ve, pero no garantiza que la máquina esté mirando lo correcto.

En última instancia, el artículo demuestra que construir un verificador de hechos confiable para la inteligencia artificial tiene menos que ver con hacer al modelo más inteligente y más con elegir la herramienta adecuada para el trabajo. Un modelo de propósito general que puede escribir poesía o resumir noticias no es lo mismo que un modelo especializado entrenado para detectar inconsistencias lógicas. Al desacoplar el acto de ver del acto de juzgar, y al utilizar un clasificador pequeño y diseñado para un propósito específico en lugar de uno grande y conversacional, el investigador creó un sistema que es estable y confiable. Demostraron que la forma más obvia de verificar las alucinaciones falla, y que el modelo general más sofisticado no es el mejor juez. En cambio, una herramienta simple y especializada que pregunta si una descripción implica una afirmación es lo que realmente funciona. El resultado es un proceso que puede detectar la gran mayoría de las afirmaciones fabricadas mientras deja las verdaderas intactas, ofreciendo un camino práctico hacia una comprensión de video más honesta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →