← Últimos artículos
💻 computer science

MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

MARQUIS es una tubería de tres etapas que mejora significativamente la generación aumentada por recuperación de video al abordar las limitaciones en el manejo de consultas complejas y la síntesis de múltiples videos mediante la expansión de consultas, la extracción estructurada de evidencia y la generación controlada de artículos, logrando un rendimiento de vanguardia en la tarea compartida MAGMaR2026.

Autores originales: Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

Publicado 2026-05-19
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un periodista encargado de escribir un artículo de noticias detallado sobre un evento complejo, como una tormenta masiva o una elección política. Sin embargo, no tienes un solo reportero en el terreno; en su lugar, tienes una biblioteca que contiene 100,000 clips de video diferentes del evento, grabados por cientos de cámaras distintas. Tu trabajo es encontrar los clips adecuados, determinar qué sucedió realmente en ellos y escribir una historia coherente que cite exactamente qué video probó cada hecho.

Este es el desafío que aborda el sistema MARQUIS. El artículo argumenta que las herramientas de IA actuales son deficientes en esta tarea específica. O bien no pueden encontrar los videos correctos cuando la pregunta es complicada, o se ven abrumadas al intentar leer demasiados videos a la vez y terminan alucinar (inventando cosas).

MARQUIS resuelve esto actuando como una línea de montaje de redacción en tres etapas, dividiendo el trabajo masivo en pasos más pequeños y manejables.

Etapa 1: La Búsqueda del Detective (Recuperación)

El Problema: Si le pides a una IA: "Cuéntame todo sobre los resultados de las elecciones de 2025", un motor de búsqueda estándar podría confundirse. Intenta convertir toda esa pregunta larga en un solo "código de búsqueda" (incrustación), lo que a menudo pierde los matices. Es como intentar encontrar una aguja específica en un pajar describiendo todo el pajar de una vez.

La Solución MARQUIS:
En lugar de una sola búsqueda grande, MARQUIS actúa como un detective que divide un gran caso en pequeñas pistas.

  1. Descomposición: Toma tu gran pregunta y la divide en más de 20 preguntas diminutas y específicas (por ejemplo: "¿Cuántos escaños ganaron los Liberales?", "¿Cuál fue la participación electoral?", "¿Qué distritos cambiaron de partido?").
  2. Búsqueda Paralela: Busca en la biblioteca de videos cada una de esas pequeñas preguntas por separado.
  3. La Fusión: Toma todas las listas de videos encontradas para las pequeñas preguntas y las fusiona en una lista maestra.
  4. El Reordenador: Finalmente, un "juez de video" especializado examina a los principales candidatos y los reordena para asegurar que los más relevantes estén en la parte superior.

El Resultado: Este método es como usar una lupa para encontrar agujas específicas en lugar de adivinar dónde está todo el pajar. Mejoró la capacidad del sistema para encontrar los videos correctos de una puntuación de 0.195 a 0.759 (un salto masivo).

Etapa 2: Los Verificadores de Hechos (Extracción de Información)

El Problema: Una vez que tienes los videos, no puedes simplemente alimentar el archivo de video completo a un escritor. El escritor necesita hechos específicos. Además, los videos pueden ser engañosos; a veces una persona dice algo que no es cierto, o el ángulo de la cámara es engañoso.

La Solución MARQUIS:
MARQUIS no solo "lee" el video; extrae "afirmaciones" específicas y luego las calibra.

  1. Tres Tipos de Notas:
    • Notas Generales: "Una mujer con un abrigo rojo está hablando". (Hechos que podrían ser útiles más adelante).
    • Afirmaciones Dirigidas: "El video muestra a 50 personas rescatadas". (Hechos que responden específicamente a tu pregunta).
    • Preguntas y Respuestas: El sistema hace preguntas específicas al video y obtiene respuestas.
  2. La Calibración (El Detector de Mentiras): Este es un paso crucial. Antes de que un escritor vea una afirmación, un modelo "calibrador" examina la afirmación y el video original lado a lado. Pregunta: "¿Este video prueba realmente esta oración?". Asigna una puntuación de probabilidad (de 0 a 1). Si el video no respalda la afirmación, esta se filtra.

La Analogía: Imagina un equipo de verificadores de hechos que lee cada oración que escribe un reportero y luego vuelve a la grabación original para verificarla. Si la grabación no coincide, la oración se tira a la basura.

Etapa 3: Los Escritores (Generación del Artículo)

El Problema: Incluso con buenos hechos, escribir un artículo fluido es difícil. Si le das a un escritor 500 puntos clave desconectados, podría escribir una lista desordenada. Si le das una transcripción de un video de 2 horas, podría perderse en los detalles y olvidar el punto principal.

La Solución MARQUIS:
El sistema ofrece tres formas de escribir el artículo, pero la mejor utiliza un enfoque estructurado:

  1. Agrupación: Agrupa los hechos verificados en temas (por ejemplo: "Bajas", "Esfuerzos de Rescate", "Respuesta del Gobierno").
  2. Resumen: Escribe una oración corta y citada para cada tema.
  3. Pulido: Une esas oraciones en una historia de noticias fluida y legible, asegurando que cada hecho tenga una cita (como [Video #45, 0:12-0:15]).

La Opción "Recursiva" (MARQUIS-RLM):
El artículo también introduce una IA especial de "Gerente" (basada en Modelos de Lenguaje Recursivos). En lugar de escribir solo una vez, este Gerente actúa como un gerente de proyecto con un cuaderno persistente.

  • Examina los hechos que tiene.
  • Se da cuenta: "Me falta el conteo de bajas para el distrito norte".
  • Vuelve a las Etapas 1 y 2, pide específicamente esa información faltante, la agrega a su cuaderno y verifica conflictos.
  • Solo cuando el cuaderno está lleno y consistente escribe el artículo final.

La Conclusión

El artículo afirma que al descomponer el problema —buscando de manera más inteligente, verificando los hechos estrictamente y organizando el proceso de escritura—, MARQUIS produce resultados mucho mejores que los métodos actuales.

  • Recuperación: Encontró los videos correctos con mucha más frecuencia.
  • Generación: Produjo artículos que los humanos calificaron más alto (3.83 de 5 frente a 3.09 para la línea base) porque eran más coherentes y tenían mejores fuentes.
  • Fiabilidad: El sistema está diseñado para estar "fundamentado", lo que significa que se niega a escribir hechos que no estén respaldados por la evidencia del video, evitando las "alucinaciones" comunes en otros sistemas de IA.

En resumen, MARQUIS convierte una pila caótica de 100,000 videos en un artículo de noticias fiable y bien documentado actuando como una redacción altamente organizada y de múltiples pasos, en lugar de un solo escritor abrumado.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →