← Derniers articles
💻 computer science

MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation

MARQUIS est un pipeline à trois étapes qui améliore considérablement la génération augmentée par récupération vidéo en palliant les limites du traitement des requêtes complexes et de la synthèse multi-vidéos grâce à l'expansion de requêtes, l'extraction structurée de preuves et la génération d'articles contrôlée, atteignant ainsi des performances de pointe sur la tâche partagée MAGMaR2026.

Auteurs originaux : Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

Publié 2026-05-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Debashish Chakraborty, Dengjia Zhang, Jialiang Jin, Hanting Liu, Katherine Guerrerio, Hanxiang Qin, Tyler Skow, Alexander Martin, Reno Kriz, Benjamin Van Durme

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un journaliste chargé de rédiger un article de presse détaillé sur un événement complexe, comme une tempête massive ou une élection politique. Cependant, vous n'avez pas un seul reporter sur le terrain ; vous disposez plutôt d'une bibliothèque contenant 100 000 clips vidéo différents de l'événement, enregistrés par des centaines de caméras distinctes. Votre tâche consiste à trouver les bons clips, à déterminer ce qui s'est réellement passé dans chacun d'eux, et à rédiger un récit cohérent citant exactement quelle vidéo a prouvé chaque fait.

C'est le défi que relève le système MARQUIS. L'article soutient que les outils d'IA actuels sont inadaptés à cette tâche spécifique. Soit ils ne parviennent pas à trouver les bonnes vidéos lorsque la question est complexe, soit ils sont submergés en essayant de lire trop de vidéos à la fois, ce qui les conduit à halluciner (à inventer des choses).

MARQUIS résout ce problème en agissant comme une chaîne de montage éditoriale en trois étapes, décomposant la tâche massive en étapes plus petites et gérables.

Étape 1 : La recherche du détective (Récupération)

Le Problème : Si vous demandez à une IA : « Dis-moi tout sur les résultats de l'élection de 2025 », un moteur de recherche standard risque de se perdre. Il tente de transformer toute cette longue question en un seul « code de recherche » (embedding), ce qui fait souvent perdre les nuances. C'est comme essayer de trouver une aiguille spécifique dans une botte de foin en décrivant toute la botte d'un coup.

La Solution MARQUIS :
Au lieu d'une seule grande recherche, MARQUIS agit comme un détective qui décompose une grande affaire en petits indices.

  1. Décomposition : Il prend votre grande question et la divise en 20+ questions minuscules et spécifiques (par exemple : « Combien de sièges les Libéraux ont-ils remportés ? », « Quel a été le taux de participation ? », « Quels districts ont changé de camp ? »).
  2. Recherche parallèle : Il interroge la bibliothèque vidéo pour chacune de ces minuscules questions séparément.
  3. La Fusion : Il prend toutes les listes de vidéos trouvées pour les petites questions et les fusionne en une seule liste maîtresse.
  4. Le Re-rankage : Enfin, un « juge vidéo » spécialisé examine les meilleurs candidats et les réorganise pour s'assurer que les plus pertinents se trouvent tout en haut.

Le Résultat : Cette méthode revient à utiliser une loupe pour trouver des aiguilles spécifiques plutôt que d'essayer de deviner où se trouve toute la botte de foin. Elle a amélioré la capacité du système à trouver les bonnes vidéos, passant d'un score de 0,195 à 0,759 (un bond massif).

Étape 2 : Les vérificateurs de faits (Extraction d'informations)

Le Problème : Une fois les vidéos en main, vous ne pouvez pas simplement donner le fichier vidéo complet à un rédacteur. Le rédacteur a besoin de faits précis. De plus, les vidéos peuvent être trompeuses ; parfois, une personne dit quelque chose qui n'est pas vrai, ou l'angle de la caméra est biaisé.

La Solution MARQUIS :
MARQUIS ne se contente pas de « lire » la vidéo ; il extrait des « affirmations » spécifiques, puis les étalonne.

  1. Trois types de notes :
    • Notes générales : « Une femme en manteau rouge parle. » (Facts qui pourraient être utiles plus tard).
    • Affirmations ciblées : « La vidéo montre 50 personnes secourues. » (Facts répondant spécifiquement à votre question).
    • Questions-Réponses : Le système pose des questions spécifiques à la vidéo et obtient des réponses.
  2. L'étalonnage (Le détecteur de mensonges) : C'est une étape cruciale. Avant qu'un rédacteur ne voie une affirmation, un modèle « étalonneur » examine l'affirmation et la vidéo originale côte à côte. Il se demande : « Cette vidéo prouve-t-elle réellement cette phrase ? » Il attribue un score de probabilité (de 0 à 1). Si la vidéo ne soutient pas l'affirmation, elle est filtrée.

L'Analogie : Imaginez une équipe de vérificateurs de faits qui relit chaque phrase écrite par un reporter, puis retourne aux images brutes pour la vérifier. Si les images ne correspondent pas, la phrase est jetée à la poubelle.

Étape 3 : Les rédacteurs (Génération d'article)

Le Problème : Même avec de bons faits, rédiger un article fluide est difficile. Si vous donnez à un rédacteur 500 points à puces déconnectés, il risque de rédiger une liste désordonnée. Si vous lui donnez la transcription d'une vidéo de deux heures, il risque de se perdre dans les détails et d'oublier l'essentiel.

La Solution MARQUIS :
Le système propose trois façons de rédiger l'article, mais la meilleure utilise une approche structurée :

  1. Regroupement : Il regroupe les faits vérifiés par thèmes (par exemple : « Victimes », « Efforts de sauvetage », « Réponse gouvernementale »).
  2. Résumé : Il rédige une phrase courte et citée pour chaque thème.
  3. Polissage : Il assemble ces phrases en un récit journalistique fluide et lisible, en veillant à ce que chaque fait ait une citation (comme [Vidéo #45, 0:12-0:15]).

L'Option « Récursive » (MARQUIS-RLM) :
L'article introduit également un IA « Manager » spécial (basé sur des modèles de langage récursifs). Au lieu d'écrire une seule fois, ce Manager agit comme un chef de projet avec un carnet de notes persistant.

  • Il examine les faits dont il dispose.
  • Il réalise : « Il me manque le nombre de victimes pour le district nord. »
  • Il retourne aux étapes 1 et 2, demande spécifiquement cette information manquante, l'ajoute à son carnet, et vérifie les conflits.
  • Ce n'est que lorsque le carnet est complet et cohérent qu'il rédige l'article final.

La Conclusion

L'article affirme qu'en décomposant le problème — en recherchant de manière plus intelligente, en vérifiant strictement les faits et en organisant le processus de rédaction — MARQUIS produit des résultats bien supérieurs aux méthodes actuelles.

  • Récupération : A trouvé les bonnes vidéos beaucoup plus souvent.
  • Génération : A produit des articles notés plus haut par des humains (3,83 sur 5 contre 3,09 pour la référence) car ils étaient plus cohérents et mieux sourcés.
  • Fiabilité : Le système est conçu pour être « ancré », ce qui signifie qu'il refuse d'écrire des faits non étayés par des preuves vidéo, évitant ainsi les « hallucinations » courantes dans d'autres systèmes d'IA.

En bref, MARQUIS transforme un tas chaotique de 100 000 vidéos en un article de presse fiable et bien sourcé en agissant comme une rédaction hautement organisée et multi-étapes plutôt que comme un seul rédacteur submergé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →