Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval
L'article présente ToolMerge, une nouvelle méthode de récupération d'images clés qui exploite un LLM pour décomposer les requêtes en appels d'outils spécifiques et fusionner leurs résultats via des opérateurs booléens, démontrant des performances compétitives sur le nouveau benchmark Molmo-2 Moments proposé.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous avez un film de 4 heures, et que quelqu'un vous pose une question très spécifique à son sujet, comme : « Que faisait l'homme en veste jaune juste avant de traverser la rivière ? »
Si vous tentiez de répondre à cela en regardant tout le film du début à la fin, cela prendrait une éternité. Si vous choisissiez simplement quelques images au hasard (comme feuilleter un album photo), vous manqueriez probablement le moment exact. C'est le problème que l'article aborde : Comment trouver les quelques secondes exactes d'une longue vidéo qui contiennent la réponse, sans regarder l'intégralité ?
Les auteurs proposent un nouveau système appelé ToolMerge. Voici comment il fonctionne, expliqué par de simples analogies.
1. Le problème des anciennes méthodes
Les systèmes précédents tentaient de résoudre ce problème de deux manières, toutes deux présentant des défauts :
- L'approche « Taille Unique » : Ils traitaient la question entière comme un seul terme de recherche géant. C'est comme demander à un bibliothécaire : « Trouvez-moi la page avec l'homme en veste jaune traversant la rivière. » Le bibliothécaire pourrait trouver une page avec une rivière, ou une page avec un homme, mais pas nécessairement la bonne combinaison.
- L'approche « Liste de contrôle rigide » : Ils tentaient de décomposer la question en une liste fixe d'objets (par exemple : « Trouver un homme », « Trouver une veste », « Trouver une rivière »). Mais la vie réelle est désordonnée. Parfois, vous devez chercher une action, parfois un objet, et parfois une couleur spécifique. Une liste de contrôle rigide manque la nuance.
2. La solution : ToolMerge (Le détective intelligent)
ToolMerge agit comme un détective intelligent qui sait utiliser différents outils pour résoudre une enquête. Au lieu de chercher la réponse en un seul bond géant, le détective décompose le travail.
Étape 1 : Le Planificateur (Le Cerveau)
D'abord, un « Planificateur » (un cerveau IA) lit la question. Au lieu de simplement rechercher la phrase entière, il décompose la question en tâches plus petites et spécifiques.
- Analogie : Si la question est « Que faisait l'homme en veste jaune ? », le Planificateur ne crie pas simplement « Veste jaune ! » dans le vide. Il dit : « D'accord, j'ai besoin de trois choses : 1. Trouver une scène avec une rivière. 2. Trouver un homme portant du jaune. 3. Trouver quelqu'un traversant l'eau. »
Étape 2 : Les Outils (Les Spécialistes)
Le Planificateur envoie ces petites tâches à différents outils « spécialistes ».
- Outil A (SigLIP) : C'est le Spécialiste des Scènes. Il regarde l'image entière pour trouver des ambiances générales (par exemple : « une rivière », « un canyon »).
- Outil B (T-REN) : C'est le Spécialiste des Objets. Il zoome pour trouver des choses spécifiques (par exemple : « un homme », « une veste jaune »).
- Outil C (OCR) : C'est le Lecteur de Texte. Il lit tous les mots écrits sur des panneaux ou des écrans dans la vidéo.
Étape 3 : La Fusion (Le Juge)
Maintenant, chaque outil a classé chaque image de la vidéo en fonction de la façon dont elle correspond à sa tâche spécifique. L'étape de « Fusion » combine ces classements.
- La règle « ET » : Si la question nécessite à la fois une rivière et un homme, le système recherche les images où les deux outils ont attribué un score élevé. C'est comme un diagramme de Venn ; la réponse doit se trouver au milieu, là où les cercles se chevauchent.
- La règle « OU » : Si la question demande « A-t-il traversé la rivière OU le pont ? », le système recherche les images qui satisfont l'une ou l'autre condition.
Enfin, le système sélectionne les 3 à 8 meilleures images ayant obtenu les scores les plus élevés selon toutes ces règles combinées et les remet à une IA finale « Répondeuse » pour fournir la réponse réelle.
3. Le nouveau test : Molmo-2 Moments (M2M)
Pour prouver que leur système fonctionne, les auteurs ont réalisé que les tests existants étaient injustes. Les anciens tests comportaient des questions qui pouvaient être répondues par devinettes ou en regardant des parties aléatoires de la vidéo.
Ils ont créé un nouveau test appelé Molmo-2 Moments (M2M).
- L'analogie : Imaginez un enseignant qui rédige un examen basé uniquement sur un clip spécifique de 10 secondes d'un film. L'enseignant sait exactement ce qui se passe dans ces 10 secondes. Si un élève répond correctement, il doit avoir regardé ces 10 secondes spécifiques. Il n'aurait pas pu le deviner à partir du reste du film.
- Cela garantit que si le système donne la bonne réponse, il a effectivement trouvé les bonnes images.
4. Les résultats
Lorsqu'ils ont testé ToolMerge :
- Il était meilleur pour trouver les bonnes images que les méthodes précédentes, en particulier pour des questions complexes impliquant plusieurs objets ou actions.
- Il a particulièrement bien performé sur la récupération de légendes. Si vous donnez au système une longue description détaillée d'une scène (comme une légende), ToolMerge est beaucoup plus efficace pour trouver le clip vidéo exact correspondant à cette description par rapport aux anciennes méthodes.
- Ils ont également montré que si vous « entraînez » un peu le Planificateur en utilisant un système de récompense spécifique (GRPO), il devient encore meilleur pour savoir quels outils utiliser.
Résumé
ToolMerge est un système qui ne tente pas de deviner la réponse à une question sur une longue vidéo d'un seul coup. Au lieu de cela, il agit comme un chef de projet : il décompose la question en petites tâches spécifiques, envoie ces tâches à différents outils spécialisés, puis combine les résultats pour trouver les quelques secondes exactes de la vidéo qui contiennent la vérité. Ils ont prouvé que cela fonctionne en créant un nouveau test plus strict où la réponse est verrouillée sur un moment précis dans le temps.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.