← Derniers articles
🤖 AI

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

Ce document présente VideoSearcher, un cadre agentique en boucle fermée qui exploite le raisonnement multi-outils et un nouvel algorithme d'apprentissage par renforcement nommé Bi-branch Sequence Policy Optimization (BiSPO) pour faire progresser la recherche vidéo approfondie (Video Deep Research) en unifiant la localisation temporelle, la focalisation spatiale et la recherche multimodale, accompagné du nouveau benchmark VideoSearch-QA pour l'évaluation.

Auteurs originaux : Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

Publié 2026-07-07
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un détective tentant de résoudre un mystère, mais au lieu d'une scène de crime, votre « scène de crime » est une vidéo longue et ennuyeuse.

Le Problème : Le Détective de la « Boîte Fermée »
La plupart des modèles d'IA vidéo actuels sont comme des détectives enfermés dans une pièce avec seulement le fichier vidéo. On leur dit : « Tout ce que vous devez savoir est dans cette vidéo. » Si la réponse n'est pas explicitement écrite ou montrée dans la vidéo, ils sont bloqués. Ils ne peuvent pas chercher un nom, vérifier une date ou vérifier un fait car ils n'ont pas le droit de sortir de la pièce.

La Solution : VideoSearcher
L'article présente VideoSearcher, un nouveau type de détective IA qui est autorisé à sortir de la pièce. Il traite la vidéo non pas comme la réponse finale, mais comme un indice.

Considérez VideoSearcher comme un détective possédant un smartphone, une loupe et une carte. Voici comment il fonctionne, étape par étape :

  1. Scanner la scène de crime (La Vidéo) : Le détective regarde la vidéo. Au lieu de fixer l'ensemble en même temps, il sait comment avancer rapidement vers les parties intéressantes (comme trouver un personnage spécifique) et zoomer sur de petits détails (comme lire une plaque d'immatriculation ou un logo).
  2. Appeler du renfort (Les Outils) : Une fois qu'il repère un indice (par exemple : « Cela ressemble à un personnage d'un jeu vidéo »), il ne devine pas. Il utilise ses outils :
    • Recherche d'image : Il prend une photo de l'indice et effectue une recherche sur Internet pour voir ce que c'est.
    • Recherche Web : Il lit des articles et des wikis pour trouver des faits sur ce personnage (comme « Quel est son coup spécial ? »).
  3. Tout assembler : Il combine ce qu'il a vu dans la vidéo avec ce qu'il a trouvé sur Internet pour donner la réponse finale.

La Recette Secrète : Comment il a appris
Enseigner cela à une IA est difficile. Si vous lui dites simplement « trouve la bonne réponse », elle pourrait avoir de la chance une fois mais échouer la fois suivante. Les auteurs ont créé une méthode d'entraînement spéciale appelée BiSPO (Bi-branch Sequence Policy Optimization).

Considérez cela comme l'entraînement d'un étudiant avec deux bulletins de notes distincts :

  • Bulletin A (La Réponse) : Avez-vous trouvé la bonne réponse finale ?
  • Bulletin B (Le Processus) : Avez-vous utilisé les bons outils ? Avez-vous zoomé au bon endroit ? Avez-vous cherché sur le web au bon moment ?

La plupart de l'entraînement des IA ne s'intéresse qu'au Bulletin A. VideoSearcher se soucie des deux. Cela garantit que l'IA ne se contente pas de deviner la réponse ; elle apprend l' habitude d'être un bon chercheur. Elle apprend à arrêter de chercher lorsqu'elle a assez d'informations et à chercher plus intensément lorsqu'elle est bloquée.

Le Nouveau Test : VideoSearch-QA
Les auteurs ont réalisé que les anciens tests n'étaient pas équitables car ils ne posaient que des questions répondables uniquement à partir de la vidéo. Ils ont donc construit un nouveau test appelé VideoSearch-QA.

Imaginez un test où l'on montre à un étudiant une vidéo d'un monument célèbre et on lui demande : « Quand a-t-il été inauguré ? » Si la vidéo ne montre pas une plaque avec la date, l'étudiant doit savoir qu'il faut faire une recherche. Ce nouveau benchmark teste exactement cela : l'IA peut-elle trouver l'indice dans la vidéo et ensuite aller trouver le reste de la réponse sur le web ouvert ?

Les Résultats
Lorsqu'ils ont testé VideoSearcher contre d'autres modèles d'IA (gratuits et coûteux), il a gagné. Il était bien meilleur pour :

  • Trouver des moments spécifiques dans de longues vidéos.
  • Utiliser Internet pour combler les lacunes.
  • Résoudre des questions complexes qui nécessitent à la fois de voir et de chercher.

En Résumé
VideoSearcher est une IA qui est passée du statut d'observateur passif à celui de chercheur actif. Elle ne se contente pas de « regarder » des vidéos ; elle les enquête, utilise des outils pour rassembler des preuves dans le monde réel, et résout des énigmes qui étaient auparavant impossibles à déchiffrer pour un ordinateur.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →