← Derniers articles
🤖 AI

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

Le papier présente video-SALMONN S, un LLM audio-visuel en streaming enrichi par la mémoire qui utilise l'entraînement au moment du test pour convertir continuellement les représentations à court terme en une mémoire à long terme, lui permettant de traiter des vidéos de plus de 3 heures et de surpasser de manière significative les modèles existants sur les benchmarks d'apprentissage épisodique et de longue durée.

Auteurs originaux : Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

Publié 2026-02-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot à comprendre un film qui dure trois heures, mais que vous ne pouvez lui montrer qu'une image par seconde (une vue très lente et saccadée) et que l'image est un peu floue (résolution 360p). De plus, le robot possède un "cerveau" très petit (mémoire) qui ne peut contenir qu'une infime quantité d'informations à la fois.

La plupart des robots d'IA actuels oublient le début du film lorsqu'ils arrivent à la fin. Ce document présente un nouveau robot nommé video-SALMONN S qui résout ce problème. Voici comment il fonctionne, en utilisant des analogies simples :

1. Le Problème : Le « Seau Percé »

Imaginez que vous essayez de remplir un seau avec de l'eau (des informations vidéo) alors que le seau a un trou au fond.

  • Les anciens modèles d'IA sont comme des seaux avec de gros trous. Si vous versez une vidéo de 3 heures, l'eau (l'information) s'échappe avant que vous n'atteigniez la fin. Ils doivent jeter la majeure partie de la vidéo pour qu'elle tienne dans leur mémoire, donc ils oublient des détails importants.
  • Les modèles de streaming (les meilleurs actuellement) sont meilleurs, mais ils perdent tout de même des informations au fil du temps car ils doivent constamment supprimer les anciennes données pour faire de la place aux nouvelles.

2. La Solution : Le « Carnet de Notes Auto-Éditable » (TTT)

La recette secrète de video-SALMONN S est une technique appelée Test-Time Training (TTT).

  • L'analogie : Imaginez que vous lisez un livre très long. Au lieu de simplement lire et oublier, vous avez un carnet magique. Chaque fois que vous lisez une nouvelle page, vous ne vous contentez pas de la noter ; vous réécrivez votre propre cerveau en fonction de ce que vous venez de lire. Vous mettez à jour votre compréhension de l'histoire pendant que vous lisez.
  • Comment ça marche : À mesure que la vidéo défile, le modèle ajuste constamment ses propres paramètres internes (ses « poids ») pour stocker les détails de l'histoire. Il transforme les mémoires à court terme (ce qui vient de se passer) en mémoires à long terme (toute l'histoire) en changeant sa propre structure. C'est comme si le robot était en train d'« apprendre » la vidéo en temps réel, plutôt que de simplement la regarder.

3. L'astuce de la « Prédiction à Longue Portée »

Pour s'assurer que le robot n'oublie pas le début du film, les auteurs ont ajouté une règle spéciale appelée Long-Span Prediction.

  • L'analogie : Imaginez que vous jouez au jeu du « Téléphone Arabe » avec un ami, mais que le jeu dure 3 heures. Habituellement, le message finit par être déformé. Ce modèle a une règle : « Chaque fois que tu transmets un message, tu dois aussi vérifier si tu te souviens encore de ce qui a été dit il y a 30 minutes. »
  • Le résultat : Cela force le robot à garder les premières parties de la vidéo claires dans son esprit, même pendant qu'il traite les images les plus récentes.

4. Le « Bibliothécaire Intelligent » (Lecteur de Mémoire)

Même avec un carnet de notes magique, vous ne pouvez pas lire chaque page d'un livre de 3 heures lorsqu'on vous pose une question spécifique. Cela prendrait trop de temps.

  • L'analogie : Quand un utilisateur demande : « Que se passe-t-il ensuite ? », le robot agit comme un bibliothécaire intelligent. Au lieu de sortir l'intégralité des archives de 3 heures, il scanne rapidement sa mémoire, trouve les quelques pages exactes pertinentes pour la question, et ignore le reste.
  • Le bénéfice : Cela permet au robot de rester rapide et efficace, même s'il a regardé des heures de vidéo.

5. Le Nouveau Test : « ELViM » (Le Défi de la Mémoire)

Les auteurs ont réalisé que les tests existants étaient trop faciles ; ils ne posaient des questions que sur les vidéos que le robot était en train de regarder à l'instant présent. Ils ont créé un nouveau test appelé ELViM (Episodic Learning from Video Memory).

  • Le scénario : Le robot regarde une vidéo de quelqu'un en train de cuisiner un gâteau. Ensuite, il regarde 30 minutes d'autres vidéos (comme des documentaires sur la nature). Enfin, la vidéo de la pâtisserie réapparaît, mise en pause juste avant que le pâtissier ne casse un œuf.
  • La question : « Quelle est l'étape suivante ? »
  • L'objectif : Le robot doit se souvenir de l'étape de la pâtisserie d'il y a 30 minutes, ignorer les documentaires sur la nature entre-temps, et répondre correctement.
  • Le résultat : video-SALMONN S a écrasé ce test, obtenant 15 % de mieux que les meilleurs modèles précédents. Cela a prouvé que le robot pouvait réellement « se souvenir » de compétences apprises des heures auparavant.

Résumé des Réalisations

  • Il regarde de longues vidéos : Il peut gérer plus de 3 heures de vidéo à un faible taux d'images sans manquer de mémoire.
  • Il se souvient mieux : Il bat à plate couture les modèles de « streaming » (qui regardent en direct) et les modèles « offline » (qui voient toute la vidéo d'un coup) de manière significative (3 à 7 % de mieux sur les tests standards, 15 % de mieux sur le test de mémoire).
  • Il est efficace : Il n'a pas besoin d'un supercalculateur pour faire cela ; il respecte un budget de mémoire standard.

En bref, video-SALMONN S est la première IA capable de regarder un long film, d'en tirer des enseignements et de se souvenir des détails des heures plus tard, tout en maintenant une utilisation de sa mémoire petite et stable.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →