← Derniers articles
🤖 AI

VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

Le document présente VideoSEMA, un modèle de classification vidéo évolutif et efficace qui combine un mécanisme d'attention espace-temps fractionné de type Mamba avec une attention temporelle softmax, démontrant une précision et une robustesse de résolution supérieures par rapport aux modèles Vision Transformer et Mamba existants sur les benchmarks K400 et SSv2.

Auteurs originaux : Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Publié 2026-07-21
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot à comprendre un film. Vous ne pouvez pas simplement lui montrer une photo unique ; vous devez lui montrer un flux entier d'images changeant au fil du temps. C'est le monde de la compréhension vidéo, une branche de l'informatique où les machines apprennent à reconnaître des actions, comme quelqu'un qui épluche une pomme de terre ou une voiture qui tourne un virage. Pendant longtemps, la meilleure façon de faire cela était d'utiliser un cerveau géant et affamé appelé Transformer. Considérez un Transformer comme un bibliothécaire super organisé qui lit chaque page de chaque livre de la bibliothèque en même temps pour trouver des connexions. Il est incroyablement intelligent, mais il est submergé et devient lent lorsque la bibliothèque (la vidéo) devient trop grande ou que les livres (les images) sont trop détaillés.

Pour corrir cela, des scientifiques ont récemment inventé un nouveau type de cerveau appelé Mamba. Si le Transformer est un bibliothécaire qui lit tout en même temps, Mamba est un détective qui descend un couloir, se souvenant des indices au fur et à mesure qu'il avance, ce qui est beaucoup plus rapide. Cependant, même Mamba peut avoir du mal lorsque la vidéo est en haute définition ou très longue. La grande question pour les chercheurs est la suivante : pouvons-nous construire un cerveau vidéo aussi intelligent que les Transformers lourds mais aussi rapide et efficace que les nouveaux détectives Mamba ? C'est exactement le puzzle que le papier « VideoSEMA » tente de résoudre.

Les auteurs de ce papier, travaillant avec des chercheurs de Qualcomm AI Research et de l'Université de Californie, Irvine, ont construit un nouveau modèle appelé VideoSEMA. Ils n'ont pas seulement jeté un nouvel ingrédient dans la marmite ; ils ont créé un système divisé ingénieux. Imaginez regarder un film où vous avez deux façons différentes de prêter attention. D'abord, vous regardez une seule image (une photo fixe) et vous utilisez un œil spécial de type « Mamba » appelé SEMA. Cet œil est assez intelligent pour regarder une petite fenêtre de détails (comme la texture de la peau d'une pomme de terre) tout en prenant une moyenne globale rapide de toute la scène, le tout sans se fatiguer. Ensuite, pour comprendre comment l'histoire évolue, le modèle utilise une attention « douce » standard pour observer comment les choses changent d'une image à l'autre.

Le papier démontre que cette approche divisée n'est pas seulement un coup de chance ; les auteurs ont en fait prouvé mathématiquement que, sous certaines conditions, cette méthode divisée est aussi bonne que de regarder l'intégralité de la vidéo d'un seul coup. Lorsqu'ils ont testé VideoSEMA sur des jeux de données vidéo célèbres comme K400 (qui contient 400 types d'actions humaines) et SSv2 (qui se concentre sur des mouvements fins et complexes), les résultats ont été impressionnants. Sur le jeu de données K400, VideoSEMA a battu des modèles beaucoup plus grands et plus lourds, y compris d'autres modèles basés sur Mamba et de gros Transformers, tout en utilisant moins de ressources informatiques. Par exemple, à une résolution de 16 × 224², VideoSEMA a atteint une précision de 82,4 %, battant le précédent modèle Mamba (VideoMamba) qui affichait 80,8 %, et ce, malgré un nombre de paramètres inférieur.

L'une des découvertes les plus excitantes est la manière dont VideoSEMA gère les vidéos haute définition. Les chercheurs ont testé ce qui se passe lorsqu'ils nourrissent le modèle avec des vidéos ayant des résolutions beaucoup plus élevées, passant de 224² à 1024² (un bond énorme en termes de détails), sans réentraîner le modèle. L'ancien modèle Mamba (VideoMamba) s'est effondré brutalement, sa précision chutant de 80,8 % à 40,8 %. En revanche, VideoSEMA a bien mieux résisté, ne tombant qu'à 54,6 %. Cela suggère que VideoSEMA est beaucoup plus robuste lorsque les détails visuels deviennent complexes. Ils ont également constaté que sur le jeu de données SSv2, VideoSEMA pouvait obtenir de meilleurs résultats avec seulement 8 images de vidéo que d'autres modèles n'en avaient besoin pour 16 images, prouvant ainsi qu'il est très efficace pour saisir rapidement les bonnes informations.

Le papier écarte également certaines idées. Ils ont testé l'utilisation d'une convolution 3D simple (une façon standard de regarder la vidéo) et un bloc Mamba pur pour la partie temporelle de la vidéo, mais ont constaté que ni l'un ni l'autre ne fonctionnaient aussi bien qu'un mécanisme d'attention standard pour la dimension temporelle. Ils ont montré que si Mamba est excellent pour l'espace, il n'était pas le meilleur choix pour gérer la dimension du temps dans cette configuration spécifique. Les auteurs précisent avec prudence que, bien que leur modèle soit très prometteur, il est encore un travail en cours. Ils suggèrent que pour des vidéos encore plus longues, ils pourraient devoir ajouter une attention « éparse » ou « dilatée » à l'avenir pour gérer le temps supplémentaire sans ralentir. Mais pour l'instant, VideoSEMA est une nouvelle façon solide, efficace et évolutive pour les ordinateurs de comprendre le monde en mouvement qui nous entoure.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →