← Derniers articles
🤖 AI

SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging

Cet article introduit SEMA, un mécanisme d'attention évolutif et efficace qui combine la localisation de jetons pour prévenir la dispersion des poids avec une moyenne arithmétique pour capturer le contexte global, surpassant ainsi les modèles existants d'attention linéaire et de vision Mamba dans les tâches de classification d'images.

Auteurs originaux : Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Publié 2026-07-17
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot à reconnaître un chat sur une photo. Pour ce faire, le robot utilise un outil spécial appelé « attention », qui agit comme un projecteur. Ce projecteur balaie l'image entière, décidant quels pixels sont importants (comme les oreilles du chat) et lesquels ne sont que du bruit de fond (comme un arbre flou). Le problème est qu'à mesure que la photo devient grande, le projecteur doit vérifier chaque pixel par rapport à tous les autres. Si la photo est petite, c'est rapide. Mais si la photo est immense, le robot est submergé, passant tellement de temps à vérifier les connexions qu'il tombe en panne de batterie avant même de pouvoir dire « chat ».

Les scientifiques ont essayé de résoudre cela en rendant le projecteur « linéaire », ce qui signifie qu'il vérifie les pixels de manière plus simple et plus rapide. Mais il y a un piège : ces projecteurs rapides perdent souvent leur concentration. À mesure que l'image s'agrandit, ils commencent à traiter chaque pixel comme étant d'égale importance, comme une lampe torche dont l'intensité aurait été tellement baissée qu'elle ne fait plus qu'une lueur uniforme sur toute la pièce. Le robot cesse de voir le chat et commence à voir un flou gris. Cet article, écrit par des chercheurs de l'Université de Californie à Irvine et de Qualcomm AI Research, s'attaque précisément à ce problème. Ils veulent construire un projecteur qui soit à la fois assez rapide pour gérer des images géantes et assez précis pour voir les détails.

Les chercheurs, dirigés par Nhat Thanh Tran et ses collègues, ont découvert une vérité mathématique qui explique pourquoi ces projecteurs rapides échouent : à mesure que le nombre de pixels (ou « tokens ») tend vers l'infini, le mécanisme d'attention se diffuse naturellement et devient inutile. Ils appellent cela le phénomène de « dispersion ». C'est comme essayer d'entendre un murmure dans un stade ; si vous essayez d'écouter tout le monde à la fois, vous n'entendrez rien d'autre que du bruit. L'article prouve que peu importe la façon dont vous modifiez les mathématiques de ces outils d'attention rapide, ils finiront par perdre leur concentration si l'image devient trop grande.

Pour résoudre cela, l'équipe a inventé une nouvelle méthode appelée SEMA (Scalable and Efficient Mamba-like Attention). Au lieu de lutter contre les mathématiques, ils ont décidé de composer avec elles. Ils ont réalisé que, bien que le projecteur doive se concentrer sur des détails spécifiques, il a aussi besoin d'un moyen de comprendre la « vue d'ensemble » sans s'y perdre. Ils ont donc conçu un système en deux parties. Premièrement, ils utilisent la Localisation de Tokens, qui revient à donner au projecteur une petite fenêtre pour regarder à travers. Il ne se concentre que sur un minuscule voisinage de pixels à la fois, garantissant qu'il ne soit jamais submergé ou distrait. Cela maintient la précision de la mise au point.

Mais regarder à travers une petite fenêtre a un inconvénient : le robot pourrait rater le chat entier s'il ne regarde qu'une patte. Pour corriger cela, SEMA ajoute une seconde étape : l'Averaging (le calcul de la moyenne). C'est comme prendre un cliché rapide et flou de toute la pièce et l'ajouter à la vue détaillée. Les chercheurs ont prouvé mathématiquement que lorsque l'image devient immense, la meilleure façon de capturer l'aspect « global » de l'image est simplement de faire la moyenne de tout. En combinant la vue détaillée du voisinage local avec cette moyenne globale simple, SEMA obtient le meilleur des deux mondों.

L'article montre que cette approche fonctionne incroyablement bien. Lorsqu'ils ont testé SEMA sur des jeux de données d'images standards comme ImageNet-1K, il a surpassé d'autres modèles populaires, y compris les récents modèles « Mamba », surtout lorsque les images étaient très grandes. Par exemple, lorsque la taille de l'image a été augmentée à 1024x1024 pixels, les autres modèles ont énormément peiné, voyant leur précision chuter, tandis que SEMA est resté solide et s'est même amélioré. Les chercheurs ont également constaté que SEMA était plus rapide que ses concurrents, prenant moins de temps pour traiter les images de grande taille.

L'un des aspects les plus intéressants de l'article est la façon dont ils ont géré le problème de la « dispersion ». Au lieu de forcer l'attention à rester nette d'une manière qui brise les mathématiques, ils ont accepté que, pour des images immenses, l'attention doive se diffuser. Ils ont utilisé cette nature diffuseuse à leur avantage en utilisant une moyenne simple pour représenter l'information globale. C'est un peu comme réaliser que si vous avez un million d'amis, vous ne pouvez pas vous souvenir de chaque détail de chacun d'entre eux, mais vous pouvez vous souvenir de l'ambiance générale du groupe. SEMA se souvient des détails du voisinage immédiat et de l'ambiance générale du groupe, permettant de reconnaître le chat parfaitement, quelle que soit la taille de la photo.

Les auteurs ont testé leur idée sur diverses tâches, allant de la reconnaissance d'objets à la détection de parties spécifiques d'une image (segmentation). Dans chaque cas, SEMA a montré qu'il pouvait passer à l'échelle supérieure pour des images plus grandes sans perdre la tête. Ils ont même montré qu'à mesure que les images devenaient plus grandes, la partie « moyennage » de leur système devenait plus importante, prouvant leur théorie selon laquelle cette étape simple est cruciale pour gérer des quantités massives de données. Bien que l'article se concentre sur la vision par ordinateur, l'équipe suggère que cette idée pourrait aider pour d'autres problèmes impliquant de longues séquences de données, comme l'analyse de scanners médicaux géants.

En résumé, SEMA est une astuce ingénieuse qui admet quand un projecteur devient trop large pour être utile et change de stratégie : regarder attentivement les détails à proximité, et prendre une moyenne rapide et simple du reste. C'est une manière évolutive, efficace et mathématiquement rigoureuse d'aider les ordinateurs à voir le monde clairement, même quand le monde devient très grand.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →