← Derniers articles
🤖 machine learning

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions

Cet article présente HyenaND, un opérateur sous-quadratique et dépendant de l'entrée qui applique des convolutions globales directement aux structures de données multidimensionnelles natives afin de surmonter les limites des modèles d'attention et récurrents standards, atteignant une précision compétitive et des accélérations significatives grâce à une implémentation CUDA spécialisée.

Auteurs originaux : David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Pali
Publié 2026-07-23
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot super intelligent à comprendre le monde. Actuellement, les meilleurs robots utilisent un outil appelé « attention » pour tout regarder en même temps, comme un étudiant parcourant une page entière de texte pour trouver les mots les plus importants. Cela fonctionne très bien pour des histoires courtes, mais si vous donnez au robot une bibliothèque entière, un film en 3D ou une carte météorologique complexe, l'outil d'« attention » est submergé. Il doit comparer chaque donnée avec toutes les autres, ce qui prend tellement de temps et d'énergie que le robot plante ou doit regarder les données à travers un minuscule trou de serrure (un processus appelé « patchification ») pour survivre.

Pour corriger cela, les scientifiques ont essayé de construire des outils plus rapides. Une idée populaire est d'utiliser des modèles « récurrents », qui lisent les données comme une ligne de texte, un mot après l'autre. Mais c'est comme essayer de comprendre une sculpture en 3D en ne la regardant que sous un seul angle, puis en devinant le reste ; cela détruit la forme naturelle de l'objet. Une autre idée est d'utiliser des « convolutions », qui sont comme le glissement d'une loupe sur une image pour repérer des motifs. Elles sont rapides et préservent la forme 3D, mais elles agissent généralement comme un tampon rigide, appliquant exactement le même motif à chaque partie de l'image sans prêter attention à ce qui s'y trouve réellement. La grande question dans ce domaine de l'informatique est la suivante : pouvons-nous construire un outil assez rapide pour gérer des données 3D massives, qui conserve la forme naturelle de ces données, et qui soit assez intelligent pour adapter sa « loupe » en fonction de ce qu'il voit ?

Ce document présente un nouvel outil appelé HyenaND qui répond par l'affirmative. Considérez HyenaND comme une loupe magique capable de changer de forme, qui peut glisser sur un objet en 3D (comme un scanner médical ou une simulation météorologique) sans jamais le lisser en une ligne 1D. Contra contrairement aux tampons rigides du passé, cet outil peut d'abord regarder l'objet entier, décider quel type de motif il doit trouver, puis ajuster instantanément sa lentille pour correspondre. Il y parvient grâce à une astuce mathématique ingénieuse impliquant les « transformées de Fourier » (une façon de transformer des images en ondes sonores pour les traiter plus rapidement) qui maintient une vitesse extrêmement élevée, ne croissant que légèrement à mesure que les données s'agrandissent, plutôt que d'exploser en termes de coûts.

Les auteurs ont découvert que HyenaND change la donne pour la gestion de données multidimensionnelles complexes. Dans leurs tests, ils ont montré que HyenaND peut accomplir des tâches qui feraient planter les outils d'« attention » standards à cause des limites de mémoire, comme l'analyse d'images médicales 3D ou la simulation de la dynamique des fluides. Lorsqu'ils l'ont testé sur un jeu de « copie » où le robot devait se souvenir d'une couleur spécifique dans une grille 3D, HyenaND s'est révélé des milliers de fois plus précis que les anciennes méthodes. Ils ont également construit un moteur logiciel spécial appelé nSubQ pour s'assurer que cette astuce mathématique s'exécute à la vitesse de l'éclair sur de vraies puces informatiques, transformant la vitesse théorique en gains de temps réels.

Le document suggère que, bien qu'HyenaND soit incroyablement puissant seul, il fonctionne encore mieux lorsqu'il est associé aux anciens outils d'« attention » dans une équipe hybride. Dans des expériences avec des séquences d'ADN, de la vision par ordinateur (ImageNet) et de l'imagerie médicale, ces équipes hybrides ont battu à la fois les modèles d'attention pure et les autres modèles rapides qui tentent de lire les données sur une ligne. Les auteurs soutiennent que nous n'avons plus besoin de choisir entre vitesse et intelligence ; nous pouvons avoir un outil qui respecte la géométrie 3D de nos données, qui passe à l'échelle pour des tailles massives, et qui continue de prêter une attention particulière aux détails. Ils concluent que cette approche élimine un goulot d'étranglement majeur, permettant à l'IA future de enfin « voir » le monde dans sa gloire 3D native et haute résolution, sans avoir à regarder à travers un minuscule trou de serrure.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →