← Derniers articles
💻 computer science

Unifying Convolution and Attention via Convolutional Nearest Neighbors

Cet article introduit les Convolutional Nearest Neighbors (ConvNN), un cadre unifié qui démontre que la convolution et l'auto-attention sont des cas particuliers d'un processus unique d'agrégation des kk plus proches voisins, reliant ainsi ces deux architectures dominantes de la vision par ordinateur et atteignant des améliorations de performance de l'état de l'art sur ImageNet-1K.

Auteurs originaux : Mingi Kang, Jeová Farias Sales Rocha Neto

Publié 2026-07-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mingi Kang, Jeová Farias Sales Rocha Neto

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de comprendre une peinture complexe. Pour ce faire, vous avez deux manières principales de regarder :

  1. L'approche du « Voisin Local » (Convolution) : Vous vous tenez très près d'un point précis de la toile et vous ne regardez que le minuscule carré de peinture immédiatement autour de votre doigt. Vous ignorez tout le reste. C'est ainsi que fonctionnent les réseaux de neurones convolutifs (CNN) traditionnels. Ils sont excellents pour percevoir les textures et les contours car ils se concentrent sur les voisins spatiaux immédiats.

  2. L'approche de la « Similitude Globale » (Attention) : Vous reculez pour regarder l'ensemble de la peinture. Vous vous demandez : « Quelles autres parties de cette peinture ressemblent à l'endroit que je regarde, même si elles se trouvent à l'autre bout ? » Vous mélangez ensuite ces parties similaires. C'est ainsi que fonctionnent les Vision Transformers (ViT). Ils sont excellents pour comprendre la vue d'ensemble car ils peuvent connecter des caractéristiques distantes et similaires.

Pendant longtemps, les informaticiens ont pensé que ces deux méthodes étaient des outils complètement différents qui ne pouvaient pas être mélangés facilement.

L'idée maîtresse : L'outil « ConvNN »

Ce document présente un nouvel outil universel appelé Convolutional Nearest Neighbors (ConvNN). Les auteurs soutiennent que les deux méthodes ci-dessus ne sont pas réellement différentes ; elles ne sont que les deux extrémités d'un même spectre.

Considérez le ConvNN comme un moteur de recherche intelligent pour les pixels.

  • Comment il fonctionne : Lorsqu'un ordinateur regarde un pixel spécifique (la « requête »), il recherche ses « voisins » pour collecter des informations.
  • Le rebondissement : L'ordinateur peut décider comment trouver ces voisins en fonction d'une règle que vous définissez :
    • Règle A (Proximité Spatiale) : « Trouvez les voisins qui sont physiquement les plus proches de moi. » (Cela transforme l'outil en une convolution standard).
    • Règle B (Similitude de Caractéristiques) : « Trouvez les voisins qui me ressemblent le plus, peu importe leur distance. » (Cela transforme l'outil en une auto-attention standard).

Le papier prouve mathématiquement que si vous ajustez les paramètres de cet outil unique, vous pouvez le faire agir exactement comme une convolution standard ou un mécanisme d'attention standard. Ils les unifient en un cadre unique.

Comment ils l'ont testé

Les chercheurs ne se sont pas contentés de mathématiques ; ils ont construit des modèles fonctionnels pour voir si cette idée aide réellement les ordinateurs à mieux voir. Ils l'ont testé sur ImageNet, une base de données massive de 1,28 million d'images utilisée pour entraîner l'IA.

1. Test sur des modèles « Locaux » (ResNet-50) :
Ils ont pris un modèle de reconnaissance d'image standard (ResNet-50) et y ont ajouté une « branche hybride ». Imaginez un travailleur qui ne regarde habituellement que le voisinage immédiat (Convolution), mais qui possède désormais un coéquipier capable de chercher des objets similaires n'importe où dans la ville (ConvNN).

  • Résultat : Cette équipe hybride a obtenu des performances nettement supérieures au travailleur seul. Elle a amélioré la précision de 3,0 %.
  • Leçon : Vous n'avez pas à choisir entre regarder localement ou globalement ; faire les deux ensemble est la stratégie gagnante.

2. Test sur des modèles « Globaux » (Vision Transformer) :
Ils ont pris un modèle Transformer (ViT-Base) et ont remplacé sa « recherche globale » standard par leur nouvel outil ConvNN.

  • Résultat : Le nouvel outil a battu le Transformer original de 0,7 %.
  • Découverte clé : Le Transformer standard traite tous ses « meilleurs correspondants » de manière égale. Le nouvel outil ConvNN a appris à attribuer des poids différents aux différents correspondants. C'est comme un bibliothécaire qui ne se contente pas de saisir les 10 livres les plus similaires, mais qui apprend à prioriser les plus pertinents parmi eux. Cela a rendu le modèle particulièrement efficace pour gérer de grands groupes d'éléments similaires.

Pourquoi cela importe (en termes simples)

  • C'est une théorie unificatrice : Cela montre que la Convolution et l'Attention sont simplement deux réglages différents sur la même machine.
  • C'est flexible : Vous pouvez concevoir un système qui se situe n'importe où entre les deux, en utilisant un mélange de proximité spatiale et de similitude de caractéristiques.
  • C'est efficace : Les auteurs ont créé une version spéciale et rapide de cet outil (utilisant ce qu'on appelle un « noyau Triton ») qui utilise moins de mémoire informatique et s'exécute plus rapidement, ce qui le rend pratique pour une utilisation réelle.

Une note sur l'entraînement

Les chercheurs ont également remarqué quelque chose d'intéressant sur la façon dont le modèle apprend. Le nouvel outil commence plus lentement que les méthodes standard lors des premières étapes de l'entraînement. Cependant, à mesure que l'entraînement approche de la fin (lorsque l'ordinateur affine ses réponses), le nouvel outil rattrape et finit par surpasser les autres. Il semble que le nouvel outil nécessite un rythme d'apprentissage « lent et progressif » pour comprendre exactement comment pondérer ses voisins, tandis que les méthodes standard sont plus rigides et apprennent rapidement mais cessent de s'améliorer plus tôt.

En résumé : Le document présente un cadre unique et flexible qui comble le fossé entre le traitement d'images local et global. En traitant les deux comme des variations de la « recherche de plus proches voisins », ils ont créé un outil mathématiquement fondé, plus rapide à exécuter et plus précis que les leaders actuels dans chacune de ces catégories.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →