← Nieuwste papers
💻 computer science

Unifying Convolution and Attention via Convolutional Nearest Neighbors

Dit artikel introduceert Convolutional Nearest Neighbors (ConvNN), een verenigd raamwerk dat aantoont dat convolutie en self-attention speciale gevallen zijn van een enkelvoudig kk-nearest neighbor aggregatieproces, waardoor deze twee dominante computer vision-architecturen worden overbrugd en staat-van-de-kunst prestatieverbeteringen op ImageNet-1K worden bereikt.

Oorspronkelijke auteurs: Mingi Kang, Jeová Farias Sales Rocha Neto

Gepubliceerd 2026-07-02
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mingi Kang, Jeová Farias Sales Rocha Neto

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een complex schilderij te begrijpen. Hiervoor kun je op twee manieren naar het werk kijken:

  1. De "Lokale Buurman"-benadering (Convolutie): Je staat heel dicht bij een specifieke plek op het canvas en kijkt alleen naar het piepkleine vierkantje verf direct rondom je vinger. De rest negeer je. Dit is hoe traditionele Convolutional Neural Networks (CNNs) werken. Ze zijn erg goed in het zien van texturen en randen omdat ze zich richten op de directe ruimtelijke buren.
  2. De "Globale Gelijkenis"-benadering (Attention): Je doet een stap terug en bekijkt het hele schilderij. Je vraagt je af: "Welke andere delen van dit schilderij lijken op de plek waar ik naar kijk, zelfs als ze aan de tegenovergestelde kant zitten?" Je mengt die gelijkaardige delen vervolgens met elkaar. Dit is hoe Vision Transformers (ViT) werken. Ze zijn erg goed in het begrijpen van het grote plaatje omdat ze verre, gelijkaardige kenmerken met elkaar kunnen verbinden.

Lange tijd dachten computerwetenschappers dat deze twee methoden volkomen verschillende instrumenten waren die niet gemakkelijk te combineren waren.

Het Grote Idee: De "ConvNN"-tool

Dit paper introduceert een nieuwe, universele tool genaamd Convolutional Nearest Neighbors (ConvNN). De auteurs stellen dat de twee methoden hierboven eigenlijk niet verschillend zijn; ze zijn slechts twee uiteinden van hetzelfde spectrum.

Zie ConvNN als een slimme zoekmachine voor pixels.

  • Hoe het werkt: Wanneer de computer naar een specifieke pixel kijkt (de "query"), zoekt hij naar zijn "buren" om informatie te verzamelen.
  • De Twist: De computer kan zelf beslissen hoe hij deze buren vindt op basis van een regel die jij instelt:
    • Regel A (Ruimtelijke Nabijheid): "Zoek de buren die fysiek het dichtst bij mij staan." (Dit verandert de tool in een standaard convolutie).
    • Regel B (Kenmerk-gelijkenis): "Zoek de buren die het meest op mij lijken, ongeacht hoe ver weg ze zijn." (Dit verandert de tool in Self-Attention).

Het paper bewijst wiskundig dat als je de instellingen van dit ene instrument aanpast, je het precies kunt laten werken als een standaard convolutie of een standaard attention-mechanisme. Het verenigt hen in één enkel framework.

Hoe ze het hebben getest

De onderzoekers hebben niet alleen wiskunde bedreven; ze hebben werkende modellen gebouwd om te zien of dit idee de computers daadwerkelijk beter laat zien. Ze testten dit op ImageNet, een enorme database van 1,28 miljoen afbeeldingen die wordt gebruikt om AI te trainen.

1. Testen op "Lokale" Modellen (ResNet-50):
Ze namen een standaard beeldherkenningsmodel (ResNet-50) en voegden een "hybride tak" toe. Stel je een werknemer voor die normaal gesproken alleen naar de directe buurt kijkt (convolutie), maar nu een zijspan heeft die ook overal in de stad naar gelijkaardige objecten kan zoeken (ConvNN).

  • Resultaat: Dit hybride team presteerde aanzienlijk beter dan de werknemer alleen. Ze verbeterden de nauwkeurigheid met 3,0%.
  • Les: Je hoeft niet te kiezen tussen lokaal of globaal kijken; beide tegelijk doen is de winnende strategie.

2. Testen op "Globale" Modellen (Vision Transformer):
Ze namen een Transformer-model (ViT-Base) en vervingen de standaard "globale zoekopdracht" door hun nieuwe ConvNN-tool.

  • Resultaat: De nieuwe tool versloeg de originele Transformer met 0,7%.
  • Belangrijke Ontdekking: De standaard Transformer behandelt alle "beste matches" gelijk. De nieuwe ConvNN-tool leerde juist verschillende gewichten te geven aan verschillende matches. Het is als een bibliothecaris die niet zomaar de top 10 gelijkaardige boeken pakt, maar leert om de meest relevante onder die 10 te prioriteren. Dit maakte het model vooral goed in het afhandelen van grote groepen gelijkaardige items.

Waarom dit ertoe doet (in simpele termen)

  • Het is een Verenigende Theorie: Het laat zien dat convolutie en attention slechts verschillende instellingen zijn op dezelfde machine.
  • Het is Flexibel: Je kunt een systeem ontwerpen dat ergens in het midden zit, met een mix van ruimtelijke nabijheid en kenmerk-gelijkenis.
  • Het is Efficiënt: De auteurs hebben een speciale, snelle versie van deze tool gemaakt (met behulp van iets dat een "Triton kernel" wordt genoemd) die minder computergeheugen gebruikt en sneller draait, wat het praktisch maakt voor echt wereldgebruik.

Een opmerking over de training

De onderzoekers merkten ook iets interessants op over hoe het model leert. De nieuwe tool start trager dan de standaard methoden tijdens de vroege stadia van de training. Echter, wanneer de training dichter bij de finishlijn komt (wanneer de computer zijn antwoorden verfijnt), haalt de nieuwe tool de anderen in en overtreft deze uiteindelijk. Het lijkt erop dat de nieuwe tool een "laag en traag" leertempo nodig heeft om precies uit te vogelen hoe hij zijn buren moet wegen, terwijl standaard methoden rigider zijn en snel leren, maar minder snel verbeteren.

Samenvattend: Het paper introduceert een enkel, flexibel framework dat de kloof overbrugt tussen lokale en globale beeldverwerking. Door beide te behandelen als variaties van "het vinden van de dichtstbijzijnde buren", hebben ze een tool gecreëerd die wiskundig onderbouwd is, sneller draait en nauwkeuriger is dan de huidige koplopers in beide categorieën.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →