← Nieuwste papers
💻 computer science

Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras

Het artikel introduceert "Spiking Patches", een asynchrone en ijle tokenisatiemethode voor event-camera's die hun unieke eigenschappen behoudt terwijl deze snellere inferentie en vergelijkbare of superieure nauwkeurigheid bereikt ten opzichte van bestaande frame- en voxelgebaseerde benaderingen over diverse visietaken heen.

Oorspronkelijke auteurs: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

Gepubliceerd 2026-09-02
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots en zelfrijdende auto's vertrouwen al lang op standaardcamera's die de wereld vastleggen als een filmcamera, waarbij elke fractie van een seconde een volledige afbeelding van een scène wordt gemaakt. Deze methode werkt goed voor veel zaken, maar creëert een zware databelasting, waarvan een groot deel slechts lege ruimte of een onveranderde achtergrond is. Een nieuw type sensor, bekend als een event-camera, werkt volgens een ander principe. In plaats van volledige foto's te maken, registreert deze alleen veranderingen. Wanneer een pixel op de sensor een verschuiving in helderheid opmerkt, stuurt deze op dat exacte moment een enkel signaal, of 'event'. Dit betekent dat de camera een stroom van geïsoleerde signalen produceert die asynchroon zijn, wat wil zeggen dat ze plaatsvinden wanneer er iets verandert, in plaats van in een vast ritme. Het betekent ook dat de data schaars is, omdat het alleen informatie bevat over waar beweging of verandering heeft plaatsgevonden, terwijl de rest van de scène stil blijft. Hoewel deze aanpak ongelooflijk efficiënt en snel is, is het moeilijk gebleken om deze unieke datastroom in de kunstmatige intelligentiemodellen te voeden die robots gebruiken om hun omgeving te begrijpen.

Jarenlang hebben onderzoekers geprobeerd dit op te lossen door deze asynchrone signalen in het oude, vertrouwde formaat van standaardbeelden te dwingen. Ze groepeerden de events in vaste tijdsintervallen om een frame te creëren, vergelijkbaar met het aan elkaar naaien van een reeks snapshots. Echter, dit proces vernietigt precies de kwaliteiten die event-camera's zo bijzonder maken. Door te wachten tot er een vaste tijd is verstreken voordat er een beeld wordt gemaakt, verliest het systeem het vermogen om direct te reageren op plotselinge veranderingen, en door de lege ruimtes in te vullen, gaat het de efficiëntie verloren van het hebben van alleen de relevante data. Een team van onderzoekers aan de Technische Universiteit van Denemarken heeft nu een andere weg vooruit voorgesteld. Ze ontwikkelden een nieuwe methode genaamd Spiking Patches, die groepen van deze veranderende signalen behandelt als enkele eenheden van informatie, zonder ze in een rigide, tijdsgebaseerd rooster te dwingen. Deze aanpak zorgt ervoor dat de data asynchroon en schaars blijft, waardoor de snelheid en efficiëntie van de oorspronkelijke sensor behouden blijven terwijl deze compatibel wordt met krachtige moderne AI-modellen.

De onderzoekers ontwierpen hun systeem door te kijken naar de werking van biologische neuronen. In de hersenen wacht een neuron tot het genoeg signalen heeft ontvangen om een bepaalde drempelwaarde te bereiken voordat het een 'spike' afgeeft. Het team paste deze logica toe op de data van de event-camera. Ze verdeelden het gezichtsveld van de camera in een raster van kleine vierkantjes, of 'patches'. Terwijl events binnenkomen, hopen ze zich op binnen elke patch, waardoor een virtueel potentiaal stijgt. Zodra het aantal events in een patch een specifieke limiet bereikt, 'vuurt' de patch, wat een token creëert dat die groep events vertegenwoordigt. Deze token wordt vervolgens naar het AI-model gestuurd voor verwerking. Cruciaal is dat dit vuren onafhankelijk gebeurt voor elke patch en op het exacte moment dat de drempelwaarde wordt bereikt, in plaats van te wachten tot een klok tikt. Dit betekent dat het systeem direct kan reageren op een snel bewegend object zodra er genoeg events zijn opgehoopt, zonder te wachten tot een volledig frame is opgebouwd.

Om te testen of dit idee in de praktijk werkte, vergeleken het team hun Spiking Patches met de twee meest gebruikelijke manieren om event-data te verwerken: standaard frames en 3D-blokken van data die voxels worden genoemd. Ze testten de methode op drie verschillende soorten AI-architecturen, waaronder netwerken ontworpen voor grafen, puntenwolken en transformers, met taken zoals het herkennen van handgebaren en het detecteren van auto's in rijbeelden. De resultaten waren opmerkelijk. Wat betreft snelheid was de nieuwe methode aanzienlijk sneller dan de alternatieven. Bij het herkennen van gebaren was het Spiking Patches-systeem tot wel 3,4 keer sneller dan de voxel-methode en tot wel 10,4 keer sneller dan de frame-gebaseerde methode. Deze versnelling ging niet ten koste van de nauwkeurigheid; in veel gevallen was de nieuwe methode net zo nauwkeurig als de oudere methoden, en in sommige gevallen was het zelfs nauwkeuriger, met een verbetering van de gebarenherkenning met tot wel 3,8 procentpunt en de objectdetectie met tot wel 1,4 procentpunt.

De studie bevestigde ook dat de methode erin slaagde de data schaars en asynchroon te houden. De onderzoekers maten hoe snel het systeem genoeg informatie kon verzamelen om op een scène te reageren in vergelijking met de ruwe stroom van events. Ze ontdekten dat het Spiking Patches-systeem bijna net zo snel kon reageren als de ruwe events zelf, met slechts een minimale vertraging van enkele milliseconden, terwijl de frame-gebaseerde methoden gedwongen waren te wachten op een vast tijdsinterval, wat een veel langere vertraging introduceerde. Bovendien verminderde de nieuwe methode de hoeveelheid data die de computer moest verwerken met een factor van minstens 1,5 vergeleken met frames en voxels, en in sommige gevallen met honderden malen vergeleken met de ruwe event-stroom. Deze reductie in datagrootte is wat de computer in staat stelt om veel sneller te werken, omdat de computer minder items hoeft te analyseren.

Een van de meest praktische aspecten van deze ontdekking is dat het systeem snel genoeg is om real-time toepassingen te kunnen afhandelen. De onderzoekers implementeerden het tokenisatieproces in een programmeertaal die bekend staat om zijn snelheid en stelden vast dat het systeem tokens sneller kan genereren dan nieuwe events bij de camera aankomen. Dit betekent dat het systeem de informatiestroom in real-world scenario's, zoals een auto die over een snelweg rijdt, kan bijhouden zonder achter te blijven. Het team onderzocht ook hoe verschillende instellingen de prestaties beïnvloedden, en ontdekte dat ze de gevoeligheid van het systeem konden aanpassen om een afweging te maken tussen het aantal gegenereerde tokens en de precisie van het resultaat. Bijvoorbeeld, door een korte pauze in te lassen nadat een patch is afgevuurd, konden ze het aantal tokens met een factor vier verminderen terwijl de nauwkeurigheid bijna gelijk bleef.

Hoewel de resultaten veelbelovend zijn, merken de onderzoekers op dat de methode zorgvuldige afstemming vereist van de drempelwaarde die een token triggert. Als de drempelwaarde te laag wordt ingesteld, kan het systeem te vaak vuren, wat te veel data creëert. Als deze te hoog is, kan het belangrijke details missen. Het team suggereert dat toekomstig werk zich kan richten op het automatisch laten aanpassen van deze drempelwaarde aan de scène. Ze zijn ook van plan de methode te testen op andere soorten taken, zoals het volgen van bewegende objecten of het berekenen van de bewegingsstroom in een scène. Voor nu demonstreert het werk echter dat het mogelijk is om de kloof te overbruggen tussen de unieke, asynchrone aard van event-camera's en de krachtige AI-modellen die moderne robotica aansturen. Door groepen events te behandelen als enkele, betekenisvolle eenheden, hebben de onderzoekers aangetoond dat we de snelheid en efficiëntie van event-camera's kunnen behouden zonder het vermogen te verliezen om de meest geavanceerde tools in kunstmatige intelligentie te gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →