← Neueste Arbeiten
💻 computer science

Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras

Das Paper stellt „Spiking Patches“ vor, eine asynchrone und spärliche Tokenisierungsmethode für Ereigniskameras, welche deren einzigartige Eigenschaften bewahrt und gleichzeitig eine schnellere Inferenz sowie eine vergleichbare oder überlegene Genauigkeit gegenüber bestehenden Frame- und Voxel-basierten Ansätzen bei verschiedenen Vision-Aufgaben erreicht.

Ursprüngliche Autoren: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

Veröffentlicht 2026-09-02
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter und selbstfahrende Autos verlassen sich seit langem auf Standardkameras, die die Welt wie eine Filmkamera erfassen, indem sie jede Bruchteilsekunde ein vollständiges Bild einer Szene aufnehmen. Diese Methode funktioniert gut für viele Dinge, erzeugt aber eine schwere Datenlast, von der ein Großteil aus leerem Raum oder unveränderten Hintergründen besteht. Ein neuerer Sensortyp, bekannt als Event-Kamera, arbeitet nach einem anderen Prinzip. Anstatt vollständige Bilder aufzunehmen, zeichnet sie nur Veränderungen auf. Wenn ein Pixel auf dem Sensor eine Verschiebung der Helligkeit bemerkt, sendet er genau in diesem Moment ein einzelnes Signal, oder ein „Event“. Das bedeutet, dass die Kamera einen Strom isolierter Signale erzeugt, die asynchron ablaufen – also immer dann, wenn sich etwas ändert, anstatt in einem festen Rhythmus. Es bedeutet auch, dass die Daten spärlich sind und nur Informationen darüber enthalten, wo Bewegung oder Veränderung stattfand, während der Rest der Szene stumm bleibt. Obwohl dieser Ansatz unglaublich effizient und schnell ist, war es schwierig, diesen einzigartigen Signalstrom in die KI-Modelle einzuspeisen, die Roboter nutzen, um ihre Umgebung zu verstehen.

Jahrelang versuchten Forscher, dies zu lösen, indem sie diese asynchronen Signale in das alte, vertraute Format von Standardbildern zwangen. Sie gruppierten die Events in feste Zeitfenster, um ein Frame zu erstellen, ähnlich wie beim Zusammenfügen einer Serie von Schnappschüssen. Dieser Prozess zerstört jedoch genau die Qualitäten, die Event-Kameras so besonders machen. Indem man wartet, bis eine feste Zeit vergangen ist, bevor ein Bild erstellt wird, verliert das System die Fähigkeit, sofort auf plötzliche Veränderungen zu reagieren, und indem man die leeren Räume auffüllt, geht die Effizienz verloren, die durch die Beschränkung auf relevante Daten entsteht. Ein Team von Forschern der Technischen Universität Dänemark hat nun einen neuen Weg vorgeschlagen. Sie entwickelten eine neue Methode namens „Spiking Patches“, die Gruppen dieser sich ändernden Signale als einzelne Informationseinheiten behandelt, ohne sie in ein starres, zeitbasiertes Gitter zu zwingen. Dieser Ansatz ermöglicht es, dass die Daten asynchron und spärlich bleiben, wodurch die Geschwindigkeit und Effizienz des ursprünglichen Sensors bewahrt werden, während sie gleichzeitig mit leistungsstarken modernen KI-Modellen kompatibel sind.

Die Forscher entwarfen ihr System, indem sie untersuchten, wie biologische Neuronen arbeiten. Im Gehirn wartet ein Neuron, bis es genügend Signale erhalten hat, um einen bestimmten Schwellenwert zu erreichen, bevor es ein Aktionspotenzial (Spike) aussendet. Das Team wandte dieselbe Logik auf die Daten der Event-Kamera an. Sie unterteilten das Sichtfeld der Kamera in ein Gitter aus kleinen Quadraten, oder „Patches“. Wenn Events eintreffen, sammeln sie sich innerhalb jedes Patches an und erhöhen ein virtuelles Potenzial. Sobald die Anzahl der Events in einem Patch einen spezifischen Grenzwert erreicht, „feuert“ der Patch und erzeugt ein Token, das diese Gruppe von Events repräsentiert. Dieses Token wird dann zur Verarbeitung an das KI-Modell gesendet. Entscheidend ist, dass dieses Feuern unabhängig für jeden Patch und zum exakten Moment geschieht, in dem der Schwellenwert erreicht wird, anstatt darauf zu warten, dass ein Takt verstrichen ist. Dies bedeutet, dass das System auf ein schnell bewegtes Objekt sofort reagieren kann, sobald genügend Events akkumuliert sind, ohne auf den Aufbau eines vollständigen Frames warten zu müssen.

Um zu testen, ob diese Idee in der Praxis funktioniert, verglich das Team ihre „Spiking Patches“ mit den zwei gängigsten Wegen der Handhabung von Event-Daten: Standard-Frames und 3D-Datenblöcken, die als Voxels bezeichnet werden. Sie testeten die Methode auf drei verschiedenen Arten von KI-Architekturen, einschließlich Netzwerken, die für Graphen, Punktwolken und Transformer konzipiert sind, bei Aufgaben wie der Erkennung von Handgesten und der Detektion von Autos in Fahrvideos. Die Ergebnisse waren beeindruckend. In Bezug auf die Geschwindigkeit war die neue Methode signifikant schneller als die Alternativen. Bei der Erkennung von Gesten war das Spiking-Patches-System bis zu 3,4-mal schneller als die Voxel-Methode und bis zu 10,4-mal schneller als die Frame-basierte Methode. Dieser Geschwindigkeitsvorteil kam ohne Einbußen bei der Genauigkeit zustande; in vielen Fällen war die neue Methode genauso genau wie die älteren Verfahren, und in einigen Fällen war sie sogar noch genauer, wobei sie die Gestenerkennung um bis zu 3,8 Prozentpunkte und die Objekterkennung um bis zu 1,4 Prozentpunkte verbesserte.

Die Studie bestätigte auch, dass die Methode die Daten erfolgreich spärlich und asynchron hält. Die Forscher maßen, wie schnell das System genügend Informationen sammeln konnte, um auf eine Szene zu reagieren, im Vergleich zum rohen Event-Strom. Sie fanden heraus, dass das Spiking-Patches-System fast so schnell auf die rohen Events reagieren konnte, mit nur einer minimalen Verzögerung von wenigen Millisekunden, während die Frame-basierten Methoden gezwungen waren, ein festes Zeitintervall abzuwarten, was einen viel längeren Verzug verursachte. Darüber hinaus reduzierte die neue Methode die Menge der Daten, die der Computer verarbeiten musste, um mindestens um den Faktor 1,5 im Vergleich zu Frames und Voxels, und in einigen Fällen um das Hundertfache im Vergleich zum rohen Event-Strom. Diese Reduktion der Datengröße ist der Grund, warum das System so viel schneller laufen kann, da der Computer weniger Elemente analysieren muss.

Einer der praktischsten Aspekte dieser Entdeckung ist, dass das System schnell genug ist, um Echtzeit-Anwendungen zu bewältigen. Die Forscher implementierten den Tokenisierungsprozess in einer Programmiersprache, die für ihre Geschwindigkeit bekannt ist, und fanden heraus, dass das System Tokens schneller generieren kann, als neue Events an der Kamera eintreffen. Das bedeutet, dass das System mit dem Informationsfluss in realen Szenarien, wie etwa einem Auto, das auf einer Autobahn fährt, Schritt halten kann, ohne in Rückstand zu geraten. Das Team untersuchte auch, wie verschiedene Einstellungen die Leistung beeinflussten, und stellte fest, dass sie die Sensitivität des Systems anpassen können, um einen Kompromiss zwischen der Anzahl der generierten Tokens und der Präzision des Ergebnisses einzugehen. Beispielsweise konnten sie durch das Einführen einer kurzen Pause nach dem Feuern eines Patches die Anzahl der Tokens um das Vierfache reduzieren, während die Genauigkeit nahezu gleich blieb.

Obwohl die Ergebnisse vielversprechend sind, merken die Forscher an, dass die Methode eine sorgfältige Abstimmung des Schwellenwerts erfordert, der ein Token auslöst. Wenn der Schwellenwert zu niedrig angesetzt wird, könnte das System zu oft feuern und dadurch zu viele Daten erzeugen. Wenn er zu hoch angesetzt wird, könnte es wichtige Details übersehen. Das Team schlägt vor, dass zukünftige Arbeiten darauf abzielen könnten, diesen Schwellenwert automatisch an die Szene anzupassen. Sie planen auch, die Methode bei anderen Arten von Aufgaben zu testen, wie etwa der Verfolgung beweglicher Objekte oder der Berechnung des Bewegungsflusses in einer Szene. Für den Moment jedoch zeigt die Arbeit, dass es möglich ist, die Lücke zwischen der einzigartigen, asynchronen Natur von Event-Kameras und den leistungsstarken KI-Modellen zu schließen, die die moderne Robotik antreiben. Indem sie Gruppen von Events als einzelne, bedeutungsvolle Einheiten behandeln, haben die Forscher gezeigt, dass wir die Geschwindigkeit und Effizienz von Event-Kameras bewahren können, ohne die Fähigkeit zu verlieren, die fortschrittlichsten Werkzeuge der künstlichen Intelligenz zu nutzen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →