← Neueste Arbeiten
🤖 AI

VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

Das Paper stellt VideoSEMA vor, ein skalierbares und effizientes Videoklassifizierungsmodell, das einen Mamba-ähnlichen Split-Space-Time-Attention-Mechanismus mit Softmax-Temporal-Attention kombiniert und eine überlegene Genauigkeit sowie Auflösungsrobustheit im Vergleich zu bestehenden Vision-Transformer- und Mamba-Modellen auf den K400- und SSv2-Benchmarks demonstriert.

Ursprüngliche Autoren: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Veröffentlicht 2026-07-21
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Roboter beizubringen, einen Film zu verstehen. Sie können ihm nicht einfach nur ein einzelnes Foto zeigen; Sie müssen ihm einen ganzen Strom von Bildern zeigen, die sich im Laufe der Zeit verändern. Dies ist die Welt des Video-Verständnisses (Video Understanding), eines Zweigs der Informatik, bei dem Maschinen lernen, Handlungen zu erkennen, wie zum Beispiel das Schälen einer Kartoffel oder das Abbiegen eines Autos. Lange Zeit war der beste Weg, dies zu erreichen, die Verwendung eines riesigen, hungrigen Gehirns namens Transformer. Stellen Sie sich einen Transformer wie einen superorganisierten Bibliothekar vor, der jedes einzelne Blatt aus jedem Buch in der Bibliothek gleichzeitig liest, um Verbindungen zu finden. Er ist unglaublich intelligent, aber er wird überfordert und langsam, wenn die Bibliothek (das Video) zu groß oder die Bücher (die Einzelbilder/Frames) zu detailliert werden.

Um dies zu beheben, haben Wissenschaftler kürzlich eine neue Art von Gehirn namens Mamba erfunden. Wenn der Transformer ein Bibliothekar ist, der alles auf einmal liest, dann ist Mamba ein Detektiv, der durch den Flur geht und dabei Hinweise im Vorbeigehen merkt, was viel schneller ist. Dennoch kann auch Mamba Schwierigkeiten bekommen, wenn das Video hochauflösend oder sehr lang ist. Die große Frage für Forscher ist: Können wir ein Video-Gehirn bauen, das so intelligent wie die schweren Transformer, aber so schnell und effizend wie die neuen Mamba-Detektive ist? Genau dieses Rätsel versucht das Paper „VideoSEMA“ zu lösen.

Die Autoren dieser Arbeit, die mit Forschern von Qualcomm AI Research und der University of California, Irvine, zusammengearbeitet haben, haben ein neues Modell namens VideoSEMA entwickelt. Sie haben nicht einfach nur eine neue Zutat in den Topf geworfen; sie haben ein cleveres Splitsystem erschaffen. Stellen Sie sich vor, Sie schauen einen Film, bei dem Sie zwei verschiedene Arten haben, Aufmerksamkeit zu schenken. Zuerst betrachten Sie ein einzelnes Frame (ein Standbild) und nutzen ein spezielles „Mamba-ähnliches“ Auge namens SEMA. Dieses Auge ist intelligent genug, um ein kleines Fenster von Details (wie die Textur einer Kartoffelschale) zu betrachten, während es gleichzeitig einen schnellen, globalen Durchschnitt der gesamten Szene erfasst, ohne dabei müde zu werden. Dann verwendet das Modell, um zu verstehen, wie sich die Geschichte bewegt, eine standardmäßige „weiche“ Attention (Aufmerksamkeit), um zu beobachten, wie sich die Dinge von einem Frame zum nächsten verändern.

Das Paper zeigt, dass dieser Split-Ansatz nicht nur ein glücklicher Zufall ist; sie haben tatsächlich mathematisch bewiesen, dass dieser Split-Ansatz unter bestimmten Bedingungen genauso gut ist, wie wenn man das gesamte Video auf einmal betrachten würde. Als sie VideoSEMA auf berühmten Video-Datensätzen wie K400 (der 400 Arten menschlicher Handlungen enthält) und SSv2 (der sich auf schwierige, feingliedrige Bewegungen konzentriert) testeten, waren die Ergebnisse beeindruckend. Auf dem K400-Datensatz schlug VideoSEMA viel größere und schwerere Modelle, einschließlich anderer Mamba-basierter Modelle und großer Transformer, unter Verwendung weniger Computerressourcen. Beispielsweise erreichte VideoSEMA bei einer Auflösung von 16 × 224² eine Genauigkeit von 82,4 % und schlug damit das vorherige Mamba-Modell (VideoMamba), das 80,8 % erreichte, obwohl VideoSEMA weniger Parameter hatte.

Eine der spannendsten Erkenntnisse ist, wie VideoSEMA mit hochauflösenden Videos umgeht. Die Forscher testeten, was passiert, wenn sie dem Modell Videos mit viel höheren Auflösungen fütterten, wobei sie die Auflösung von 224² auf 1024² skalierten (ein riesiger Sprung in der Detailtiefe), ohne das Modell neu zu trainieren. Das alte Mamba-Modell (VideoMamba) brach massiv ein und sank in seiner Genauigkeit von 80,8 % auf 40,8 % ab. Im Gegensatz dazu hielt sich VideoSEMA viel besser und sank nur auf 54,6 %. Dies deutet darauf an, dass VideoSEMA wesentlich robuster ist, wenn die visuellen Details komplizierter werden. Sie fanden auch heraus, dass VideoSEMA auf dem SSv2-Datensatz bessere Ergebnisse mit nur 8 Frames erzielen konnte, als andere Modelle 16 Frames benötigten, um ein ähnliches Niveau zu erreichen, was beweist, dass es sehr effizient darin ist, die richtigen Informationen schnell zu erfassen.

Das Paper schließt auch einige Ideen aus. Sie testeten die Verwendung einer einfachen 3D-Konvolution (eine Standardmethode, um Videos zu betrachten) und eines reinen Mamba-Blocks für den zeitbasierten Teil des Videos, fanden jedoch, dass keiner von beiden so gut funktionierte wie die Verwendung eines Standard-Attention-Mechanismus für die Zeitdimension. Sie zeigten, dass Mamba zwar großartig für den Raum ist, aber in diesem spezifischen Setup nicht die beste Wahl war, um die Zeitdimension zu handhaben. Die Autoren weisen vorsichtig darauf hin, dass ihr Modell zwar sehr vielversprechend ist, aber noch eine laufende Arbeit darstellt. Sie schlagen vor, dass sie für noch längere Videos in Zukunft möglicherweise „sparse“ (dünnbesetzte) oder „dilated“ (erweiterte) Attention hinzufügen müssen, um die zusätzliche Zeit zu bewältigen, ohne die Geschwindigkeit zu drosseln. Aber für den Moment ist VideoSEMA ein starker, effizienter und skalierbarer neuer Weg für Computer, um die sich bewegende Welt um uns herum zu verstehen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →