← Neueste Arbeiten
🤖 AI

MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention

Das Papier stellt MOSS-Video-Preview vor, ein Framework zum Echtzeit-Verständnis von Videos, das eine Zwei-Kanal-Cross-Attention-Architektur verwendet, um Wahrnehmung von Generierung zu entkoppeln, was kontinuierliche Wahrnehmung, Antwortrevision und rechtzeitiges Schweigen ermöglicht und gleichzeitig signifikante Geschwindigkeitssteigerungen gegenüber Offline-Baselines bei minimalem Leistungsabfall erzielt.

Ursprüngliche Autoren: Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shan
Veröffentlicht 2026-06-09
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shanqing Gao, Yixian Tian, Chenghao Liu, Xinghao Wang, Botian Jiang, Xipeng Qiu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie schauen ein Live-Sportspiel im Fernsehen.

Der alte Weg (Offline): Sie warten, bis das Spiel komplett beendet ist, und drehen sich dann zu Ihrem Freund um und sagen: „Okay, hier ist, was passiert ist.“ Sie haben die Action verpasst, während Sie gesprochen haben.
Der aktuelle „Streaming“-Weg: Sie sprechen, während das Spiel läuft, aber in dem Moment, in dem Sie den Mund aufmachen, hören Sie auf, den Bildschirm zu beobachten. Wenn ein Tor geschossen wird, während Sie mitten im Satz sind, wissen Sie es erst, wenn Sie Ihren Satz beendet haben. Sie müssen warten, dann neu anfangen, um sich zu korrigieren.
Der neue Weg (MOSS-Video-Preview): Sie beobachten den Bildschirm und sprechen zur exakt gleichen Zeit. Wenn ein Tor geschossen wird, während Sie gerade sagen: „Das Team spielt gut“, unterbrechen Sie sich sofort selbst, sagen: „Warte, sie haben gerade getroffen!“, und aktualisieren Ihre Erzählung. Wenn nichts Interessantes passiert, bleiben Sie stumm und schauen einfach weiter zu.

Dieses Paper stellt MOSS-Video-Preview vor, ein neues KI-Modell, das genau das tut: gleichzeitig schauen und sprechen, ohne dass das eine das andere stoppt.

Hier ist die Erklärung, wie sie es geschafft haben, unter Verwendung einfacher Analogien:

1. Das Problem: Der „Stau“

Die meisten KI-Modelle von heute sind wie eine einspurige Straße. Um ein Video zu verstehen, muss das Modell jedes Frame lesen, dann aufhören zu lesen, um seine Antwort zu schreiben, und dann aufhören zu schreiben, um mehr Frames zu lesen. Dies erzeugt einen Stau. Das Modell kann nicht „neue Dinge sehen“, während es „spricht“.

2. Die Lösung: Die „Zweispurige Autobahn“

Die Autoren haben eine Zwei-Kanal-Architektur gebaut. Stellen Sie sich eine Autobahn mit zwei separaten Spuren vor:

  • Spur A (Die Augen): Diese Spur ist ausschließlich dem Beobachten des Videos gewidmet. Sie empfängt ständig neue Frames (Autos).
  • Spur B (Der Mund): Diese Spur ist ausschließlich dem Sprechen (Generieren von Text) gewidmet.

In älteren Modellen teilten sich „Augen“ und „Mund“ dieselbe Spur, sodass sie abwechseln mussten. In diesem neuen Modell speisen die „Augen“ Informationen von der Seite in den „Mund“ ein, wie ein Boxenstopp-Team, das einem Fahrer einen neuen Reifen übergibt, während das Auto noch fährt. Das Auto (die KI) muss nie anhalten, um die neuen Informationen zu erhalten.

3. Das Geheimrezept: „Cross-Attention“

Um dieses Zwei-Spur-System zum Laufen zu bringen, verwendeten sie eine spezielle Technik namens Cross-Attention.

  • Alter Weg: Stellen Sie sich vor, Sie versuchen ein Buch zu lesen, während Ihnen jemand die nächste Seite des Buches direkt ins Ohr schreit. Sie müssen aufhören zu lesen, um zuzuhören, und aufhören zuzuhören, um zu lesen.
  • Neuer Weg: Stellen Sie sich vor, Sie lesen ein Buch und ein Freund steht neben Ihnen. Wenn Sie wissen müssen, was auf der nächsten Seite steht, werfen Sie einfach einen Blick auf das Exemplar Ihres Freundes. Sie müssen nicht aufhören, Ihr eigenes Buch zu lesen, um dies zu tun. Der Freund (das Video) ist immer da und bereit, kurz angeblickt zu werden, ohne Ihren Lesefluss zu unterbrechen.

4. Die KI lehren, „den Mund zu halten“

Eine große Herausforderung besteht darin, dass eine KI, wenn sie ein Video beobachtet, das Gefühl haben könnte, sie müsse alles beschreiben, was sie sieht, selbst wenn nichts passiert.

  • Die Lösung: Das Team entwickelte eine spezielle Trainingsmethode. Sie brachten der KI eine neue Regel bei: „Wenn nichts Interessantes passiert, sag nichts.“
  • Sie verwendeten ein spezielles Token namens <|silence|>. Die KI lernt, dieses Token auszugeben, wenn sie eine statische Szene sieht. Es ist wie ein Sicherheitsmann, der nur spricht, wenn er einen Dieb sieht; ansonsten steht er einfach nur da und beobachtet.

5. Die Ergebnisse: Schneller und Schlauer

Die Autoren testeten dieses Modell (das sie als „Preview“ oder „Proof-of-Concept“ bezeichnen) und fanden heraus:

  • Geschwindigkeit: Da sich „Augen“ und „Mund“ nicht gegenseitig blockieren, ist das Modell viel schneller. Auf einem leistungsstarken Computer war es 5 Mal schneller beim Beginn des Sprechens und 2,7 Mal schneller beim kontinuierlichen Sprechen im Vergleich zu einem führenden bestehenden Modell, obwohl ihr Modell tatsächlich größer ist.
  • Genauigkeit: Es ist sehr gut darin, zu verstehen, wann Dinge passieren und wo sie passieren (räumliches und zeitliches Denken), was für die Echtzeit-Interaktion entscheidend ist.
  • Der Kompromiss: Es ist im Vergleich zu den größten, bekanntesten Modellen von heute etwas weniger gut darin, allgemeine Trivia zu beantworten oder Text aus Bildern zu lesen. Die Autoren geben zu, dass dies daran liegt, dass sie sich auf die neue Architektur und das Echtzeitverhalten konzentriert haben, anstatt nur das Modell größer zu machen oder es mit mehr Daten zu füttern.

Zusammenfassung

MOSS-Video-Preview ist ein Prototyp für eine KI, die wie ein Echtzeit-Beobachter agiert. Sie wartet nicht, bis das Video endet, und sie hört nicht auf zu schauen, um zu sprechen. Sie schaut, spricht, korrigiert sich sofort selbst, wenn sich Dinge ändern, und bleibt stumm, wenn es nichts zu sagen gibt.

Das Paper behauptet, dass dies beweist, dass Echtzeit-Video-Verständnis möglich ist, wenn man die richtige Architektur besitzt, selbst wenn das Modell noch nicht das absolut intelligenteste der Welt ist. Es ist ein „Proof of Concept“, der die Tür öffnet für zukünftige KI-Assistenten, die wirklich mit der Welt interagieren können, während diese geschieht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →