← Neueste Arbeiten
💻 computer science

X2SAM: Any Segmentation in Images and Videos

X2SAM ist ein einheitliches multimodales Large Language Model, das die Segmentierungsfähigkeiten von Bildern auf Videos erweitert, indem es ein LLM mit einem Mask Memory-Modul koppelt, wodurch eine qualitativ hochwertige, zeitlich konsistente Maskengenerierung sowohl aus konversationellen Anweisungen als auch aus visuellen Prompts über diverse Segmentierungsaufgaben hinweg ermöglicht wird.

Ursprüngliche Autoren: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

Veröffentlicht 2026-05-05
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen superintelligenten Assistenten, der ein Foto oder Video betrachten und Ihnen genau sagen kann, was passiert. Lange Zeit waren diese Assistenten hervorragend darin, das „große Ganze" zu beschreiben (wie „ein Hund, der in einem Park spielt"), aber schrecklich darin, spezifische Details zu erkennen (wie „zeichnen Sie einen Kreis um die linke Pfote des Hundes").

Auf der anderen Seite gibt es spezialisierte Werkzeuge, die fantastisch darin sind, diese präzisen Kreise (Masken) um Objekte zu zeichnen, die jedoch wie Roboter sind, die nur einfache Befehle wie „klicken Sie hier" oder „zeichnen Sie einen Kasten" verstehen. Sie verstehen keine komplexen Sätze wie: „Finden Sie den Hund, der dem roten Ball hinterherjagt, und zeichnen Sie einen Kreis um ihn."

X2SAM ist der neue „Super-Verbinder", der diese Lücke schließt. Es kombiniert das Gehirn eines konversationellen KI-Systems mit den Händen eines präzisen Zeichenwerkzeugs und funktioniert sowohl für stehende Fotos als auch für bewegte Videos.

Hier ist eine Aufschlüsselung der Funktionsweise, unter Verwendung einiger alltäglicher Analogien:

1. Der „Universalübersetzer" für Bilder und Videos

Stellen Sie sich X2SAM als einen Universalübersetzer vor, der sowohl „Menschen-Sprache" als auch „Pixel-Sprache" spricht.

  • Der alte Weg: Wenn Sie ein bestimmtes Objekt in einem Video finden wollten, mussten Sie möglicherweise ein Werkzeug verwenden, um das Video zu verstehen, und ein anderes Werkzeug, um den Umriss zu zeichnen. Diese beiden sprachen nicht gut miteinander.
  • Der X2SAM-Weg: Sie können einfach natürlich mit ihm sprechen. Sie können sagen: „Zeigen Sie mir die Person, die hin und her läuft in der Nähe der weißen Wand", oder sogar auf eine Stelle auf Ihrem Bildschirm zeigen und sagen: „Finden Sie, was sich in diesem Bereich befindet." X2SAM versteht die Anweisung und zeichnet sofort den Umriss für Sie, egal ob es sich um ein einzelnes Foto oder einen 10-Sekunden-Videoclip handelt.

2. Die „Gedächtnisbank" für bewegte Bilder

Dies ist das Geheimnis, das X2SAM für Videos besonders macht.

  • Das Problem: Wenn Sie eine Standard-KI bitten, eine Person in einem Video zu verfolgen, betrachtet sie oft jeden Frame (jedes Bild in einem Bruchteil einer Sekunde), als wäre es brandneu. Sie könnte die Person aus den Augen verlieren, wenn sie hinter einen Baum läuft oder wenn die Kamera wackelt.
  • Die X2SAM-Lösung: X2SAM verfügt über ein Masken-Gedächtnismodul. Stellen Sie sich dies als ein System mit „klebenden Notizen" vor. Während das Video läuft, notiert X2SAM, wo sich das Objekt im vorherigen Frame befand, und behält diese Notiz in seiner Tasche. Wenn es den nächsten Frame betrachtet, überprüft es seine Notizen und sagt: „Ah, ich weiß, dass diese Person gerade hier war, also ist sie wahrscheinlich immer noch hier." Dies ermöglicht es ihm, den Umriss des Objekts glatt und konsistent zu halten, selbst wenn sich das Objekt bewegt, versteckt wird oder seine Form ändert.

3. Das „Schweizer Taschenmesser" der Aufgaben

Die Arbeit behauptet, dass X2SAM eine riesige Vielfalt an Aufgaben mit einem einzigen System bewältigen kann, anstatt für jede Aufgabe ein anderes Werkzeug zu benötigen. Es kann Folgendes tun:

  • Generische Segmentierung: „Zeichnen Sie Umrisslinien für alles in diesem Bild."
  • Referenzierende Segmentierung: „Zeichnen Sie die Katze, die einen Hut trägt."
  • Schlussfolgernde Segmentierung: „Finden Sie das Objekt, das verwendet werden könnte, um Wasser in ein Glas zu gießen." (Es muss nachdenken, um zu erkennen, dass es ein Krug ist, und nicht nur nach dem Wort „Krug" suchen).
  • Visuell verankerte Segmentierung: Sie zeigen auf eine Stelle auf dem Bildschirm, und es zeichnet das Objekt, auf das Sie zeigen.
  • Konversation: Es kann mit Ihnen über das Bild oder Video plaudern, während es gleichzeitig die Masken zeichnet.

4. Wie es gelernt hat (Das Training)

Um so gut zu werden, haben die Forscher es nicht einfach nacheinander auf eine Sache trainiert. Sie verwendeten eine unifizierte gemeinsame Trainingsstrategie.

  • Die Analogie: Stellen Sie sich vor, Sie unterrichten einen Schüler. Anstatt ihm am Montag Mathematik und am Dienstag Geschichte beizubringen, bringen Sie ihm bei, mathematische Probleme unter Verwendung von Geschichtsfakten zu lösen, und umgekehrt, alles gleichzeitig.
  • X2SAM wurde gleichzeitig auf einer riesigen Mischung aus Bildern und Videos trainiert. Dies half ihm zu lernen, dass die Regeln zum Finden eines „Hundes" auf einem Foto ähnlich sind wie das Finden eines „Hundes" in einem Video, jedoch mit dem zusätzlichen Twist, sich daran zu erinnern, wo der Hund eine Sekunde zuvor war.

5. Der neue „Test" (V-VGD)

Die Autoren haben auch einen neuen Test namens Video Visual Grounded (V-VGD)-Segmentierung erstellt.

  • Die Analogie: Früher fragten Tests hauptsächlich: „Können Sie den Hund finden?" Der neue Test von X2SAM fragt: „Ich zeige auf eine Stelle auf dem Bildschirm in diesem Video; können Sie das Objekt finden, auf das ich zeige, und es verfolgen, während es sich bewegt?" Dies testet, ob die KI wirklich den Zusammenhang zwischen einem visuellen Hinweis und dem sich bewegenden Objekt versteht. X2SAM bestand diesen Test mit Bravour und schlug vorherige Modelle.

Zusammenfassung

X2SAM ist wie einem menschlichen Künstler ein Paar Augen zu geben, die jeden Pixel sehen können, ein Gehirn, das komplexe Sätze und Logik versteht, und ein Gedächtnis, das sich daran erinnert, wo Dinge vor einem Moment waren. Es ermöglicht Ihnen, ein natürliches Gespräch mit einem Computer zu führen, um spezifische Dinge in Fotos und Videos zu finden und zu umreißen, alles auf einmal.

Was es nicht tut (basierend auf der Arbeit):
Die Arbeit konzentriert sich ausschließlich auf die technische Fähigkeit, Objekte in Bildern und Videos zu segmentieren (zu umreißen). Sie behauptet nicht, für medizinische Diagnosen, selbstfahrende Autos oder Sicherheitsüberwachung verwendet zu werden, obwohl dies potenzielle zukünftige Anwendungen für eine solche Technologie sind. Es ist strikt ein Werkzeug zum Verstehen und Umreißen von visuellen Inhalten basierend auf Anweisungen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →