← Neueste Arbeiten
💬 NLP

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed führt ein vereinheitlichtes, Decoder-only-basiertes multimodales Embedding-Modell ein, das sowohl dünnbesetzte lexikalische als auch dichte Repräsentationen in einem einzigen kausalen Vorwärtspass generiert und dabei eine Spitzenleistung bei multimodalen Benchmarks erzielt, während es gleichzeitig effiziente agentische Anwendungen ermöglicht.

Ursprüngliche Autoren: Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

Veröffentlicht 2026-08-04
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, ein bestimmtes Buch in einer riesigen, chaotischen Bibliothek zu finden. Lange Zeit nutzten Bibliothekare einen einfachen Trick: Sie suchten nach exakten Wörtern. Wenn Sie nach „Katze“ fragten, fanden sie nur Bücher, in denen das Wort „Katze“ vorkam. Das ist schnell und einfach, aber ein wenig dumm; es übersieht Bücher über „Feliden“ oder „Kätzchen“, die das Wort „Katze“ nie verwendet haben. Um dies zu beheben, erfanden Wissenschaftler „schlaue“ Suchmaschinen, die Bedeutung verstehen. Diese Motoren verwandeln Ihre Frage und die Bücher in lange Listen von Zahlen (genannt „dichte Vektoren“). Es ist, als würde man jedem Buch einen einzigartigen Fingerabdruck basierend auf seiner Stimmung und Geschichte geben. Das ist großartig für das Verständnis, aber schwerfällig, langsam und manchmal schwer zu erklären, warum ein Buch ausgewählt wurde.

Stellen Sie sich nun eine neue Art von Bibliothekar vor, der beide Aufgaben gleichzeitig erledigen kann. Er kann Ihnen sowohl den „Stimmungs-Fingerabdruck“ als auch eine Liste der wichtigsten Schlagwörter liefern – und das mit einem einzigen, blitzschnellen Blick. Dies ist die Welt der Informationsabfrage (Information Retrieval), die Wissenschaft des Findens von Nadeln im digitalen Heuhaufen. Die große Frage, die Forscher gestellt haben, lautet: Können wir ein einziges, super-intelligentes Gehirn bauen, das sowohl die Suche nach „exakten Wörtern“ als auch die Suche nach „bedeutungsbasierter“ Information bewältigt, ohne zwei verschiedene, klobige Systeme zu benötigen? Und kann dieses Gehirn nicht nur Text, sondern auch Bilder, Videos und Dokumente gleichzeitig verstehen? Hier beginnt die Geschichte einer neuen Erfindung namens UEmbed.

Die Ein-Gehirn-Lösung: UEmbed

Lernen Sie UEmbed (Unified Embedding) kennen, eine neue Art von Computergehirn, das von Forschern der Alibaba, der Chinesischen Akademie der Wissenschaften und der Yale University entwickelt wurde. Denken Sie an UEmbed als einen vielseitigen Superhelden, der sich weigert, sich zwischen einem „Wort-Zauberer“ und einem „Bedeutungs-Meister“ zu entscheiden. In der Vergangenheit mussten Sie, wenn Sie eine Suchmaschine wollten, die tiefe Bedeutungen verstand, ein schweres, langsames System verwenden. Wenn Sie eine wollten, die schnell war und Schlagwörter nutzte, mussten Sie ein einfacheres, „dümmeres“ System verwenden. Normalerweise konnten Sie nicht beides in einem Paket haben, besonders wenn es um Bilder und Videos ging.

UEmbed verändert das Spiel durch die Verwendung einer „Decoder-only“-Architektur. Um eine einfache Analogie zu verwenden: Stellen Sie sich vor, eine Standard-Suchmaschine ist wie eine Person, die ein Buch von Anfang bis Ende liest und dabei hin und her schaut, um die ganze Geschichte zu verstehen (dies nennt man „bidirektional“). UEmbed hingegen ist wie ein Geschichtenerzähler, der der ganzen Geschichte zuhört und am Ende sofort zwei Arten der Zusammenfassung liefert: erstens, indem er Ihnen einen „Stimmungs-Score“ gibt (den dichten Teil), und zweitens, indem er die 10 bis 20 wichtigsten Wörter laut ausruft, die ihm gerade in den Sinn gekommen sind (den spärlichen Teil). Er erledigt all das in einem einzigen Durchgang, wie das Umlegen eines Schalters.

Wie es funktioniert: Die Magie spezieller Token

Wie schafft es dieses Gehirn also, Schlagwörter auszurufe, während es gleichzeitig die ganze Geschichte versteht? Das Geheimrezept ist ein cleverer Trick mit „speziellen Token“.

Stellen Sie sich vor, Sie schreiben eine Geschichte und hängen ganz am Ende ein paar unsichtbare, magische Klebezettel an. Im Fall von UEmbed hängen die Forscher 16 dieser speziellen Notizen (Token) an das Ende der Eingabe. Bevor der Computer zu lesen beginnt, unterteilt er das gesamte Wörterbuch (das Vokabular) in 16 verschiedene Gruppen, so wie man eine riesige Kiste mit LEGO-Steinen in 16 verschiedene farbige Behälter sortiert.

Während der Computer Ihr Bild, Video oder Ihren Text liest, verarbeitet er die Geschichte. Wenn er an jenen 16 magischen Klebezetteln am Ende ankommt, wird jedem Zettel eine spezifische Aufgabe zugewiesen: „Du bist zuständig für den roten Behälter der Wörter“, „Du kümmerst dich um den blauen Behälter“ und so weiter. Jeder Zettel sieht sich die ganze Geschichte an, die er gerade gehört hat, und entscheidet: „Basierend auf dem, was ich gehört habe, sind dies die wichtigsten Wörter aus meinem Farbbehälter.“

Wenn der Computer fertig ist, hat er 16 kleine Listen wichtiger Wörter. Er fügt sie alle zusammen, um eine massive, super-detaillierte Liste von Schlagwörtern (den spärlichen Vektor) zu erstellen. Gleichzeitig nimmt er die „Stimmung“ der gesamten Geschichte, um den dichten Fingerabdruck zu erstellen. Dieses clevere Partitionieren löst ein großes Problem: Normalerweise kann ein Computergehirn nur ein einziges „Zusammenfassungs-Token“ verwenden, um eine ganze Geschichte zu beschreiben, was nicht ausreicht, um alle Schlagwörter festzuhalten. Durch die Verwendung von 16 verschiedenen Token verteilt UEmbed die Arbeit, was es ermöglicht, gleichzeitig sowohl schlagwortreich als auch bedeutungreich zu sein.

Was die Zahlen sagen

Die Forscher testeten UEmbed bei einigen der schwierigsten Herausforderungen der Welt der Suche. Sie betrachteten nicht nur Text; sie warfen Bilder, Videos und komplexe Dokumente darauf.

  • Der große Score: In einem massiven Benchmark namens MMEB-v2, der testet, wie gut Modelle verschiedene Arten von Medien verstehen, erreichte die größte Version von UEmbed (das 9B-Modell, das 9 Milliarden Parameter besitzt) einen Wert von 71,8 für seine „Stimmungs“-Suche und 71,0 für seine „Schlagwort“-Suche.
  • Der Vergleich: Dies ist eine große Sache. Normalerweise hinkt die schlagwortbasierte Suche hinter der „Stimmungs“-Suche hinterher. Hier ist der Schlagwort-Modus von UEmbed fast so gut wie sein Stimmungs-Modus, und er schlägt fast alle anderen Modelle, die auf öffentlichen Daten trainiert wurden. Zum Beispiel übertraf es ein 7-Milliarden-Parameter-Modell namens RzenEmbed-V2-7B (das 71,1 erreichte) und ein 2-Milliarden-Parameter-Modell namens Embed-RL-4B (das 68,1 erreichte).
  • Die Effizienz: Da UEmbed wie ein „Decoder-only“-Modell aufgebaut ist (die gleiche Art, die auch bei populären Chatbots verwendet wird), arbeitet es gut mit Hochgeschwindigkeitsservern zusammen. Es kann diese dualen Ergebnisse unglaublich schnell generieren, was es für den praktischen Einsatz in der realen Welt tauglich macht.

Warum das wichtig ist: Der „Agent“-Vorteil

Das Paper legt nahe, dass dieser Dual-Power-Ansatz nicht nur ein netter Trick ist, sondern eine praktische Notwendigkeit für die Zukunft von KI-„Agenten“ – smarten Programmen, die das Web durchsuchen und Aufgaben für Sie erledigen.

Wenn ein KI-Agent versucht, ein Problem zu lösen, stellt er oft kurze, schlagwortlastige Fragen wie „bestes Pizza in der Nähe“ oder „wie repariere ich ein Leck“. Die dichte „Stimmungs“-Suche übersieht diese manchmal, weil sie nach tiefer Bedeutung sucht, während die Schlagwortsuche zwar schnell, aber „dumm“ ist. UEmbed bietet das Beste aus beiden Welten. In Tests auf einem Benchmark namens BrowseComp-Plus fanden die Forscher heraus, dass die Verwendung des Schlagwort-Modus von UEmbed dem KI-Agenten half, die richtigen Informationen mit weniger Suchversuchen zu finden, was Zeit und Rechenleistung spart.

Die Grenzen und die Zukunft

Die Autoren weisen vorsichtig darauf hin, dass UEmbed noch nicht perfekt ist. Sie stellten fest, dass das Modell manchmal bei Sprachen außer Englisch und Chinesisch etwas verwirrt ist, wahrscheinlich weil es hauptsächlich auf diesen beiden trainiert wurde. Sie sahen auch, dass die „magischen Klebezettel“ manchmal seltsame, nicht-standardisierte Wörter ausrufen (wie „_alt“ oder „_perm“), was Artefakte aus dem internen Wörterbuch des Computers sind.

Das Kernkonzept ist jedoch solide: UEmbed beweist, dass man sich nicht zwischen Geschwindigkeit und Intelligenz oder zwischen Wörtern und Bedeutung entscheiden muss. Indem es diese beiden Welten in einem einzigen Decoder-only-Modell vereint, öffnet es die Tür für Suchmaschinen, die schneller, intelligenter und in der Lage sind, die gesamte digitale Welt – von einem einzelnen Satz bis zu einem Langfilm – in einem Rutsch zu verstehen. Es ist ein neues Paradigma, in dem die Suchmaschine nicht nur nach Wörtern sucht oder nur die Stimmung fühlt; sie tut beides, und zwar sofort.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →