← Neueste Arbeiten
💻 computer science

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

Das Papier stellt Gemini Embedding 2 vor, ein natives multimodales Einbettungsmodell, das Video, Audio, Bild und Text in einem einzigen Repräsentationsraum vereint, state-of-the-art-Leistung bei diversen unimodalen, cross-modalen und multimodalen Abrufaufgaben erzielt und gleichzeitig robuste Zero-Shot-Fähigkeiten in spezialisierten Domänen demonstriert.

Ursprüngliche Autoren: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Sam
Veröffentlicht 2026-05-27
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich eine riesige Bibliothek vor, die Bücher, Filme, Musikaufnahmen und Fotografien enthält. Wenn Sie derzeit ein bestimmtes Lied finden möchten, das wie eine Filmszene klingt, oder ein Rezept, das zu einem Foto eines Gerichts passt, müssen Sie meistens alles zuerst in Text übersetzen. Sie müssten eine Beschreibung des Fotos schreiben, die Audioaufnahme in Worte transkribieren und dann suchen. Es ist, als würde man versuchen, eine bestimmte Farbe zu finden, indem man nur eine Liste von Farbnamen betrachtet; man verliert das eigentliche „Gefühl" der Farbe.

Gemini Embedding 2 ist Googles neues Werkzeug, das das Spiel verändert. Anstatt alles in Text zu zwingen, schafft es eine einzige, universelle „Sprache", in der Bilder, Töne, Videos und Wörter denselben Dialekt sprechen.

Hier ist eine Aufschlüsselung, wie es funktioniert und warum es wichtig ist, unter Verwendung einfacher Analogien:

1. Der universelle Übersetzer (Die Kernidee)

Stellen Sie sich die alte Methode als das Vorhandensein verschiedener Wörterbücher für verschiedene Sprachen vor. Wenn Sie ein französisches Buch mit einem deutschen Film vergleichen wollten, mussten Sie beide zuerst ins Englische übersetzen, was oft Nuancen verlor.

Gemini Embedding 2 ist wie ein universeller Übersetzer, der „Bedeutung" spricht.

  • Er nimmt ein Video, ein Lied, ein Foto oder einen Textabsatz und wandelt sie alle in eine einzige Art von „Ausweis" (einen mathematischen Vektor) um.
  • Da sie alle dieselbe „Sprache" sprechen, kann das Modell sofort erkennen, dass ein Video eines bellenden Hundes und ein Text, der „ein lauter Hund" sagt, zusammenhängen, obwohl das eine Ton und das andere Worte sind. Es muss den Ton nicht zuerst in Worte umwandeln; es versteht den Ton direkt.

2. Der „All-in-One"-Koch

Frühere Modelle waren wie Köche, die nur eine Art von Essen gut kochen konnten. Ein Koch war großartig im Text, ein anderer bei Bildern und ein weiterer bei Videos. Wenn Sie eine Mahlzeit mit allen drei wollten, mussten Sie drei verschiedene Köche einstellen und hoffen, dass sie sich auf den Geschmack einigen.

Gemini Embedding 2 ist ein Meisterkoch, der jede Zutat bewältigen kann.

  • Er wurde auf einer riesigen Mischung von Aufgaben trainiert: Code lesen, Filme verstehen, Audio hören und Dokumente analysieren.
  • Da er aus dieser enormen Vielfalt gelernt hat, gerät er nicht in Verwirrung, wenn Sie Zutaten mischen. Sie können ihn bitten, einen Videoclip mit einer Mischung aus einem Foto und einem Satz zu finden, und er versteht die Kombination perfekt.

3. Die „Zero-Shot"-Superkraft

Normalerweise müssen Sie einem Computer beibringen, ein sehr spezifisches Thema (wie Astronomie oder Kochen) zu verstehen, indem Sie ihn speziell für dieses Thema unterrichten. Es ist, als würde man einen Nachhilfelehrer einstellen, um einen Schüler nur über das Sonnensystem zu unterrichten.

Gemini Embedding 2 ist wie ein Schüler, der bereits in allem Experte ist.

  • Die Arbeit zeigt, dass dieses Modell bei spezialisierten Themen wie Mikroskopie (Biologie), Astronomie, bildender Kunst und Kochen ohne zusätzliche Schulung unglaublich gut funktioniert.
  • Es ist „out-of-the-box" einsatzbereit. Wenn Sie ihm ein Bild einer Sternkarte oder ein komplexes Rezept zeigen, versteht es den Kontext sofort besser als spezialisierte Modelle, die nur auf eines dieser Dinge trainiert wurden.

4. Der Durchbruch bei Audio (Keine Transkription mehr)

Eines der größten Probleme bei der Suche nach Audio ist, dass Computer die Audioaufnahme normalerweise zuerst „lesen" müssen (Sprache in Text transkribieren), bevor sie danach suchen können. Das ist, als würde man versuchen, ein Lied zu finden, indem man den Text liest, aber wenn der Sänger murmelt oder der Akzent stark ist, versteht der Computer den Text falsch und Sie finden das Lied nie.

Gemini Embedding 2 überspringt den Zwischenhändler.

  • Er hört direkt auf den rohen Sound. Er versteht den Ton, die Tonhöhe und die Emotion der Stimme, nicht nur die Worte.
  • Die Arbeit ergab, dass die Suche mit rohem Audio viel genauer ist als die Suche mit transkribiertem Text. Es ist, als würde man die Stimme eines Freundes in einer Menge erkennen, ohne zu hören, was er sagt.

5. Wie es gebaut wurde (Das Trainingsrezept)

Um diesen „universellen Übersetzer" zu bauen, lehrte das Team das Modell nicht nacheinander nur eine Sache. Sie verwendeten einen dreistufigen Kochprozess:

  1. Pre-Fine-Tuning: Sie gaben dem Modell einen riesigen, chaotischen Haufen von Daten (Text, Code, Bilder), um es an die Idee des „Encodierens" von Informationen zu gewöhnen.
  2. Fine-Tuning: Sie gaben ihm sehr spezifische, hochwertige Beispiele dafür, wie man Dinge zusammenbringt (wie das Abgleichen einer Frage mit einer Antwort oder eines Videos mit einer Beschreibung).
  3. Model Souping: Dies ist ein kluger Trick, bei dem sie mehrere verschiedene Versionen des trainierten Modells nahmen und sie „vermischten", wie man verschiedene Suppenchargen mischt, um den perfekten Geschmack zu erhalten. Dies machte das endgültige Modell stabiler und besser darin, verschiedene Arten von Aufgaben gleichzeitig zu bewältigen.

Das Fazit

Gemini Embedding 2 ist eine leistungsstarke neue Engine, die Computern ermöglicht, die Welt so zu verstehen, wie Menschen es tun: indem sie alles als zusammenhängendes Ganzes sehen, hören und lesen. Ob Sie nach einem bestimmten Moment in einem Video mit einer Textbeschreibung suchen, ein Lied basierend auf einer Summe finden oder ein Dokument nachschlagen, das Diagramme und Text enthält – dieses Modell erledigt alles in einem einheitlichen Raum, oft besser als spezialisierte Tools, die nur für einen dieser Aufgaben entwickelt wurden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →