← Nieuwste papers
💻 computer science

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

Het artikel introduceert Gemini Embedding 2, een native multimodale embedding-model dat video, audio, afbeeldingen en tekst verenigt in één representatieruimte, state-of-the-art prestaties bereikt voor diverse unimodale, cross-modale en multimodale zoekopdrachten en tegelijkertijd robuuste zero-shot capaciteiten demonstreert in gespecialiseerde domeinen.

Oorspronkelijke auteurs: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Sam
Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een enorme bibliotheek voor met boeken, films, muziekopnames en foto's. Op dit moment moet je, als je een specifiek liedje wilt vinden dat op een filmscène lijkt, of een recept dat past bij een foto van een gerecht, meestal eerst alles naar tekst vertalen. Je zou een beschrijving van de foto moeten schrijven, de audio naar woorden moeten transcriberen en dan pas zoeken. Het is alsof je probeert een specifieke kleur te vinden door alleen naar een lijst met verfnamen te kijken; je verliest het echte "gevoel" van de kleur.

Gemini Embedding 2 is Googles nieuwe tool die het spel verandert. In plaats van alles naar tekst te dwingen, creëert het één universele "taal" waarin afbeeldingen, geluiden, video's en woorden allemaal dezelfde dialect spreken.

Hieronder volgt een uiteenzetting van hoe het werkt en waarom het belangrijk is, met eenvoudige analogieën:

1. De Universele Vertaler (De Kernidee)

Denk aan de oude manier van werken als het hebben van verschillende woordenboeken voor verschillende talen. Als je een Frans boek wilde vergelijken met een Duitse film, moest je beide eerst naar het Engels vertalen, wat vaak de nuance verloor.

Gemini Embedding 2 is als een universele vertaler die "Betekenis" spreekt.

  • Het neemt een video, een lied, een foto of een alinea tekst en zet ze allemaal om in één type "ID-kaart" (een wiskundige vector).
  • Omdat ze allemaal in dezelfde "taal" zijn, kan het model direct zien dat een video van een blaffende hond en de tekst "een luidruchtige hond" gerelateerd zijn, zelfs als het ene geluid is en het andere woorden. Het hoeft het geluid niet eerst om te zetten in woorden; het begrijpt het geluid direct.

2. De "Alles-in-Één" Chef

Eerdere modellen waren als koks die maar één type voedsel goed konden koken. De ene kok was geweldig in tekst, een andere in afbeeldingen en een derde in video. Als je een maaltijd wilde met alle drie, moest je drie verschillende koks inhuren en hopen dat ze het eens werden over de smaak.

Gemini Embedding 2 is een meesterkok die elk ingrediënt aankan.

  • Het is getraind op een enorme mix van taken: code lezen, films begrijpen, naar audio luisteren en documenten analyseren.
  • Omdat het uit deze enorme variatie heeft geleerd, raakt het niet in de war als je ingrediënten mengt. Je kunt het vragen om een videoclip te vinden met een mix van een foto en een zin, en het begrijpt de combinatie perfect.

3. De "Zero-Shot" Superkracht

Meestal moet je, als je wilt dat een computer een zeer specifiek onderwerp begrijpt (zoals sterrenkunde of koken), het specifiek voor dat onderwerp leren. Het is alsof je een tutor huurt om een student alleen over het zonnestelsel te leren.

Gemini Embedding 2 is als een student die al expert is in alles.

  • Het artikel toont aan dat dit model ongelooflijk goed werkt op gespecialiseerde onderwerpen zoals microscopie (biologie), sterrenkunde, fine art en koken zonder extra training nodig te hebben.
  • Het is "out-of-the-box" klaar. Als je het een foto van een sterrenkaart of een complex recept laat zien, begrijpt het direct de context beter dan gespecialiseerde modellen die alleen op één van die dingen waren getraind.

4. De Doorbraak in Audio (Geen Transcriptie Meer)

Een van de grootste problemen bij het doorzoeken van audio is dat computers het geluid meestal eerst moeten "lezen" (spraak naar tekst transcriberen) voordat ze erin kunnen zoeken. Dit is alsof je probeert een lied te vinden door de tekst te lezen, maar als de zanger mompelt of het accent te dik is, krijgt de computer de tekst verkeerd en vind je het lied nooit.

Gemini Embedding 2 slaat de tussenpersoon over.

  • Het luistert direct naar het ruwe geluid. Het begrijpt de toon, het pit en de emotie van de stem, niet alleen de woorden.
  • Het artikel vond dat zoeken met ruwe audio veel nauwkeuriger is dan zoeken met getranscribeerde tekst. Het is alsof je de stem van een vriend herkent in een menigte zonder te horen wat ze zeggen.

5. Hoe Het Is Gebouwd (Het Trainingsrecept)

Om deze "universele vertaler" te bouwen, leerde het team het niet één voor één. Ze gebruikten een drie-staps kookproces:

  1. Pre-Fine-Tuning: Ze gaven het model een enorme, rommelige stapel data (tekst, code, afbeeldingen) om het te laten wennen aan het idee van het "coderen" van informatie.
  2. Fine-Tuning: Ze gaven het zeer specifieke, hoogwaardige voorbeelden van hoe dingen aan elkaar gekoppeld moeten worden (zoals het koppelen van een vraag aan een antwoord, of een video aan een beschrijving).
  3. Model Souping: Dit is een slimme truc waarbij ze verschillende versies van het getrainde model namen en ze "mengden", alsof je verschillende batches soep mengt om de perfecte smaak te krijgen. Dit maakte het uiteindelijke model stabieler en beter in het tegelijkertijd afhandelen van verschillende soorten taken.

De Conclusie

Gemini Embedding 2 is een krachtige nieuwe motor die computers de wereld laat begrijpen zoals mensen dat doen: door alles te zien, te horen en te lezen als een samenhangend geheel. Of je nu zoekt naar een specifiek moment in een video met een tekstopdracht, een lied vindt op basis van een gefluisterde melodie, of een document opzoekt met grafieken en tekst, dit model doet het allemaal in één uniforme ruimte, vaak beter dan gespecialiseerde tools die alleen voor één van die taken zijn ontworpen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →