← Derniers articles
💻 computer science

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

L'article présente Gemini Embedding 2, un modèle d'encodage multimodal natif qui unifie la vidéo, l'audio, l'image et le texte dans un espace de représentation unique, atteignant des performances de pointe sur diverses tâches de recherche unimodales, intermodales et multimodales tout en démontrant des capacités zero-shot robustes dans des domaines spécialisés.

Auteurs originaux : Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Sam
Publié 2026-05-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédiez une bibliothèque immense contenant des livres, des films, des enregistrements musicaux et des photographies. Pour l'instant, si vous voulez trouver une chanson spécifique qui ressemble à une scène de film, ou une recette correspondant à une photo d'un plat, vous devez généralement tout traduire en texte au préalable. Vous devriez écrire une description de la photo, transcrire l'audio en mots, puis effectuer une recherche. C'est comme essayer de trouver une couleur spécifique en ne regardant qu'une liste de noms de peintures ; vous perdez le véritable « ressenti » de la couleur.

Gemini Embedding 2 est le nouvel outil de Google qui change la donne. Au lieu de forcer tout le monde à se transformer en texte, il crée un « langage » unique et universel où les images, les sons, les vidéos et les mots parlent tous le même dialecte.

Voici une explication de son fonctionnement et de son importance, en utilisant des analogies simples :

1. Le Traducteur Universel (L'Idée Centrale)

Considérez l'ancienne façon de faire comme ayant différents dictionnaires pour différentes langues. Si vous vouliez comparer un livre français à un film allemand, vous deviez d'abord traduire les deux en anglais, ce qui faisait souvent perdre la nuance.

Gemini Embedding 2 est comme un traducteur universel qui parle « Sens ».

  • Il prend une vidéo, une chanson, une photo ou un paragraphe de texte et les convertit tous en un seul type de « carte d'identité » (un vecteur mathématique).
  • Parce qu'ils sont tous dans le même « langage », le modèle peut instantanément voir qu'une vidéo d'un chien aboyant et un texte disant « un chien bruyant » sont liés, même si l'un est un son et l'autre des mots. Il n'a pas besoin de convertir le son en mots au préalable ; il comprend le son directement.

2. Le Chef « Tout-en-Un »

Les modèles précédents étaient comme des chefs qui ne pouvaient bien cuisiner qu'un seul type de nourriture. Un chef était excellent pour le texte, un autre pour les images, et un autre pour la vidéo. Si vous vouliez un repas avec les trois, vous deviez engager trois chefs différents et espérer qu'ils s'accordent sur la saveur.

Gemini Embedding 2 est un chef maître capable de gérer n'importe quel ingrédient.

  • Il a été entraîné sur un mélange massif de tâches : lire du code, comprendre des films, écouter de l'audio et analyser des documents.
  • Parce qu'il a appris à partir de cette grande variété, il ne se perd pas lorsque vous mélangez les ingrédients. Vous pouvez lui demander de trouver un extrait vidéo en utilisant un mélange d'une photo et d'une phrase, et il comprend la combinaison parfaitement.

3. Le Super-pouvoir « Zero-Shot »

Habituellement, si vous voulez qu'un ordinateur comprenne un sujet très spécifique (comme l'astronomie ou la cuisine), vous devez le former spécifiquement pour ce sujet. C'est comme engager un tuteur pour enseigner à un élève uniquement le système solaire.

Gemini Embedding 2 est comme un élève qui est déjà expert en tout.

  • L'article montre que ce modèle fonctionne incroyablement bien sur des sujets spécialisés comme la microscopie (biologie), l'astronomie, les beaux-arts et la cuisine sans avoir besoin d'entraînement supplémentaire.
  • Il est prêt « hors de la boîte ». Si vous lui montrez une photo d'un diagramme stellaire ou une recette complexe, il comprend immédiatement le contexte mieux que des modèles spécialisés qui n'ont été entraînés que sur l'un de ces éléments.

4. La Percée Audio (Plus de Transcription)

L'un des plus grands problèmes de la recherche audio est que les ordinateurs doivent généralement « lire » l'audio d'abord (transcrire la parole en texte) avant de pouvoir le rechercher. C'est comme essayer de trouver une chanson en lisant les paroles, mais si le chanteur marmonne ou si l'accent est fort, l'ordinateur se trompe sur les paroles et vous ne trouvez jamais la chanson.

Gemini Embedding 2 saute l'intermédiaire.

  • Il écoute le son brut directement. Il comprend le ton, la hauteur et l'émotion de la voix, pas seulement les mots.
  • L'article a constaté que la recherche avec de l'audio brut est beaucoup plus précise que la recherche avec du texte transcrit. C'est comme reconnaître la voix d'un ami dans une foule sans avoir besoin d'entendre ce qu'il dit.

5. Comment il a été construit (La Recette d'Entraînement)

Pour construire ce « traducteur universel », l'équipe ne lui a pas appris une chose à la fois. Ils ont utilisé un processus de cuisson en trois étapes :

  1. Pré-affinage : Ils ont donné au modèle un énorme tas de données en désordre (texte, code, images) pour l'habituer à l'idée de « coder » l'information.
  2. Affinage : Ils lui ont donné des exemples très spécifiques et de haute qualité sur la façon de faire correspondre les éléments (comme associer une question à une réponse, ou une vidéo à une description).
  3. Soupe de Modèles : C'est une astuce ingénieuse où ils ont pris plusieurs versions différentes du modèle entraîné et les ont « mélangées » ensemble, comme mélanger différents pots de soupe pour obtenir la saveur parfaite. Cela a rendu le modèle final plus stable et meilleur pour gérer différents types de tâches à la fois.

La Conclusion

Gemini Embedding 2 est un nouveau moteur puissant qui permet aux ordinateurs de comprendre le monde comme les humains le font : en voyant, en entendant et en lisant tout comme un tout connecté. Que vous cherchiez un moment précis dans une vidéo en utilisant une description textuelle, que vous trouviez une chanson basée sur un air siffloté, ou que vous recherchiez un document contenant des graphiques et du texte, ce modèle fait tout cela dans un espace unifié, souvent mieux que des outils spécialisés conçus pour une seule de ces tâches.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →