← 最新论文
💻 computer science

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

本文介绍了 Gemini Embedding 2,这是一种原生多模态嵌入模型,它将视频、音频、图像和文本统一到一个单一的表示空间中,在多种单模态、跨模态和多模态检索任务中实现了最先进的性能,同时在专业领域展现了强大的零样本能力。

原作者: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Sam
发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个巨大的图书馆,里面藏书、电影、音乐录音和照片。目前,如果你想找到一首听起来像电影场景的特定歌曲,或者找到一张与菜肴照片相匹配的食谱,你通常必须先将所有内容转化为文字。你得为照片撰写描述,将音频转录成文字,然后进行搜索。这就像试图仅通过查看油漆名称列表来寻找特定的颜色;你失去了颜色实际的“感觉”。

Gemini Embedding 2 是谷歌推出的一款新工具,它将彻底改变游戏规则。它不再强迫所有内容转化为文字,而是创建了一种单一的、通用的“语言”,让图片、声音、视频和文字都能使用同一种方言进行交流。

以下是其工作原理及其重要性的简要说明,辅以简单的类比:

1. 通用翻译器(核心理念)

将旧有的工作方式想象成拥有针对不同语言的不同词典。如果你想将一本法语书与一部德语电影进行比较,你必须先将两者都翻译成英语,而这往往会丢失细微差别。

Gemini Embedding 2 就像一位会说“意义”的通用翻译器

  • 它将视频、歌曲、照片或一段文字转换为一种单一类型的“身份证”(数学向量)。
  • 因为它们都使用同一种“语言”,模型可以立即识别出一段狗吠的视频和一段写着“一只大声的狗”的文字是相关的,即使一个是声音,另一个是文字。它无需先将声音转换为文字;它能直接理解声音。

2. “全能”厨师

以前的模型就像只能擅长烹饪一种食物的厨师。一位厨师擅长处理文字,另一位擅长图像,还有一位擅长视频。如果你想要一顿包含这三种元素的餐食,你就必须雇佣三位不同的厨师,并指望他们在口味上达成一致。

Gemini Embedding 2 是一位能处理任何食材的大厨

  • 它是在海量的混合任务上训练的:阅读代码、理解电影、聆听音频以及分析文档。
  • 因为它从这种巨大的多样性中学习,所以当混合食材时,它不会感到困惑。你可以要求它通过混合照片和句子来查找视频片段,它能完美地理解这种组合。

3. “零样本”超能力

通常,如果你想让计算机理解一个非常具体的主题(如天文学或烹饪),你必须专门针对该主题对其进行训练。这就像雇佣一位家庭教师,只教学生关于太阳系的知识。

Gemini Embedding 2 就像一位已经是万事通的学生

  • 论文表明,该模型在显微镜技术(生物学)天文学美术烹饪等专门主题上表现极其出色,无需任何额外训练。
  • 它是“开箱即用”的。如果你给它看一张星图或一份复杂的食谱,它能立即比那些仅针对其中某一项进行训练的专门模型更好地理解上下文。

4. 音频突破(不再需要转录)

搜索音频的最大问题之一是,计算机通常必须先“阅读”音频(将语音转录为文字),然后才能进行搜索。这就像试图通过阅读歌词来寻找一首歌,但如果歌手含糊不清或口音很重,计算机就会听错歌词,导致你永远找不到那首歌。

Gemini Embedding 2 跳过了中间环节。

  • 它直接聆听原始声音。它理解声音的语调、音高和情感,而不仅仅是文字。
  • 论文发现,使用原始音频进行搜索比使用转录文本进行搜索要准确得多。这就像在人群中认出朋友的声音,而无需听到他们在说什么。

5. 它是如何构建的(训练食谱)

为了构建这个“通用翻译器”,团队并没有一次只教它一件事。他们采用了一个三步烹饪过程:

  1. 预微调:他们向模型提供了一大堆杂乱的数据(文本、代码、图像),让它适应“编码”信息的概念。
  2. 微调:他们提供了非常具体、高质量的示例,教导模型如何将事物匹配在一起(例如将问题与答案匹配,或将视频与描述匹配)。
  3. 模型混合(Model Souping):这是一个巧妙的技巧,他们取了几种不同版本的训练模型并将它们“混合”在一起,就像混合不同批次的汤以获得完美的味道一样。这使得最终模型更加稳定,并且更擅长同时处理不同类型的任务。

总结

Gemini Embedding 2 是一款强大的新引擎,它让计算机能够像人类一样理解世界:通过观察、聆听和阅读,将一切视为一个相互联系的整体。无论你是通过文字描述搜索视频中的特定时刻,通过哼唱的曲调查找歌曲,还是查找包含图表和文字的文档,该模型都能在一个统一的空间中完成所有这些任务,其表现往往优于仅针对其中某一项工作设计的专门工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →