← 最新论文
💬 NLP

Gemma 4 Technical Report

Gemma 4 技术报告介绍了一种新一代开放权重、原生多模态模型,其具备多样化的架构、用于原始音频和图像处理的无编码器设计以及思维模式,所有这些共同在 STEM 和长文本基准测试中实现了效率、推理能力和性能方面的显著提升。

原作者: Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Victor Cotruta, Alice Couck
发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Glenn Cameron, Charlotte Caucheteux, Garima Chadha, Jetha Chan, Aditya Chawla, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Takumi Fujimoto, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Chetan Tekur, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,Google DeepMind 刚刚发布了 Gemma 4,这是一个全新的“智能助手”家族,它是开放的,任何人都可以使用、微调并以此为基础进行开发。不要把它们仅仅看作是单个的、巨大的机器人,而要将它们视为一整套不同尺寸的“大脑工具箱”,从一个微小的、口袋大小的助手,到规模宏大的、超级计算机级别的思考者。

以下是关于 Gemma 4 有何特别之处的详细拆解,我们使用了简单的类比:

1. 不同尺寸的工具箱

以前,你可能只有一个大脑袋或一个小脑袋。Gemma 4 则提供了一整套选择:

  • 口袋小助手 (2.3B 和 4.5B): 它们就像智能手表。它们足够小,可以直接在你的手机或笔记本电脑上运行,而不需要庞大的服务器集群。
  • 主力劳模 (12B 和 31B): 它们就像功能强大的台式电脑,能够处理复杂的任务。
  • 专家模型 (26B-A4B): 这是一个“混合专家”(Mixture of Experts)模型。想象一下有一个由 26 个人组成的团队,对于任何一个问题,只有最相关的 4 位专家会站出来回答。这使得它在保持极高智能的同时,运行速度极快且效率极高。

2. “思考帽”(推理模式)

其中一个最大的升级是全新的 “思考模式” (Thinking Mode)

  • 以前: 如果你问一个模型一道难题,它会立即猜出一个答案。
  • 现在: 模型会戴上“思考帽”。它会先对自己进行“低声细语”式的思考过程(就像学生在草稿纸上演算步骤一样),然后再写下最终答案。这使得它能更好地解决棘手的数学和编程问题,就像人类在认真思考时那样。

3. 无需眼镜或耳朵也能看与听

旧的模型需要特殊的“眼镜”(视觉编码器)和“耳朵”(音频编码器)来理解图像和声音。这些是附着在“大脑”上的沉重、独立的设备。

  • 新方法: 12B 模型是无编码器 (encoder-free) 的。这就像大脑本身就学会了直接看和听。它不再需要佩戴沉重的眼镜,而是直接通过原始像素观察图像,或通过原始声波理解声音,从而实现瞬间理解。这让整个系统变得更轻量、更快,也更简洁。

4. 无限图书馆(长文本上下文)

想象一下尝试阅读一本 1,000 页的书,并记住每一个细节。旧模型会出现“记忆迷雾”,读到结尾时就会忘记开头。

  • 解决方案: Gemma 4 使用了一个聪明的记忆技巧。它将书本视为一个“滑动窗口”:它对最近的几页保持高清记忆(局部注意力),同时对整本书保留一个精简、高效的索引(全局注意力)。
  • 结果: 它可以在不耗尽内存的情况下,阅读并记住海量的文本(高达 12 8k 或 256k token),而且其内存占用比以前减少了 37.5%

5. 加速比赛(效率)

  • 预测未来: 模型使用了一个“草拟器 (drafter)”头。想象一位赛车手不仅在驾驶赛车,还能预判接下来的三个弯道。这使得模型可以瞬间预测出句子中的下一个词组,从而让它的表达速度大幅提升。
  • 压缩大脑: 团队在训练模型时进行了“量化 (quantized)”处理。这就像打包行李:他们没有打包厚重、臃肿的衣服(全精度),而是将所有东西紧凑地折叠起来(压缩权重),以便装进更小的包里。你可以几乎无损地在移动设备上运行这些模型。

6. 它们有多聪明?

论文通过一个被称为 Arena 的“盲测”将 Gemma 4 与其他顶尖模型(如 Claude 或 DeepSeek)进行了对比。

  • 结果: 31B 模型是其尺寸类别中排名第一的开源模型(意味着任何人都可以下载它)。它的表现足以媲美那些体积比它大 10 倍的模型。
  • 小个子巨人: 微小的 2.3B 模型表现得像上一代的 27B 模型一样出色,这意味着它比以前的效率提升了 10 倍。

7. 安全与责任

就像你不会让一个没有经过训练的孩子开车一样,团队从底层构建了 Gemma 4 的安全性。

  • 他们在训练前过滤掉了危险或有害的数据。
  • 他们对模型进行了严格测试,以确保它们不会生成仇恨言论、危险指令或有害内容。
  • 他们承认,虽然这些工具非常强大,但必须负责任地使用,并提供了相关指南来帮助开发者保持安全。

简而言之: Gemma 4 是新一代的开源 AI,它更快、推理更聪明、能够直接看和听,并且能够记住海量信息——同时它还足够小,可以在你自己的设备上运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →