تقدم الورقة البحثية Gemma 4، وهي جيل جديد من النماذج اللغوية مفتوحة الأوزان ومتعددة الوسائط أصلاً، والتي تتميز ببنيات متنوعة، وتصميم موحد خالٍ من المشفر (encoder-free)، ونمط تفكير، مما يحقق مجتمعاً تحسينات كبيرة في الاستنتاج والكفاءة والأداء عبر معايير العلوم والتكنولوجيا والهندسة والرياضيات (STEM) والسياقات الطويلة.
المؤلفون الأصليون:Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor CotruGemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou
تخيل عالماً لا تكتفي فيه الحواسيب بقراءة الكلمات فحسب، بل يمكنها أيضاً رؤية صورة، وسماع أغنية، ثم استنتاج حل لمسألة رياضية معقدة قبل أن تنطق بكلمة واحدة. هذا هو الركن المثير في العلم المسمى بالذكاء الاصطناعي، وتحديداً الفرع الذي يتعامل مع "النماذج اللغوية الكبيرة". فكر في هذه النماذج كطلاب مطلعين للغاية درسوا كل شيء تقريباً على الإنترنت. في الماضي، كان هؤلاء الطلاب بارعين في القراءة، لكنهم كانوا يحتاجون إلى معلم خصوصي منفصل لمساعدتهم على فهم الصور أو الأصوات. كما كانوا يتعبون ويصبحون بطيئين جداً عندما يُطلب منهم تذكر مكتبة كاملة من الكتب في وقت واحد. السؤال الكبير الذي يطرحه العلماء هو: هل يمكننا بناء عقل واحد فائق الذكاء يتعامل مع النصوص والرؤية والصوت جميعها في آن واحد، دون أن يشعر بالإرهاق، ومع بقائه صغيراً بما يكفي ليتناسب مع حاسوب عادي؟
إليك فريق "Gemma 4"، الذي كشف للتو عن جيل جديد من عقول الذكاء الاصطناعي هذه. إن ابتكارهم الأخير، Gemma 4، يشبه "السكين السويسري" للذكاء الاصطناعي. فبدلاً من الحاجة إلى أدوات منفصلة لمهام مختلفة، فإن هذه العائلة الجديدة من النماذج "متعددة الوسائط أصلياً" (natively multimodal)، مما يعني أنها بُنيت من الأساس لفهم النصوص والصور والصوت معاً. لقد أنشأ الفريق مجموعة كاملة من هذه النماذج، تتراوح من نماذج صغيرة يمكنها العمل على هاتف (بواقع حوالي 2.3 مليار "عصبون") إلى نماذج ضخمة (تصل إلى 31 مليار عصبون) يمكنها حل أصعب الألغاز. إحدى أذكى حيلهم هي "وضع التفكير"؛ فتماماً كما قد يتوقف الإنسان قليلاً ليدون مسودة لعملية تفكيره قبل إعطاء إجابة، يمكن لـ Gemma 4 توليد "أثر استدلالي" أولاً، وهذا يساعده على حل المسائل الرياضية والبرمجية المعقدة بشكل أفضل بكثير. كما نجحوا في جعل هذه النماذج تتذكر كميات هائلة من المعلومات دون أن ينفجر حجم ذاكرتها، وذلك باستخدام حيل ذكية مثل مشاركة فتحات الذاكرة وطريقة جديدة لعد المواقع.
تفصل الورقة البحثية كيف بنوا هذه النماذج باستخدام مزيج من البنى "الكثيفة" (حيث يكون كل جزء من الدماغ نشطاً) و"خليط الخبراء" (حيث تستيقظ أجزاء محددة فقط لمهام معينة، مما يوفر الطاقة). وبالنسبة لنموذج الـ 12 مليار معلمة، فقد قاموا بشيء جذري: تخلصوا من "المشفرات" المنفصلة التي تقوم عادةً بترجمة الصور والأصوات إلى لغة يفهمها الذكاء الاصطناعي. بدلاً من ذلك، بنوا نظاماً موحداً يغذي دماغ النموذج مباشرة بقطع الصور الخام وقطع الصوت. وهذا يجعل النظام أسرع وأقل ازدحاماً. كما قاموا بتدريب النماذج لتكون "واعية للكمية" (quantization-aware)، وهي طريقة منمقة تعني أنهم جعلوا النماذج أصغر وأكثر كفاءة دون فقدان ذكائها، مما يسمح لها بالعمل على أجهزة ذات ذاكرة محدودة.
عندما اختبروا Gemma 4، كانت النتائج مبهرة. ففي الاختبارات القياسية للعلوم والرياضيات والبرمجة، أظهرت النماذج قفزة نوعية في الأداء مقارنة بأسلافها. النسخة الأكبر، وهي نموذج 31B، قدمت أداءً يضاهي النماذج المفتوحة الأكبر حجماً والأكثر تكلفة في المهام التي يتم تقييمها بشرياً. وقد أثبت "وضع التفكير" قوة خاصة، حيث ساعد النماذج على تسجيل درجات أعلى في اختبارات الاستدلال الصعبة. وحتى النماذج الأصغر، مثل نسخة 2.3B، تمكنت من مضاهاة أداء النماذج الأقدم والأكبر حجماً مع استخدام جزء بسيط من الذاكرة. كما أظهر الفريق أن هذه النماذج رائعة في المحادثات الطويلة، حيث تتعامل مع سياقات تصل إلى 128,000 توكن (ما يعادل طول رواية طويلة) بدقة عالية.
ومع ذلك، يلاحظ المؤلفون بحذر أنه رغم قوة هذه النماذج، إلا أنها ليست مثالية. فقد خضعت لفحوصات سلامة صارمة لضمان عدم إنتاجها لمحتوى ضار، أو خطاب كراهية، أو تعليمات خطيرة، ووجدوا تحسينات كبيرة في السلامة مقارنة بالإصدارات السابقة. وهم يؤكدون أنه بينما يسمح الانفتاح للجميع بالبناء على هذه الأدوات، فإنه يتطلب أيضاً المسؤولية. لا تدعي الورقة البحثية أنها حلت جميع مشاكل الذكاء الاصطناعي، لكنها تشير إلى أنه من خلال الجمع بين التصميم الفعال، والفهم الأصلي متعدد الوسائط، وعملية "التفكير"، يمكننا بناء ذكاء اصطناعي ليس فقط أكثر ذكاءً، بل أكثر عملية للاستخدام اليومي على الأجهزة التي نملكها بالفعل.
ملخص تقني: التقرير التقني لـ Gemma 4
بيان المشكلة
أدى التطور السريع للنماذج اللغوية الكبيرة إلى خلق طلب حاسم على النماذج ذات الأوزان المفتوحة التي تمتلك فهماً متعدد الوسائط قوياً، وقدرات استدلال متقدمة، وكفاءة حوسبية عالية. غالباً ما تعاني الحلول الحالية من صعوبة في الموازنة بين الأداء المتقدم والقيود المفروضة على أجهزة الحوسبة المحلية (on-device)، لا سي لمساحة الذاكرة، وزمن انتقال الاستنتاج (inference latency)، ومعالجة السياق الطويل. علاوة على ذلك، فإن دمج المدخلات متعددة الوسائط (النص، الصورة، الصوت) يعتمد عادةً على مشفرات منفصلة وثقيلة تزيد من تجزئة الذاكرة والتعقيد.
المنهجية
تقدم مجموعة نماذج Gemma 4 عائلة من بنيات Transformer القائمة على فك التشفير فقط (decoder-only)، والمصممة لمعالجة هذه التحديات من خلال عدة ابتكارات منهجية رئيسية:
المتغيرات الهيكلية
تتضمن العائلة نماذج كثيفة (2.3B، 4.5B، 12B، و31B بارامتر) ومتغير Mixture-of-Experts (MoE) (بإجمالي 26B بارامتر مع 3.8B بارامتر نشط).
النماذج الكثيفة مقابل MoE: تستخدم نماذج 2.3B (E2B) و4.5B (E4B) تضمينات لكل طبقة لتحقيق أعداد بارامترات فعالة تبلغ 2.3B و4.5B على التوالي، رغم إجمالي عدد البارامترات الأكبر.
وضع التفكير (Thinking Mode): تم تجهيز النماذج بـ "وضع تفكير" يولد مسار استدلال قبل الاستجابة النهائية، مما يعزز الأداء في المجالات التي تعتمد على الاستدلال مثل الرياضيات والبرمجة.
التكامل متعدد الوسائط
النماذج متعددة الوسائط القياسية (E2B، E4B، 26B-A4B، 31B): تستخدم هذه النماذج مشفرات رؤية وصوت مجمدة.
الرؤية: تستخدم محولات الرؤية (ViT) بـ 150 مليون بارامتر للنماذج الأصغر و550 مليون للنماذج الأكبر، مع دعم نسب العرض إلى الارتفاع المتغيرة عبر axial 2D-RoPE.
الصوت: تستخدم مشفراً بـ 305 مليون بارامتر يعتمد على النموذج العالمي للكلام (USM)، حيث يعالج قطعاً صوتية مدتها 40 مللي ثانية مع مدخلات Mel filterbank.
بنية موحدة خالية من المشفرات (نموذج 12B): نموذج جديد حيث يستبدل نموذج 12B المشفرات المنفصلة بوحدات إسقاط خفيفة الوزن.
الرؤية: يتم إسقاط قطع صور RGB الخام بحجم 48×48×3 مباشرة في فضاء تضمين LLM عبر عملية ضرب مصفوفة واحدة كبيرة، معززة بتضمينات موضعية قائمة على الإحداثيات ثنائية الأبعاد.
الصوت: يتم تقسيم الصوت الخام إلى قطع مدتها 40 مللي ثانية (16 كيلو هرتز) ويتم إسقاطه مباشرة في فضاء التضمين دون الحاجة لمشفر مخصص أو ترميز موضع إضافي.
تحسينات الكفاءة والسياق الطويل
آليات الانتباه (Attention Mechanisms): تستخدم النماذج آلية انتباه محلي بنوافذ منزلقة بنسبة 5:1 للانتباه الذاتي العالمي (4:1 لـ E2B). تعيد الطبقات العالمية استخدام المفاتيح كقيم ($values = keys$) لتقليل بصمة ذاكرة KV cache بنسبة تصل إلى 37.5%.
الترميز الموضعي (Positional Encoding): يستخدم نهج هجين p-RoPE (p=0.25) للطبقات العالمية وRoPE القياسي للطبقات المحلية، مع ترددات مضبوطة عند 1 مليون و10 آلاف على التوالي.
فك التشفيد التكهني (Speculative Decoding): تم تدريب رأس درفت (drafter head) متعدد التوكينات (MTP) ذاتي الانحدار جنباً إلى جنب مع النموذج الرئيسي. يستخدم هذا الـ drafter الانتباه المتقاطع (cross-attention) مع KV cache الخاص بالنموذج الرئيسي لتوليد توكينات مستقبلية، مما يلغي الحاجة إلى MTP prefill ويدعم أطوال درفت متغيرة.
الكمية (Quantization): يتم إصدار النماذج مع تدريب واعٍ بالكمية (QAT) لكل من الأوزان والتنشيطات. تشمل التنسيقات الكمية للهواتف المحمولة (مزيج من أوزان int2/int4 وتنشيطات int8)، وQ4_0، مما يقلل بشكل كبير من بصمة الذاكرة وزمن الانتقال.
البنية التحتية للتدريب
يعتمد التدريب المسبق على مجموعات TPUv4 وTPUv6e مع تقسيم البيانات والتسلسل والنسخ (sharding). تتضمن خط أنابيب التدريب "المرونة على مستوى الشريحة" (Slice-Granularity Elasticity) للتعامل مع الإخفاقات الموضعية بأقل قدر من التأخير. تتضمن مرحلة ما بعد التدريب ضبط التعليمات باستخدام توكنات تنسيق محددة (مثل <thought>) وتصفية البيانات للحد من الهلوسة والمخرجات غير الآمنة.
المساهمات الرئيسية
بنية موحدة خالية من المشفرات: تقديم نموذج 12B الذي يستوعب قطع الصوت والصور الخام دون مشفرات منفصلة، مما يقلل من تجزئة الذاكرة والعبء الإضافي للبارامترات.
دمج وضع التفكير: الإدراج المنهجي لمرحلة توليد مسار الاستدلال لتحسين الأداء في مهام العلوم والتكنولوجيا والهندسة والرياضيات (STEM) والبرمجة.
كفاءة السياق الطويل: مزيج من نسب الانتباه المحلي/العالمي، وp-RoPE، واستراتيجيات مشاركة KV cache التي تقلل بشكل كبير من استخدام الذاكرة مع الحفاظ على الأداء في السياقات الممتدة (حتى 256 ألف توكين).
كفاءة الحوسبة والذاكرة: نشر رؤوس MTP للفك التكهني وللتدريب الواعي بالكمية (QAT) للاستنتاج المكمم، مما يسمح بالتنفيذ عالي الأداء على الأجهزة ذات الموارد المحدودة.
مقاييس متعددة الوسائط شاملة: تقييم واسع النطاق عبر وسائط النص والرؤية والصوت، مما يظهر أداءً تنافسياً ضد نماذج أكبر بكثير، سواء كانت مفتوحة أو مغلقة.
النتائج
أداء المقاييس (Benchmarks): يحقق Gemma 4 31B تصنيف Elo قدره 1451 في Arena Text، مما يجعله يتصدر النماذج ذات الأوزان المفتوحة الكثيفة وينافس نماذج MoE الأكبر بكثير (مثل GLM 5.1، MiMo V2.5 Pro).
الاستدلال والبرمجة: في "وضع التفكير"، يسجل Gemma 4 31B نتيجة 89.2 في AIME 2026 (بدون أدوات) و80.0 في LiveCodeBench v6، متفوقاً بشكل كبير على Gemma 3 27B.
القدرات متعددة الوسائط:
الرؤية: يحقق Gemma 4 12B نتيجة 76.9 في MMMU Pro و85.6 في MATH-Vision، متفوقاً على Gemma 3 27B.
الصوت: رغم انخفاض بصمة القرص بنسبة 78% (من 390 ميجابايت إلى 87 ميجابايت عبر الكمية)، تظهر نماذج Gemma 4 E2B وE4B تحسناً نسبياً بنسبة 12% و10% في الترجمة (CoVoST) و17% و12% في النسخ الصوتي (FLEURS ASR) مقارنة بنظيراتها من عائلة Gemma 3.
السياق الطويل: تظهر نماذج Gemma 4 أداءً فائقاً في مهام استرجاع واستدلال السياق الطويل (مثل RULER، LOFT، GraphWalks) مقارنة بـ Gemma 3، حيث يتفوق E4B على Gemma 3 27B رغم امتلاكه عدداً أقل من البارامترات.
الكفاءة: تقلل النسخ المكممة (Q4_0) بصمات الذاكرة بشكل كبير (على سبيل المثال، نموذج 31B من 64.0 جيجابايت إلى 19.2 جيجابايت) مع حد أدنى من تدهور الجودة.
الأهمية
يزعم البحث أن Gemma 4 يمثل قفزة نوعية في عائلة نماذج Gemma، حيث يضع معياراً جديداً للنماذج متعددة الوسائط الأصلية ذات الأوزان المفتوحة. من خلال دمج أوضاع التفكير، والبنيات الخالية من المشفرات، وتحسينات الكفاءة المتقدمة، يحقق Gemma 4 أداءً يضاهي النماذج المفتوحة الضخمة، مع كونه محسناً لبيئات الأجهزة المتنوعة، بما في ذلك أجهزة الحافة (edge devices). إن إصدار هذه النماذج بموجب رخصة Apache 2.0 يهدف إلى تمكين المطورين والباحثين من بناء وتخصيص وتوسيع هذه القدرات، مما يعزز البحث المفتوح وتطوير الذكاء الاصطناعي المسؤول. ويؤكد المؤلفون أن هذه النماذج تخضع لتقييمات سلامة صارمة وقد صُممت مع اعتبار الحوكمة وتخفيف المخاطر مكونات أساسية في دورة حياة تطويرها.