← أحدث الأبحاث
💬 NLP

Gemma 4 Technical Report

تقدم الورقة البحثية Gemma 4، وهي جيل جديد من النماذج اللغوية مفتوحة الأوزان ومتعددة الوسائط أصلاً، والتي تتميز ببنيات متنوعة، وتصميم موحد خالٍ من المشفر (encoder-free)، ونمط تفكير، مما يحقق مجتمعاً تحسينات كبيرة في الاستنتاج والكفاءة والأداء عبر معايير العلوم والتكنولوجيا والهندسة والرياضيات (STEM) والسياقات الطويلة.

المؤلفون الأصليون: Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotru
نُشر 2026-07-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً لا تكتفي فيه الحواسيب بقراءة الكلمات فحسب، بل يمكنها أيضاً رؤية صورة، وسماع أغنية، ثم استنتاج حل لمسألة رياضية معقدة قبل أن تنطق بكلمة واحدة. هذا هو الركن المثير في العلم المسمى بالذكاء الاصطناعي، وتحديداً الفرع الذي يتعامل مع "النماذج اللغوية الكبيرة". فكر في هذه النماذج كطلاب مطلعين للغاية درسوا كل شيء تقريباً على الإنترنت. في الماضي، كان هؤلاء الطلاب بارعين في القراءة، لكنهم كانوا يحتاجون إلى معلم خصوصي منفصل لمساعدتهم على فهم الصور أو الأصوات. كما كانوا يتعبون ويصبحون بطيئين جداً عندما يُطلب منهم تذكر مكتبة كاملة من الكتب في وقت واحد. السؤال الكبير الذي يطرحه العلماء هو: هل يمكننا بناء عقل واحد فائق الذكاء يتعامل مع النصوص والرؤية والصوت جميعها في آن واحد، دون أن يشعر بالإرهاق، ومع بقائه صغيراً بما يكفي ليتناسب مع حاسوب عادي؟

إليك فريق "Gemma 4"، الذي كشف للتو عن جيل جديد من عقول الذكاء الاصطناعي هذه. إن ابتكارهم الأخير، Gemma 4، يشبه "السكين السويسري" للذكاء الاصطناعي. فبدلاً من الحاجة إلى أدوات منفصلة لمهام مختلفة، فإن هذه العائلة الجديدة من النماذج "متعددة الوسائط أصلياً" (natively multimodal)، مما يعني أنها بُنيت من الأساس لفهم النصوص والصور والصوت معاً. لقد أنشأ الفريق مجموعة كاملة من هذه النماذج، تتراوح من نماذج صغيرة يمكنها العمل على هاتف (بواقع حوالي 2.3 مليار "عصبون") إلى نماذج ضخمة (تصل إلى 31 مليار عصبون) يمكنها حل أصعب الألغاز. إحدى أذكى حيلهم هي "وضع التفكير"؛ فتماماً كما قد يتوقف الإنسان قليلاً ليدون مسودة لعملية تفكيره قبل إعطاء إجابة، يمكن لـ Gemma 4 توليد "أثر استدلالي" أولاً، وهذا يساعده على حل المسائل الرياضية والبرمجية المعقدة بشكل أفضل بكثير. كما نجحوا في جعل هذه النماذج تتذكر كميات هائلة من المعلومات دون أن ينفجر حجم ذاكرتها، وذلك باستخدام حيل ذكية مثل مشاركة فتحات الذاكرة وطريقة جديدة لعد المواقع.

تفصل الورقة البحثية كيف بنوا هذه النماذج باستخدام مزيج من البنى "الكثيفة" (حيث يكون كل جزء من الدماغ نشطاً) و"خليط الخبراء" (حيث تستيقظ أجزاء محددة فقط لمهام معينة، مما يوفر الطاقة). وبالنسبة لنموذج الـ 12 مليار معلمة، فقد قاموا بشيء جذري: تخلصوا من "المشفرات" المنفصلة التي تقوم عادةً بترجمة الصور والأصوات إلى لغة يفهمها الذكاء الاصطناعي. بدلاً من ذلك، بنوا نظاماً موحداً يغذي دماغ النموذج مباشرة بقطع الصور الخام وقطع الصوت. وهذا يجعل النظام أسرع وأقل ازدحاماً. كما قاموا بتدريب النماذج لتكون "واعية للكمية" (quantization-aware)، وهي طريقة منمقة تعني أنهم جعلوا النماذج أصغر وأكثر كفاءة دون فقدان ذكائها، مما يسمح لها بالعمل على أجهزة ذات ذاكرة محدودة.

عندما اختبروا Gemma 4، كانت النتائج مبهرة. ففي الاختبارات القياسية للعلوم والرياضيات والبرمجة، أظهرت النماذج قفزة نوعية في الأداء مقارنة بأسلافها. النسخة الأكبر، وهي نموذج 31B، قدمت أداءً يضاهي النماذج المفتوحة الأكبر حجماً والأكثر تكلفة في المهام التي يتم تقييمها بشرياً. وقد أثبت "وضع التفكير" قوة خاصة، حيث ساعد النماذج على تسجيل درجات أعلى في اختبارات الاستدلال الصعبة. وحتى النماذج الأصغر، مثل نسخة 2.3B، تمكنت من مضاهاة أداء النماذج الأقدم والأكبر حجماً مع استخدام جزء بسيط من الذاكرة. كما أظهر الفريق أن هذه النماذج رائعة في المحادثات الطويلة، حيث تتعامل مع سياقات تصل إلى 128,000 توكن (ما يعادل طول رواية طويلة) بدقة عالية.

ومع ذلك، يلاحظ المؤلفون بحذر أنه رغم قوة هذه النماذج، إلا أنها ليست مثالية. فقد خضعت لفحوصات سلامة صارمة لضمان عدم إنتاجها لمحتوى ضار، أو خطاب كراهية، أو تعليمات خطيرة، ووجدوا تحسينات كبيرة في السلامة مقارنة بالإصدارات السابقة. وهم يؤكدون أنه بينما يسمح الانفتاح للجميع بالبناء على هذه الأدوات، فإنه يتطلب أيضاً المسؤولية. لا تدعي الورقة البحثية أنها حلت جميع مشاكل الذكاء الاصطناعي، لكنها تشير إلى أنه من خلال الجمع بين التصميم الفعال، والفهم الأصلي متعدد الوسائط، وعملية "التفكير"، يمكننا بناء ذكاء اصطناعي ليس فقط أكثر ذكاءً، بل أكثر عملية للاستخدام اليومي على الأجهزة التي نملكها بالفعل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →