← أحدث الأبحاث
🤖 AI

Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation

يُعد Ming-Flash-Omni نموذج "خليط من الخبراء" (Mixture-of-Experts) متفرقاً وعالي الكفاءة، يضم 100 مليار معلمة، ويوحد قدرات الإدراك والتوليد متعددة الوسائط المتقدمة عبر الرؤية والكلام واللغة، محققاً أداءً يضاهي نموذج Gemini 2.5 Pro، وممثلاً خطوة كبيرة نحو الذكاء الاصطنا_الاصطناعي العام.

المؤلفون الأصليون: Inclusion AI, :, Bowen Ma, Cheng Zou, ChengKun Du, Canxiang Yan, Chunxiang Jin, Chunjie Shen, Chenyu Lian, Chengxiang Fan, Dandan Zheng, Fudong Wang, Furong Xu, Guangming Yao, Haohao Liu, Han Peng, J
نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Inclusion AI, :, Bowen Ma, Cheng Zou, ChengKun Du, Canxiang Yan, Chunxiang Jin, Chunjie Shen, Chenyu Lian, Chengxiang Fan, Dandan Zheng, Fudong Wang, Furong Xu, Guangming Yao, Haohao Liu, Han Peng, Jun Zhou, Junluan Xia, Jingdong Chen, Jianing Li, Jianxin Sun, Jianjiang Zhu, Jianping Jiang, Jinpeng Ou, Jun Peng, Jin Peng, Kaixiang Ji, Li Tang, Libin Wang, Lixiang Ru, Longhua Tan, Lu Ma, Lan Wang, Mochen Bai, Minghong Cai, Mingxue Yang, Ning Gao, Qingpei Guo, Qinglong Zhang, Qiang Xu, Qin Zhao, Rui Liu, Ruijie Xiong, Ruobing Zheng, Sirui Gao, Shaoxiong Lin, Tao Zhang, Tianqi Li, Tinghao Liu, Tongli Wang, Taoye Huang, Weilong Chai, Xiaomei Wang, Xiaolong Wang, Xiaojian Liu, Xiao Lu, Xiaoyu Li, Xingning Dong, Xuzheng Yu, Xuezhi Wang, Yi Yuan, Yuting Gao, Yuting Xiao, Yunxiao Sun, Yipeng Chen, Yifan Mao, Yifei Wu, Yongjie Lyu, Yingying Zhang, YuQian Li, Ziping Ma, Zhiqiang Fang, Zhihao Qiu, Ziyuan Huang, Zizheng Yang, Zhengyu He

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً فائق الذكاء يُدعى Ming-Flash-Omni. فكر فيه ليس مجرد روبوت دردشة، بل كأنه سكين سويسري لعقل الإنسان.

بينما كانت نماذج الذكاء الاصطناعي السابقة تشبه المتخصصين (رسام بارع لا يستطيع التحدث، أو متحدث لبق لا يستطيع الرسم)، فإن Ming-Flash-Omni هو عامّ شامل. يمكنه الرؤية، والسمع، والتحدث، والقراءة، والكتابة، والإبداع في آن واحد، والتبديل بين هذه المهارات فوراً دون أن يفقد إيقاعه.

إليك تفصيل كيفية عمله ولماذا يعد أمراً بالغ الأهمية، باستخدام تشبيهات بسيطة:

1. المحرك: "المكتبة الذكية" (بنية MoE)

تخيل مكتبة ضخمة تحتوي على 100 مليار كتاب (بارامترات). في الماضي، للإجابة على سؤال ما، كان على أمين المكتبة سحب كل كتاب من الرف للعثور على الإجابة. كان هذا بطيئاً ومرهقاً.
Ming-Flash-Omni يستخدم نظاماً جديداً يسمى خليط الخبراء (Mixture-of-Experts - MoE).

  • التشبيه: بدلاً من وجود عقل واحد عملاق يحاول القيام بكل شيء، تخيل فريقاً من 100 خبير متخصص. عندما تسأل سؤالاً في الرياضيات، يستيقظ "خبير الرياضيات" فقط. وعندما تسأل عن لوحة فنية، يستيقظ "خبير الفن" فقط.
  • النتيجة: رغم أن المكتبة ضخمة (100 مليار كتاب)، إلا أن حوالي 6 مليارات منها فقط هي "النشطة" لأي مهمة واحدة. وهذا يجعل الذكاء الاصطناعي سريعاً للغاية وموفراً للطاقة، مثل سيارة تستخدم فقط أسطوانات المحرك التي تحتاجها لصعود تلة.

2. العيون: رؤية الزمان والمكان

كانت نماذج الذكاء الاصطناعي السابقة غالباً ما تنظر إلى الفيديو كأنه عرض شرائح من صور ثابتة، مما يجعلها تفقد تدفق الزمن.

  • التطوير: يستخدم Ming-Flash-Omni تقنية Time-Interleaved VideoRoPE. فكر في هذا كمنح الذكاء الاصطناعي ساعة يد مسجلة بالوقت لكل إطار في الفيديو. فهو لا يرى طائراً فحسب، بل يرى الطائر وهو يرفرف بجناحيه عند الثانية 0.5 بالضبط. يساعد هذا في فهم الحركة والسبب والنتيجة في الفيديوهات بشكل أفضل بكثير.

3. الصوت: المغني "المستمر"

كانت أصوات الذكاء الاصطناعي القديمة تبدو آلية بعض الشيء لأنها كانت تبني الكلام من "كتل" صغيرة ومنفصلة (مثل قطع الليغو)، مما قد يترك فجوات أو أخطاء تقنية.

  • التطوير: يعامل Ming-Flash-Omni الصوت مثل الماء الانسيابي بدلاً من قطع الليغو. فهو يولد الكلام، والمؤثرات الصوتية، والموسيقى في تدفق مستمر واحد.
  • القوة الخارقة: يمكنه الآن التبديل بين اللهجات واللكنات (مثل لهجات سيشوان أو شنغهاي) وفهم السياق. إذا قلت كلمة "bank" (ضفة أو مصرف) في محادثة عن الصيد، سيعرف أنك تقصد ضفة النهر وليس المصرف المالي. إنه يشبه امتلاك دليل محلي يعرف لغتك العامية المحلية تماماً.

4. الأيدي: "فرشاة الرسم السحرية"

هذا هو الجزء الأكثر إبداعاً على الإطلاق.

  • التقسيم التوليدي (Generative Segmentation): تخيل أن لديك صورة لشاطئ. تقول للذكاء الاصطناعي: "اجعل السماء أرجوانية والرمال ذهبية". النماذج القديمة قد تضع فقط مربعاً أرجوانياً فوق السماء. لكن Ming-Flash-Omni يفهم شكل السماء؛ فهو يلون السماء فقط، مع احترام السحب والأفق. إنه يعامل "التعديل" كعملية "إبداع".
  • الحفاظ على الهوية: إذا أردت وضع وجهك في صورة عطلة، فإنه يحافظ على وجهك ليبدو تماماً مثلك، حتى لو تغيرت الإضاءة. إنه يشبه خياطاً ماهراً يمكنه حياكة زي جديد على مانيكان دون تشويه شكل المانيكان.
  • النصوص داخل الصور: يمكنه كتابة الكلمات داخل الصورة (مثل لافتة على متجر) بإملاء مثالي ومنظور صحيح، وهو أمر تعاني منه العديد من نماذج الذكاء الاصطناعي.

5. العقل: التعلم من "المحادثات الطويلة"

يتعلم البشر من خلال إجراء محادثات طويلة متبادلة.

  • التطوير: يمكن لهذا النموذج تذكر محادثة تستمر لمدة 30 دقيقة أو تتضمن فيلمًا مدته ساعتان. هو لا ينسى أول شيء قلته عندما تصل إلى نهاية المحادثة. يمكنه الانتقة من التحدث عن حبكة فيلم إلى تحليل رسم بياني من ذلك الفيلم، كل ذلك في نفس جلسة الدردشة.

لماذا يهم هذا؟

فكر في الذكاء الاصطناضي العام (AGI) كهدف لبناء روبوت يمكنه القيام بأي شيء يمكن للإنسان القيام به.

  • قبل: كان لدينا روبوت يمكنه الكتابة، وروبوت يمكنه الرسم، وروبوت يمكنه التحدث. كان عليك تمرير العمل بينهم.
  • الآن: Ming-Flash-Omni هو عقل واحد موحد. يرى صورة، ويفهم القصة، ويكتب سيناريو لفيديو بناءً عليها، ثم يولد الفيديو مع تعليق صوتي — كل ذلك في خطوة واحدة.

باختدصار: Ming-Flash-Omni هو شريك إبداعي شامل، فائق السرعة، وعالي الكفاءة، يرى العالم بدقة عالية، ويتحدث بكل اللهجات، ويمكنه الرسم، والتعديل، والكتابة بمستوى من التحكم يبدو بشرياً تقريباً. إنه خطوة كبيرة نحو ذكاء اصطناعي لا يجيب على الأسئلة فحسب، بل يفهم حقاً ويبدع جنباً إلى جنب معنا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →