← أحدث الأبحاث
🤖 AI

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

يُعدّ Dynin-Omni أول نموذج تأسيسي شامل الأنماط يعتمد على الانتشار المقنع (masked-diffusion)، حيث يوحد فهم وتوليد النصوص والصور والكلام والفيديو ضمن بنية واحدة، محققاً أداءً هو الأفضل في فئته عبر مختلف معايير الاختبار متعددة الوسائط، مع إثبات إمكانات الانتشار المقنع كنموذج موحد للنمذجة من أي نوع إلى أي نوع آخر.

المؤلفون الأصليون: Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

نُشر 2026-04-02
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك سكيناً سويسرياً. عادةً ما تحتوي هذه الأدوات على أداة محددة لكل مهمة: مفك براغي للبراغي، وفتاحة زجاجات للمشروبات، وسكين للقطع. إذا أردت فتح زجاجة، عليك طي فتاحة الزجاجات، واستخدامها، ثم طيها مرة أخرى للحصول على السكين. الأمر يعمل، لكنه يتسم ببعض التعقيد ويتطلب منك التبديل بين الأدوات باستمرار.

Dynin-Omni يشبه أداة سحرية مكونة من قطعة واحدة يمكنها فعل كل شيء — القطع، والربط، وفتح الزجاجات — في آن واحد، دون الحاجة أبداً لطي جزء مختلف. إنه نوع جديد من الذكاء الاصطناعي الذي لا يكتفي فقط بـ "قراءة" النصوص، أو "رؤية" الصور، أو "سماع" الكلام بشكل منفصل؛ بل يفهمها ويصنعها جميعاً في وقت واحد، باستخدام عقل واحد موحد.

إليك شرح بسيط لكيفية عمله ولما কেন يعد أمراً بالغ الأهمية:

1. الطريقة القديمة: خط التجميع (النماذج ذات الترتيب الذاتي - Autoregressive Models)

تعمل معظم نماذج الذكاء الاصطاري الحالية مثل خط تجميع صارم أو شخص يكتب قصة كلمة بكلمة. لا يمكنهم النظر إلى الأمام؛ يمكنهم فقط تخمين الكلمة التالية بناءً على ما سبقها.

  • المشكلة: هذا رائع لكتابة جملة، لكنه سيء جداً لأشياء مثل الصور أو الموسيقى. فالصورة ليست قصة لها "بداية" و"نهاية". إنها صورة كاملة دفعة واحدة. إجبار الذكاء الاصطناعي على بناء صورة بكسل تلو الآخر من اليسار إلى اليمين يشبه محاولة رسم لوحة فنية بشرط أن يُسمح لك برسم نقطة صغيرة واحدة فقط في كل مرة، وبشكل صارم من اليسار إلى اليمين. هذا يجعل العملية بطيئة ويحد من الإبداع.
  • الحل الهجين: تحاول بعض النماذج الأحدث إصلاح ذلك باستخدام نهج "الفريق". حيث يكون لديهم عقل للنصوص يتحدث إلى عقل منفصل للصور، والذي يتحدث بدوره إلى عقل للكلام. يشبه الأمر قائد أوركسترا يدير ثلاث فرق أوركسترا مختلفة. هذا يعمل، لكن الفرق قد لا تعزف دائماً في تناغم تام.

2. الطريقة الجديدة: لعبة "الشم والتخمين" (الانتشار المقنع - Masked Diffusion)

يستخدم Dynin-Omni استراتيجية مختلفة تسمى الانتشار المقنع. تخيل أن لديك جملة، أو صورة، أو أغنية، وقام شخص ما بتغطية 50% منها بشريط أسود (قناع).

  • اللعبة: مهمة الذك_ الاصطناعي هي النظر إلى الأجزاء المرئية وتخمين ما تحت الشريط.
  • السحر: على عكس خط التجميع، يمكن للذكاء الاصطناعي النظر إلى الصورة بأكملها في وقت واحد. يمكنه تخمين البداية، والمنتصف، والنهاية في آن واحد. ثم يكشف عن جزء صغير من الإجابة، ويغطيها مرة أخرى، ثم يحسن تخمينه. يكرر هذا مراراً وتكراراً، لتصبح الصورة أو النص أو الصوت أكثر وضوحاً في كل جولة، حتى يصبح العمل كاملاً ومثالياً.

ولأنه يستطيع رؤية "المستقبل" و"الماضي" في نفس الوقت، فإنه ينتج نتائج أكثر طبيعية وتماسكاً، خاصة للأشياء التي ليس لها ترتيب صارم مثل الصور والكلام.

3. خدعة "اللغة الواحدة"

أكبر تحدٍ يواجه الذكاء الاصطناعي هو أن النصوص والصور والأصوات كلها "لغات" مختلفة.

  • حل Dynin-Omni: يقوم بترجمة كل شيء إلى "أبجدية" مشتركة واحدة من "الرموز" (Tokens) (وحدات بناء رقمية).
    • الكلمة هي رمز.
    • رقعة صغيرة من صورة هي رمز.
    • شريحة صغيرة من الصوت هي رمز.
  • النتيجة: لا يحتاج الذكاء الاصطناعي إلى "عقل للصور" أو "عقل للكلام". هو فقط يرى سلسلة طويلة من الرموز. سواء كان يقرأ كتاباً، أو يصف فيديو، أو يغني أغنية، فهو مجرد عملية ملء للرموز المفقودة بنفس الطريقة. وهذا يسمح له بالدمج والمزج دون عناء. على سبيل المثال، يمكنك أن تطلب منه "رسم صورة لقط يغني الأوبرا"، وسيفهم أن جزء "القط" وجزء "الغناء" هما مجرد أنواع مختلفة من الرموز في نفس الجملة.

4. كيف علموه (التدريب ثلاثي المراحل)

تعليم نموذج للقيام بكل شيء في وقت واحد أمر صعب. إذا ألقيت بطفل في مسبح، ثم في محيط عميق، ثم في فرقة جاز في آن واحد، فقد يغرق أو يصاب بالارتباك. استخدم الباحثون وصفة تدريب ذكية من ثلاث خطوات:

  1. المرحلة الأولى: مرحلة "الطالب الجديد": علموا النموذج أولاً كيفية التعامل مع "اللغات" الجديدة (الفيديو والكلام) من خلال التمسك بمهام بسيطة، مثل تحويل الكلام إلى نص. لم يطلبوا منه القيام بعمليات تفكير معقدة بعد.
  2. المرحلة الثانية: مرحلة "الدمج": هذا هو الجزء الذكي. عندما أضافوا الكلام والفيديو، بدأ النموذج ينسى كيفية الكتابة الجيدة بالإنجليزية أو رسم صور جيدة (وهي مشكلة تسمى "النسيان الكارثي"). ولحل هذه المشكلة، استخدموا تقنية تسمى الدمج المتمايز للأنماط (Modality-Disentangled Merging).
    • تشبيه: تخيل أن لديك شيفاً ماهراً (النموذج الأصلي) بارعاً في الطبخ. ثم وظفت مساعد شيف جديداً بارعاً في الخبز. بدلاً من طرد الشيف الماهر واستبداله، أو مجرد خلط عقولهم عشوائياً، قمت بدمج مهاراتهم بعناية. لقد حافظت على مهارات استخدام السكين للشيف الماهر (النصوص/الصور) وأضفت مهارات الخبز لمساعد الشيف (الكلام/الفيديو) دون إفساد الوصفات الأصلية.
  3. المرحلة الثالثة: مرحلة "الدروس المتقدمة": الآن بعد أن تعلم النموذج كل اللغات، علموه كيف يصبح عبقرياً. أعطوه ألغازاً منطقية صعبة، وصوراً عالية الدقة، وأحادث طويلة ليجعلوه أكثر ذكاءً ودقة.

5. لماذا هذا مهم؟

  • إنه أسرع وأذكى: لأنه لا يضطر لانتظار انتهاء رمز واحد قبل البدء في الآخر، يمكنه إنشاء مخرجات معقدة بسرعة أكبر بكثير.
  • إنه موحد: لا تحتاج للتبديل بين أدوات ذكاء اصطناعي مختلفة للنصوص والصور والصوت. نموذج واحد يفعل كل شيء.
  • إنه مفتوح المصالم: جعل المبتكرون الكود والنموذج متاحين للجميع لاستخدامهم، وهو أمر نادر لمثل هذه التكنولوجيا القوية.

باختصار: Dynin-Omni هو أول ذكاء اصطناعي يعامل النصوص والصور والفيديو والكلام كمواطنين متساوين في مدينة واحدة، بدلاً من إجبارهم على العيش في أحياء منفصلة. ومن خلال استخدام لعبة "التخمين والتحسين" بدلاً من قاعدة "كلمة واحدة في كل مرة" الصارمة، فإنه يخلق ذكاءً أكثر مرونة وقوة وشبهاً بالبشر، يمكنه فهم وإنشاء أي شيء، وكل شيء، في آن واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →