← أحدث الأبحاث
🤖 machine learning

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

تقدم دينين-روبوتيكس (Dynin-Robotics) نموذج انتشار موحداً متعدد الأنماط يعامل اللغة والرؤية والأفعال كرموز منفصلة للتعلم المشترك للتنبؤ بالهدف، ونمذجة الديناميكيات، وتوليد الأفعال، محققاً أداءً تنافسياً في العديد من المعايير من خلال نمذجة المسار المشتركة وتوسيع النطاق في وقت الاختبار.

المؤلفون الأصليون: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

نُشر 2026-09-14
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كافحت الروبوتات لفهم العالم كما يفعل البشر. فبينما يمكن برمجة الآلة لتحريك ذراعها إلى إحداثية معينة، فإنها غالباً ما تفشل عندما تتطلب المهمة فهم تعليمات غامضة مثل "ناولني شيئاً لقطع العبوة". ولحل هذه المشكلة، يعمل الباحثون على بناء أنظمة تربط اللغة والرؤية والحركة الفيزيائية في عقل واحد. هذه الأنظمة، المعروفة بنماذج الرؤية واللغة والفعل (vision-language-action models)، تحاول تعلم ليس فقط ماهية الشيء، بل أيضاً كيف يتصرف وكيفية التعامل معه. كان التحدي يكمن في أن معظم النهج الحالية تعامل هذه المهارات بشكل منفصل: فقد يفهم جزء من النظام الكلمات، بينما يتعرف جزء آخر على الصورة، ويقوم جزء ثالث بحساب أوامر المحرك. هذا الفصل غالباً ما يترك الروبوت في حالة ارتباك عندما يتغير العالم الحقيقي أو عندما تُصاغ التعليمات بطرق غير متوقعة.

قدم فريق من الباحثين في جامعة سيول الوطنية نهجاً جديداً يسمى "Dynin-Robotics" يوحد هذه المهارات المنفصلة في نموذج واحد متماسك. فبدلاً من بناء عقل روبوت بقطع برمجية مختلفة لمهام مختلفة، أنشأوا نظاماً واحداً يتعلم التنبؤ بالمستقبل بطرق متعددة في آن واحد. تخيل روبوتاً، عندما يُعطى مهمة، لا يقوم فقط بحساب الخطوة التالية، بل يتخيل أيضاً كيف سيبدو المشهد بعد تلك الخطوة، وما هي الحالة النهائية المستهدفة، وكيف يصف المهمة بالكلمات. ومن خلال تدريب نموذج واحد للتعامل مع كل هذه التنبؤات في وقت واحد، وجد الباحثون أن الروبوت يصبح أفضل بكثير في اتباع التعليمات، حتى عندما تُصاغ تلك التعليمات بشكل مختلف عما تدرّب عليه.

جوهر هذا النظام هو طريقة تسمى "الانتشار المقنع" (masked diffusion). وببساطة، هذه عملية تعلم حيث يُعرض على النموذج تسلسل من المعلومات — مثل فيديو لمهمة ما، وتعليماً مكتوباً، وحركات الروبوت — ولكن يتم إخفاء أو "قناع" أجزاء من هذا التسلسل. مهمة النموذج هي النظر إلى الأجزاء المرئية وتخمين الأجزاء المخفية. على سبيل المثال، قد يرى صورة لكوب وكلمات "ارفع الكوب"، لكن بيانات الحركة مخفية، لذا يجب عليه التنبؤ بالحركة الصحيحة. وفي سيناريو آخر، قد يرى الحركة والتعليمات، لكن الصورة النهائية للكوب في اليد مخفية، لذا يجب عليه التنبؤ بالنتيجة. ومن خلال ممارسة ألعاب التخمين المختلفة هذه على مجموعة بيانات ضخمة تضم أكثر من 1.3 مليون مسار لروبوت، يتعلم النموذج فهماً عميقاً لكيفية ترابط اللغة والرؤية والفعل.

ما يجعل هذا النهج فريداً هو قدرة النموذج نفسه على الانتقال بين هذه الأدوار المختلفة فورياً. يمكنه العمل كسياسة (policy)، لتحديد الإجراء التالي؛ أو كنماذج عالم (world model)، للتنبؤ بما ستراه الكاميرا بعد إجراء معين؛ أو كمتنبئ بالهدف (goal predictor)، لتصور الحالة النهائية الناجحة لمهمة ما؛ أو كمعلم (teacher)، لإعادة بناء التعليمات الأصلية من فيديو لعمل الروبوت. تسمح هذه المرونة للنظام باستخدام تنبؤاته الخاصة لتحسين أدائه. فعلى سبيل المثال، قبل أن يقرر الروبوت كيفية تحريك ذراعه، يمكنه أولاً التنبؤ بكيفية ظهور الحالة النهائية. ثم يستخدم هذا الهدف المتوقع كدليل لتنقيح خطة عمله. عملية التطلع للمستقبل وتعديل الخطة في الوقت الفعلي تساعد الروبوت على التعامل مع المهام المعقدة التي تتطلب دقة في المحاذاة، مثل إدخال زهرة في مزهرية أو تكديس المكعبات بترتيب معين.

اختبر الباحثون هذا النظام على مجموعة متنوعة من الاختبارات القياسية لمعرفة مدى أدائه مقارنة بنماذج الروبوتات الرائدة الأخرى. في مهام المحاكاة القياسية، حقق النموذج نسبة نجاح بلغت 98.1%، مما وضعه ضمن أفضل المؤدين في هذا المجال. والأهم من ذلك، عندما تم اختباره في مهام تغيرت فيها التعليمات لتصبح أكثر غير مباشرة أو تجريدية، أظهر النظام قدرة كبيرة على التكيف. في إحدى التجارب، تم اختبار النموذج في مهمة كان عليه فيها اختيار فاكهة بناءً على وصف مثل "شيء حلو وعصيري طبيعياً" بدلاً من أمر مباشر مثل "التقط التفاحة". وبينما عانت النماذج الأخرى من هذه التحولات في اللغة، حافظ Dynin-Robotics على معدل نجاح مرتفع، مما أثبت أنه تعلم المفهوم الأساسي للمهمة بدلاً من مجرد حفظ عبارات محددة.

أثبت النظام فعاليته أيضاً في العالم الحقيقي. نشر الباحثون النموذج على ذراع روبوت فيزيائي معروف باسم "Franka Research 3". وفي سلسلة من الاختبارات الواقعية التي تضمنت التقاط الفاكهة، وفرز المكعبات الملونة، وتكديسها في ترتيبات محددة، حقق الروبوت متوسط معدل نجاح قدره 78.4% عبر أربعة ظروف تلاعب مختلفة. كان هذا الأداء قوياً بشكل خاص في المهام التي تتطلب اتباع تسلسل من الخطوات، مثل تكديس المكعبات وفق ترتيب لوني محدد من قبل المستخدم. إن القدرة على تصور الهدف والخطوات المتوسطة سمحت للروبوت بتصحيح مساره إذا ارتكب خطأً، وهي قدرة تفتقر إليها الأنظمة الأبسط.

بالإضافة إلى قدرته على التحكم في الروبوت، أظهر النموذج قدرة مذهلة على فهم وتوليد الأوصاف. فعندما يُعرض عليه فيديو لروبوت يؤدي مهمة، يمكن للنظام وصف ما يحدث بدقة، باستخدام أفعال مثل "التقط"، "ضع"، و"اطوِ"، وتحديد الأشياء من خلال لونها وموقعها. وعلى العكس من ذلك، عند إعطائه وصفاً لمهمة، يمكنه توليد تنبؤ بصري لما سيبدو عليه المشهد النهائي. تشير هذه القدرات إلى أن النموذج قد بنى تمثيلاً داخلياً غنياً للعالم المادي يتجاوز مجرد التحكم الحركي البسيط.

ولجعل هذا النظام سريعاً بما يكفي للاستخدام في الوقت الفعلي، طور الباحثون أيضاً طريقة متخصصة لتشغيل النموذج. ولأن النموذج يعمل من خلال صقل تخميناته بشكل متكرر، فقد يكون بطيئاً إذا اضطر لمعالجة كل خطوة واحدة تلو الأخرى. ابتكر الفريق تقنية تسمح للنموذج بالتنبؤ والالتزام بعدة خطوات من الحركة في وقت واحد. أدت هذه العملية إلى تسريع عملية اتخاذ القرار لدى الروبوت بمقدار 30 ضعفاً تقريباً مقارنة بالطريقة القياسية، مما جعل من الممكن تشغيل النموذج المعقد على أجهزة يمكنها مواكبة سرعة الروبوت الفيزيائي.

تشير نتائج هذا العمل إلى أن معاملة تعلم الروبوت كمسألة تنبؤ موحدة هي استراتيجية قوية. فمن خلال الجمع بين القدرة على فهم اللغة، والتنبؤ بالتغيرات البصرية، وتوليد الأفعال في إطار واحد، خلق الباحثون نظاماً أكثر قوة وقابلية للتكيف من النماذج السابقة. يشير نجاح Dynin-Robotics إلى أنه عندما يستطيع الروبوت تخيل المستقبل وفهم سياق المهمة، يصبح أكثر قدرة على التعامل مع الطبيعة غير المتوقعة للعالم الحقيقي. ورغم أنه لا يزال هناك عمل يتعين القيام به، خاصة فيما يتعلق بتوسيع هذه القدرات لتشمل تسلسلات أطول وأكثر تعقيداً من الأفعال، إلا أن هذا النهج يقدم مساراً واعداً نحو روبوتات يمكنها حقاً فهم بيئتها والتفاعل معها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →