← أحدث الأبحاث
💻 computer science

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

إنَّ DREAM هو إطار عمل يُمكِّن التكيف القابل للتوسع لنماذج الرؤية واللغة والعمل (vision-language-action models) مع مساحات عمل جديدة من خلال التوليد التلقائي لبيانات الضبط الدقيق عبر إعادة البناء من الواقع إلى المحاكاة، وتخطيط المهام المدفوع بالنماذج اللغوية الكبيرة، ورندرة المسارات، مما يلغي الحاجة إلى عمليات التحكم عن بُعد البشرية المكلفة.

المؤلفون الأصليون: Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

نُشر 2026-09-01
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات بارعة في التكرار، حيث تؤدي نفس الحركة الدقيقة آلاف المرات في المصنع، لكنها تواجه صعوبة عندما يُطلب منها التكيف مع غرفة جديدة أو ترتيب مختلف قليستاً للأشياء. لتعليم روبوت مهمة جديدة، يعتمد المهندسون تقليدياً على طريقة تسمى "التحكم عن بُعد" (teleoperation)، حيث يقوم إنسان بتوجيه الآلة مادياً عبر الخطوات، وتسجيل كل حركة لإنشاء مجموعة بيانات تدريبية. ورغم فعالية هذه العملية، إلا أنها بطيئة ومكلفة وتتطلب وجود شخص لكل بيئة جديدة. يتجه مجال الروبوتات الآن نحو نهج مختلف: استخدام نماذج الذكاء الاصطناعي التي يمكنها فهم اللغة والرؤية في آن واحد. هذه النماذج، المدربة على كميات هائلة من البيانات، يمكنها بالفعل تخمين كيفية تحريك ذراع الروبوت بناءً على جملة بسيطة مثل "ضع المكعب الأزرق في الوعاء". ومع ذلك، حتى هذه الأنظمة المتقدمة غالباً ما تفشل عند وضعها في بيئة واقعية لم ترها من قبل، لأن التخطيط المحدد للغرفة، والإضاءة، والموضع الدقيق للأشياء يخلق تحدياً فريداً لا يمكن للتدريب العام حله.

قام باحثون في جامعة طوكيو بتطوير نظام يسمى DREAM لحل هذه المشكلة دون الحاجة إلى توجيه إنسان للروبوت. فبدلاً من طلب قيام شخص بتوضيح المهمة، يأخذ النظام مقطع فيديو قصيراً لمساحة العمل الفارغة وتعليماً نصياً بسيطاً. ثم يقوم ببناء نسخة رقمية دقيقة لتلك الغرفة، كاملة مع زوايا الكاميرا الدقيقة التي ستستخدمها الروبوت للرؤية. وباستخدام محرك تخطيط متطور، يستنتج الكمبيوتر تسلسلاً منطقياً من الحركات لتحقيق الهدف، مثل التقاط جسم ووضعه في مكان آخر. بعد ذلك، يولد آلاف المتغيرات لهذه المهمة، محاكياً مواضع بدء مختلفة للأشياء، ويسجل حركات الروبوت الناجحة في هذا العالم الافتراضي. يتم بعد ذلك تحويل هذه الحركات المحاكات إلى صور واقعية وبيانات حركة، والتي تُستخدم لضبط "دماغ" الروبوت بدقة قبل أن يلمس العالم الحقيقي.

يكمن جوهر هذه الطريقة في إنشاء "توأم رقمي" للمساحة الفيزيائية. يبدأ الباحثون بتسجيل فيديو قصير للطاولة أو مساحة العمل باستخدام كاميرا محمولة عادية. يحلل النظام هذه اللقطات لإعادة بناء المشهد في ثلاثة أبعاد، ملتقطاً ملمس وموضع كل سطح وكل جسم. ومن الأهمية بمكان، أنه يربط هذا الإعادة الرقمية مع نظام إحداثيات الروبوت الخاص، مما يضمن أن الكاميرا الافتراضية ترى العالم تماماً كما سترى كاميرات الروبوت الحقيقية. وهذا يسمح للنظام بتوليد بيانات تدريب تبدو وتشعر وكأنها من البيئة الحقيقية، مما يسد الفجوة بين محاكاة الكمبيوتر والعالم المادي. وبمجرد بناء البيئة، يستخدم النظام نموذج لغة كبيراً لترجمة التعليمات البشرية إلى مجموعة من الأهداف المنطقية. على سبيل المثال، إذا كانت التعليمات هي تعبئة الفاكهة، فإن النظام يفهم أنه يجب عليه أولاً الوصول إلى الموزة، ثم الخوخة، وأخيراً وضعهما على الطبق.

بعد تحديد الأهداف، يستخدم النظام مخططاً للمهام والحركة لتحديد الخطوات الفيزيائية المطلوبة للنجاح. يعمل هذا المخطط كمهندس منطقي للغاية، حيث يقسم المهمة إلى تسلسل من الإجراءات ويحسب حركات المفاصل الدقيقة التي يحتاجها الروبوت لتجنب الاصطدامات والوصول إلى أهدافه. يقوم بتوليد مجموعة صغيرة من المسارات الناجحة الأولية، المعروفة باسم "نماذج العرض المصدرية". ولإنشاء قدر كافٍ من البيانات لتدريب روبوت قوي، يقوم النظام بتوسيع هذه الأمثلة القليلة إلى مجموعة بيانات ضخمة. يأخذ الحركات الناجحة ويطبقها على مئات السيناريوهات الجديدة والعشوائية حيث تكون الأشياء في أماكن مختلفة. ويتحقق من كل محاولة جديدة لضمان أنها ممكنة فيزيائياً وآمنة، مستبعداً أي محاولة تفشل. أخيراً، يقوم بمعالجة هذه المحاولات الناجحة إلى إطارات فيديو واقعية، مما يخلق مجموعة بيانات كاملة من أزواج (الصورة-والحركة) التي يمكن للروبوت التعلم منها.

اختبر الباحثون هذا النهج على ذراع روبوت حقيقية تؤدي مهمتين متميزتين: وضع مكعب أزرق في وعاء أحمر، وتعبئة موزة وخوخة على طبق بترتيب محدد. وقارنوا بين الروبوتات المدربة على بيانات تم إنشاؤها بواسطة DREAM مقابل الروبوتات المدربة على بيانات جمعها مشغلون بشريون قاموا بتوجيه الآلة. أظهرت النتائج أن التوأم الرقمي كان متنبئاً موثوقاً بالأداء في العالم الحقيقي؛ فإذا أدى الروبوت بشكل جيد في المحاكاة، فسيؤدي بشكل جيد في العالم الحقيقي. والأهم من ذلك، أثبت النظام أنه قابل للتوسع بشكل كبير. فبينما يمكن للمشغل البشري إنتاج حوالي مائة نموذج توضيحي في وقت معقول، أنتج نظام DREAM ألف مثال تدريبي عالي الجودة. وعند تدريب الروبوتات على هذا الحجم الأكبر من البيانات المولدة تلقائياً، حققت الروبوتات معدلات نجاح أعلى من تلك التي تدربت على المجموعة الأصغر من العروض البشرية.

تسلط الدراسة الضوء على تحول كبير في كيفية تعلم الروبوتات. وبينما يظل التحكم البشري عن بُعد وسيلة صالحة لجمع البيانات، إلا أنه محدود بوقت وانتباه المشغل. وفي المقابل، يتطلب نظام DREAM مجرد تصوير فيديو واحد وتعليماً نصياً لإنتاج مكتبة واسعة من أمثلة التدريب. يستغرق الإعداد الأولي بضع دقائق، ولكن بمجرد تشغيل النظام، يمكنه توليد آلاف سيناريوهات التدريب في الوقت الذي يستغرقه الإنسان لتسجيل حفنة قليلة فقط. وجد الباحثون أنه بالنسبة للمهام البسيطة، سمحت البيانات المولدة تلقائياً للروبوت بالنجاح في كثير من الأحيان أكثر من البيانات التي جمعها البشر، ببساطة لأن حجم الممارسة كان أكبر بكثير. وبالنسبة للمهام الأكثر تعقيداً ومتعددة الخطوات، ظل النظام يتفوق على جمع البيانات البشرية، رغم أن تعقيد المهمة تطلب وقتاً حسابياً أكثر لتخطيط الحركات الأولية.

يشير هذا العمل إلى مستقبل يمكن فيه نشر الروبوتات في بيئات جديدة بأقل قدر من التدخل البشري. فبدلاً من انتظار متخصص ليقضي ساعات في تعليم روبوت كيفية التنقل في مطبخ أو ورشة عمل محددة، يمكن للمستخدم ببساطة أن يُري الروبوت الغرفة ويخبره بما يجب فعله. سيقوم النظام بعد ذلك بالعمل الشاق المتمثل في إنشاء بيانات التدريب، مما يضمن استعداد الروبوت للتحديات المحددة لتلك المساحة. يقر الباحثون بأن نظامهم الحالي يعمل بشكل أفضل مع الأجسام الصلبة على الطاولات الثابتة، وأن العمل المستقبلي سيتعين عليه معالجة السيناريوهات الأكثر تعقيداً التي تتضمن أجساماً لينة أو متحركة. ومع ذلك، فإن القدرة على تحويل فيديو بسيط وجملة إلى سياسة روبوت مدربة بالكامل تمثل خطوة كبيرة نحو جعل المساعدين الروبوتيين أكثر قدرة على التكيف وسهولة في الاستخدام اليومي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →