LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models
يُعد LD4WAM إطار عمل مبتكر يجسّر الفجوة بين المعارف المسبقة للفيديو البشرية والتحكم الروبوتي القابل للتنفيذ من خلال تعلم ديناميكيات كامنة متوافقة حركياً ومستقلة عن التجسيد، مما يمكّن نموذج عالم يعتمد على مزيج من المحولات (mixture-of-transformers) من التعميم بفعالية عبر مختلف الأجسام والخلفيات والتجسيدات الروبوتية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما عانت الروبوتات في تعلم كيفية المراقبة من البشر. فبينما يمكن برمجة الآلة بتعليمات دقيقة لمهمة واحدة، فإن تعليمها فهم الواقع المرن والمضطرب للحركة البشرية كان تحديًا هائلًا. لسنوات، حاول الباحثون سد هذه الفجوة عبر تغذية الروبوتات بآلاف الساعات من الفيديو، آملين أن تتعلم الآلة قواعد الفيزياء والسبب والنتيجة بمجرد المراقبة. ومع ذلك، استمرت مشكلة جوهرية: عندما يشاهد الروبوت يدًا بشرية تلتقط كوبًا، فإنه يرى بكسلات تتغير على الشاشة. هو لا يدرك بطبيعته أن اليد تتحرك بطريقة معينة لتحقيق هدف ما، كما أنه لا يعرف كيفية ترجمة تلك الملاحظة البصرية إلى الأوامر الحركية المحددة المطلوبة لجسمه الميكانيكي الخاص ليتحرك. العالم المرئي غني بالتفاصيل، لكن الكثير من تلك التفاصيل — مثل لون القميص أو ملمس الطاولة — لا علاقة لها بميكانيكا الفعل نفسه. ولتعليم الروبوت بفعالية، يحتاج العلماء إلى وسيلة لتجريد الضجيج البصري واستخراج الحركة النقية الكامنة، وإنشاء لغة عالمية يمكن لكل من الفيديو البشري والميكانيكا الروبوتية فهمها.
لقد طور فريق من الباحثين نظامًا جديدًا يسمى LD4WAM يحل هذه المشكلة عن طريق إنشاء طبقة وسطى من الفهم بين ما يراه الروبوت وما يفعله. فبدلاً من محاولة التنبؤ بالإطار التالي للفيديو بكسل تلو الآخر، وهو ما يؤدي غالبًا إلى نماذج جيدة في تخمين الصور ولكنها سيئة في الحركة، درب الباحثون نظامهم للتركيز على "الديناميكيات الكامنة المتوافقة مع الحركة". وبتعبير أبسط، يتعلم النظام تجاهل مظهر الأشياء والمظهر المحدد للبيئة، والتركيز بدلاً من ذلك على التغييرات الجوهرية في الحركة بين لحظة وأخرى. إنه يعمل كمترجم، حيث يحول البيانات البصرية المعقدة ليد بشرية تمتد نحو جسم ما إلى تمثيل مجرد وموجز لتلك الحركة. يُستخدم هذا التمثيل بعد ذلك لتوجيه أفعال الروبوت الخاصة، مما يسمح له بالتعلم من الفيديوهات البشرية دون الارتباك بسبب الاختلافات بين الجسم البشري والذراع الروبوتية.
لبناء هذا النظام، جمع الباحثون أولاً مجموعة ضخمة من البيانات، تجمع بين أكثر من 5,000 ساعة من الفيديو لكل من البشر والروبوتات. تضمنت هذه المجموعة سيناريوهات متنوعة، من المهام البسيطة مثل فرز العناصر إلى عمليات التحكم المعقدة التي تتضمن أدوات دقيقة. قاموا بتنظيف هذه البيانات بصرامة، من خلال إزالة المقاطع التي اهتزت فيها الكاميرا كثيرًا أو التي لم تكن الأيدي مرئية فيها، لضمان أن يتعلم النظام فقط من الأمثلة الواضحة وذات الصلة. يكمن جوهر ابتكارهم في كيفية معالجة هذه البيانات؛ فقد دربوا نموذجًا لمراقبة تسلسل من إطارات الفيديو وتحديد "الفرق" (delta) أو التغير في الموضع الذي حدث، مما يعني فعليًا تعلم الفرق بين الصورة الثابتة والصورة المتحركة. ومن خلال مواءمة هذه التغييرات المتعلمة مع الحركات الفعلية المسجلة من الروبوتات، أنشأوا جسرًا يربط العالم المرئي بالعالم المادي. يسمح هذا الجسر للروبوت بفهم أن نمطًا بصريًا معينًا يتوافق مع فعل ميكانيكي محدد، بغض النظر عما إذا كان الفيديو الأصلي يعرض إنسانًا أم آلة.
يعمل النظام في مرحلتين رئيسيتين. أولًا، يقوم نموذج متخصص بتحليل الفيديو لاستخراج أنماط الحركة هذه، مستبعدًا التفاصيل غير ذات الصلة مثل الفوضى في الخلفية أو تغيرات الإضاءة. ثانيًا، يستخدم "نموذج عمل العالم" الأكبر هذه الأنماط المستخرجة للتنبؤ بما سيحدث بعد ذلك ولتقرير الإجراء الذي يجب اتخاذه. تم تصميم هذا النموذج الثاني ليكون مرنًا؛ إذ يمكنه توليد تنبؤ بمستقبل الفيديو لضمان منطقية الفيزياء، بينما يستخدم في الوقت نفسه أنماط الحركة المستخرجة لتحديد الحركات الدقيقة اللازمة لتحقيق هدف ما. اختبر الباحثون هذا النهج بطريقتين: في محاكاة حاسوبية واقعية للغاية تتضمن 5 الـ 50 مهمة مختلفة، وعلى روبوتات فيزيائية حقيقية مجهزة بكل من مقابض بسيطة ذات إصبعين وأيدٍ معقدة تشبه اليد البشرية. وفي المحاكاة، حقق النظام معدل نجاح بنسبة 93.4 بالمائة، متفوقًا على الأساليب الرائدة السابقة. وعند تطبيقه على روبوتات حقيقية، أظهر قدرة على التعامل مع مهام طويلة متعددة الخطوات، مثل ترتيب المكتب أو طي قميص، وحتى أدى بشكل جيد مع الأيدي الماهرة التي تتلاعب بأشياء مثل مكعب روبيك.
كان أحد أهم النتائج هو قدرة النظام على التعميم في مواقف لم يسبق له رؤيتها. فعند اختباره مع أشياء لم يواجهها أثناء التدريب، أو في غرف ذات خلفيات وإضاءة مختلفة، حافظ الروبوت على مستوى عالٍ من الأداء. وهذا يشير إلى أن النظام قد تعلم حقًا الميكانيكا الأساسية للمهام بدلاً من مجرد حفظ مشاهد بصرية محددة. على سبيل المثال، عند الطلب منه نقل كوب إلى موقع جديد، استطاع الروبوت القيام بذلك حتى لو كان الكوب مختلف الشكل أو كانت الطاولة ذات ملمس مختلف. وجد الباحثون أن مفتاح هذا النجاح كان الطبيعة "المتوافقة مع الحركة" لتدريبهم؛ فمن خلال ترسيخ التعلم في الحركة الفيزيائية الحقيقية، تجنب النظام الوقوع في فخ الإفراط في التخصيص (over-fitting) للتفاصيل البصرية التي لا تهم المهمة. وتشير النتائج إلى أن هذا النهج يسم يسمح للروبوتات بالتعلم من المورد الهائل وغير المستغل لبيانات الفيديو البشرية، وتحويلها إلى دليل عملي للتحكم الروبوتي.
كما سلطت الدراسة الضوء على ما لا يعمل بشكل جيد مثل الطريقة الجديدة. فالأساليب السابقة التي حاولت التعلم مباشرة من تغيرات البكسل دون مواءمتها مع الحركة الحقيقية غالبًا ما فشلت في إنتاج نتائج قابلة للتنفيذ، مما ترك الروبوت غير قادر على ترجمة ما يراه إلى ما يجب أن يفعله. وبالمثل، فإن الأساليب التي اعتمدت بشكل كبير على مطابقة أجزاء الجسم البشري مباشرة مع مفاصل الروبوت واجهت صعوبات عندما كان للروبوت بنية فيزيائية مختلفة، مثل المقبض بدلاً من اليد. يتجنب النظام الجديد هذه العثرات من خلال التركيز على الديناميكيات المجردة للحركة بدلاً من التشريح المحدد للفاعل. وبينما أظهر النظام بعض القيود عندما تغيرت نسيج الخلفية بشكل جذري، إلا أنه لا يزال يتفوق بشكل كبير على النماذج الأخرى في هذه الظروف الصعبة، مما يثبت أن النهج المتوافق مع الحركة يوفر أساسًا قويًا لتعلم الروبوتات.
في النهاية، يمثل هذا العمل تحولًا في كيفية تعلم الروبوتات من المراقبة. فمن خلال إنشاء تمثيل لا يعتمد على جسم محدد يقوم بالفعل، أظهر الباحثون أن الروبوت يمكنه التعلم من فيديو بشري وتطبيق تلك المعرفة على شكله الميكانيكي الفريد. لا يتطلب النظام أن يمتلك الروبوت جسمًا يشبه جسم الإنسان ليستفيد من العروض البشرية؛ بل يتطلب فقط وسيلة لفهم القصد والحركة وراء الفعل. ومع مجموعة بيانات تضم أكثر من 270 مليون إطار واختبارات ناجحة على أجهزة حقيقية، أثبت الباحثون أن هذه الطريقة ليست مجرد إمكانية نظرية، بل هي أداة عملية لبناء روبوتات أكثر قدرة وتكيفًا. إن القدرة على التعلم من هذا الكم الهائل من البيانات البشرية تفتح الباب أمام مستقبل يمكن فيه تدريب الروبوتات على مجموعة واسعة من المهام دون الحاجة إلى عروض توضيحية مكلفة ومستهلكة للوقت لكل وظيفة جديدة قد يواجهونها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.