Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction
إن DEX-X هو إطار عمل يسخر المحاكاة كمحرك إكمال لمسي لإعادة بناء تفاعلات اليد مع الأشياء ذات الأساس الفيزيائي من فيديوهات بشرية أحادية الكاميرا، مما يتيح تدريب ونشر سياسات التلاعب البارع البصرية-اللمسية في العالم الحقيقي دون الحاجة إلى جمع بيانات من جانب الروبوت.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لطالما كانت الروبوتات بارعة في أرض المصنع، حيث تتحرك بدقة على مسارات ثابتة لتجميع السيارات أو رص الصناديق. ولكن بمجرد الخروج من تلك البيئة المحكومة، غالبًا ما تعاني نفس هذه الآلات. فاليد البشرية هي أعجوبة من أعاجيب التكيف، فهي قادرة على التقاط بيضة هشة، أو تدوير مقبض باب، أو فرك طاولة، كل ذلك مع التكيف المستمر مع الدفع والسحب غير المرئي الناتج عن التلامس. ولتكرار ذلك، لجأ العلماء إلى مصدرين رئيسيين للبيانات: تجارب الروبوت المباشرة، وهي بطيئة ومكلفة، وفيديوهات البشر، وهي وفيرة ومجانية. وكان التحدي دائمًا يتمثل في قطعة مفقودة من اللغز؛ ففيديوهات البشر تظهر لنا كيف تبدو الأيدي أثناء حركتها، لكنها تخفي المعلومة الأكثر أهمية للروبوت: حاسة اللمس. فبدون معرفة مدى قوة الضغط أو متى ينزلق جسم ما، لا يمكن للروبوت أن يتعلم كيفية التعامل مع الأدوات أو التفاعل مع العالم بالطرق المعقدة التي تعتمد على التلامس كما يفعل البشر.
قدم فريق من الباحثين من جامعة تسينغهوا ومؤسسات أخرى حلاً لهذه الفجوة، حيث قدموا نظامًا يسمى DEX-X. يتساءل عملهم سؤالًا جوهريًا: هل يمكن للروبوت أن يتعلم أداء مهام دقيقة تعتمد على اللمس بمجرد مشاهدة فيديوهات بشرية، دون الحاجة أبدًا لجمع بياناته الفيزيائية الخاصة أولاً؟ اعتمدت الإجابة التي وجدوها على استخدام ذكي للمحاكاة الحاسوبية. فبدلاً من محاولة تخمين معلومات اللمس المفقودة من الفيديو وحده، يستخدم الباحثون الفيديو لتوجيه روبوت داخل عالم افتراضي. وفي هذا المختبر الرقمي، تُفرض قوانين الفيزياء بصرامة؛ فعندما يلمس الروبوت الافتراضي جسمًا ما، يحسب الكمبيوتر القوى الدقيقة المتضمنة، مما يؤدي فعليًا إلى "ملء" حاسة اللمس المفقودة التي افتقر إليها الفيديو الأصلي. وتعمل هذه العملية على تحويل سجل بصري سلبي إلى درس فيزيائي نشط.
بدأ الباحثون بأخذ فيديوهات أحادية العدسة لبشر يقومون بمهام متنوعة، مثل التقاط كوب، أو استخدام ممسحة لتنظيف طاولة، أو طرق مسمار. واستخدموا رؤية حاسوبية لتتبع حركة الأيدي البشرية والأشياء التي يحملونها، وإعادة بناء الحركة في ثلاثة أبعاد. ثم نُقلت هذه الحركة المعاد بناؤها إلى ذراع ويد روبوت رقمية، والتي تتكون من تسعة وعشرين جزءًا متحركًا، مما يحاكي تعقيد الطرف البشري عن قرب. ومع ذلك، لم يكن مجرد نسخ الحركات البشرية كافيًا؛ ففي العالم الحقيقي، غالبًا ما يفشل الروبوت الذي يتبع مسار الإنسان بشكل أعمى لأنه لا يستطيع الشعور إذا كان يضغط بقوة زائدة أو إذا كان الجسم ينزلق. ولحل هذه المشكلة، قام الفريق بتدريب روبوت "معلم" داخل المحاكاة. شاهد هذا المعلم الحركة البشرية كدليل، لكنه كان حرًا في استكشاف وتعديل حركاته الخاصة بناءً على القوى المحاكية التي يشعر بها عند أطراف أصابعه. ومن خلال آلاف التجارب في العالم الافتراضي، تعلم هذا المعلم الحفاظ على قبضة مستقرة والتحكم في الأشياء من خلال التفاعل مع الدفع والسحب غير المرئي الناتج عن التلامس، وهي مهارة لم يكن بإمكان فيديو الإنسان الأصلي تعليمها بمفرده.
بمجرد أن أتقن المعلم هذه المهارات في المحاكاة، قام الباحثون باستخلاص معرفته في سياسة "طالب". صُمم هذا الطالب ليكون قابلًا للنشر على أجهزة حقيقية. وعلى عكس المعلم، الذي كان لديه وصول إلى معرفة مثالية بالمحاكاة، كان على الطالب الاعتماد فقط على ما يمكن للروبوت الحقيقي استشعاره: عرض كاميرا للمشهد، وموقع مفاصله، ومستشعرات الضغط في أطراف أصابعه. تعلم الطالب تفسير سحابة من النقاط تمثل العالم من حوله، حيث دمج الشكل البصري للجسم مع بيانات القوة من مستشعراته. سمح ذلك للطالب بالعمل دون الحاجة إلى المعرفة الداخلية المثالية للمحاكاة، مما جعله جاهزًا للتعامل مع الواقع الفعلي المليء بالمتغيرات.
تم اختبار نتائج هذا النهج على روبوت حقيقي مجهز بيد وذراع ذات تسعة وعشرين درجة من الحرية. طلب الباحثون من الروبوت أداء مهام لم يرها من قبل، باستخدام السياسات المتعلمة من الفيديوهات البشرية والمحاكاة فقط. وفي اختبار لالتقاط مكعب، نجح الروبوت في ثمان وعشرين محاولة من أصل ثلاثين، بنسبة نجاح بلغت 93 بالمئة. كما تمكن من سكب الماء من كوب ورفع أشياء بموثوقية مماثلة. وأظهر النظام أيضًا قدرة على التعميم على أشياء لم يواجهها أثناء التدريب؛ فعندما عُرِض عليه مكعب رفيع أو بطة لعبة مختلفة عن أشياء التدريب، تمكن الروبوت من التقاطهما، وإن كان بنسب نجاح أقل قليلاً، مما أثبت أن المهارات المتعلمة لم تكن مجرد حركات محفوظة بل استراتيجيات قابلة للتكيف.
ومع ذلك، فإن النظام لا يخلو من القيود. لاحظ الباحثون أن المهام التي تتطلب تلامسًا مستدامًا وطويل الأمد، مثل تنظيف الطاولة باستخدام الممسحة، كانت أكثر صعوبة. فقد نجح الروبوت في حوالي 53 بالمئة من هذه التجارب، وغالبًا ما حدثت الإخفاقات عندما يفقد الروبوت قبضته أو يصطدم بالطاولة أثناء الحركة. وهذا يشير إلى أنه بينما توفر المحاكاة جسرًا قويًا للتعلم، فإن تعقيد الحفاظ على التلامس بمرور الوقت يظل عقبة كبيرة. كما وجد الفريق أن إزالة المدخلات البصرية أو التغذية الراجعة اللمسية تقلل الأداء بشكل كبير، مما يؤكد أن كلا الحاستين ضروريتان لكي يتمكن الروبوت من التنقل في العالم المادي بفعالية.
يشير هذا العمل إلى أن التفاعل الفيزيائي المحاكى يمكن أن يعمل كحلقة وصل حيوية بين المكتبة الضخمة من فيديوهات البشر المتاحة على الإنترنت وتطوير روبوتات قادرة وقابلة للنشر. ومن خلال استخدام المحاكاة لتوليد بيانات اللمس المفقودة، أظهر الباحثون أن الروبوتات يمكنها تعلم مهارات معقدة غنية بالتلامس دون الحاجة إلى جمع بيانات متخصصة ومكلفة. وتشير النتائج إلى مسار للمستقبل حيث يمكن للروبوتات التعلم من وفرة النشاط البشري الملتقط عبر الفيديو، وترجمة تلك العروض البصرية إلى قدرات فيزيائية من خلال الاختبار الصارم في عالم افتراضي. وبينما تظل التحديات قائمة في التعامل مع التفاعلات الأكثر تعقيدًا، فإن القدرة على نقل هذه المهارات مباشرة إلى الأجهزة الحقيقية دون الحاجة إلى مزيد من الضبط تمثل خطوة مهمة نحو آلات أكثر تنوعًا واستقلالية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.