Visible-Reachable Workspace for Perception-Aware Humanoid Design
تقدم هذه الورقة مفهوم حيز العمل المرئي المتاح (VRW) كمعيار تصميم مدرك للإدراك، وتثبت من خلال روبوت بشري مخصص بـ 31 درجة من الحرية مزود بكاميرات تعمل بشكل مستقل أن هذا التمفصل يوسع بشكل كبير إمكانية الوصول القابلة للملاحظة ويحسن كفاءة المناولة مقارنة بالتصاميم ذات المستشعرات الثابتة.
المؤلفون الأصليون:Boxi Xia, Zijiang Yang, Ryan Shin, Bokuan Li, Eric Wun-Hao Lu, Jacob Lee, Jiaxun Liu, Boyuan Chen
لكي يتمكن الروبوت من التقاط جسم ما، يجب أن يكون قادراً أولاً على الوصول إليه بذراعه. هذه الحقيقة الهندسية البسيطة كانت لفترة طويلة هي المعيار الذي يقيس به المهندسون قدرة الروبوت؛ حيث يقومون بحساب "مساحة العمل"، أو الحجم ثلاثي الأبعاد للفضاء الذي يمكن ليد الروبوت أن تصل إليه فعلياً. ومع ذلك، بالنسبة لروبوت يعتمد على الكاميرات ليرى ما يفعله، فإن القدرة على الوصول تمثل نصف القصة فقط. فقد يكون الهدف ضمن نطاق وصول ذراع الروبوت تماماً، ومع ذلك يكون غير مرئي تماماً لعينيه لأن جسم الروبوت يحجب الرؤية، أو لأن كاميراته موجهة في الاتجاه الخاطئ. إذا لم يستطع الروبوت رؤية الجسم الذي يحاول الإمساك به، فلن يتمكن من التخطيط للحركة للوصول إليه. وهذا يخلق فجوة محبطة: الروبوت قادر جسدياً على أداء المهمة، لكنه أعمى إدراكياً عنها، مما يضطره لإضاعة الوقت والطاقة في إعادة تموضع جسمه بالكامل لمجرد الحصول على لمحة عما يحتاجه.
سعى باحثون في جامعة ديوك إلى سد هذه الفجوة من خلال إعادة التفكير في كيفية بناء الروبوتات. فقد قدموا طريقة جديدة لقياس إمكانات الروبوت تسمى "مساحة العمل المرئية المتاحة". وبدلاً من مجرد السؤال عن المكان الذي يمكن للروبوت الوصول إليه، تساءلوا أين يمكنه الوصول والرؤية في نفس الوقت. ولاختبار هذه الفكرة، قاموا ببناء روبوت بشري جديد، وهو "ديوك هيومانويد V2" (Duke Humanoid V2)، المصمم خصيصاً لحل مشكلة الرؤية أثناء الوصول. وخلافاً لمعظم الروبوتات التي تمتلك كاميرات ثابتة في رؤوسها، أو كاميرات لا تتحرك إلا عندما يدور رأسها بالكامل، يمتلك هذا الروبوت كاميرتين مستقلتين مثبتتين على حامل جيروسكوبي (gimbal) خاص. يمكن لهذه الكاميرات أن تلتف يساراً، يميناً، أعلى، وأسفل بشكل مستقل، بعيداً تماماً عن أذرع الروبوت وجذعه. يسمح هذا التصميم للروبوت بالنظر إلى جسم واحد بكاميرا واحدة بينما تصل ذراعه إلى جسم آخر، كل ذلك دون تحريك جسمه.
استخدم الفريق مقياسهم الجديد لمقارنة هذا الروبوت المخصص مع عدة نماذج بشرية أخرى، ووجدوا فرقاً كبيراً في القدرة. ففي حالة "ديوك هيومانويد V2"، سمحت الكاميرات المتحركة بشكل مستقل للروبوت برؤية 97 بالمائة من المساحة التي يمكن لأذرعه الوصول إليها. وفي المقابل، عندما كانت الكاميرات نفسها مثبتة في مكانها، استطاع الروبوت رؤية 38 بالمائة فقط من تلك المساحة المتاحة. أما الروبوتات البشرية الأخرى، حتى تلك المزودة برقبة متحركة، فقد كان أداؤها أسوأ؛ إذ لم يستطع الروبوت ذو الرأس الثابت رؤية سوى 16 بالمائة من مساحة عمله المتاحة، بينما تراوحت الروبوتات ذات الرقاب التي يمكنها الدوران بين 48 و76 بالمائة. واكتشف الباحثون أن مجرد إضافة المزيد من الكاميرات لم يحل المشكلة بنفس كفاءة جعل الكاميرات الموجودة تتحرك بشكل مستقل. إن إضافة كاميرا ثانية مستقلة للروبوت زادت من قدرته على مراقبة منطقتين منفصلتين في آن واحد من 45 بالمائة إلى 95 بالمائة. أما إضافة كاميرا ثالثة فلم تقدم أي فائدة تذكر، حيث رفعت النسبة إلى 97 بالمائة فقط، مما يشير إلى أن وجود عينين متحركتين وموضوعتين جيداً أكثر قيمة بكثير من وجود ثلاث كاميرات ثابتة.
ولإثبات أن هذا التصميم يساعد الروبوت بالفعل على العمل بشكل أفضل، أجرى الفريق سلسلة من الاختبارات حيث تعين على الروبوت العثور على جسمين وجمعهما موضوعين في مواقع مختلفة. في بعض السيناريوهات، كان الجسمان جنباً إلى جنب؛ وفي حالات أخرى، كان أحدهما في الأمام والآخر في الخلف. وقارنوا بين الروبوت ذي الكاميرات المتحركة ونفس الروبوت عندما تكون كاميراته مثبتة في مكانها. وكانت النتائج واضحة: الروبوت ذو الكاميرات المتحركة أنهى المهام أسرع بنسبة 17 بالمائة واستخدم طاقة ميكانيكية أقل بنسبة 19 بالمائة. وقد جاءت هذه المدخرات من كل مرحلة من مراحل العملية؛ فالروبوت ذو العيون المتحركة قضى وقتاً أقل في البحث عن الأجسام لأنه استطاع ببساطة تدوير كاميراته للعثور عليها، بدلاً من الاضطرار للمشي حولها أو التواء جسمه بالكامل للحصول على رؤية. كما قضى وقتاً أقل في المشي نحو الأجسام لأنه استطاع رصدها من مسافة بعيدة قبل التحرك. وحتى عملية الإمساك بالأجسام كانت أسرع، حيث استطاع الروبوت إبقاء عين واحدة على الهدف بينما تتحرك ذراعه، دون الحاجة للتوقف وإعادة التوجيه.
نقل الباحثون هذه النتائج من المحاكاة الحاسوبية إلى العالم الحقيقي، حيث نجح الروبوت في أداء المهام نفسها على طاولة حقيقية. استطاع الروبوت مراقبة هدف أمامه بينما يصل إلى جسم خلفه، أو تتبع شخصين يحملان أجساماً تتحرك بشكل مستقل. وعندما كان أحد الأذرع يحجب الرؤية عن هدف ما، كانت الكاميرا المعنية تبحث عنه بنشاط وتستعيد تتبعه بمجرد أن يصبح مرئياً مرة أخرى. أكدت هذه العروض الفيزيائية أن مبدأ التصميم يعمل خارج النموذج الحاسوبي. تشير الدراسة إلى أنه لكي تصبح الروبوتات فعالة حقاً في المهام التي تتطلب الرؤية واللمس معاً، يجب دمج تصميم مستشعراتها مع تصميم أطرافها. ومن خلال التعامل مع الرؤية كقيد يشكل الهيكل الفيزيائي للروبوت، بدلاً من كونها مجرد فكرة لاحقة، يمكن للمهندسين بناء آلات تتحرك بكفاءة أكبر وتؤدي مهاماً معقدة بسهولة أكبر. وقد جعل الفريق التصاميم والبرمجيات الخاصة بهذا الروبوت متاحة للجمهور، آملين أن يستخدم الآخرون هذه الرؤى لبناء الجيل القادم من الآلات القادرة والمدركة.
ملخص تقني: حيز العمل المرئي-المتاح للتصميم البشري المدرك للإدراك
بيان المشكلة
يركز تحليل حيز عمل الروبوت الكلاسيكي على الوصول الحركي (kinematic reachability)—أي تحديد الأماكن التي يمكن للمنفذ النهائي وضع نفسه فيها فيزيائياً. ومع ذلك، بالنسبة للروبوتات البشرية الموجهة بالإدراك، يعد الوصول وحده مقيساً غير مكتمل. فقد يقع الهدف ضمن حيز العمل الحركي للذراع، ولكنه يظل خارج مجال رؤية المستشعرات الموجودة على متن الروبوت في التكوين المحدد المطلوب للوصول إليه. هذا "الحيز المتاح-الأعمى" يجبر الروبوت على القيام بحركات كاملة الجسم تعويضية (مثل تدوير الجذع، أو المشي إلى نقطة رؤية جديدة، أو إعادة توجيه الكاميرا) لمجرد الحصول على رؤية، مما يحول القصور الإدراكي إلى حركة ميكانيكية غير ضرورية. تعاني التصميمات البشرية الحالية، التي غالباً ما ترث سمات الشكل البشري مع رؤية مقيدة تتركز في الرأس أو الصدر، من عدم تطابق بين حيز عمل الأذرع الواسع وقدرات الاستشعار المحدودة والمقترنة غالباً.
المنهجية
1. تعريف الحيز المرئي-المتاح (VRW)
يقدم المؤلفون الحيز المرئي-المتاح (Visible-Reachable Workspace - VRW)، وهو مقياس لمرحلة التصميم يربط الرؤية بتكوينات الوصول الممكنة.
تقسيم التكوين: يتم تقسيم تكوين الروبوت q إلى مفاصل المناولة (qm)، ومفاصل الاستشعار (qp)، والمفاصل الاسمية (q0). تُعطى الأولوية للمفاصل التي تؤثر على المنفذ النهائي النشط في qm. ومن الأهمية بمكان أن هذا يميز بين المستشعرات المقترنة بالمناول (مثل المثبتة على المعصم) وتلك ذات التشغيل المستقل (مثل الجيمبال).
الرؤية المشروطة: يُعتبر الهدف x مرئياً-متاحاً فقط إذا وجد تكوين ممكن (qm,qp) بحيث يصل المنفذ النهائي إلى xو تقوم كاميرا واحدة على الأقل بمراقبة x دون حدوث انسداد ذاتي.
المقاييس:
التغطية (η): نسبة حجم الحيز المرئي-المتاح (WVR) إلى إجمالي حيز العمل المتاح (WR).
التغطية الثنائية (η2): مقياس للرؤية المتزامنة، يقيس احتمالية إمكانية مراقبة منطقتين متباعدتين مكانياً (هدف مناولة ومنطقة اهتمام ثانية) في وقت واحد دون تغيير تكوين المناولة.
2. التحقيق العتادي: Duke Humanoid V2
للتحقق من مقياس VRW، قام المؤلفون ببناء Duke Humanoid V2، وهو روبوت بشري بـ 31 درجة حرية (DoF) يعمل بنظام المحركات المباشرة شبه الموجهة (QDD).
المورفولوجيا: طوله 1.2 متر، ووزنه 36 كجم، مع ذراعين بكل منهما 7 درجات حرية، وساقين بكل منهما 6 درجات حرية.
بنية الاستشعار: الابتكار الرئيسي هو رأس الكاميرا مزدوج المحاور (yaw-pitch) ذو التشغيل المستقل. تم تركيب كاميرتين RGB-D على منصات جيمبال (gimbals) ذات درجتي حرية، مما يسمح لهما بالتوجيه نحو مناطق متباعدة مكانياً بشكل مستقل عن اتجاه الجذع وتكوين الذراع.
التحكم: يستخدم الروبوت سياسة تعلم تعزيزي (RL) لكامل الجسم تم تدريبها باستخدام FlashSAC (Soft Actor-Critic)، وتعمل بتردد 50 هرتز مع تتبع PD عند مستوى المفصل بتردد 200 هرتز. تتعامل السياسة مع حركة القاعدة، ومناولة الذراع، ونظر الكاميرا في آن واحد.
3. التقييم التجريبي
تقيم الدراسة VRW عبر أبعاد متعددة:
المقارنة عبر المنصات: تم حساب VRW للروبوتات البشرية الموجودة (Unitree G1, Booster T1, Apptronik Apollo, Fourier GR-3, PAL Talos) باستخدام حركيتها ونماذج الكاميرا المنشورة لها.
تحسين تكوين الكاميرا: في Duke Humanoid V2، قارن المؤلفون بين تخطيطات تحتوي على K=1,2,3 كاميرات، كل منها في تكوينات ثابتة أو مشغلة.
مهام الاختبار المرجعي: تم إجراء اختبار مرجعي "الوصول والإمساك بهدفين" في المحاكاة وعلى الروبوت الفيزيائي. تضمنت المهام الإمساك بجسمين موضوعين في تكوينات مختلفة (يمين/يسار، أمام/خلف، قريب/بعيد، وأهداف ديناميكية يحملها بشر).
النتائج الرئيسية
1. تحسينات تغطية VRW
التشغيل مقابل العدد: كان لتشغيل الكاميرا تأثير أكبر بكثير على تغطية VRW من إضافة المزيد من الكاميرات. في Duke Humanoid V2، أدى تشغيل الكاميرات إلى زيادة التغطية المرئية-المتاحة من 38% (ثابتة) إلى 97%.
التغطية الثنائية: بينما حسنت الكاميرا الواحدة المشغلة تغطية الهدف الواحد، إلا أنها لم تستطع رؤية المناطق المتباعدة بفعالية في وقت واحد. أدت إضافة كاميرا ثانية مشغلة بشكل مستقل إلى رفع التغطية الثنائية (η2) من 0.45 إلى 0.95. وفرت الكاميرا الثالثة عوائد متناقصة (0.97) مقابل تكلفة عتادية كبيرة.
المقارنة: حقق الروبوت Unitree G1 ذو الرأس الثابت 16% فقط من تغطية VRW. أما المنصات ذات الأعناق المشغلة (مثل PAL Talos و Fourier GR-3) فقد حققت 48-76%، لكن جميعها ظلت دون Duke Humanoid V2 بنسبة 97% لأن كاميراتها تشترك في محور عنق واحد، مما يمنع الرؤية المستقلة للمناطق المتباعدة.
2. الأداء في مهام المناولة
في اختبار الوصول والإمساك بهدفين، تفوق التكوين المزدوج المشغل (Act2) على التكوين المرجعي ذي الكاميرا الثابتة (Fix2) والتكوينات الأخرى:
الكفاءة: قلل التكوين Act2 متوسط وقت الإنجاز بنسبة 17% واستهلاك الطاقة الميكانيكية بنسبة 19% مقارنة بـ Fix2.
البحث والاقتراب: توزعت نسبة تقليل الوقت على مراحل البحث، والاقتراب، والمناولة. وتحديداً، قلل تشغيل الكاميرا من وقت البحث من خلال السماح للروبوت بتحديد المواقع عبر النظر بدلاً من المشي، وقلل وقت الاقتراب من خلال تمكين مسارات مباشرة نحو الأهداف بمجرد تحديدها.
التحقق الواقعي: أكدت التجارب الفيزيائية أن التصميم المزدوج المشغل سمح بالمراقبة والمناولة المتزامنة لأزواج الأهداف (أمام/خلف و يمين/يسار) دون الحاجة لإعادة توجيه الجذع. نجح الروبوت في تتبع والإمساك بأهداف متحركة يحملها شخصان.
الأهمية والادعاءات
يزعم البحث أن الوصول يصبح كمية تصميم أكثر إفادة للمناولة البشرية الموجهة بالإدراك عندما يتم تقييمه مع تكوينات الاستشعار التي تجعل حيز العمل المتاح قابلاً للملاحظة.
إشارة التصميم: يعمل VRW كإشارة تصميم كمية. وتظهر النتائج أن التحسين من أجل تغطية المرئي-المتاح (تحديداً عبر تشغيل الكاميرا المستقل) يترجم مباشرة إلى تنفيذ أكثر كفاءة لكامل الجسم، مما يقلل من الحاجة إلى حركات الجسم التعويضية.
مبدأ التصميم المقترن: يجادل العمل ضد معاملة الاستشعار والمناولة كوحدات منفصلة. وبدلاً من ذلك، يقترح مبدأ تصميم مقترن حيث يتم تحسين تخطيط الاستشعار لزيادة التداخل مع حيز عمل المناولة، لا سيما لمهام المناطق المتعددة المتزامنة.
المصدر المفتوح: يلتزم المؤلفون بجعل البرمجيات وتصميم الروبوت البشري (Duke Humanoid V2) مفتوحة المصدر لتسهيل المزيد من الأبحاث في تصميم الروبوتات المدركة للإدراك.
يخلص البحث إلى أنه بينما يحدد الوصول الكلاسيكي أين يمكن للروبوت الذهاب، فإن VRW يحدد أين يمكن للروبوت أن يعمل بفعالية أثناء الإدراك، وأن سد هذه الفجوة من خلال الاستشعار المشغل أمر بالغ الأهمية للجيل القادم من الروبوتات البشرية.