SpaceDex: Generalizable Dexterous Grasping in Tiered Workspaces
يُعد SpaceDex إطار عمل هرمياً يجمع بين مخطط نموذج رؤية-لغة للاستدلال المكاني متعدد الرؤى وشبكة تحكم في الذراع واليد منفصلة لتحسين معدلات نجاح القبض الماهر القابل للتعميم بشكل كبير في مساحات العمل المتدرجة والمحتجبة الصعبة مقارنة بالنماذج المرجعية التقليدية لأسطح الطاولات.
المؤلفون الأصليون:Wensheng Wang, Chuanjun Guo, Wei Wei, Tong Wu, Ning Tan
إذا كنت روبوتاً عادياً، فمن المرجح أنك ستفشل. لماذا؟ لأن معظم الروبوتات مدربة على التقاط الأشياء من فوق طاولة مفتوحة ومسطحة (مثل طاولة الطعام). على الطاولة، يكون كل شيء مرئياً، ويمكن للروبوت ببساطة أن يمد يده مباشرة. لكن خزانة المطبخ مختلفة:
إنها مظلمة ومزدحمة: المرطبانات الأخرى تحجب رؤيتك.
إنها ضيقة: عليك أن تحرك ذراعك عبر فجوات ضيقة دون الاصطدام بالجوانب.
إنها صعبة: لا يمكنك مجرد "رؤية" المرطبان؛ قد تحتاج إلى تحسس طريقك للوصول إليه.
تقدم هذه الورقة البحثية SpaceDex، وهو "عقل روبوتي" جديد مصمم خصيصاً لحل "مشكلة الخزانة" هذه. إليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:
1. "المدير الذكي" (المخطط رفيع المستوى)
فكر في الروبوت وكأن لديه عقلين. الأول يشبه المدير الذكي الذي يستخدم نموذج الرؤية واللغة (VLM).
ماذا يفعل: أنت تخبر الروبوت، "أحضر المخلل". المدير لا ينظر فقط إلى كاميرا واحدة. بل ينظر إلى ثلاث زوايا مختلفة (يسار، أمام، يمين) مثل حارس أمن يراقب عدة شاشات.
الحيلة: إنه يحدد "خطة اللعب". يدرك قائلاً: "أوه، المخلل خلف الكاتشب. يجب أن أحرك الكاتشب أولاً". إنه يرسم خريطة للمكان الذي يجب أن يذهب إليه الروبوت، متجاهلاً الفوضى ومركزاً على المسار.
التشبيه: الأمر يشبه نظام GPS لا يكتفي بقول "انعطف يساراً"، بل يقول "هناك منطقة أعمال إنشائية أمامك، لذا لنأخذ شارعاً جانبياً ونتجنب الازدحام المروري".
2. "الأيدي المتخصصة" (المتحكم منخفض المستوى)
بمجرد أن يعطي المدير الخريطة، يتولى العقل الثاني المهمة. هذا هو المتحكم منخفض المستوى، ولديه حيلة خاصة تسمى "فصل الميزات" (Feature Separation).
المشكلة: عادةً ما تحاول الروبوتات التحكم في ذراعها بالكامل وأصابعها باستخدام عقل واحد كبير. هذا يشبه محاولة قيادة سيارة بيد واحدة بينما تحاول في الوقت نفسه ربط حذائك باليد الأخرى. يصاب العقل بالارتباك، وقد تصطدم الذراع بالرف أثناء تعثر الأصابع.
الحل: يقوم SpaceDex بتقسيم العقل إلى فريقين متخصصين:
فريق الذراع: مهمتهم الوحيدة هي التنقل في متاهة الرف دون الاصطدام بالجدران. هم بمثابة "السائقين".
فريق اليد: مهمتهم الوحيدة هي الإمساك بالشيء بلطف. هم بمثابة "محترفي الالتقاط".
التشبيه: الأمر يشبه فريق سرقة محترف. شخص يقود سيارة الهروب (يتنقل في الشوارع)، بينما يقوم الآخر بفتح الخزنة (التعامل مع الشيء). لا يحاول أحدهما القيام بعمل الآخر.
3. "الحواس الفائقة" (العين واللمس)
لا يعتمد SpaceDex على العينين فقط؛ بل لديه حواس فائقة.
عيون متعددة الزوايا: إذا حجب ذراع الروبوت الكاميرا الرئيسية (مثل يدك التي تحجب وجهك عندما تمد يدك لشيء ما)، ينتقل الروبوت فوراً للرؤية من خلال كاميرا المعصم أو الكاميرات الجانبية. إنه لا يفقد رؤية الهدف أبداً.
لمس أطراف الأصباع: هذا هو السر الحقيقي. عندما يصل الروبوت إلى زاوية مظلمة حيث لا يستطيع رؤية الشيء، فإنه يستخدم أطراف أصابعه مثل الشخص الكفيف الذي يقرأ بطريقة "برايل". إنه يشعر بالشكل والملمس.
مثال: إذا أمسك بفاكهة منزلقة، تشعر المستشعرات بانزلاقها وتشد القبضة فوراً. وإذا أمسك بصندوق صلب، فإنه يعرف تماماً أين توجد الحواف المسطحة.
4. "شبكة الأمان" (تدريب الاستعادة)
لم يتم تدريب الروبوت على النجاحات المثالية فحسب، بل تم تدريبه أيضاً على الأخطاء.
الوصفة: علم الباحثون الروبوت ما يجب فعله عندما تسوء الأمور. إذا اصطدم الروبوت بالرف أو أسقط الشيء، فإنه لا يصاب بالذعر ويتوقف. لديه "وضع استعادة" يسمح له بالتعديل والمحاولة مرة أخرى دون طلب المساعدة.
التشبيه: الأمر يشبه تعلم ركوب الدراجة. أنت لا تتدرب فقط على السقوط بشكل مثالي؛ بل تتدرب على النهوض مجدداً واستعادة التوازن.
النتائج: هل نجح الأمر؟
اختبر الفريق SpaceDex في سيناريو واقعي بـ 100 محاولة على أكثر من 30 شيئاً مختلفاً (صناديق، زجاجات، فواكه، وأكياس لينة) مخبأة في رف متعدد الطبقات وفوضوي.
الروبوتات القديمة (نمط الطاولة): نجحت بنسبة 39% فقط. لقد ارتبكت بسبب الفوضى والمساحات الضيقة.
SpaceDex: نجح بنسبة 63% من المرات.
لماذا هذا مهم؟
هذا ليس مجرد موضوع عن روبوتات تلتقط المخلل. إنها خطوة كبيرة نحو روبوتات يمكنها حقاً مساعدتنا في منازلنا ومستودعاتنا. إنها تنقل الروبوتات من "اللعب في صندوق الرمل" (الطاولات المفتوحة) إلى "العمل في العالم الحقيقي" (الأرفف المزدحمة، الثلاجات، والخزائن). من خلال فصل "القيادة" عن "الإمساك" ومنح الروبوت حاسة اللمس، يجعل SpaceDex الروبوتات الماهرة أكثر موثوقية في العالم الثلاثي الأبعاد الفوضوي الذي نعيش فيه.
إليك ملخص تقني مفصل لورقة "SpaceDex: الإمساك الماهر القابل للتعميم في مساحات العمل المتعددة الطبقات."
1. بيان المشكلة
تتناول الورقة تحدي الإمساك الماهر القابل للتعميم في مساحات العمل ذات الطبقات والمقيدة مكانياً (مثل أرفف المستودعات، الثلاجات، الخزائن). وخلافاً لبيئات الطاولات المفتوحة حيث تكون الأشياء مرئية من منظور علوي وتكون الحركة غير مقيدة، فإن مساحات العمل متعددة الطبقات تفرض ثلاثة صعوبات محددة:
الانسداد الشديد: غالباً ما تكون الأجسام المستهدفة مخفية جزئياً أو كلياً بواسطة أجسام أخرى أو هياكل الأرفف، مما يحد من الإدراك أحادي الرؤية.
القيود الهندسية: يجب على الروبوت التنقل عبر خلوصات ضيقة وتجنب الاصطدام بجدران الأرفف، والأسقف، والأجسام المتراكمة.
الاعتمادات المرتبطة بالارتفاع: ترتيب العمليات مهم (على سبيل المثال، إزالة جسم يعيق الوصول قبل الإمساك بالهدف)، مما يتطلب استدلالاً مكانياً ثلاثي الأبعاد بدلاً من مجرد استدلال بسيط على مستوى ثنائي الأبعاد.
تفشل الطرق الحالية، التي غالباً ما يتم تدريبها على مجموعات بيانات الطاولات المفتوحة، في هذه السيناريوهات بسبب نقص الوعي المكاني ثلاثي الأبعاد، وعدم القدرة على التعامل مع الانسداد، وتداخل الميزات بين ملاحة الذراع وتحريك اليد.
2. المنهجية: إطار عمل SpaceDex
يعتبر SpaceDex إطار عمل هرمي للرؤية واللغة والعمل (VLA) مصمم لسد الفجوة بين التخطيط الدلالي عالي المستوى والتحكم الماهر منخفض المستوى. ويتكون من مكونين رئيسيين:
أ. المستوى العالي: المستدل المكاني المدرك للطبقات
المدخلات: تعليمات لغوية من المستخدم وتغذية من كاميرات متعددة الرؤى (3 كاميرات خارجية ثابتة + 1 كاميرا معصم).
الآلية:
التخطيط باستخدام نماذج الرؤية واللغة (VLM): يستخدم نموذج الرؤية واللغة (Qwen2.5-VL) لتحليل التعليمات والاستدلال حول تسلسل الانسداد وعلاقات الارتفاع.
الاستعلام المتوازي متعدد الكاميرات: يقوم الـ VLM بالاستعلام عن جميع رؤى الكاميرات بالتوازي للتنبؤ بصناديق الإحاطة (bounding boxes) ودرجات الثقة. ويختار ديناميكياً الرؤية "الأساسية" للكاميرا ذات الثقة الأعلى والانسداد الأقل للتخفيف من النقاط العمياء.
تأسيس الهدف (Target Grounding): يولد صناديق إحاطة ثنائية الأبعاد ويستخدم نموذج SAM (Segment Anything Model) للتقطيع الأولي، يليه Cutie لتتبع القناع الزمني. يوفر هذا توجيهاً مكانياً مهيكلاً (أقنعة) للمتحكم منخفض المستوى.
ب. المستوى المنخفض: المتحكم المكاني اللمسي
البنية: سياسة Transformer الانتشار (DiT) مشروطة تتنبأ بتسلسل من الأفعال (الأفق Ha=32) لضمان السلاسة الزمنية.
الإدراك متعدد الوسائط:
البصري: يدمج الميزات العالمية (من الرؤية الخارجية المختارة) والميزات المحلية (من كاميرا المعصم) باستخدام DINOv2.
اللمسي: يدمج مستشعرات طرف الإصبع التي تعمل بتأثير هول (Hall-effect) ثلاثية الأبعاد (المختزلة إلى متجه قوة وكثافة خماسي الأبعاد) للتعامل مع الحالات التي يكون فيها التغذية الراجعة البصرية محجوبة.
الانتباه المتقاطع المرتكز على المعصم: آلية مبتكرة حيث تعمل ميزات المعصم كاستعلام (Query Q) لاسترجاع القيود المكانية من الرؤى العالمية (K,V). يضمن ذلك بقاء السياسة واعية مكانياً حتى عندما يحجب الذراع الكاميرات الخارجية.
شبكة فصل ميزات الذراع واليد:
المشكلة: في المساحات الضيقة، يحتاج الذراع إلى تجنب العوائق العالمية بينما تحتاج اليد إلى مطابقة هندسية دقيقة. غالباً ما تسبب المساحة الكامنة المشتركة تداخلاً في الميزات.
الحل: تقوم الشبكة بتفريع الرموز الكامنة المشتركة إلى مسارين متخصصين:
مسار الذراع (ϕarm): يركز على تراجع المسار المكاني وتجنب حدود الرف.
مسار اليد (ϕhand): يركز على مطابقة شكل الجسم وتحسين التلامس.
يتم دمج هذه المسارات مع إشراف مساعد للتنبؤ بمكونات ضوضاء متميزة، مما يضمن الوصول الخالي من الاصطدام دون التضحية باستقرار الإمساك.
آلية الاستعادة: تتضمن مجموعة بيانات التدريب حوالي 5% من عروض "استعادة الخطأ" حيث يقوم المشغلون بتصحيح الاضطرابات (مثل الانزلاق أو الاصطدام)، مما يمكن السياسة من التعافي من الحالات الخارجة عن التوزيع دون إعادة الاستعلام من المخطط عالي المستوى.
3. المساهمات الرئيسية
إطار عمل SpaceDex: أول إطار عمل يوسع الإمساك الماهر القابل للتعميم من الطاولات المفتوحة إلى مساحات العمل ثلاثية الأبعاد متعددة الطبقات والمقيدة، مع نمذجة صريحة للبنية والاعتمادات ثلاثية الأبعاد.
التصميم الهرمي: مزيج مبتكر بين مخطط عالي المستوى مدرك للطبقات (باستخدام استدلال VLM متعدد الرؤى للتعامل مع الانسداد) ومتحكم مكاني لمسي منخفض المستوى.
فصل ميزات الذراع واليد: تقديم بنية شبكة متخصصة تفصل ملاحة الذراع العالمية عن تحريك اليد الموضعي، مما يحل تداخل الميزات في الأنظمة عالية درجات الحرية (high-DoF).
تعزيز المتانة: دمج الإدراك متعدد الرؤى، والاستشعار اللمسي لأطراف الأصابع، وبيانات استعادة الخطأ للتعامل مع الإدراك الجزئي والتلامسات غير الطبيعية.
4. النتائج التجريبية
تم تقييم النظام على منصة حقيقية (ذراع بـ 7 درجات حرية، ويد ماهرة بـ 15 درجة حرية) عبر 100 تجربة شملت أكثر من 30 جسماً غير مرئي ضمن أربع فئات (متوازي مستطيلات صلب، أسطوانات، أجسام قابلة للتشوه، وأجسام قريبة من الشكل الكروي).
معدل النجاح: حقق SpaceDex معدل نجاح بنسبة 63.0%، متفوقاً بشكل كبير على خط الأساس القوي للطاولات (DexGraspVLA) الذي سجل 39.0% (تحسن قدره 24 نقطة مئوية).
أداء الفئات:
الأجسام القريبة من الكروية: 84.0% (SpaceDex) مقابل 52.0% (الأساس).
الأجسام القابلة للتشوه: 40.0% (SpaceDex) مقابل 16.0% (الأساس).
ملاحظة: لوحظت أكبر المكاسب في الأجسام التي تتطلب تغذية راجعة لمسية دقيقة وتحكماً دقيقاً.
دراسات الاستئصال (Ablation Studies):
إزالة فصل الذراع واليد أدى إلى انخفاض النجاح إلى 44.0%.
إزالة بيانات الاستعادة أدى إلى انخفاض النجاح إلى 52.0%.
استخدام مدخلات كاميرا واحدة فقط أدى إلى انخفاض النجاح إلى 52.0%.
تحليل الفشل: حدثت معظم حالات الفشل في أعمق طبقات الرف بسبب اصطدامات الذراع بالرف (عنق زجاجة في الملاحة) أو مع الأجسام القابلة للتشوه بسبب القوة المفرطة.
5. الأهمية
يمثل SpaceDex تحولاً جذرياً من الاستدلال في المستوى ثنائي الأبعاد إلى الوعي المكاني ثلاثي الأبعاد في المناولة الروبوتية. ومن خلال الفصل الصريح بين ملاحة الذراع والتحكم في اليد ودمج التغذية الراجعة اللمسية مع تخطيط VLM متعدد الرؤى، فإنه يثبت أن الروبوتات يمكنها العمل بموثوقية في البيئات المعقدة والمزدحمة والمحجوبة مثل الأرفف الواقعية. يوفر هذا العمل نموذجاً قابلاً للتعميم لنشر المناولة الماهرة في البيئات ثلاثية الأبعاد المهيكلة، متجاوزاً قيود أبحاث الطاولات المفتوحة.