ActiveGlasses: Learning Manipulation with Active Vision from Ego-centric Human Demonstration
إن ActiveGlasses هو نظام يتيح النقل الصفري للمهارات من عروض توضيحية بشرية من منظور الشخص الأول عبر استخدام كاميرا ستيريو في نظارات ذكية لالتقاط الإدراك والعمل المنسقين، والذي يتم بعد ذلك تكراره على ذراع روبوتية عبر سياسة سحابة نقاط متمحورة حول الأشياء.
المؤلفون الأصليون:Yanwen Zou, Chenyang Shi, Wenye Yu, Han Xue, Jun Lv, Ye Pan, Chuan Wen, Cewu Lu
إليك شرح لورقة بحث ActiveGlasses، مترجم إلى لغة بسيطة مع استخدام تشبيهات إبداعية.
المشكلة الكبرى: الروبوتات "جائعة للبيانات" ولكنها "متعثرة في التعلم"
تخيل أنك تريد تعليم روبوت كيفية القيام بالأعمال المنزلية، مثل وضع كتاب على الرف أو صب الماء دون سكب. للقيام بذلك، يحتاج الروبوت إلى مشاهدة البشر وهم يفعلون ذلك أولاً (وهي عملية تسمى "التعلم بالتقليد").
لكن هناك عقبة:
مشكلة "حقيبة الظهر الثقيلة": الطرق الحالية لتعليم الروبوتات مرهقة للغاية. غالباً ما يضطر المشغلون لارتداء سماعات واقع افتراضي ضخمة أو الإمساك بأجهزة تحكم ثقيلة تحاكي أذرع الروبوت. الأمر يشبه محاولة تعلم الرقص وأنت ترتدي حقيبة ظهر تزن 50 رطلاً. إنه أمر متعب، بطيء، والبيانات التي تحصل عليها ليست طبيعية تماماً.
مشكلة "العين السلبية": معظم الروبوتات لديها كاميرات مثبتة على معاصمها. هذا يشبه وجود كاميرا ملتصقة بيدك. إذا أردت الرؤية حول زاوية ما، يجب أن تتحرك يدك إلى هناك أولاً. لكن البشر لا يعملون بهذه الطريقة! نحن نحرك رؤوسنا لاستراق النظر حول العوائق قبل أن نحرك أيدينا. الروبوتات ذات كاميرات المعصم تفتقد هذه "الرؤية النشطة" وغالباً ما تتعثر لأنها لا تستطيع رؤية المهمة بوضوح.
الحل: "ActiveGlasses" (النظارات النشطة)
قام الباحثون ببناء نظام يسمى ActiveGlasses. فكر في الأمر كأنك تمنح الروبوت "عيناً بشرية ذكية" و"دماغاً بشرياً" دون إجباره على ارتداء حقيبة ظهر ثقيلة.
إليك كيف يعمل، مقسماً إلى ثلاث خطوات بسيطة:
1. "المعلم ذو الأيدي الحرة" (جمع البيانات)
بدلاً من جعل المشغل البشري يرتدي وحدة تحكم روبوتية ثقيلة، يرتدي فقط زوجاً من النظارات الذكية (مثل XREAL Air 2) مع كاميرا ستيريو صغيرة ملحقة بها.
التشبيه: تخيل أنك تعلم روبوتاً كيفية خبز كعكة. بدلاً من جعل المعلم يرتدي بدلة ضخمة ومعقدة تجبره على التحرك مثل الروبوت، أنت تتركه يرتدي نظارات عادية ويستخدم يديه الطبيعيتين. يتحرك بشكل طبيعي، يسترق النظر حول الفرن، ويمسك المكونات تماماً كما يفعل البشر.
النتيجة: يقوم النظام بتسجيل ما يراه الإنسان بالضبط (فيديو ستيريو) وكيف يحرك رأسه بالضبط (تتبع 6-DoF). هذا يلتقط "الرؤية النشطة" — الطريقة الطبيعية التي ينظر بها البشر حولهم لحل المشكلات.
2. "الدماغ المرتكز على الأشياء" (السياسة/النموذج)
هذا هو الجزء الذكي. عادةً، إذا علمت روبوتاً باستخدام يد الإنسان، فإن الروبوت يصاب بالارتباك لأن لديه مخالب معدنية وليس أصابع.
التشبيه: تخيل أنك تعلم كلباً كيف يجلب كرة. أنت لا تعلم الكلب كيف يحرك مخالبه ليشبه الإنسان؛ بل تعلمه أين توجد الكرة.
كيف يعمل: لا يحاول الذكاء الاصطناعي تقليد حركات يد الإنسان. بدلاً من ذلك، ينظر إلى العالم ثلاثي الأبعاد (مثل السحابة النقطية - point cloud) ويتنبأ بأين يجب أن يذهب الشيء (الكتاب، الخبز، إبريق الشاي). إنه يتجاهل "كيفية" الحركة (الأصابع مقابل المخالب) ويركز على "ماذا" (نقل الشيء من النقطة أ إلى النقطة ب). هذا يسمح للروبوت بالتعلم من الإنسان ثم استخدام أذرعه الروبوتية فوراً للقيام بنفس المهمة، حتى لو كانت الأذرع تبدو مختلفة تماماً.
3. "الروبوت المحاكي للرأس" (التنفيذ)
عندما يبدأ الروبوت في العمل، فإنه لا يكتفي بالجلوس فقط. لديه إعداد خاص:
الذراع (أ) (العامل): هذه الذراع تمسك الشيء وتحركه بناءً على توقع الذكاء الاصطناعي.
الذراع (ب) (الرأس): هذه ذراع روبوتية ثانية تحمل الكاميرا. وهي تحاكي حركات رأس الإنسان التي تم تسجيلها سابقاً.
التشبيه: إذا انحنى المعلم البشري ليلقي نظرة تحت طاولة لرؤية عملة مفقودة، فإن "ذراع الرأس" للروبوت ستنحني أيضاً لتلقي نظرة. هذا يسمح للروبوت بالرؤية حول العوائق وحل المهام الصعبة التي قد تفشل فيها الكاميرا الثابتة.
ماذا اختبروا؟
جربوا هذا على ثلاث مهام صعبة عادة ما تُربك الروبوتات:
وضع الكتاب: وضع كتاب على رف حيث تكون الرؤية محجوبة بجانب الرف.
إدخال الخبز: تمرير الخبز داخل محمصة خبز حيث تكون الفتحة مخفية حتى تنظر إليها من الزاوية الصحيحة.
صب الماء: صب الماء في كوب مخفي خلف حاجز.
النتائج
النقل الفوري (Zero-Shot Transfer): تعلم الروبوت من الإنسان الذي يرتدي النظارات، ثم حاول فوراً تنفيذ المهمة على روبوت حقيقي دون أي تدريب إضافي. لقد نجح الأمر ببساطة.
التفوق على النماذج المرجعية: في الاختبارات، كان نظام ActiveGlasses أكثر نجاحاً بنسبة 25% إلى 35% من الطرق المتقدمة الأخرى.
لماذا؟ لأنه جمع بين الحركة البشرية الطبيعية (لا حقائب ظهر ثقيلة) والرؤية النشطة (تحريك الكاميرا للرؤية بشكل أفضل) ودماغ ذكي يركز على الشيء، وليس على أجزاء الجسم المحددة.
الخلاصة
ActiveGlasses هو بمثابة مترجم عالمي للروبوتات. إنه يترجم الطريقة البشرية الطبيعية والبديهية في التفاعل مع العالم (تحريك رؤوسنا للرؤية، استخدام أيدينا بحرية) إلى تعليمات يمكن للروبوتات فهمها وتنفيذها، حتى لو لم تكن تشبهنا في المظهر. إنه يحل أزمة "الجوع للبيانات" بجعل جمع البيانات سريعاً، مريحاً، وفعالاً للغاية.
إليك ملخص تقني مفصل لورقة البحث بعنوان "ActiveGlasses: التعلم من خلال التلاعب عبر الرؤية النشطة من خلال العروض التوضيحية البشرية من منظور الشخص الأول (Ego-centric)."
1. بيان المشكلة
تعالج الورقة عقبتين حرجتين في توسيع نطاق تعلم الروبوتات من العروض التوضيحية البشرية:
عدم كفاءة وعبء جمع البيانات: تعتمد المسارات الحالية غالبًا على التحكم عن بُعد (Teleoperation) أو الأجهزة الضخمة المحمولة باليد (مثل وحدات التحكم ذات التغذية الراجعة للقوة، أو سماعات الواقع الافتراضي الثقيلة). تجبر هذه الطرق المشغلين على محاكاة الحركات الكينماتيكية للروبوت بدلاً من استخدام حركات أيديهم الطبيعية، مما يؤدي إلى الإرهاق البدني، وجودة بيانات دون المستوى، وقابلية محدودة للتوسع.
فجوة التجسد والإدراك:
التلاعب: عملية مطابقة الأيدي البشرية مع مقابض الروبوت (Grippers) عرضة للأخطاء.
الإدراك: تستخدم معظم الأنظمة كاميرات ثابتة من منظور الشخص الثالث أو كاميرات مثبتة على المعصم بشكل سلبي. ومع ذلك، يستخدم البشر الرؤية النشطة (Active Vision) — حيث يحركون رؤوسهم غريزيًا للنظر حول العوائق، أو الاقتراب لزيادة الدقة، أو تعديل زوايا الرؤية بشكل مستقل عن حركات اليد. تفشل الأنظمة الحالية في التقاط هذه الإشارة الإدراكية "المدفوعة بالقصد"، مما يؤدي إلى الفشل في المهام التي تعاني من الانسداد (Occlusion) أو تتطلب دقة عالية.
2. المنهجية: نظام ActiveGlasses
يقترح المؤلفون نظام ActiveGlasses، وهو نظام خفيف الوزن يُثبت على الرأس، يلتقط التلاعب البشري الطبيعي والرؤية النشطة، مقترنًا بسياسة متمحورة حول الأشياء (Object-centric policy) للنقل الصفري (Zero-shot transfer) إلى الروبوتات.
أ. الأجهزة وجمع البيانات
الإعداد: يرتدي المشغلون نظارات ذكية من طراز XREAL Air 2 Ultra مزودة بكاميرا ستيريو ZED Mini.
التفاعل: يقوم المشغلون بأداء المهام باستخدام الأيدي المجردة (بدون أجهزة محمولة باليد).
المستشعرات:
الرؤية: تلتقط كاميرا ZED Mini فيديو RGB-D ستيريو.
الحركة: تسجل وحدة التتبع سداسية درجات الحرية (6-DoF) الداخلية في XREAL مسار رأس المشغل (محاكيًا حركة الرقبة/الجذع).
الواجهة: توفر واجهة مستخدم قائمة على Unity في النظارات تغذية راجعة صوتية وإيماءات لبدء وانتهاء الحلقة (Episode).
معالجة البيانات:
العمق والسحب النقطية: تتم معالجة الصور الستيريو عبر FoundationStereo لتوليد خرائط العمق والسحب النقطية ثلاثية الأبعاد.
التقطيع (Segmentation): يقوم نموذج Grounded-SAM بإزالة الأيدي؛ بينما يقوم SAM2 بتقطيع الجسم المستهدف.
المعايرة: تستخدم طريقة معايرة قوية باستخدام ثلاث كرات ثابتة على الطاولة لإنشاء إطار عالمي (World Frame)، ونشر التحويلات عبر الحركة النسبية لوضعية الرأس للتعامل مع انسداد علامات المعايرة.
ب. تصميم السياسة: سياسة ثلاثية الأبعاد متمحورة حول الأشياء
لسد الفجوة بين الأيدي والرؤوس البشرية وأذرع الروبوت، يتجنب النظام إعادة التوجيد الكينماتيكي المباشر، وبدلاً من ذلك، يتنبأ بمسارات الأشياء في الفضاء ثلاثي الأبعاد.
المدخلات: سحب نقطية موحدة ثلاثية الأبعاد (في الإطار العالمي) مشتقة من كاميرا الستيريو ووضعية الرأس.
البنية: هيكل خلفي يعتمد على Transformer ثلاثي الأبعاد مع رأسين للانتشار (Diffusion Heads):
رأس التلاعب (Manipulation Head): يتنبأ بـ المسار المطلق سداسي درجات الحرية (6-DoF) للجسم المستهدف.
رأس الإدراك (Perception Head): يتنبأ بـ مسار حركة الرأس النسبي (لمحاكة الرؤية النشطة).
خيارات التصميم الرئيسية:
المطلق مقابل النسبي: يتم التنبؤ بمسارات الأشياء في إحداثيات مطلقة لضمان استقرار التعلم؛ بينما تكون حركات الرأس نسبية لتجنب حدود مساحة العمل.
عدم اشتراط الوضع الحالي: لا تأخذ السياسة الوضع الحالي للجسم كشرط صريح؛ وهذا يجبر النموذج على الاعتماد على الاستدلال البصري بدلاً من حفظ المسارات الثابتة بناءً على الحالة الأولية، مما يحسن التعميم.
التنفيذ:
ذراع التلاعب: تنفذ المسار المتوقع للجسم.
ذراع الإدراك: ذراع ثانية سداسية درجات الحرية (مثبتة على الطاولة) تحاكي ديناميكيًا حركات رأس الإنسان المتوقعة، مما يوفر للروبوت قدرات الرؤية النشطة.
3. المساهمات الرئيسية
جمع بيانات الأيدي المجردة القابلة للتوسع: نظام يلغي الحاجة إلى التحكم عن بُعد أو الأجهزة الثقيلة المحمولة باليد، مما يسم يسمح للمشغلين بجمع البيانات بشكل طبيعي بأيدٍ مجردة أثناء ارتداء نظارات خفيفة الوزن.
مدخلات الرؤية النشطة فقط: يعتمد الإطار بالكامل على كاميرا واحدة نشطة الرؤية (مثبتة على ذراع "رأس" الروبوت) لكل من التدريب والاستدلال. وهو يتعامل بنجًا مع حالات الانسداد والتفاعلات البعيدة دون الحاجة إلى كاميرات خارجية ثابتة أو مستشعرات مثبتة على المعصم.
سياسة عابرة للتجسد متمحورة حول الأشياء: من خلال التنبؤ بمسارات الأشياء في الفضاء ثلاثي الأبعاد بدلاً من زوايا مفاصل الروبوت، يحقق النظام نقلًا صفريًا (Zero-shot transfer) عبر منصات روبوتية مختلفة (مثل Flexiv Rizon4 و UR5) دون الحاجة لإعادة التدريب أو إعادة التوجيه.
أول تكامل من نوعه: يعد هذا أول عمل يجمع بين النظارات الذكية لجمع بيانات الرؤية النشطة وسياسة ثلاثية الأبعاد متمحورة حول الأشياء للنشر الصفري للروبوتات.
4. النتائج التجريبية
تم تقييم النظام في ثلاث مهام واقعية صعبة تتضمن الانسداد والدقة:
وضع الكتاب: إدخال كتاب في رف مغطى جزئيًا.
صب الماء عن بعد مع وجود انسداد: صب الماء في كوب مخفي خلف حاجز.
إدخال الخبز: إدخال الخبز في فتحة محمصة لم تكن مرئية في البداية.
مقاييس الأداء:
مقابل الخطوط المرجعية (Baselines): تحت نفس إعداد الأجهزة (كاميرا واحدة)، تفوق ActiveGlasses على الخط المرجعي القوي π0.5 (المدرب على بيانات التحكم عن بُعد للروبوت الحقيقي) بفارق كبير في معدلات النجاح النهائية:
وضع الكتاب: +35%
إدخال الخبز: +25%
صب الماء: +30%
دراسات الاستئصال (Ablation Studies):
الرؤية النشطة: أدى إزالة الرؤية النشطة (استخدام كاميرا ثابتة) إلى انخفاض حاد في الأداء، خاصة في المهام التي تعاني من الانسداد (على سبيل المثال، انخفض نجاح إدخال الخبز من 15/20 إلى 10/20).
تصميم السياسة: استخدام تمثيل مسار الجسم المطلق حقق نتائج أفضل من التمثيل النسبي. كما أن اشتراط الوضع الحالي للجسم أدى إلى تدهور الأداء، حيث مال النموذج إلى تجاهل المدخلات البصرية.
العبور عبر التجسد (Cross-Embodiment): نجحت السياسة في الانتقال من روبوت Flexiv Rizon4 إلى روبوت UR5 بأداء مماثل في المراحل الأولى، مما أظهر المتانة تجاه الهياكل الكينماتيكية المختلفة.
5. الأهمية
تحول في نموذج جمع البيانات: يثبت ActiveGlasses أن بيانات تعلم الروبوت عالية الجودة يمكن جمعها بكفاءة من خلال قيام البشر بالتصرف بشكل طبيعي، مما يزيل "فجوة التجسد" خلال مرحلة الحصول على البيانات.
الرؤية النشطة كإشارة قابلة للتعلم: تثبت الورقة أن حركة الرأس ليست مجرد ضجيج، بل هي إشارة حاسمة وقابلة للتعلم لحل مهام الانسداد والدقة. ومن خلال نمذجة هذا السلوك وإعادة إنتاجه صراحة، يمكن للروبوتات تحقيق وعي بالموقف يشبه وعي البشر.
القابلية للتوسع: إن الجمع بين الأجهزة منخفضة التكلفة (النظارات الذكية + كاميرا ستيريو)، والتفاعل الطبيعي (الأيدي المجردة)، والسياسات المتمحورة حول الأشياء، يقدم مسارًا عالي القابلية للتوسع نحو نشر روبوتات عامة الأغراض في البيئات اليومية.