REAL: Robust Extreme Agility via Spatio-Temporal Policy Learning and Physics-Guided Filtering
تقدم هذه الورقة REAL، وهو إطار عمل متين وشامل (end-to-end) يجمع بين عمود فقري من نوع Mamba مُعدل بواسطة FiLM لتصفية الضوضاء الزمكانية وبين مُقدِّر بايزي موجه بالفيزياء لتمكين روبوت رباعي الأرجل من أداء مناورات باركور قصوى بموثوقية حتى في ظل التدهور الحسي الشديد ومناطق العمى البصري.
تخيل كلبًا آليًا يحاول اجتياز مسار للباركور. عليه أن يقفز فوق الفجوات، ويتسلق السلالم شديدة الانحدار، ويهبط على حواف ضيقة. الآن، تخيل القيام بذلك وأنت ترتدي نظارات شمسية قد يتشوش رؤيتها أحيانًا، أو تُخدش، أو حتى تصبح سوداء تمامًا لثانية واحدة.
معظم الكلاب الآلية ستتعثر، أو تسقط، أو تتجمد في حالة من الارتباك في اللحظة التي تصبح فيها رؤيتها مشوشة. فهي تعتمد كليًا على ما تراه "الآن". إذا حدث خلل في الكاميرا، يصاب الروبوت بالذعر.
تقدم الورقة البحثية التي شاركتها نظام REAL (تعلم الرشاقة القصوى المتينة)، وهو "دماغ" جديد للكلاب الآلية يحل هذه المشكلة. إليك كيف يعمل، مشروحًا من خلال تشبيهات بسيطة:
١. المشكلة: الروبوت ذو "ذاكرة الثانية الواحدة"
الكلاب الآلية الحالية تشبه أشخاصًا يعانون من فقدان الذاكرة في كل مرة يرمشون فيها. إذا كان الروبوت في منتصف قفزة، وتغطت الكاميرا بالطين أو حدث تشويش ناتج عن الحركة، فإنه ينسى أين هو وماذا يفعل. يحاول التفاعل مع صورة مشوشة، مما يؤدي إلى الاصطدام.
٢. الحل: دماغ "الرياضي الخبير"
يعلم نظام REAL الروبوت ليكون مثل رياضي باركور خبير. الرياضي لا ينظر إلى الأرض في اللحظة الراهنة فحسب؛ بل يتذكر الخطوات القليلة الماضية، ويشعر بالرياح، ويستشعر وضعية جسده.
يفعل REAL ذلك عبر ثلاث حيل رئيسية:
أ. "المُرشح الذكي" (FiLM & Mamba)
التشبيه: تخيل أنك تركض عبر سوق مزدحم. أحيانًا يحجب الناس رؤيتك (ضجيج بصري). الشخص العادي قد يتوقف ويحدق في الزحام مرتبكًا. أما العداء الخبير، فيستخدم حس الاستقبال العميق (Proprioception) الخاص به (شعوره بعضلاته ومفاصله) لـ "تصفية" الفوضى البصرية. هو يعرف: "لقد قفزت للتو، إذًا أنا في الهواء، حتى لو لم أرَ الأرض بعد".
كيف يفعلها REAL: يستخدم نظامًا خاصًا يسمى FiLM. اعتبر هذا بمثابة مفتاح تعتيم ذكي. عندما ترى الكاميرا شيئًا مشوشًا أو غريبًا (مثل تشويش الحركة)، تخبر مستشعرات جسم الروبوت الدماغ: "لا تثق بالعينين الآن؛ ثق بالعضلات!". يقوم النظام بتعتيم البيانات البصرية غير الموثوقة ويرفع مستوى التركيز على مستشعرات الجسم.
العمود الفقري "Mamba": لتذكر المسار، يستخدم REAL نوعًا جديدًا من ذاكرة الذكاء الاصطناي تسمى Mamba. على عكس نماذج الذكاء الاصطناعي القديمة التي تصبح بطيئة وتصاب بالارتباك عند النظر في تسلسلات طويلة (مثل فيديو طويل)، فإن Mamba يشبه أمين مكتبة فائق الكفاءة يمكنه استدعاء آخر ١٠ ثوانٍ من الحركة فورًا دون تعب. وهذا يسمح للروبوت بالاستمرار في الحركة حتى لو فقدت الكاميرا قدرتها على الرؤية للحظة.
ب. "محقق الفيزياء" (Physics-Guided Filtering)
التشبيه: إذا انزلقت على الجليد، فقد تخبرك عيناك أنك تتحرك بسرعة، لكن قدميك تشعران بأنك تنزلق. الروبوت العادي قد يصدق عينيه ويصطدم. أما الروبوت الذكي فيعرف قوانين الفيزياء: "إذا كانت قدماي تنزلقان، فلا يمكن لجسمي أن يتسارع بهذا القدر".
كيف يفعلها REAL: يستخدم مرشحًا موجهًا بالفيزياء. هذا يشبه المحقق الذي يراجع "قصة" الروبوت مقابل قوانين الفيزياء. إذا قالت الكاميرا "أنا أطير!" بينما تقول محرك الفيزياء "أنت مجرد منزلق"، فإن المحقق يتجاهل الكاميرا ويثق في الفيزياء. هذا يمنع الروبوت من القيام بحركات مستحيلة أو خطيرة.
ج. "المدرب الصارم" (Consistency-Aware Loss Gating)
التشبيه: تخيل تعليم طالب القيادة. في البداية، تريد منه أن يقلد كل حركة تقوم بها بدقة (التقليد/Imitation). ولكن إذا بدأ بالذعر وفعل شيئًا خطيرًا، فإنك توقفه وتتركه يحاول اكتشاف الأمر بنفسه (التعلم المعزز/Reinforcement Learning).
كيف يفعلها REAL: يمتلك النظام "مدربًا" (المعلم) الذي يعرف الحركات المثالية. كما يمتلك "طالبًا" (الروبوت) الذي يتعلم بكاميرات سيئة. يراقب المدرب الطالب. إذا كان الطالب يفعل شيئًا مختلفًا جدًا عن المدرب، يتدخل المدرب ويقول: "توقف، قلدني!" (التقليد). وإذا كان الطالب يبلي بلاءً حسنًا، يقول المدرب: "حسنًا، أنت في أمان، حاول التكيف بمفردك!" (التعلم المعزز). هذا يمنع الروبوت من التحطم أثناء تعلمه.
٣. النتيجة: "الركض الأعمى"
اختبر الباحثون هذا على كلب آلي حقيقي (Unitility Go2).
الاختبار: قاموا بتغطية كاميرا الروبوت بصندوق أسود لمدة متر واحد قبل كل عقبة.
النتيجة:
الروبوتات القديمة: توقفت فورًا أو سقطت لأنها لم تستطع الرؤية.
روبوت REAL: استمر في الركض. لقد استخدم "ذاكرة العضلات" (حس الاستقبال العميق) و"ذاكرته قصيرة المدى" (Mamba) لتخمين مكان العقبات وهبط بشكل مثالي.
ملخص
REAL هو دماغ روبوت لا يصاب بالذعر عندما تفشل عيناه. بدلاً من ذلك، يعتمد على شعور جسده، ويتذكر ما حدث قبل ثانية واحدة، ويتحقق من أفعاله مقابل قوانين الفيزياء. إنه الفرق بين روبوت يتعثر في ظل، وروبوت يمكنه اجتياز مسار باركور حتى لو كان معصوب العينين لبضع ثوانٍ.
إليك ملخص تقني مفصل لورقة البحث بعنوان "REAL: التعلم المتين للسياسات عبر الفضاء الزماني والترشيح الموجه بالفيزياء".
1. بيان المشكلة
تتطلب رياضة الباركوريات القصوى (Extreme parkour) للروبوتات أداء مناورات عالية الديناميكية (القفز، التسلق، الانتقالات السريعة في المشية) عبر تضاريس غير متصلة ومزدحمة. وبينما حققت أساليب التعلم المعزز (RL) الحديثة مرونة مثيرة للإعجاب، إلا أنها تعاني من هشاشة حرجة: تدهور الإدراك.
نقطة الضعف: تعتمد الأساليب الحالية بشكل كبير على مدخلات بصرية مستمرة ونظيفة. حتى الضوضاء البصرية القصيرة، أو زمن التأخير (latency)، أو ضبابية الحركة، أو الحجب المؤقت للمستشعرات (على سبيل المثال، أثناء الهبوط عالي التأثير أو مراحل الطيران) يمكن أن تؤدي إلى فشل كارثي.
الفجوة: تفتقر مقدرات الحالة الحالية غالباً إلى نمذجة عدم اليقين أو الاتساق الفيزيائي، بينما قد تواجه بنيات السياسة (مثل المحولات - Transformers) صعوبة في قيود الاستدلال في الوقت الفعلي أو تفشل في استخدام الذاكرة الزمنية بفعالية عند فقدان الرؤية.
الهدف: تطوير إطار عمل شامل (end-to-end) يتيح انتقالاً متيناً (zero-shot transfer) إلى الأجهزة الحقيقية، مع الحفاظ على الاستقرار حتى تحت ظروف التدهور الحسي الشديد (مثل منطقة عمى بصري بطول متر واحد).
2. المنهجية: إطار عمل REAL
يقترح المؤلفون REAL، وهو إطار عمل شامل يوحد الاستدلال الهيكلي للتضاريس، والذاكرة المكانية الزمانية التكيفية، والتقدير الموجه بالفيزياء للحالة. وهو يستخدم نموذج استقاء (distillation) يتكون من مرحلتين: المعلم والطالب (Teacher-Student).
أ. تعلم السياسة المكاني الزماني
المعلم المتميز (المرحلة 1): تم تدريبه في المحاكاة مع الوصول إلى معلومات "متميزة" (مسوحات تضاريس مثالية، وحالات حقيقية). يستخدم آلية الانتباه عبر الوسائط (Cross-Modal Attention) لتعلم الارتباطات الهيكلية بين الحالة الحسية العميقة (proprioceptive state) وهندسة التضاريس. تعمل حالة جسم الروبوت كاستعلام (query) لاسترجاع ميزات التضاريس ذات الصلة، مما يتيح اتخاذ قرارات واعية بالسياق.
الطالب القابل للنشر (المرحلة 2): يتم استقاؤه من المعلم، لكنه يعمل فقط باستخدام صور العمق المتوفرة على متن الروبوت والحس العميق.
دمج FiLM المعدل: يستخدم التعديل الخطي للميزات (FiLM) لتعديل الميزات البصرية ديناميكياً بناءً على الإشارات الحسية العميقة. يعمل هذا كمرشح تكيفي، حيث يقوم بكبح البيانات البصرية غير الموثوقة (مثل ضبابية الحركة) عندما تشير ديناميكيات الروبوت إلى وجود عدم يقين عالٍ.
بنية Mamba: تستبدل نماذج RNN أو Transformers التقليدية ببنية Mamba (نموذج فضاء الحالة). يوفر هذا نمذجة تسلسلية فعالة بزمن خطي (O(1))، مما يسمح للروبوت بالحفاظ على "ذاكرة تضاريس قصيرة المدى" عند تدهور المدخلات البصرية أو فقدانها.
ب. الترشيح الموجه بالفيزياء
لمعالجة نقص الاتساق الفيزيائي في المقدرات العصبية الصرفة:
شبكة السرعة الواعية بعدم اليقين: تعالج شبكة ResNet أحادية الأبعاد تسلسلاً حسياً عميقاً مكوناً من 10 إطارات للتنبؤ بالسرعة وعدم اليقين المرتبط بها (توزيع غاوسي). تستخدم خسارة Huber-Gaussian لضمان المتانة ضد القيم المتطرفة.
الدمج البايزي (EKF): يتم دمج تنبؤ السرعة العصبي مع نموذج ديناميكا الجسم الجاسئ عبر مرشح كالمان الموسع (EKF).
إذا تنبأت الشبكة العصبية بعدم يقين عالٍ (أثناء الانزلاق أو مرحلة الطيران مثلاً)، يعتمد EKF بشكل أكبر على النموذج الفيزيائي.
إذا كان التنبؤ واثقاً، فإنه يقوم بتصحيح النموذج الفيزيائي.
يضمن ذلك بقاء تقدير الحالة منطقياً من الناحية الفيزيائية وخالياً من الانحراف أثناء المناورات عالية التأثير.
ج. بوابات الخسارة الواعية بالاتساق
لتحقيق استقرار عملية الاستقاء من المعلم إلى الطالب:
تعمل آلية بوابة تكيفية على موازنة خسائر التقليد السلوكي (BC) والتعلم المعزز (RL) ديناميكياً.
يتم تحديد معامل البوابة بناءً على المسافة الإقليدية بين إجراء الطالب وإجراء المعلم.
التباين العالي: يعطي النظام الأولوية لـ BC لمنع الانحرافات المزعزعة للاستقرار.
التباين المنخفض: ينتقل النظام نحو RL لتشجيع الاستكشاف والمتانة تجاه الضوضاء.
3. المساهمات الرئيسية
إطار عمل REAL: بنية تعلم سياسة مكانية زمانية مبتكرة تلتقط الارتباطات الهيكلية بين الحس العميق والتضاريس، مما يتيح حركة رباعية الأرجل متينة.
الترشيح الموجه بالفيزياء: وحدة تعمل صراحة على نمذجة عدم اليقين وتفرض الاتساق للجسم الجاسئ عبر EKF، مما يضمن تقديراً موثوقاً للحالة أثناء الأحداث عالية الديناميكية.
بوابات الخسارة الواعية بالاتساق: استراتيجية توازن تكيفياً بين التقليد والتعلم المعزز، مما يحسن الاستقرار ونقل التعلم من المحاكاة إلى الواقع (sim-to-real).
التحقق من الأجهزة: نقل ناجح (zero-shot transfer) إلى الروبوت رباعي الأرجل Unitree Go2، مما أظهر قدرة على أداء الباركوريات القصوى بمتانة حتى مع وجود منطقة عمى بصري بطول متر واحد.
4. النتائج التجريبية
تم تقييم إطار العمل على Unitree Go2 في كل من المحاكاة والأجهزة الحقيقية، مقارنة بالنماذج المرجعية مثل Extreme Parkour وRPL وSoloParkour.
قابلية عبور التضاريس القصوى: حقق REAL معدل نجاح إجمالي (SR) بنسبة 78% عبر الحواجز والدرجات والفجوات، متفوقاً بشكل كبير على النماذج المرجعية (مثل Extreme Parkour الذي حقق 16%). كما قلل من متوسط انتهاكات الحواف (MEV) بفارق كبير، مما يشير إلى وضع قدم أكثر أماناً.
المتانة تجاه التدهور: في ظل الظروف القاسية (سقوط الإطارات، ضوضاء غاوسية، حجب مجال الرؤية)، حافظ REAL على أداء عالٍ. على سبيل المثال، تحت حجب مجال الرؤية المكاني، انخفض معدل النجاح في REAL قليلاً (0.78 ← 0.72)، بينما انهارت النماذج المرجعية المعتمدة على الرؤية.
مناورات منطقة العمى: في اختبار تم فيه حجب الرؤية قبل العوائق بمتر واحد، حافظ REAL على معدل نجاح بنسبة 55%، بينما فشلت النماذج المرجعية تقريباً فوراً (معدل نجاح ≈ 0-11%). وهذا يثبت فعالية الذاكرة الزمنية القائمة على Mamba.
الأداء في الوقت الفعلي: حققت بنية Mamba متوسط زمن استدلال قدره 13.1 مللي ثانية/خطوة (تعقيد O(1) محدود)، مما يلبي بدقة ميزانية التحكم في الوقت الفعلي البالغة 20 مللي ثانية. في المقابل، بلغ متوسط زمن الاستدلال للنماذج المرجعية القائمة على Transformers حوالي 23.07 مللي ثانية، مما يتجاوز القيد الزمني.
دراسات الاستئصال (Ablation Studies):
أدى إزالة Mamba إلى انخفاض معدل النجاح إلى 51% وزيادة MEV بمقدار 5 أضعاف تقريًا.
أدت إزالة FiLM إلى انخفاض معدل النجاح إلى 44% بسبب عدم القدرة على ترشيح المدخلات البصرية المشوشة.
قلل المرشح الموجه بالفيزياء من خطأ جذر متوسط مربع (RMSE) لتقدير السرعة إلى 0.23، متفوقاً على شبكات MLP القياسية (0.52).
5. الأهمية
يمثل إطار عمل REAL قفزة نوعية في مجال الروبوتات ذات الأرجل من خلال معالجة "الهشاشة" التي تعاني منها المتحكمات الحالية القائمة على التعلم.
الموثوقية في البيئات غير المهيكلة: يتيح للروبوتات العمل في سيناريوهات حرجة للسلامة (الاستجابة للكوارث، استكشاف الكواكب) حيث تكون المستشعرات عرضة للفشل أو الحجب.
الكفاءة مقابل الأداء: من خلال الاستفادة من Mamba، يحقق إطار العمل استدلالاً مكانياً زمانياً عالي الأداء دون العبء الحسابي للنماذج المحولة (Transformers)، مما يجعله قابلاً للنشر على الأجهزة ذات الموارد المحدودة.
التعلم الموجه بالفيزياء: إن دمج الترشيح البايزي مع الشبكات العصبية يسد الفجوة بين التعلم القائم على البيانات والقوانين الفيزيائية، مما يضمن بقاء الحالة الداخلية للروبوت متسقة مع الواقع حتى عندما يتدهور الإدراك.
باختصار، يثبت REAL أنه من خلال الربط الوثيق بين الرؤية، والحس العميق، والذاكرة الزمنية، والقيود الفيزيائية، يمكن للروبوتات تحقيق مرونة قصوى تتسم بالمتانة تجاه العيوب الحتمية في الاستشعار في العالم الحقيقي.