PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration
يُعد PhysCaP عاملاً مبتكرًا يعزز التلاعب الروبوتي من خلال دمج طبقة استكشاف قائمة على الفيزياء ومعلوماتية وخالية من التدريب في أطر عمل "البرمجة كسياسة" (code-as-policy)، مما يتيح بحثاً فعالاً ومستهدفاً عن المعلومات لاستنتاج الخصائص الكامنة للأجسام مثل الكتلة والصلابة عبر نظام مزدوج الوكيل للتخطيط وتحديد الأولويات.
لطالما كانت الروبوتات بارعة في عالم المرئيّات. فإذا كانت المهمة تتضمن نقل كوب من فوق الطاولة إلى الحوض، يمكن للروبوت الحديث غالبًا أن يرى الكوب، ويخطط لمسار، وينفذ الحركة ببراعة مبهرة. ويعتمد هذا النجاح على سياسات "الرؤية-اللغة-الفعل"، وهي أنظمة تتعلم من خلال مشاهدة البشر وهم يؤدون المهام ثم محاكاة تلك الحركات. ومع ذلك، تعمل هذه الأنظمة وفق قصور جوهري: فهي لا ترى إلا ما هو موجود على السطح. لا يمكنها الشعور بوزن علبة لتعرف ما إذا كانت فارغة، ولا يمكنها استشعار صلابة فاكهة لتعرف ما إذا كانت ناضجة. وفي العالم الحقيقي، تعتمد العديد من المهام على هذه الخصائص الفيزيائية الخفية. فالإنسان الذي ينظف المطبخ قد يهز علبة صودا ليسمع ما إذا كانت فارغة أو يضغط على حبة أفوكادو ليتأكد من نضجها، مستخدمًا اللمس والصوت لملء الفجوات التي يتركها البصر وراءه. وبدون هذه القدرة على البحث بنشاط عن المعلومات الخفية، يظل الروبوت أعمى عن التفاصيل ذاتها التي تحدد ما إذا كانت المهمة ستنجح أم ستفشل.
لقد طور باحثون في جامعة تايوان الوطنية وشركة NVIDIA نهجًا جديدًا لسد هذه الفجوة، حيث ابتكروا نظامًا أطلقوا عليه اسم PhysCaP. يعلّم هذا النظام الروبوت كيف يتصرف كإنسان فضولي، حيث يجمع بين القدرة على كتابة تعليماته الخاصة وقدرة جديدة على الاستكشاف الفيزيائي. فبدلاً من مجرد المشاهدة والتقليد، صُمم الروبوت ليطرح أسئلة على العالم المادي. فعندما يواجه طاولة مليئة بالأشياء حيث تكون الإجابة مخفية، لا يقوم الروبوت بالتخمين، بل يقرر التفاعل، عبر رفع أو ضغط العناصر لجمع البيانات المحددة التي يحتاجها. بُني النظام على إطار عمل "البرمجية كسياسة" (code-as-policy)، مما يعني أن الروبوت يولد كودًا برمجيًا قابلًا للتنفيذ للتحكم في حركاته، مما يسمح له بالتفكير في خطوات معقدة تمامًا مثل الإنسان الذي يخطط لتسلسل من الأفعال. وما يجعل PhysCaP فريدًا هو إضافة طبقة استكشاف مستوحاة من الفيزياء؛ تسمح هذه الطبقة للروبوت بتقدير خصائص مثل الكتلة والصلابة باستخدام التغذية الراجعة من محركاته ومفاصله فقط، دون الحاجة إلى مستشعرات خاصة مثل الجلد الحساس للمس أو الموازين.
إن جوهر هذا النظام الجديد هو تصميم يعتمد على وكيل مزدوج يدير التوازن الدقيق بين التصرف قبل الأوان أو إضاعة الوقت. أحد الوكيلين، وهو "المخطط" (Planner)، ينظر إلى المشهد ويقرر ما إذا كان لدى الروبوت معلومات كافية لإتمام المهمة. وإذا كانت المعلومات مفقودة، يضع المخطط قائمة بالإجراءات المحتملة لإيجادها. ثم يقوم وكيل ثانٍ، وهو "المُرتِّب" (Prioritizer)، بمراجعة هذه القائمة وترتيب الإجراءات بناءً على القرائن البصرية. فعلى سبيل المثال، إذا كانت المهمة هي العثور على علبة صودا فارغة من بين أربع علب، يلاحظ "المُرتِّب" أن علبتين مغطاتان وأخريين تبرز منهما مصاصات، فيستنتج منطقيًا أن العلب المغطاة من المرجح أن تكون ممتلئة، فيعطي الأولوية لفحص العلب المفتوحة أولاً. وهذا يمنع الروبوت من إضاعة الطاقة في أشياء من غير المرجح أن تحمل الإجابة. وبمجرد أن يجمع الروبوت أدلة كافية، يتوقف النظام عن الاستكشاف وينفذ المهمة النهائية.
ولاختبار هذه الفكرة، أعد الباحثون ثلاثة تحديات متميزة على طاولة في العالم الحقيقي. في مهمة واحدة، كان هناك مكعب أزرق مخفي تحت أحد ثلاثة أكواب، وكان أحد الأكواب أصغر من أن يتسع للمكعب. قد يقوم روبوت يعتمد على الرؤية فقط برفع كل الأكواب، لكن PhysCaP استخدم تفكيره ليرى فرق الحجم وتجاوز الكوب المستحيل، رافعًا فقط المرشحين القابلين للاستيعاب. وفي مهمة أخرى، كان على الروبوت العثور على علبة صودا فارغة واحدة من بين أربع علب. وباستخدام قدرته على قياس الوزن من خلال التغذية الراجعة للمحرك، نجح في تحديد العلبة الفارغة. وفي المهمة الثالثة، كان عليه اختيار حبة أفوكدو ناضجة من بين مجموعة من الثمار الخضراء والداكنة. ومن خلال ضغط حبات الأفوكادو الداكنة لقياس مدى صلابتها، اختار الثمرة الناضجة متجاهلًا الثمار الصلبة غير الناضجة. وفي جميع هذه السيناريوهات، نجح النظام حيث فشلت الأساليب الأخرى. فالروبوتات التي اعتمدت على الرؤية فقط لم تستطع حل المهام لأنها لم تستطع رؤية الخصائص الخفية. أما الروبوتات التي استطاعت قياس الخصائص ولكن افتقرت إلى القدرة على ترتيب الأولويات، فقد انتهى بها الأمر بفحص كل شيء، مما استغرق وقتًا أطول واستهلك طاقة أكثر.
أظهرت النتائج أن PhysCaP يمكنه إكمال هذه المهام بمعدلات نجاح عالية مع التفاعل مع عدد أقل بك من الأشياء مقارنة بمنافسيه. وفي الاختبارات الواقعية، وجد النظام المكعب المخفي، وعلبة الصودا الفارغة، وحبة الأفوكادو الناضجة بعدد أقل بكثير من اللمسات الفيزيائية وفي وقت أقل من الأنظمة التي تفحص كل شيء بشكل عشوائي. كما أجرى الباحثون عمليات محاكاة لمعرفة كيفية أداء النظام في بيئة رقمية، وكانت النتائج صحيحة: فالنظام الذي يمكنه التفكير فيما يجب قياسه ومتى يتوقف، تفوق على النماذج التي تحاول ببساطة التخمين أو فحص كل شيء. وتؤكد الدراسة أنه لكي تعمل الروبوتات حقًا في العالم الحقيقي الفوضوي وغير المتوقع، يجب أن تكون قادرة على البحث بنشاط عن الحقائق الفيزيائية التي لا يستطيع البصر وحده كشفها. ومن خلال منح الروبوتات القدرة على طرح الأسئلة الصحيحة والاستماع إلى الإجابات التي يقدمها العالم المادي، يقربنا هذا البحث من آلات يمكنها التعامل مع التعقيدات اللمسية الدقيقة للحياة البشرية.
ملخص تقني: PhysCaP – وكيل "الكود كسياسة" (Code-as-Policy) مرتكِز على الفيزياء مع استكشاف مستنير فيزيائياً
بيان المشكلة
أظهرت سياسات "الرؤية واللغة والعمل" (VLA) الحديثة أداءً قوياً في محاكاة العروض التوضيحية للمهام المعقدة في المناولة. ومع ذلك، فهي تعتمد بشكل أساسي على الملاحظة السلبية، وتفشل في استنتاج الخصائص الفيزيائية الكامنة (مثل كتلة الجسم، أو الصلابة، أو الحالة الداخلية) التي تُعد حاسمة للمهام التي تنطوي على حالات مخفية. وبينما يمكن لتعلم التعزيز (Reinforcement Learning) نظرياً اكتشاف سلوكيات البحث عن المعلومات، إلا أنه غالباً ما يعاني من عدم كفاءة العينات وينتج سياسات يصعب تفسيرها. إن أطر عمل "الكود كسياسة" (CaP) الحالية، التي تفكك الإدراك والاستدلال إلى مكونات نمطية قابلة للتنفيذ، تحسن من قابلية التفسير ولكنها تظل مقيدة جوهرياً بالإدراك السلبي؛ فهي تفتقر إلى الآليات التي تمكنها من اكتساب المعلومات الفيزيائية المفقودة بنشاط من خلال التفاعل، مما يؤدي إلى الفشل في البيئات ذات الإدراك الجزئي أو يؤدي إلى "استكشاف مفرط" غير فعال حيث يتفاعل الوكيل مع جميع الأجسام دون تمييز.
المنهجية
يقترح المؤلفون PhysCaP، وهو وكيل "كود كسياسة" مستنير فيزيائياً مصمم للإدراك النشط في المناولة الروبوتية. يدمج الإطار ثلاثة مكونات أساسية لتمكين الاستكشاف المستهدف والفعال:
1. وحدات استخراج الخصائص الفيزيائية الخالية من التدريب (PhysX)
يقدم PhysCaP وحدات لتقدير الخصائص الفيزيائية الكامنة مباشرة من الاستقبال الحسي الخاص بالروبوت (عزوم دوران المفاصل وجهد المحرك) دون الحاجة إلى مستشعرات إضافية مثل جلود اللمس أو مستشعرات القوة والعزم.
قياس الكتلة (get_mass): يستنتج كتلة الجسم من خلال مقارنة عزوم دوران المفاصل أثناء مسار رفع ثابت (15 سم) مع وجود الجسم وبدونه. يقوم النظام بحساب فرق العزم (Δτ) وإسقاطه على "جاكوبي" النهاية الطرفية (End-effector Jacobian) لتقدير الكتلة، مع مراعاة التكوين الكينماتيكي.
قياس الصلابة (get_stiffness): يقدر صلابة الجسم من خلال تحليل العلاقة بين إزاحة فكي القابض والجهد الطبيعي للمحرك. يقوم النظام بإجراء اختبار "تراجع" للتحقق من التلامس الحقيقي ويقيس التشوه عند مستوى جهد مستهدف، ثم يربط النتيجة بمقياس صلابة منفصل (1–5).
2. بنية الاستكشاف ثنائية الوكيل
للموازنة بين تكلفة التفاعل وكفاءة كسب المعلومات، يستخدم PhysCaP عملية استدلال ثنائية المرحلة:
وكيل المخطط (Planner Agent): يقيم ما إذا كانت الملاحظات البصرية الحالية كافية لتنفيذ المهمة. إذا كانت الخصائص الفيزيائية مخفية، فإنه ينشئ قائمة بمرشحي الاستكشاف (الأجسام المراد التفاعل معها) ويحدد المعلومات المطلوبة (مثل "وزن العلبة الخضراء"). كما يعمل أيضاً كمعيار ديناميكي للتوقف، حيث ينهي الاستكشاف بمجرد جمع أدلة كافية.
وكيل تحديد الأولويات (Prioritizer Agent): يقوم بتنقية قائمة المرشحين الخاصة بالمخطط باستخدام الاستدلالات البصرية. فهو يستبعد التفاعلات غير المنطقية (مثل وزن علبة مغلقة يُعرف أنها ممتلئة) ويرتب المرشحين المتبقين بناءً على درجة أولوية تعكس صلة المهمة. هذا يمنع "الاستكشاف المفرط" من خلال ضمان تفاعل الروبوت مع الأجسام الأكثر إفادة أولاً.
3. تنفيذ "الكود كسياسة"
يقوم وكيل برمجي بترجمة خطة الاستكشاف ذات الأولوية إلى كود بايثون قابل للتنفيذ. يستدعي هذا الكود واجهات التحكم منخفضة المستوى (مثل goto_pose و get_mass) لأداء التفاعلات الفيزيائية. يعمل النظام في حلقة مغلقة: بعد كل تفاعل، يتم دمج البيانات الفيزيائية الجديدة في حالة الاعتقاد الخاصة بالوكيل، ويعيد المخطط تقييم الحاجة إلى مزيد من الاستكشاف.
المساهمات الرئيسية
طبقة الاستكشاف المستنيرة فيزيائياً: تقديم إطار عمل يعزز وكلاء "الكود كسياسة" بالتفاعل الفيزيائي النشط، مما يتيح استنتاج الحالات الكامنة (الكتلة، الصلابة) دون أجهزة استشعار خارجية.
وحدات PhysX الخالية من التدريب: خوارزميات مبتكرة لتقدير كتلة الجسم وصلابته باستخدام الاستقبال الحسي القياسي للروبوت فقط، والتي تم التحقق من صحتها عبر مجموعة من الأجسام.
تصميم الوكيل المزدوج: فصل معماري محدد بين المخطط (الذي يحدد ماذا و متى يستكشف) والمحدد للأولويات (الذي يحدد أي جسم يجب استكشافه أولاً بناءً على الإشارات البصرية). يعالج هذا التصميم المقايضة بين نقص الاستكشاف (الفشل بسبب نقص المعلومات) والاستكشاف المفرط (عدم الكفاءة).
التحقق التجريبي: تقييم شامل في مهام سطح المكتب الواقعية (إيجاد مكعبات مخفية، تحديد علب فارغة، اختيار حبات أفوكادو ناضجة) وفي بيئة محاكية (LIBERO).
النتائج
أُجريت التجارب على ذراع روبوتية من نوع AgileX PiPER بـ 7 درجات حرية عبر ثلاث مهام تتطلب تقدير الحالة المخفية:
معدل نجاح المهمة (SR): حقق PhysCaP معدلات نجاح عالية (80-90% في المهام الواقعية، و78% في المحاكاة)، متفوقاً بشكل كبير على نماذج VLA السلبية (التي فشلت بسبب الخصائص المخفية) والنماذج التفاعلية الأساسية.
الكفاءة (التفاعلات والوقت): تطلب PhysCaP أقل عدد من التفاعلات الفيزيائية (على سبيل المثال، 1.33 تفاعلاً في المتوسط لمهمة "إيجاد المكعب الأزرق" مقابل 3 للنماذج المرجعية) وأقصر وقت تنفيذ.
المقارنة مع النماذج المرجعية:
CaP (السلبي): فشل في المهام التي تتطلب استنتاجاً فيزيائياً.
CaP+PhysX (تفاعلي أساسي): نجح ولكنه قام باستكشاف شامل (قياس جميع الأجسام)، مما أدى إلى تكاليف تفاعل ووقت مرتفعين.
CaP+PhysX+Planner: حسن الكفاءة من خلال التوقف المبكر ولكنه كان لا يزال يفتقر إلى تحديد الأولويات، مما أدى إلى تسلسلات تفاعل غير مثالية.
PhysCaP: حقق أداءً مثالياً من خلال الجمع بين التوقف المبكر وتحديد الأولويات القائم على الاستدلال البصري.
دراسات الاستئصال (Ablation Studies): أكدت أن تصميم الوكيل المزدوج (الفصل بين التخطيط وتحديد الأولويات) يتفوق على نهج الوكيل الواحد المدمج، الذي مال إلى توليد خطط غير منظمة وشاملة. كما ثبت أن وحدات PhysX تقدر الكتلة والصلابة بدقة، حيث حقق اختبار "المرجع المثالي" (Oracle Test) باستخدام الكتلة الحقيقية نجاحاً بنسبة 100% في مهمة "تحديد العلبة الفارغة".
الأهمية والادعاءات
يزعم البحث أن PhysCaP يمثل خطوة هامة نحو تعلم روبوتي عام في البيئات ذات الإدراك الجزئي. من خلال ترسيخ الاستدلال عالي المستوى في التفاعل الفيزيائي الصريح، يسمح الإطار للروبوتات بتقليل عدم اليقين بنشاط بدلاً من الاعتماد فقط على الإشارات البصرية السلبية. يؤكد المؤلفون أن نهجهم يتيح إكمال المهام بكفاءة مع حد أدنى من تكاليف التفاعل، مما يعالج قصوراً جوهرياً في نماذج VLA الحالية. يوضح العمل أن دمج التقدير الحسي (Proprioceptive) الخالي من المستشعرات مع الاستدلال الهيكلي القائم على الكود يسمح للوكلاء بحل مهام المناولة التي قد تكون مستعصية على الأنظمة البصرية البحتة أو الأنظمة التفاعلية البسيطة. ويُقدم الإطار كونه مستقلاً عن النموذج (Model-agnostic)، وقادراً على العمل مع مختلف النماذج التأسيسية، وقابلاً للتوسع لإضافة وحدات أخرى لاستخراج الخصائص الفيزيائية.