← أحدث الأبحاث
💻 computer science

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

يُعد PhysCaP عاملاً مبتكرًا يعزز التلاعب الروبوتي من خلال دمج طبقة استكشاف قائمة على الفيزياء ومعلوماتية وخالية من التدريب في أطر عمل "البرمجة كسياسة" (code-as-policy)، مما يتيح بحثاً فعالاً ومستهدفاً عن المعلومات لاستنتاج الخصائص الكامنة للأجسام مثل الكتلة والصلابة عبر نظام مزدوج الوكيل للتخطيط وتحديد الأولويات.

المؤلفون الأصليون: Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

نُشر 2026-08-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات بارعة في عالم المرئيّات. فإذا كانت المهمة تتضمن نقل كوب من فوق الطاولة إلى الحوض، يمكن للروبوت الحديث غالبًا أن يرى الكوب، ويخطط لمسار، وينفذ الحركة ببراعة مبهرة. ويعتمد هذا النجاح على سياسات "الرؤية-اللغة-الفعل"، وهي أنظمة تتعلم من خلال مشاهدة البشر وهم يؤدون المهام ثم محاكاة تلك الحركات. ومع ذلك، تعمل هذه الأنظمة وفق قصور جوهري: فهي لا ترى إلا ما هو موجود على السطح. لا يمكنها الشعور بوزن علبة لتعرف ما إذا كانت فارغة، ولا يمكنها استشعار صلابة فاكهة لتعرف ما إذا كانت ناضجة. وفي العالم الحقيقي، تعتمد العديد من المهام على هذه الخصائص الفيزيائية الخفية. فالإنسان الذي ينظف المطبخ قد يهز علبة صودا ليسمع ما إذا كانت فارغة أو يضغط على حبة أفوكادو ليتأكد من نضجها، مستخدمًا اللمس والصوت لملء الفجوات التي يتركها البصر وراءه. وبدون هذه القدرة على البحث بنشاط عن المعلومات الخفية، يظل الروبوت أعمى عن التفاصيل ذاتها التي تحدد ما إذا كانت المهمة ستنجح أم ستفشل.

لقد طور باحثون في جامعة تايوان الوطنية وشركة NVIDIA نهجًا جديدًا لسد هذه الفجوة، حيث ابتكروا نظامًا أطلقوا عليه اسم PhysCaP. يعلّم هذا النظام الروبوت كيف يتصرف كإنسان فضولي، حيث يجمع بين القدرة على كتابة تعليماته الخاصة وقدرة جديدة على الاستكشاف الفيزيائي. فبدلاً من مجرد المشاهدة والتقليد، صُمم الروبوت ليطرح أسئلة على العالم المادي. فعندما يواجه طاولة مليئة بالأشياء حيث تكون الإجابة مخفية، لا يقوم الروبوت بالتخمين، بل يقرر التفاعل، عبر رفع أو ضغط العناصر لجمع البيانات المحددة التي يحتاجها. بُني النظام على إطار عمل "البرمجية كسياسة" (code-as-policy)، مما يعني أن الروبوت يولد كودًا برمجيًا قابلًا للتنفيذ للتحكم في حركاته، مما يسمح له بالتفكير في خطوات معقدة تمامًا مثل الإنسان الذي يخطط لتسلسل من الأفعال. وما يجعل PhysCaP فريدًا هو إضافة طبقة استكشاف مستوحاة من الفيزياء؛ تسمح هذه الطبقة للروبوت بتقدير خصائص مثل الكتلة والصلابة باستخدام التغذية الراجعة من محركاته ومفاصله فقط، دون الحاجة إلى مستشعرات خاصة مثل الجلد الحساس للمس أو الموازين.

إن جوهر هذا النظام الجديد هو تصميم يعتمد على وكيل مزدوج يدير التوازن الدقيق بين التصرف قبل الأوان أو إضاعة الوقت. أحد الوكيلين، وهو "المخطط" (Planner)، ينظر إلى المشهد ويقرر ما إذا كان لدى الروبوت معلومات كافية لإتمام المهمة. وإذا كانت المعلومات مفقودة، يضع المخطط قائمة بالإجراءات المحتملة لإيجادها. ثم يقوم وكيل ثانٍ، وهو "المُرتِّب" (Prioritizer)، بمراجعة هذه القائمة وترتيب الإجراءات بناءً على القرائن البصرية. فعلى سبيل المثال، إذا كانت المهمة هي العثور على علبة صودا فارغة من بين أربع علب، يلاحظ "المُرتِّب" أن علبتين مغطاتان وأخريين تبرز منهما مصاصات، فيستنتج منطقيًا أن العلب المغطاة من المرجح أن تكون ممتلئة، فيعطي الأولوية لفحص العلب المفتوحة أولاً. وهذا يمنع الروبوت من إضاعة الطاقة في أشياء من غير المرجح أن تحمل الإجابة. وبمجرد أن يجمع الروبوت أدلة كافية، يتوقف النظام عن الاستكشاف وينفذ المهمة النهائية.

ولاختبار هذه الفكرة، أعد الباحثون ثلاثة تحديات متميزة على طاولة في العالم الحقيقي. في مهمة واحدة، كان هناك مكعب أزرق مخفي تحت أحد ثلاثة أكواب، وكان أحد الأكواب أصغر من أن يتسع للمكعب. قد يقوم روبوت يعتمد على الرؤية فقط برفع كل الأكواب، لكن PhysCaP استخدم تفكيره ليرى فرق الحجم وتجاوز الكوب المستحيل، رافعًا فقط المرشحين القابلين للاستيعاب. وفي مهمة أخرى، كان على الروبوت العثور على علبة صودا فارغة واحدة من بين أربع علب. وباستخدام قدرته على قياس الوزن من خلال التغذية الراجعة للمحرك، نجح في تحديد العلبة الفارغة. وفي المهمة الثالثة، كان عليه اختيار حبة أفوكدو ناضجة من بين مجموعة من الثمار الخضراء والداكنة. ومن خلال ضغط حبات الأفوكادو الداكنة لقياس مدى صلابتها، اختار الثمرة الناضجة متجاهلًا الثمار الصلبة غير الناضجة. وفي جميع هذه السيناريوهات، نجح النظام حيث فشلت الأساليب الأخرى. فالروبوتات التي اعتمدت على الرؤية فقط لم تستطع حل المهام لأنها لم تستطع رؤية الخصائص الخفية. أما الروبوتات التي استطاعت قياس الخصائص ولكن افتقرت إلى القدرة على ترتيب الأولويات، فقد انتهى بها الأمر بفحص كل شيء، مما استغرق وقتًا أطول واستهلك طاقة أكثر.

أظهرت النتائج أن PhysCaP يمكنه إكمال هذه المهام بمعدلات نجاح عالية مع التفاعل مع عدد أقل بك من الأشياء مقارنة بمنافسيه. وفي الاختبارات الواقعية، وجد النظام المكعب المخفي، وعلبة الصودا الفارغة، وحبة الأفوكادو الناضجة بعدد أقل بكثير من اللمسات الفيزيائية وفي وقت أقل من الأنظمة التي تفحص كل شيء بشكل عشوائي. كما أجرى الباحثون عمليات محاكاة لمعرفة كيفية أداء النظام في بيئة رقمية، وكانت النتائج صحيحة: فالنظام الذي يمكنه التفكير فيما يجب قياسه ومتى يتوقف، تفوق على النماذج التي تحاول ببساطة التخمين أو فحص كل شيء. وتؤكد الدراسة أنه لكي تعمل الروبوتات حقًا في العالم الحقيقي الفوضوي وغير المتوقع، يجب أن تكون قادرة على البحث بنشاط عن الحقائق الفيزيائية التي لا يستطيع البصر وحده كشفها. ومن خلال منح الروبوتات القدرة على طرح الأسئلة الصحيحة والاستماع إلى الإجابات التي يقدمها العالم المادي، يقربنا هذا البحث من آلات يمكنها التعامل مع التعقيدات اللمسية الدقيقة للحياة البشرية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →