← أحدث الأبحاث
💻 computer science

Embodied Robot Manipulation in the Era of Foundation Models: Planning and Learning Perspectives

تقدم هذه الدراسة استعراضاً هيكلياً للمناولة الروبوتية في عصر النماذج التأسيسية من خلال تنظيم النهج التعلمية الحديثة في إطار موحد من التخطيط عالي المستوى (الذي يشمل الاستدلال عبر اللغة، والبرمجيات، والهندسة) ونمذجة الفعل منخفض المستوى، مع تسليط الضوء على كيفية مساهمة النماذج التأسيسية في كل من نواتج التخطيط وتوليد الأفعال المباشرة.

المؤلفون الأصليون: Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Zhe Li, Pengxiang Ding, Cheng Chi, Chang Xu, Xiaolong Zheng, Donglin Wang, Haoang Li, Shanghang Zhang
نُشر 2026-08-18
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Shuanghao Bai, Wenxuan Song, Jiayi Chen, Yuheng Ji, Zhide Zhong, Jin Yang, Han Zhao, Wanqi Zhou, Zhe Li, Pengxiang Ding, Cheng Chi, Chang Xu, Xiaolong Zheng, Donglin Wang, Haoang Li, Shanghang Zhang, Badong Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات بارعة في التكرار، حيث تؤدي نفس الحركة الدقيقة آلاف المرات في المصنع، لكنها تعاني عندما يتغير العالم. فلكي تنقل كوباً من الطاولة إلى الحوض، يحتاج الروبوت التقليدي إلى إنسان يبرمج كل خطوة بدقة: أين يوجد الكوب، وكيف يمسكه، وكيف يحرك الذراع بالضبط دون سكب المحتويات. ينبع هذا الصعوبة من كون المهمة تتطلب سلسلة من المهارات: رؤية الشيء، وفهم ماهيته، وتحديد الخطوات اللازمة لنقله، ثم التحكم جسدياً في العضلات للقيام بالعمل. لعقود من الزمن، حاول الباحثون سد الفجوة بين عيون الروبوت ويديه، لكن الاتصال كان غالباً هشاً. يأتي الموج الجديد من التقدم من نوع جديد من الذكاء الاصطناعي يُعرف بالنماذج التأسيسية (foundation models). هذه النماذج هي أنظمة ضخمة مدربة على كميات هائلة من البيانات من الإنترنت، وهي قادرة على فهم اللغة والصور والعالم المادي بطريقة تبدو شبه حدسية. إنها توفر فرصة لتعليم الروبوتات ليس فقط كيفية التحرك، بل كيفية التفكير في عملية التحرك.

يرسم مسح شامل جديد أجراه فريق من الباحثين من جامعات عبر آسيا وأستراليا والولايات المتحدة، كيف تعيد هذه النماذج القوية للذكاء الاصطناعي تشكيل مجال التحكم في الأشياء (robotic manipulation). وقد نظم المؤلفون، بقيادة باحثين من مؤسسات تشمل جامعة شيان جياوتونغ وجامعة هونغ كونغ للعلوم والتكنولوجيا، هذا العمل المتنامي بسرعة في هيكل واضح. وهم يقترحون أنه يجب علينا التوقف عن النظر إلى هذه الروبوتات ككتلة واحدة من الكود البرمجي، وبدلاً من ذلك، النظر إليها كنظام يتكون من طبقتين متمايزتين تعملان معاً: مخطط رفيع المستوى (high-level planner) يقرر ما يجب فعله، ومتحكم منخفض المستوى (low-level controller) يحدد كيفية تحريك العضلات للقيام بذلك. يساعد هذا الإطار في تفسير سبب قدرة بعض الروبوتات على اتباع تعليمات معقدة مثل "اطبخ حبة بطاطس وضعها في سلة إعادة التدوير"، بينما لا تستطيع روبوتات أخرى سوى التقاط مكعب محدد.

في قمة هذا النظام يقع المخطط. في الماضي، كان إعطاء روبوت تعليمات معقدة يتطلب تفكيكها إلى خطوات ثابتة مكتوبة مسبقاً. أما اليوم، فتعمل النماذج التأسيسية كدماغ يمكنه التفكير في المهمة. يسلط المسح الضوء على كيفية قدرة هذه النماذج على أخذ جملة بسيطة وتفكيكها إلى تسلسل من الخطوات المنطقية، مثل "توجه إلى الثلاجة"، "افتح الباب"، و"أمسك حبة البطاطس". تستخدم بعض الأنظمة نماذج لغوية كبيرة لتوليد هذه الخطط، بينما تكتب أنظمة أخرى أكواداً برمجية لوصف الأفعال. ويتضمن أحد النهج الواعدة بشكل خاص تعليم الروبوت فهم الشكل المادي للعالم. فبدلاً من مجرد قراءة الكلمات، تنشئ هذه النماذج خرائط ذهنية للمساحة ثلاثية الأبعاد، وتحدد مكان الأشياء وكيفية ملاءمتها لبعضها البعض. كما يمكنها تعلم "الإمكانات" (affordances)، وهو مفهوم يصف ما تسمح به الأفعال تجاه جسم ما؛ فعلى سبيل المثال، المقبض يسمح بالسحب، بينما السطح المستوي يسمح بالوضع. ومن خلال الجمع بين اللغة، والرؤية ثلاثية الأبعاد، وفهم ما يمكن للأشياء فعله، توفر هذه المخططات عالية المستوى دليلاً هيكلياً يتبعه الروبوت.

بمجرد تحديد الخطة، يجب على الروبوت تنفيذها. هذه هي مهمة نموذج الفعل منخفض المستوى، الذي يترجم الخطة المجردة إلى حركة فيزيائية. وجد الباحثون أن النهج الحديث الأكثر نجاحاً لا يعتمد على طريقة واحدة، بل يمزج غالاً بين استراتيجيات تعلم مختلفة. تتعلم بعض الروبوتات من خلال مراقبة البشر، وتقليد الحركات التي يراها في الفيديوهات أو العروض التوضيحية. بينما يتعلم البعض الآخر من خلال التجربة والخطأ، وتجربة حركات مختلفة حتى ينجح، وهي عملية تُعرف بالتعلم المعزز (reinforcement learning). وثمة اتجاه هام حدده البحث يتمثل في استخدام "التعلم الكامن" (latent learning)، حيث يتعلم الروبوت ضغط الحركات المعقدة إلى تمثيلات أبسط وخفية. فكر في الأمر كأن الروبوت يتعلم "جوهر" الحركة بدلاً من حفظ كل تشنج عضلي صغير، مما يسمح له بتكييف نفس الحركة مع أشياء أو مواقف مختلفة. كما يشير المسح أيضاً إلى تركيز متزايد على استخدام الرؤية ثلاثية الأبعاد وحتى مستشعرات اللمس. وبينما اعتمدت الروبوتات المبكرة بشكل أساسي على الكاميرات، بدأت الأنظمة الأحدث في دمج التغذية الراجعة اللمسية، مما يسمح لها بالشعور بما إذا كانت تمسك بشيء بقوة زائدة أو إذا كان الجسم ينزلق، وهو أمر بالغ الأهمية للمهام الدقيقة.

على الرغم من هذه التطورات، يلاحظ المؤلفون بحذر أن المجال لا يزال بعيداً عن المثالية. فالروبوتات الموصوفة في المسح ليست جاهزة بعد لاستبدال العمال البشر في كل منزل أو مصنع. فالعديد من الأنظمة تعمل بشكل جيد في بيئات محكومة أو عمليات محاكاة، لكنها تعاني عند مواجهة عدم القدرة على التنبؤ والفوضى في العالم الحقيقي. ويشير المسح إلى أنه بينما يمكن لهذه النماذج التفكير في المهمة، فإنها تفشل أحياناً في فهم الحدود الفيزيائية للروبوت، مثل ما إذا كان بإمكان الذراع الوصول فعلياً إلى نقطة معينة دون الاصطدام بجدار. وهناك أيضاً عقبات كبيرة تتعلق بالبيانات؛ إذ يتطلب تدريب هذه الأنظمة كميات هائلة من البيانات عالية الجودة، وهو أمر مكلف وصعب الجمع. علاوة على ذلك، تظل السلامة مصدر قلق رئيسي. فكلما أصبحت الروبوتات أكثر استقلالية، تطلبت ضمانات قوية لضمان عدم إلحاق الضرر بالبشر أو كسر الأشياء، وهي ضمانات لا تمتلكها النماذج الحالية دائماً.

يخلص الباحثون إلى أن الطريق إلى الأمام يكمن في بناء أنظمة أكثر عمومية يمكنها التعلم من تجارب متنوعة والتكيف مع المواقف الجديدة دون الحاجة إلى إعادة برمجتها لكل مهمة على حدة. ويقترحون أن مستقبل التحكم في الأشياء سيعتمد على إيجاد طرق أفضل لتقييم هذه الأنظمة، وجمع المزيد من البيانات من العالم الحقيقي، ودمج الحواس المتعددة مثل البصر واللمس والسمع في فهم موحد للعالم. يعمل هذا المسح كخارطة طريق، يوضح أنه بينما حققنا تقدماً ملحوظاً في تعليم الروبوتات التفكير والتحرك، فإن الرحلة نحو آلات ذكية وقابلة للتكيف حقاً لا تزال في بدايتها. لا يدعي هذا العمل أنه حل مشكلة التحكم في الروبوتات، بل يوفر رؤية واضحة ومنظمة لمكان وقوف التكنولوجيا اليوم وما يجب التغلب عليه من تحديات لجعل هذه الآلات مفيدة حقاً في حياتنا اليومية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →