← أحدث الأبحاث
💻 computer science

MS-MEM: Multi-Skill Manipulation-Enhanced Mapping via Uncertainty- and Disturbance-Aware Action Selection

تقترح هذه الورقة إطار عمل MS-MEM، وهو إطار عمل استدلالي يدمج الاختيار النشط لوجهة النظر، ودفع الأجسام، والإمساك بها مع قيد الاضطراب الجانبي لتعزيز دقة رسم الخرائط في البيئات المزدحمة مع تقليل التغييرات غير الضرورية في المشهد.

المؤلفون الأصليون: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

نُشر 2026-09-03
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تواجه الروبوتات التي تعمل في منازلنا ومستودعاتنا مشكلة بسيطة في ظاهرها: وهي أنها لا تستطيع رؤية كل شيء. ففي غرفة مزدحمة، تختبئ الأشياء خلف بعضها البعض، مما يخلق نقاطاً عمياء تربك مستشعرات الروبوت. وللعثور على عنصر معين، يجب على الروبوت أن يفعل ما هو أكثر من مجرد النظر؛ بل يجب عليه التفاعل مع العالم. قد يقوم بدفع صندوق جانباً ليرى ما خلفه، أو ينتقل إلى زاوية جديدة للحصول على رؤية أفضل. هذا المجال من الدراسة، المعروف باسم "الإدراك النشط" (active perception)، يعتمد على فكرة أن الروبوت يتعلم بشكل أفضل من خلال لمس الأشياء وتحريكها، وليس فقط بمجرد التحديق فيها. ومع ذلك، هناك عقبة؛ ففي كل مرة يدفع فيها الروبوت جسماً ما، فإنه يغير المشهد. إذا دفع بقوة كبيرة أو تكرر ذلك كثيراً، فقد يتسبب في بعثرة رف مرتب بعناية، مما يجعل فهم التخطيط لاحقاً أمراً أكثر صعوبة. ويتمثل التحدي الذي يواجه المهندسين في تعليم الروبوت كيف يكون فضولياً بما يكفي للعثور على الأشياء المخفية، وحذراً بما يكفي لعدم إحداث فوضى في هذه العملية.

قام باحثون من معهد كارلسروه للتكنولوجيا، وجامعة بون، والجامعة التقنية في دارمشتات بتطوير نظام جديد لحل عملية التوازن هذه. أطلقوا عليه اسم MS-MEM، وهو إطار عمل مصمم لمساعدة الروبوتات على رسم خرائط للمساحات الضيقة والمزدحمة مثل الأرفف، مع الحفاظ على المشهد دون اضطراب قدر الإمكان. يسمح النظام للروبوت بالاختيار بين ثلاثة أنواع مختلفة من الإجراءات: الانتقال إلى وجهة نظر جديدة لرؤية المزيد، أو دفع الأشياء للكشف عما هو مخفي، أو التقاط وإزالة جسم يحجب الرؤية. والابتكار الجوهى هو أن الروبوت لا يختار فقط الإجراء الذي يكشف أكبر قدر من المعلومات، بل يحسب أيضاً تكلفة ذلك الإجراء. فهو يسأل نفسه: "إذا دفعت هذا الصندوق، فبأي قدر سأزعزع استقرار بقية الرف؟" و"هل المعلومات الجديدة تستحق الفوضى التي قد أحدثها؟".

بنى الفريق نظامه على أساس من عدم اليقين. فبدلاً من معاملة خريطة الغرفة كصورة ثابتة، يحتفظ الروبوت بـ "اعتقاد" حول مكان وجود الأشياء، مكتملاً بمقياس لمدى عدم تأكده. فعندما يكون الروبوت واثقاً جداً من منطقة ما، فإنه يعرف ألا يلمسها. وعندما يكون غير متأكد، يعرف أنه بحاجة إلى الاستقصاء. ولاتخاذ هذه القرارات، قدم الباحثون طريقة جديدة للروبوت لفهم عملية الإمساك بالأشياء. كانت الأنظمة السابقة غالباً ما تعاني في التنبؤ بكيفية تفاعل قابض الروبوت مع جسم ما عندما تكون الرؤية جزئية أو عندما يكون الجسم في مكان ضيق. يعلم هذا النظام الجديد الروبوت ليس فقط أين يمسك، بل مدى ثقته في تلك المسكة، وكيف قد يكون اتجاه الجسم غير مؤكد. وهذا يسمح للروبوت بدمج المعلومات من زوايا متعددة، وتدقيق فهمه لعملية الإمساك بمرور الوقت أثناء تحركه حول الجسم.

في تجاربهم، اختبر الباحثون هذا النظام في بيئة محاكاة تحاكي رفاً حقيقياً مليئاً بأشياء موضوعة عشوائياً. وقارنوا نهجهم الجديد متعدد المهارات بالأساليب القديمة التي تعتمد على نوع واحد فقط من الإجراءات، مثل الدفع فقط أو الإمساك فقط. وأظهرت النتائج أن الجمع بين هذه المهارات كان أكثر فعالية بكثير. فمن خلال استخدام الدفع لفصل الأشياء وخلق مساحة، ثم استخدام الإمساك لإزالة العوائق المحددة، تمكن الروبوت من بناء خريطة أكثر دقة للمشهد. ومع ذلك، جاءت أهم نتيجة من قدرة النظام على الحد من الاضطراب؛ فعندما أضاف الباحثون قيداً محدداً لعملية اتخاذ القرار لدى الروبوت — وهو قاعدة تعاقب على التغييرات غير الضرورية في المشهد — أصبح الروبوت أكثر حذراً. لقد ظل يجد الأشياء المخفية، لكنه حرك عدداً أقل بكثير من العناصر مقارنة بالأنظمة التي لم تكن تمتلك هذه القاعدة. وفي عمليات المحاكاة، قلل النظام الجديد المسافة الإجمية التي تحركت فيها الأشياء بهامش كبير مقارنة بالأساليب التي تجاهلت اضطراب المشهد، مع تحقيق دقة عالية في رسم خرائط الرف في الوقت ذاته.

كما اختبر الفريق النظام في العالم الحقيقي باستخدام ذراع روبوت مادية مجهزة بكاميرا وقابض. وضعوا الروبوت أمام رف يحتوي على 69 جسماً عبر خمس إعدادات مختلفة وصعبة. كان على الروبوت العثور على أكبر عدد ممكن من الأجسام وتحديدها. ووجد النظام الذي يجمع بين الدفع والإمساك والحركة الحذرة عدداً أكبر من الأجسام مقارنة بالأنظمة التي استخدمت مهارة واحدة فقط. فقد نجح في تحديد 44 جسماً، مقارنة بـ 40 للنظام الذي يعتمد على الدفع فقط و38 للنظام الذي يعتمد على الإمساك فقط. والأهم من ذلك، أنه فعل ذلك مع التسبب في إزاحة فيزيائية أقل للعناصر على الرف. كان نظام الإمساك فقط هو الأقل حركة، لكنه فشل في العثور على العديد من العناصر المخفية لأنه كان متحفظاً للغاية. أما نظام الدفع فقط فقد وجد العديد من العناصر لكنه بعثر الرف بشكل كبير. وقد حقق النظام الجديد أفضل توازن، حيث وجد أكبر عدد من الأجسام مع الحفاظ على ترتيب المشهد نسبياً.

يوضح هذا العمل أنه لكي تعمل الروبوتات بفعالية في المساحات البشرية، يجب أن تكون قادرة على التفكير في عواقب أفعالها. فلا يكفي مجرد القدرة على التقاط الأشياء أو دفعها؛ بل يجب على الروبوت أن يفهم قيمة المعلومات التي يكتسبها مقابل تكلفة التغيير الذي يحدثه. ومن خلال تعليم الروبوتات وزن هذه العوامل، خطا الباحثون خطوة نحو آلات يمكنها التنقل في عالمنا المزدحم بنفس القدر من العناية والقدرة على التكيف التي يستخدمها البشر. إن هذا النظام لا يرى العالم فحسب، بل يفهم الفرق بين التفاعل المفيد والتفاعل المزعج، مما يسمح له بالتعلم عن بيئته دون تدمير النظام الذي يحاول رسم خرائطه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →