← أحدث الأبحاث
💻 computer science

MessyMem: Learning-from-Doing Memory for Mobile Manipulation

تُعد MessyMem نظام ذاكرة مستمرة للمناولات المحمولة، حيث تحافظ على مخطط مشهد ثلاثي الأبعاد مرتبط مكانياً ومعزز بالمعرفة المستمدة من التفاعل، مما يمكّن الروبوتات من التعلم من الخبرة والتفوق بشكل كبير على النماذج المرجعية الحالية عبر إعادة استخدام الاكتشافات السابقة في المهام طويلة الأمد.

المؤلفون الأصليون: Anuva Banwasi, William Muckelroy III, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg, Cherie Ho

نُشر 2026-09-16
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Anuva Banwasi, William Muckelroy III, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg, Cherie Ho

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

أصبحت الروبوتات التي تتحرك في منازلنا ومكاتبنا أكثر شيوعاً، لكنها لا تزال تعاني من مهارة بشرية أساسية: وهي تذكر ما تعلمته. فغالباً ما تتعامل الروبوتات المنزلية اليوم مع كل طلب جديد كما لو كانت هذه هي المرة الأولى التي تدخل فيها الغرفة على الإطلاق. إذا فتح الروبوت خزانة ووجدها فارغة، فقد ينسى هذه الحقيقة بحلول صباح اليوم التالي. وإذا اكتشف أن درجاً مغلقاً، فقد يحاول فتحه بالقوة مراراً وتكراراً في المهام المستقبلية. هذا الافتقار إلى الذاكرة المستمرة يجبر الروبوتات على البدء من الصفر باستمرار، مما يهدر الوقت والطاقة. لكي يعمل الروبوت بفعالية في منزل حقيقي، فإنه يحتاج إلى ما هو أكثر من مجرد خريطة لأماكن الأشياء؛ إنه يحتاج إلى سجل لما اكتشفه من خلال اللمس والعمل، وطريقة لاسترجاع تفاصيل بصرية محددة من ساعات أو أيام مضت.

قام باحثون في جامعة ستانفورد بتطوير نظام يسمى "MessyMem" لحل هذه المشكلة. يعمل هذا النظام كذاكرة طويلة المدى للروبوتات المتنقلة، مما يسمح لها بنقل المعرفة عبر غرف مختلفة وعلى فترات زمنية طويلة. وبدلاً من الاعتماد على قائمة بسيطة من الأشياء أو بث فيديو مستمر كبير جداً بحيث يصعب البحث فيه، يقوم "MessyMem" ببناء خريطة مهيكلة للعالم تنمو وتصبح أكثر ذكاءً مع كل تفاعل. فهو يجمع بين ثلاثة أنواع متميزة من المعلومات: خريطة مكانية لمواقع الأشياء، وسجلاً لما تعلمه الروبوت من خلال لمس الأشياء أو تحريكها فعلياً، ومكتبة من الصور الفوتوغرافية المحددة الملتقطة في لحظات رئيسية. ومن خلال ربط هذه العناصر الثلاثة معاً، يمكن للروبوت الإجابة على أسئلة معقدة مثل "أين رأيت المقص؟" أو "أي خزانة مغلقة؟" دون الحاجة إلى إعادة استكشاف المنزل بأكمله.

جوهر هذا النظام هو "رسم بياني للمشهد ثلاثي الأبعاد" (3D scene graph)، وهو في الأساس خريطة رقمية تسرد كل جسم رآه الروبوت وموقعه في العالم. وخلافاً للخريطة القياسية التي تسجل الهندسة فقط، يقوم هذا النظام بإرفاق ملف تعريف مفصل بكل عنصر. عندما يتفاعل الروبوت مع جسم ما، مثل محاولة فتح درج أو التقاط كوب، يقوم مكون برمجيات متخصص بتحليل النتيجة. فهو يحدد ما إذا كان الدرج مغلقاً، أو ما إذا كان الكوب فارغاً، أو ما إذا كانت العملية قد فشلت لأن الروبوت انزلق. تُكتب هذه المعلومات مباشرة في الملف الرقمي لهذا الجسم. لذا، إذا حاول الروبوت فتح خزانة ووجدها مغلقة، يتم حفظ هذه الحقيقة. ولاحقاً، عندما يُطلب منه البحث عن شيء بالداخل، يفحص ذاكرته، ويرى ملاحظة "مغلق"، ويتخطى تلك الخزانة تماماً، متوجهاً مباشرة إلى خزانة أخرى غير مغلقة.

ومع ذلك، فإن معرفة أن الخزانة مغلقة ليست كافية دائماً. فأحياناً يحتاج الروبوت إلى تذكر تفاصيل دقيقة لا يمكن لملاحظة نصية بسيطة أن تلتقطها، مثل ملصق معين على كوب أو علامة تجارية على جرة. وللتعامل مع هذا، يقوم "MessyMem" بحفظ صور فوتوغرافية مختارة، تسمى "الإطارات الرئيسية" (keyframes)، ويربطها مباشرة بالأشياء الموجودة في خريطته. هذه الصور ليست مجرد تدفق عشوائي للفيديو؛ بل هي لحظات مختارة بعناية، مثل المشهد الذي يسبق إمساك الروبوت بجسم ما مباشرة، أو المشهد داخل الدرج بعد فتحه. وعندما يواجه الروبوت مهمة جديدة، فإنه يبحث في ذاكرته عن الصور الأكثر صلة. قد يبحث عن صورة تظهر الرف الدقيق الذي وُضع عليه وعاء القهوة آخر مرة، أو صورة لنمط معين على جورب. وهذا يسمح للروبوت بالتمييز بين عنصرين متشابهين في المظهر بناءً على الأدلة البصرية التي جمعها في الماضي.

اختبر الباحثون هذا النظام في كل من المحاكاة الحاسوبية وفي بيئة مادية يتحرك فيها روبوت حقيقي. وفي محاكاة تتضمن تسلسلاً مستمراً من خمسة وعشرين مهمة منزلية مختلفة امتدت لأكثر من ثلاث ساعات، نجح الروبوت الذي يستخدم "MessyMem" في إكمال ثمانين بالمائة من المهام. وكان هذا تحسناً كبيراً مقارنة بالطرق الأخرى؛ فالروبوتات التي اعتمدت فقط على الخريطة المكانية دون ملاحظات التفاعل، أو تلك التي امتلكت الملاحظات ولكن دون الصور، كان أداؤها أسوأ بكثير. فعلى سبيل المثال، عندما طُلب منها العثور على عنصر محدد مخبأ في خزانة مزدحمة، تمكن النظام الكامل من استعادة الترتيب البصري الدقيق للعناصر، بينما فشلت الأنظمة الأخرى لأنها لم تستطع التمييز بين الهدف والأشياء الشبيهة به. وفي اختبار في العالم الحقيقي تضمن مكتباً يحتوي على عدة أدراج، نجح الروبوت في العثور على مقص، وتحديد كوب خاص بشخص يدعى "جون"، وتحديد موقع وحدة تحكم في الألعاب، وكل ذلك من خلال إعادة استخدام المعرفة التي جمعها في خطوات سابقة.

أظهرت التجارب أن النظام يعمل بشكل أفضل عندما تكون المكونات الثلاثة حاضرة. فالخريطة المكانية توفر الموقع، وملاحظات التفاعل توفر حالة العالم (مثل ما هو مغلق أو فارغ)، والصور توفر الإثبات البصري اللازم للتمييزات الصعبة. وبدون ملاحظات التفاعل، أضاع الروبوت وقتاً في محاولة فتح الأدراج المغلقة. وبدون الصور، لم يستطع التمييز بين زجاجتين متشابهتين. كما أثبت النظام كفاءته؛ فحتى بعد تخزين آلاف الصور والعمل لساعات، كان بإمكانه العثود بسرعة إلى القطعة المحددة من الأدلة المطلوبة لمهمة ما، بالنظر إلى ما وراء ساعة من النشاط الماضي لاتخاذ قرار.

يشير هذا العمل إلى أنه لكي تصبح الروبوتات مساعدة حقيقية في حياتنا اليومية، يجب أن تكون قادرة على التعلم من أفعالها وتذكر تلك الدروس. يوضح نظام "MessyMem" أنه من خلال الجمع بين الخريطة، وسجل التفاعلات، ومكتبة من الصور الرئيسية، يمكن للروبوت أن يتوقف عن معاملة كل مهمة كأنها اكتشاف جديد ويبدأ في بناء تاريخ مستمر لتجاربه. وبينما يستخدم النظام الحالي قائمة محددة مسبقاً من الأشياء التي يمكنه التعرف عليها، يشير الباحثون إلى أنه يمكن توسيع النسخ المستقبلية لتتعرف على مجموعة متنوعة من العناصر وحتى تتعلم من الأفعال البشرية. وفي الوقت الحالي، تظهر النتائج مساراً واضحاً للمستقبل: روبوت يتذكر ما لمسه وما رآه هو روبوت يمكنه أخيراً العمل جنباً إلى جنب معنا دون أن يبدأ من جديد في كل مرة نطلب فيها المساعدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →