← أحدث الأبحاث
🤖 machine learning

MEM: Multi-Scale Embodied Memory for Vision Language Action Models

تقدم الورقة البحثية ذاكرة التجسيد متعددة المقاييس (MEM)، وهي بنية هجينة الأنماط تدمج الذاكرة قصيرة المدى القائمة على الفيديو والذاكرة طويلة المدى القائمة على النصوص لتمكين نماذج الرؤية واللغة والعمل من تنفيذ مهام روبوتية معقدة وطويلة الأمد تمتد حتى خمس عشرة دقيقة.

المؤلفون الأصليون: Marcel Torne, Karl Pertsch, Homer Walke, Kyle Vedder, Suraj Nair, Brian Ichter, Allen Z. Ren, Haohuan Wang, Jiaming Tang, Kyle Stachowicz, Karan Dhabalia, Michael Equi, Quan Vuong, Jost Tobias Springe
نُشر 2026-03-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Marcel Torne, Karl Pertsch, Homer Walke, Kyle Vedder, Suraj Nair, Brian Ichter, Allen Z. Ren, Haohuan Wang, Jiaming Tang, Kyle Stachowicz, Karan Dhabalia, Michael Equi, Quan Vuong, Jost Tobias Springenberg, Sergey Levine, Chelsea Finn, Danny Driess

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية طهي وجبة معقدة أو تنظيف مطبخ فوضوي. إذا طلبت من روبوت عادي القيام بذلك، فالأمر يشبه طلب ذلك من شخص يعاني من فقدان الذاكرة. يمكنه رؤية المكونات أمامه مباشرة، ولكن بمجرد أن يدير ظهره ليحضر التوابل، ينسى ما كان يفعله. إذا أسقط ملعقة، لا يتذكر أنه أسقطها للتو، لذا يستمر في محاولة التقاطها بنفس الطريقة مرارًا وتكرارًا، ويفشل في كل مرة.

تقدم هذه الورقة نظامًا جديدًا يسمى MEM (الذاكرة المتجسدة متعددة المقاييس)، والذي يمنح الروبوتات "دماغًا" قادرًا على التذكر بطريقتين مختلفتين تمامًا، تمامًا كما نفعل نحن البشر.

إليك التبسيط السهل لكيفية عمله، باستخدام بعض التشبيهات من حياتنا اليومية:

1. المشكلة: "مدى الانتباه القصير" للروبوت

معظم الروبوتات المتقدمة اليوم تشبه السمكة الذهبية. يمكنها رؤية ما يحدث الآن، لكنها لا تستطيع تذكر ما حدث قبل 10 ثوانٍ، ناهيك عن 10 دقائق.

  • المشكلة: إذا كان الروبوت يمسح الطاولة، فقد ينسى أنه مسح الجانب الأيسى بالفعل. إذا كان يطبخ، فقد ينسى أنه أضاف الملح بالفعل.
  • الطريقة القديمة: لإصلاح ذلك، حاول العلماء تغذية الروبوت بكل إطار فيديو من الساعة الماضية. لكن هذا يشبه محاولة قراءة كتاب مكون من 500 صفحة في ثانية واحدة. حاسوب الروبوت يصاب بالارتباك، ويتباطأ بشكل كبير.

2. الحل: نوعان من الذاكرة

أدرك المؤلفون أن البشر لا يتذكرون كل شيء بنفس الطريقة. لدينا ذاكرة قصيرة المدى (ما رأيته للتو) وذاكرة طويلة المدى (الخطة التي أتبعها). يمنح نظام MEM الروبوت هاتين الأداتين المتميزتين.

أ. الذاكرة قصيرة المدى: "العين الحادة جدًا" (ذاكرة الفيديو)

  • ما هي: كاميرا فيديو عالية السرعة تتذكر الثواني القليلة الماضية بدقة عالية.
  • التشبيه: تخيل أنك تحاول التقاط قطعة صابون منزلقة. تنظر إليها، تمد يدك، فتنزلق.
    • بدون MEM: ينسى الروبوت أنها انزلقت ويحاول نفس القبضة تمامًا مرة أخرى.
    • مع MEM: تتذكر "عين" الروبوت: "مهلًا، لقد جربت هذه القبضة للتو وفشلت". فيقوم بتعديل زاوية يده فورًا، تمامًا كما ستفعل أنت إذا تذكرت أن الصابونة كانت منزلقة.
  • لماذا هي مميزة: إنها تعالج مشكلة الانسداد/الحجب (عندما يحجب ذراعك رؤيتك لشيء ما). يتذكر الروبوت ما كان موجودًا هناك قبل لحظة وجيزة، لذا لا يرتبك عندما لا يستطيع رؤية الشيء للحظة.

ب. الذاكرة طويلة المدى: "المذكرات الذكية" (ذاكرة النص)

  • ما هي: ملخص نصي مضغوط لما حدث خلال الـ 15 دقيقة الماضية.
  • التشبيه: تخيل أنك تنظف مطبخًا كبيرًا. لست بحاجة لتذكر اللون الدقيق لكل طبق غسلته. تحتاج فقط لتذكر القصة: "غسلت الأطباق، وضعتها في الرف، وأغلقت الخزانة."
  • السحر: بدلًا من تغذية الروبوت بـ 10,000 إطار فيديو للتنظيف، يكتب الروبوت ملاحظة صغيرة في "مذكراته": "تم: الأطباق. التالي: الثلاجة." هذا فعال للغاية، فهو يسمح للروبوت بتتبع مهمة مدتها 15 دقيقة (مثل طهي عشاء كامل) دون أن يصاب بـ "صداع حاسوبي".

3. كيف يعملان معًا: "المدير والعامل"

تصف الورقة دماغ الروبوت كجزأين يعملان جنبًا إلى جنب:

  1. المدير رفيع المستوى (ذاكرة النص): ينظر هذا الجزء إلى الصورة الكبيرة. يقرأ "المذكرات" ليعرف: "حسنًا، نحن في الخطوة 4 من الوصفة. لدينا البطاطس، لكننا لم نحصل على الزبدة بعد." وهو يخبر الروبوت ما هي المهمة الفرعية التالية.
  2. العامل منخفض المستوى (ذاكرة الفيديو): ينظر هذا الجزء إلى الفعل الفوري. يرى برطمان الزبدة، ويتذكر آخر مرة حاول فيها فتحه وانزلق، فيعدل قبضته لفتحه بنجاح.

4. النتائج: ماذا يمكنه أن يفعل الآن؟

بفضل نظام الذاكرة المزدوج هذا، يمكن للروبوت الآن القيام بأشياء كانت مستحيلة سابقًا:

  • تنظيف مطبخ كامل: يمكنه تذكر أي أدراج أفرغها، وأي أسطح مسحها، وأنه يحتاج لإغلاق باب الثلاجة في النهاية.
  • طهي وجبة: يمكنه اتباع وصفة لمدة 15 دقيقة، متذكرًا أي المكونات أضافها ومتى يقلب الشطيرة.
  • التكيف على الطاير: إذا حاول فتح ثلاجة وفشل، فإنه يتذكر الفشل، ويدرك أن الباب يفتح من الجهة الأخرى، ويحاول مرة أخرى فورًا. لا يعلق في حلقة مفرغة من الفشل.

الخلاصة الكبرى

فكر في MEM كمنح الروبوت ذاكرة فوتوغرافية للماضي القريب جداً (للتعامل مع الحركات الفيزيائية الصعبة) ودفتر ملخصات ذكي للماضي البعيد (لتتبع الأهداف طويلة المدى).

قبل هذا، كانت الروبوتات تشبه الأشخاص الذين يعانون من قصر فترة الانتباه ولا يستطيعون إكمال جملة واحدة. أما الآن، فهي تشبه مساعدًا كفؤًا يمكنه تذكر الخطة، وملاحظة وقوع خطأ ما، وإصلاحه — كل ذلك مع الحفاظ على استمرارية العمل لفترة طويلة. هذه خطوة هائلة نحو روبوتات يمكنها حقًا العيش والعمل معنا في منازلنا، والقيام بالمهام المنزلية المعقدة دون الحاجة إلى إمساك يد بشرية في كل خطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →