Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision
تقدم هذه الورقة "رموز مساحة العمل" (workspace tokens)، وهي تمثيل ذاكرة كامنة خفيف الوزن يتم تدريبه عبر إشراف مدفوع بالأهمية النسبية (saliency-driven supervision) من نماذج الرؤية واللغة الكبيرة (VLMs)، مما يمكّن السياسات الروبوتية من حل مهام الذاكرة طويلة المدى بكفاءة عند التشغيل دون الحاجة إلى استدلال من نماذج الرؤية واللغة أثناء العمل، مع تحسين الأداء العام أيضاً.
المؤلفون الأصليون:Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz
تواجه الروبوتات التي يمكنها التعامل مع الأشياء في العالم الحقيقي تحديًا جوهريًا: فهي تحتاج إلى تذكر ما حدث قبل لحظة، أو حتى قبل دقائق، لاتخاذ القرار الصحيح الآن. إذا كان الروبوت يقوم برص المكعبات، فيجب عليه تذكر عدد المكعبات التي وضعها بالفعل. وإذا كان يفتح درجًا، فيجب عليه تذكر أي درج يحتوي على الشيء الذي يبحث عنه. في الماضي، حاول المهندسون حل هذه المشكلة عن طريق تغذية كمبيوتر الروبوت بكل إطار فيديو رآه على الإطلاق، لكن هذا النهج غالبًا ما كان يربك الآلة، مما يؤدي بها إلى التشبث بتفاصيل غير ذات صلة والفشل. ومؤخرًا، حاول الباحثون استخدام نماذج ذكاء اصطناعي ضخمة وقوية لتعمل كذاكرة، تقوم بمسح تاريخ الروبوت باستمرار لتلخيص ما هو مهم. ورغم أن هذا الأسلوب فعال، إلا أنه بطيء ومكلف، تمامًا مثل طلب أمين مكتبة بشري لقراءة كل كتاب في المكتبة في كل مرة تسأل فيها عن صفحة واحدة. وقد كان السؤال الجوهري لعلماء الروبوتات هو كيفية منح الروبوت ذاكرة موثوقة دون إبطائه أو تطلب تشغيلها حاسوبًا خارقًا.
اقترح فريق من الباحثين من معهد ماساتشوستس للتكنولوجيا (MIT) وجامعة كارنيجي ميلون حلاً أطلقوا عليه اسم "نموذج مساحة العمل" (workspace model). فبدلاً من الاعتماد على كمبيوتر قوي وبطيء لتلخيص التاريخ أثناء عمل الروبوت، يقومون بتعليم نظام ذاكرة صغير وخفيف الوزن خلال مرحلة التدريب. إنهم يستخدمون نموذج ذكاء اصطناعي قوي أثناء تعلم الروبوت فقط، وليس أثناء أدائه للمهمة. يعمل هذا النموذج القوي كمعلم، يشير بدقة إلى اللحظات المهمة في الفيديو — مثل اللحظة التي يلتقط فيها قابض الروبوت مكعبًا أو عندما يُغلق الدرج. ثم يقوم الباحثون بتدريب نظام مدمج وفعال لضغط هذه اللحظات المهمة في ملخص صغير ومخفي. وبمجرد اكتمال هذا التدريب، يمكن للروبوت استخدام هذا الملخص الصغير لتذكر الماضي فورًا، دون الحاجة إلى استدعاء المعلم القوي والبطيء مرة أخرى.
اختبر الباحثون هذا النهج في عدة مهام صعبة تتطلب ذاكرة طويلة المدى. في بيئة محاكاة، كان على الروبوت إسقاط خمسة مكعبات بالضبط في وعاء، لكن المكعبات كانت تختفي عن الأنظر بمجرد دخولها، مما أجبر الروبوت على عدّها في ذاكرته. وفي مهمة أخرى، كان على الروبوت فتح درج محدد كان روبوت آخر قد أغلقه سابقًا، مما تطلب منه تذكر أي درج يحتوي على الشيء المطلوب. كما اختبروا روبوتًا حقيقيًا في إعداد مادي حيث كان عليه وضع مكعبات في صناديق كانت مرتفعة جدًا بحيث لا يمكن رؤية ما بداخلها، مما تطلب منه أيضًا الاحتفاظ بعدّ مستمر. وعبر هذه الاختبارات، نجح نموذج مساحة العمل الجديد بنسبة 91.5 بالمائة من المحاولات. وكان هذا أفضل بكثير من الطرق الأخرى؛ فالروبوت القياسي الذي ينظر فقط إلى الإطارات الأخيرة فشل معظم الوقت لأنه نسي الماضي. أما الروبوت الذي حاول استخدام نموذج ذكاء اصطناوي قوي لاختيار اللحظات الرئيسية من الماضي أثناء المهمة، فقد كان أبطأ بكثير ونجح بنسبة 66.8 بالمائة فقط. لم يكن نموذج مساحة العمل هو الأكثر دقة فحسب، بل كان أيضًا الأسرع، مما سمح للروبوت بالاستجابة بسرعة دون التأخير الناتج عن انتظار كمبيوتر ضخم لمعالجة التاريخ.
ينبع نجاح هذه الطريقة من تحول ذكي في كيفية بناء الذاكرة. في المحاولات السابقة، كان الباحثون يطلبون من نموذج ذكاء اصطناعي كبير اختيار الإطارات المهمة من بث الفيديو أثناء حركة الروبوت. وقد تسبب هذا في حدوث تأخير، أو "لاغ" (lag)، جعل حركات الروبوت متقطعة وأقل دقة. أما النهج الجديد فينقل هذا العبء الثقيل إلى مرحلة التدريب. خلال التدريب، يراجع نموذج الذكاء الاصطناعي القوي مقطع الفيديو بأكمله للمهمة ويحدد الأحداث الحاسمة. ثم يعلّم نموذج مساحة العمل الصغير كيفية إعادة إنشاء قائمة بهذه التفاصيل البصرية الهامة. يتعلم النموذج الصغير ضغط هذه المعلومات في "توكن" (token) واحد كثيف — وهو قطعة صغيرة من البيانات تحمل جوهر الماضي. وعندما يتم نشر الروبوت في العالم الحقيقي، فإنه ببسال النظر إلى هذا "التوكن". فهو لا يحتاج إلى إعادة تحليل الماضي أو انتظار نموذج كبير ليفكر؛ إذ تكون الذاكرة قد تم تقطيرها وجاهزة بالفعل. وهذا يسم يسمح للروبوت بالحفاظ على تدفق مستمر وواضح من الحركة دون الانقطاعات التي عانت منها الأساليب السابقة.
وجد الباحثون أن هذه الطريقة لم تجعل الروبوت أسرع فحسب، بل جعلته أكثر ذكاءً أيضًا. فعندما حللوا سبب فشل الأساليب الأخرى، اكتشفوا أن مجرد تغذية الروبوت بمزيد من الإطارات، أو حتى إطارات مختارة بعناية، غالبًا ما كان يربكه. حيث يبدأ الروبوت في محاكاة الحركات الخاطئة أو يفشل في الإمساك بالأشياء بدقة لأن المعلومات الإضافية تسبب ضوضاء. في المقابل، قدم نموذج مساحة العمل تمثيلًا سلسًا ومستمرًا للماضي. ولأن النموذج الصغير تم تدريبه على إعادة بناء التفاصيل الأكثر بروزًا من التاريخ بأكمله، فقد تعلم تجاهل الضوضاء المشتتة والتركيز فقط على ما يهم للمهمة. وأدى ذلك إلى روبوت يمكنه العد بشكل صحيح، والعثيد على الدرج الصحيح، والإمساك بالأشياء بمستوى من الدقة لم تستطع الأساليب الأخرى مضاهاته.
تشير الدراسة إلى أن مستقبل ذاكرة الروبوتات قد لا يكمن في جعل الروبوتات نفسها أكبر أو أقوى، بل في كيفية تعليمها التذكر. فمن خلال استخدام أدوات قوية لتدريب أنظمة أبسط وأكثر كفاءة، يمكن للباحثين إنشاء روبوتات سريعة وقادرة على التفكير المعقد طويل المدى. يعمل نموذج مساحة العمل كجسر، يأخذ التفكير الثقيل المطلوب للذاكرة ويضغطه في شكل يمكن للروبوت استخدامه في الوقت الفعلي. يوفر هذا النهج مسارًا للمستقبل للروبوتات التي تحتاج إلى العمل في بيئات ديناميكية وغير متوقعة حيث يكون تذكر الماضي لا يقل أهمية عن رؤية الحاضر. وتثبت هذه الدراسة أنه مع استراتيجية التدريب الصحيحة، يمكن للروبوت أن يحمل تاريخًا غنيًا من الخبرة في حزمة خفيفة الوزن، جاهزة للعمل بوضوح وسرعة.
ملخص تقني: نماذج مساحة العمل (Workspace Models): ذاكرة روبوتية خفيفة الوزن عبر الإشراف القائم على البروز
بيان المشكلة
غالبًا ما تتطلب مهام المناولة الروبوتية المعقدة ذاكرة طويلة المدى للأحداث والإجراءات الماضية من أجل النجاح. ومع ذلك، فإن تكييف السياسات (Policies) بناءً على سجلات الملاحظات الكاملة يفرض تحديات كبيرة:
خطأ التعميم: يمكن أن يؤدي زيادة تاريخ الملاحظات دون تصميم دقيق إلى "تعلم الاختصارات" أو "الارتباك السببي"، حيث تلتصق النماذج بالارتباطات الزائفة في الإطارات التاريخية غير ذات الصلة بدلاً من تعلم الحالة الكامنة الحقيقية المطلوبة لاختيار الإجراء.
زمن الاستجابة والتكلفة: تعتمد أحدث الأساليب الحالية غالبًا على نماذج الرؤية واللغة (VLMs) لتنقية التاريخ ذي الصلة بالمهمة (على سبيل المثال، اختيار الإطارات الرئيسية أو توليد ملخصات نصية) أثناء التشغيل (in-the-loop). وهذا يؤدي إلى زمن استجابة حوسبي عالٍ، مما يبطئ السياسات التفاعلية، ويكبد تكاليف مالية باهظة (رسوم واجهة برمجة التطبيقات أو أجهزة باهظة الثمن).
ندرة البيانات: بيانات تعلم الروبوت محدودة وعالية الأبعاد. وغالبًا ما يتطلب تدريب السياسات على تواريخ طويلة وغير منقحة كمية بيانات أكبر مما هو متاح لمنع الإفراط في التخصيص (Overfitting).
تواجه الحلول الحالية مقايضة: توفر نماذج VLMs القوية ملخصات أفضل ولكنها تسبب تأخيرًا غير مقبول، بينما تفتقر النماذج خفيفة الوزن إلى القدرة على تحديد المعلومات البارزة بدقة.
المنهجية: نماذج مساحة العمل (Workspace Models)
يقترح المؤلفون نماذج مساحة العمل، وهو إطار عمل يعمل على استهلاك (Amortizing) التكلفة الحوسبية للاستدلال باستخدام VLM من وقت التشغيل إلى وقت التدريب. الفكرة الجوهرية هي تدريب مشفر ذاكرة كامنة خفيف الوزن ("مشفر مساحة العمل") لضغط المعلومات التاريخية في تمثيل مدمج ("رمز مساحة العمل") باستخدام إشراف مستمد من نماذج VLM قوية.
البنية وخط أنابيب التدريب
يتكون النهج من مرحلتين رئيسيتين:
1. الإشراف القائم على البروز (وقت التدريب):
بناء مجموعة البروز: أثناء التدريب، يتم استخدام نموذج VLM قوي (تحديدًا Qwen3-VL لكشف الأحداث و MolmoPoint للإشارة المكانية) لتحديد المعلومات "البارزة" من المسار الكامل.
كشف الأحداث: يحدد الـ VLM متى تحدث الأحداث البارزة (مثل "إضافة الملح إلى الحساء").
اختيار الرقع (Patches): يحدد الـ VLM ما الذي يجب تذكره من خلال الإشارة إلى كائنات أو مناطق (رقع) محددة في الصورة.
النتيجة هي مجموعة من رقع الصور البارزة (St) من الملاحظات الماضية والحالية، بحد أقصى لحجم المجموعة m.
مشفر مساحة العمل (fϕ): يقوم مشفر يعتمد على الـ Transformer بمعالجة تسلسل الملاحظات الخام (المجزأة عبر DinoV3) ويخرج تسلسلاً من رموز مساحة العمل الكامنة (w1:t).
مفكك إعادة بناء المجموعة (gψ): يتم تدريب مفكك (Decoder) جنبًا إلى جنب مع المشفر. يأخذ رمز مساحة العمل الحالي wt ويحاول إعادة بناء المجموعة البارزة St.
يخرج المفكك m من "الفتحات" (Slots)، حيث تتنبأ كل منها بإعادة بناء رقعة واحتمالية الإشغال.
دالة الخسارة: تقوم خوارزمية المطابقة الهنغارية (Hungarian matching) بمحاذاة فتحات المفكك المتوقعة مع الرقع البارزة الحقيقية. وتتكون الخسارة من حد إعادة بناء الميزات (MSE على الرقع) وحد تصنيف الوجود (Cross-entropy على إشغال الفتحة).
التجميد: بمجرد التدريب، يتم تجميد المشفر fϕ. يتعلم ضغط جميع المعلومات البارزة التاريخية الضرورية في رمز مساحة العمل دون الحاجة إلى الـ VLM أثناء الاستدلال.
2. تعلم السياسة (وقت التشغيل):
يتم تدريب سياسة لاحقة (مطبقة كسياسة انتشار - Diffusion Policy) للتنبؤ بكتل الإجراءات (Action Chunks) مشروطة بتاريخ قصير من رموز مساحة العمل والحالات الحسية (Proprioceptive states) الحالية.
لا يتم استخدام الـ VLM أثناء التشغيل. تتلقى السياسة التاريخ الكامن المدمج، مما يسمًا باستدلال منخفض زمن الاستجابة.
المساهمات الرئيسية
نماذج مساحة العمل: بنية مبتكرة لذاكرة الروبوت تفصل التكلفة الحوسبية الثقيلة لتنقية التاريخ (التي تتم في وقت التدريب عبر VLMs) عن التنفيذ خفيف الوزن لاسترجاع الذاكرة (الذي يتم في وقت التشغيل عبر مشفر مجمد).
الإشراف القائم على البروز: يقدم البحث نموذجًا تدريبيًا حيث توفر نماذج التأسيس القوية "تسميات البروز" (ما يجب تذكره) لتدريب مشفر مدمج، مما يؤدي فعليًا إلى تقطير استدلال الـ VLM في فضاء كامن.
الأداء المتفوق: على عكس الحدس بأن أنظمة الـ VLM-in-the-loop هي الأفضل، يثبت المؤلفون أن نماذج مساحة العمل تحقق معدلات نجاح أعلى من النماذج المرجعية التي تستخدم VLMs لاختيار الإطارات الرئيسية أثناء الاستدلال.
زمن استجابة منخفض: يقلل هذا الأسلوب من زمن استجابة الاستدلال بشكل كبير مقارنة بالنهج القائمة على VLM، مما يجعله مناسبًا للتحكم الروبوتي في الوقت الفعلي.
النتائج التجريبية
قيم المؤلفون نماذج مساحة العمل (Wksp) مقابل ثلاثة نماذج مرجعية عبر أربع مهام (ثلاث منها في المحاكاة، وواحدة على أجهزة حقيقية) تتطلب العد، والاستدعاء المكاني، والتكيف في السياق:
النماذج المرجعية: سياسة الانتشار العادية (Vanilla Diffusion Policy - بدون تاريخ)، سياسة الانتشار المشروطة بالتاريخ (Frame Stacking)، واختيار الإطارات الرئيسية (Keyframe selection - VLM-in-the-loop).
المهام:
CUBEDROP / HALFANDHALF: عد الأشياء الموضوعة في حاويات محجوبة.
DRAWERRECALL: الاستدعاء المكاني لشيء مخفي في درج معين.
BALANCEBAR: التكيف في السياق لإيجاد مركز الكتلة لجسم ما.
النتائج الرئيسية:
معدل النجاح: حققت نماذج مساحة العمل أعلى متوسط معدل نجاح (91.5%) عبر جميع المهام، متفوقة بشكل كبير على النموذج المرجعي التالي (Keyframe بنسبة 66.8%).
زمن الاستجونة: تضيف نماذج مساحة العمل حوالي 1.2x من زمن استجابة حزمة إدراك CNN الأساسية (VanillaDP) في التكوين القياسي (94.9 مللي ثانية مقابل 41.3 مللي ثانية). مع استخدام الدفعات (Batching) وتخزين مفتاح-قيمة (KV-caching)، ينخفض هذا العبء إلى ~1.28x (52.9 مللي ثانية). في المقابل، تتحمل طرق الإطارات الرئيسية تكلفة تقارب 5 أضعاف النموذج المرجعي (302 مللي ثانية مقابل 41.3 مللي ثانية، أو ~7.3 ضعف بدون دفعات)، وهو ما أشار المؤلفون إلى أنه سيكون أسوأ بكثير مع نماذج VLMs القائمة على واجهات برمجة التطبيقات (APIs).
أنماط الفشل:
عانت نماذج HistoryDP و Keyframe غالبًا من "الالتباس في التحكم" (Control Aliasing)، حيث أدى الاختيار المنفصل للإطارات إلى حدوث تحولات في التوزيع، مما أدى إلى أخطاء مناولة دقيقة (مثل تفويت الإمساك) حتى لو كانت الذاكرة عالية المستوى صحيحة.
وفرت نماذج مساحة العملتمثيلًا سلسًا للتاريخ. يعزو المؤلفون تفوق الأداء إلى قدرة المشفر على الانتباه عالميًا عبر الزمن وإنتاج انتقالات كامنة سلسة، مما يتجنب هشاشة الاختيار المنفصل للإطارات.
الأهمية والادعاءات
يضع البحث "نماذج مساحة العمل" كإثبات مفهوم لـ استهلاك الاستدلال (Amortizing Reasoning) في الروبوتات. يدعي المؤلفون أنه من خلال استغلال عدم التماثل بين الحوسبة في وقت التدريب (التي يمكن توسيعها) والحوسبة في وقت الاختبار (التي يجب أن تكون محدودة)، فمن الممكن تدريب مشفرات خفيفة الوزن تتفوق على النماذج الثقيلة التي تعمل داخل الحلقة (In-the-loop).
التعميم: يشير العمل إلى أن ضغط التاريخ في تمثيل كامن سلس يعد أمرًا متفوقًا على اختيار الإطارات المنفصل، لأنه يخفف من آثار "الالتباس" التي تعاني منها الطرق القائمة على الإطارات الرئيسية.
القابلية للتوسع: يقدم النهج مسارًا لذاكرة طويلة المدى في الروبوتات دون زمن الاستجابة المرهق والتكلفة العالية للاستعلام المستمر من نماذج VLMs.
التواضع: يقر المؤلفون بأن تنفيذهم الحالي (باستخدام رقع الصور ومفكك من نوع DETR) هو تجربة أولية. كما يشيرون إلى قيود، مثل التوسع التربيعي للمشفر ذاتي الانحدار (Autoregressive encoder) للسلاسل الطويلة جدًا، والاعتماد على نماذج VLMs لتسمية البروز، والتي قد لا تكون دقيقة تمامًا من حيث التأسيس الأرضي (Grounding). ويقترحون أن العمل المستقبلي يمكن أن يستكشف وسائط أخرى (نصوص، فيديو) وتوليفات هرمية مع سياسات عامة.