← أحدث الأبحاث
🤖 AI

Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

تقدم هذه الورقة "رموز مساحة العمل" (workspace tokens)، وهي تمثيل ذاكرة كامنة خفيف الوزن يتم تدريبه عبر إشراف مدفوع بالأهمية النسبية (saliency-driven supervision) من نماذج الرؤية واللغة الكبيرة (VLMs)، مما يمكّن السياسات الروبوتية من حل مهام الذاكرة طويلة المدى بكفاءة عند التشغيل دون الحاجة إلى استدلال من نماذج الرؤية واللغة أثناء العمل، مع تحسين الأداء العام أيضاً.

المؤلفون الأصليون: Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz

نُشر 2026-09-18
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تواجه الروبوتات التي يمكنها التعامل مع الأشياء في العالم الحقيقي تحديًا جوهريًا: فهي تحتاج إلى تذكر ما حدث قبل لحظة، أو حتى قبل دقائق، لاتخاذ القرار الصحيح الآن. إذا كان الروبوت يقوم برص المكعبات، فيجب عليه تذكر عدد المكعبات التي وضعها بالفعل. وإذا كان يفتح درجًا، فيجب عليه تذكر أي درج يحتوي على الشيء الذي يبحث عنه. في الماضي، حاول المهندسون حل هذه المشكلة عن طريق تغذية كمبيوتر الروبوت بكل إطار فيديو رآه على الإطلاق، لكن هذا النهج غالبًا ما كان يربك الآلة، مما يؤدي بها إلى التشبث بتفاصيل غير ذات صلة والفشل. ومؤخرًا، حاول الباحثون استخدام نماذج ذكاء اصطناعي ضخمة وقوية لتعمل كذاكرة، تقوم بمسح تاريخ الروبوت باستمرار لتلخيص ما هو مهم. ورغم أن هذا الأسلوب فعال، إلا أنه بطيء ومكلف، تمامًا مثل طلب أمين مكتبة بشري لقراءة كل كتاب في المكتبة في كل مرة تسأل فيها عن صفحة واحدة. وقد كان السؤال الجوهري لعلماء الروبوتات هو كيفية منح الروبوت ذاكرة موثوقة دون إبطائه أو تطلب تشغيلها حاسوبًا خارقًا.

اقترح فريق من الباحثين من معهد ماساتشوستس للتكنولوجيا (MIT) وجامعة كارنيجي ميلون حلاً أطلقوا عليه اسم "نموذج مساحة العمل" (workspace model). فبدلاً من الاعتماد على كمبيوتر قوي وبطيء لتلخيص التاريخ أثناء عمل الروبوت، يقومون بتعليم نظام ذاكرة صغير وخفيف الوزن خلال مرحلة التدريب. إنهم يستخدمون نموذج ذكاء اصطناعي قوي أثناء تعلم الروبوت فقط، وليس أثناء أدائه للمهمة. يعمل هذا النموذج القوي كمعلم، يشير بدقة إلى اللحظات المهمة في الفيديو — مثل اللحظة التي يلتقط فيها قابض الروبوت مكعبًا أو عندما يُغلق الدرج. ثم يقوم الباحثون بتدريب نظام مدمج وفعال لضغط هذه اللحظات المهمة في ملخص صغير ومخفي. وبمجرد اكتمال هذا التدريب، يمكن للروبوت استخدام هذا الملخص الصغير لتذكر الماضي فورًا، دون الحاجة إلى استدعاء المعلم القوي والبطيء مرة أخرى.

اختبر الباحثون هذا النهج في عدة مهام صعبة تتطلب ذاكرة طويلة المدى. في بيئة محاكاة، كان على الروبوت إسقاط خمسة مكعبات بالضبط في وعاء، لكن المكعبات كانت تختفي عن الأنظر بمجرد دخولها، مما أجبر الروبوت على عدّها في ذاكرته. وفي مهمة أخرى، كان على الروبوت فتح درج محدد كان روبوت آخر قد أغلقه سابقًا، مما تطلب منه تذكر أي درج يحتوي على الشيء المطلوب. كما اختبروا روبوتًا حقيقيًا في إعداد مادي حيث كان عليه وضع مكعبات في صناديق كانت مرتفعة جدًا بحيث لا يمكن رؤية ما بداخلها، مما تطلب منه أيضًا الاحتفاظ بعدّ مستمر. وعبر هذه الاختبارات، نجح نموذج مساحة العمل الجديد بنسبة 91.5 بالمائة من المحاولات. وكان هذا أفضل بكثير من الطرق الأخرى؛ فالروبوت القياسي الذي ينظر فقط إلى الإطارات الأخيرة فشل معظم الوقت لأنه نسي الماضي. أما الروبوت الذي حاول استخدام نموذج ذكاء اصطناوي قوي لاختيار اللحظات الرئيسية من الماضي أثناء المهمة، فقد كان أبطأ بكثير ونجح بنسبة 66.8 بالمائة فقط. لم يكن نموذج مساحة العمل هو الأكثر دقة فحسب، بل كان أيضًا الأسرع، مما سمح للروبوت بالاستجابة بسرعة دون التأخير الناتج عن انتظار كمبيوتر ضخم لمعالجة التاريخ.

ينبع نجاح هذه الطريقة من تحول ذكي في كيفية بناء الذاكرة. في المحاولات السابقة، كان الباحثون يطلبون من نموذج ذكاء اصطناعي كبير اختيار الإطارات المهمة من بث الفيديو أثناء حركة الروبوت. وقد تسبب هذا في حدوث تأخير، أو "لاغ" (lag)، جعل حركات الروبوت متقطعة وأقل دقة. أما النهج الجديد فينقل هذا العبء الثقيل إلى مرحلة التدريب. خلال التدريب، يراجع نموذج الذكاء الاصطناعي القوي مقطع الفيديو بأكمله للمهمة ويحدد الأحداث الحاسمة. ثم يعلّم نموذج مساحة العمل الصغير كيفية إعادة إنشاء قائمة بهذه التفاصيل البصرية الهامة. يتعلم النموذج الصغير ضغط هذه المعلومات في "توكن" (token) واحد كثيف — وهو قطعة صغيرة من البيانات تحمل جوهر الماضي. وعندما يتم نشر الروبوت في العالم الحقيقي، فإنه ببسال النظر إلى هذا "التوكن". فهو لا يحتاج إلى إعادة تحليل الماضي أو انتظار نموذج كبير ليفكر؛ إذ تكون الذاكرة قد تم تقطيرها وجاهزة بالفعل. وهذا يسم يسمح للروبوت بالحفاظ على تدفق مستمر وواضح من الحركة دون الانقطاعات التي عانت منها الأساليب السابقة.

وجد الباحثون أن هذه الطريقة لم تجعل الروبوت أسرع فحسب، بل جعلته أكثر ذكاءً أيضًا. فعندما حللوا سبب فشل الأساليب الأخرى، اكتشفوا أن مجرد تغذية الروبوت بمزيد من الإطارات، أو حتى إطارات مختارة بعناية، غالبًا ما كان يربكه. حيث يبدأ الروبوت في محاكاة الحركات الخاطئة أو يفشل في الإمساك بالأشياء بدقة لأن المعلومات الإضافية تسبب ضوضاء. في المقابل، قدم نموذج مساحة العمل تمثيلًا سلسًا ومستمرًا للماضي. ولأن النموذج الصغير تم تدريبه على إعادة بناء التفاصيل الأكثر بروزًا من التاريخ بأكمله، فقد تعلم تجاهل الضوضاء المشتتة والتركيز فقط على ما يهم للمهمة. وأدى ذلك إلى روبوت يمكنه العد بشكل صحيح، والعثيد على الدرج الصحيح، والإمساك بالأشياء بمستوى من الدقة لم تستطع الأساليب الأخرى مضاهاته.

تشير الدراسة إلى أن مستقبل ذاكرة الروبوتات قد لا يكمن في جعل الروبوتات نفسها أكبر أو أقوى، بل في كيفية تعليمها التذكر. فمن خلال استخدام أدوات قوية لتدريب أنظمة أبسط وأكثر كفاءة، يمكن للباحثين إنشاء روبوتات سريعة وقادرة على التفكير المعقد طويل المدى. يعمل نموذج مساحة العمل كجسر، يأخذ التفكير الثقيل المطلوب للذاكرة ويضغطه في شكل يمكن للروبوت استخدامه في الوقت الفعلي. يوفر هذا النهج مسارًا للمستقبل للروبوتات التي تحتاج إلى العمل في بيئات ديناميكية وغير متوقعة حيث يكون تذكر الماضي لا يقل أهمية عن رؤية الحاضر. وتثبت هذه الدراسة أنه مع استراتيجية التدريب الصحيحة، يمكن للروبوت أن يحمل تاريخًا غنيًا من الخبرة في حزمة خفيفة الوزن، جاهزة للعمل بوضوح وسرعة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →