← أحدث الأبحاث
💻 computer science

MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?

تقدم الورقة البحثية MINERVA، وهي سياسة رؤية-لغة-فعل مدمجة للغاية بـ 0.54 مليون معلمة تحقق أداءً يقارب أحدث ما توصل إليه العلم في معيار LIBERO، مما يكشف أن الحد الأدنى لقدرة المهمة منخفض بشكل مفاجئ بينما يظهر قيوداً حرجة في متانة التكييف مع التعليمات وعدم الاستفادة من مطابقة التدفق.

المؤلفون الأصليون: Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

نُشر 2026-09-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Kohei Sendai, Tatsuya Matsushima, Yusuke Iwasawa

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تتعلم الروبوتات التحرك ببراعة كانت تبدو في السابق مستحيلة، حيث تقوم بالتقاط الأشياء، وتكديس المكعبات، واتباع أوامر صوتية بسيطة. هذا التقدم مدفوع بنوع جديد من الذكاء الاصطناعي الذي يجمع بين الرؤية واللغة والعمل في نظام واحد. هذه الأنظمة، التي تُسمى غالباً نماذج الرؤية واللغة والعمل (vision-language-action models)، تعمل بمثابة عقل للروبوت، حيث تنظر إلى المشهد، وتفهم طلباً مثل "التقط المكعب الأحمر"، ثم تحسب الحركات الدقيقة اللازمة لإتمام المهمة. ولتدريب هذه العقول، يستخدم الباحثون مجموعة قياسية من التحديات تُعرف باسم "المعايير المرجعية" (benchmarks)، والتي تعمل كمقياس لمدى جودة أداء الروبوت. ولسنوات طويلة، كان المعيار المرجعي الأكثر شعبية في مجال التحكم الروبوتي هو مجموعة من أربعين مهمة مختلفة تتضمن تحريك الأشياء في بيئة محاكية. وكان الاعتقاد السائد في هذا المجال هو أنه لكي يتمكن الروبوت من حل هذه المهام بشكل جيد، فإنه يحتاج إلى عقل ضخم — نموذج رقمي يحتوي على مليارات المعلمات (parameters)، أو الإعدادات الداخلية، التي تتطلب أجهزة كمبيوتر قوية ومكلفة لتشغيلها.

ومع ذلك، طرح فريق من الباحثين من جامعة طوكيو سؤالاً أبسط وأكثر عملية: ما هو الحجم الفعلي الذي يجب أن يكون عليه العقل؟ إذا تم نشر روبوت للقيام بمجموعة محددة من الوظائف في مصنع أو منزل، فهو لا يحتاج إلى القدرة على فهم كل لغات العالم أو التعرف على كل جسم لم يره من قبل؛ بل يحتاج فقط إلى حل المهام المحددة التي استُؤجر لأدائها. أراد الباحثون إيجاد أصغر نسخة ممكنة من عقل الروبوت التي يمكنها مع ذلك حل المجموعة القياسية المكونة من أربعين مهمة بشكل مثالي. كانوا يبحثون عن الحد الأدنى من قدرة الحوسبة المطلوبة لإنجاز العمل، وهو العتبة التي ستحدد ما إذا كان بإمكان الروبوت العمل على شريحة صغيرة ورخيصة، أم أنه سيحتاج دائماً إلى خادم ضخم.

ولإيجاد هذا الحد، بنى الفريق عائلة من "سياسات الروبوت" (robot policies)، وهي البرامج التي تخبر الروبوت بكيفية التحرك، وقاموا بتصغيرها بشكل منهجي. بدأوا بنموذج يحتوي على ما يقرب من عشرة ملايين إعداد داخلي وبدأوا في تقليصه خطوة بخطوة، مراقبين متى سيبدأ الروبوت في الفشل. لقد جردوا النموذج من الميزات المعقدة الشائعة في النماذج الأكبر، مثل القدرة على قراءة جمل لغوية طبيعية أو استخدام أنظمة رؤية مدربة مسبقاً. بدلاً من ذلك، أعطوا الروبوت قائمة بسيطة من أسماء المهام الأربعين، ممثلة بأرقام، وكاميرا تتعلم الرؤية من الصفر. ثم قاموا بتدريب هذه النماذج على المهام الأربعين القياسية واختبروها أكثر من ألفي مرة لمعرفة عدد مرات نجاحها.

كشفت النتائج عن حد أدنى مفاجئ. فقد وجد الباحثون أن نموذجاً يحتوي على 0.54 مليون معلمة فقط كان قادراً على حل المهام بنسبة نجاح بلغت 95.1 بالمائة. وقد أدى هذا النموذج الصغير أداءً يقارب النماذج الأكبر والأكثر شهرة في هذا المجال، والتي تحتوي على مليارات المعلمات وهي أكبر منها بآلاف المرات. لم يتحسن أداء الروبوت بشكل ملحوظ بمجرد وصول حجم النموذج إلى حوالي مليون معلمة؛ إذ لم يؤدِ إضافة المزيد من قدرة الحوسبة بعد تلك النقطة إلى سوى نتائج ضئيلة. وعلى العكس من ذلك، عندما تم تقليص النموذج إلى أقل من ربع مليون معلمة، انهارت قدرة الرماوت على الحل، لا سيما في المهام الأكثر تعقيداً وطويلة الأمد. وهذا يشير إلى أنه بالنسبة لهذه المجموعة المحددة من التحديات، لا يحتاج الروبوت إلى عقل عملاق؛ بل يحتاج فقط إلى عقل صغير وفعال.

كما كشفت الدراسة عما يهم فعلياً في عقل الروبوت. اختبر الباحثون طرقاً مختلفة لتنظيم النموذج ووجدوا أن المورد الأكثر أهمية هو الجزء الذي يعالج المعلومات البصرية — أي "عيون" الروبوت. فإذا سلبوا الكثير من القدرة من النظام البصري، يفشل الروبوت، بغض النظر عن مقدار الطاقة المتبقية للجزء المسؤول عن التخطيط للحركات. كما اكتشفوا أن الطرق الرياضية المعقدة المستخدمة غالباً لتوليد حركات سلسة وانسيابية لم تكن ضرورية لهذا المستوى من الأداء؛ إذ إن طريقة أبسط وأسرع لحساب الحركات كانت تعمل بنفس الكفاءة وسمحت للروبوت باتخاذ القرارات في جزء من الثانية.

ولعل النتيجة الأكثر إثارة للدهشة كانت كيفية فهم الروبوت للتعليمات. في النماذج الأكبر، يقرأ الروبوت جملة مثل "التقط الكوب" ويحاول فهم معنى الكلمات. أما في هذا النموذج الصغير، فقد استبدل الباحثون اللغة برمز رقمي بسيط. وعندما قاموا بخلط هذه الرموز بحيث أُعطي الروبوت الرقم الخاطئ لمهمة ما، انخفض معدل نجاح الروبوت إلى ما يقرب من الصفر. وقد أثبت هذا أنه في هذا المعيار المرجعي المحدد، لم يكن الروبوت "يفهم" اللغة بمعناها العام؛ بل كان ببساطة يحفظ أي نمط بصري يتوافق مع أي رمز رقمي. كانت التعليمات مجرد مفتاح لفتح سلوك محفوظ بعينه.

هذا التمييز له آثار عميقة على كيفية بناء الروبوتات واستخدامها. فقد أظهر الباحثون أن معدلات النجاح العالية التي سجلتها النماذج العملاقة في هذا المعيار المرجعي هي في الغالب مقياس لمدى جودة حفظ الروبوت للمهام المحددة، بدلاً من مدى قدرته على التعميم في مواقف جديدة. فعندما اختبروا هذه النماذج الصغيرة مقابل تغييرات في المهام — مثل تغيير الإضاءة، أو الخلفية، أو شكل الأشياء — انخفض معدل النجاح بشكل كبير، مما كشف أن النماذج لم تتعلم الفيزياء الأساسية للعالم، بل تعلمت فقط المظهر المحدد لمهام التدريب. ومع ذلك، بالنسبة لروبوت يتم نشره للقيام بنفس المهام الأربعين يومياً، فإن هذا الحفظ هو بالضبط ما هو مطلوب.

النتيجة العملية لهذا البحث هي سياسة روبوتية فعالة للغاية. يمكن لنموذج الـ 0.54 مليون معلمة أن يعمل على جهاز كمبيوتر محمول قياسي دون الحاج أي بطاقات رسوميات متخصصة، ويتخذ القرارات في أقل من عشرة مللي ثانية. وهذا أسرع بمئات المرات من النماذج المتطورة الحالية، التي غالباً ما تستغرق ثوانٍ لتخطيط حركة واحدة. ومن خلال إثبات أن نموذجاً صغيراً ومتخصصاً يمكنه حل المعيار المرجعي القياسي، أظهر الباحثون أن المسار نحو روبوتات عملية وبأسعار معقولة لا يتطلب بالضرورة بناء عقول أكبر فأكبر. بدلاً من ذلك، يتطلب الأمر إيجاد أصغر عقل وأكثرها كفاءة يناسب الوظيفة المحددة، وهو اكتشاف قد يسمح بنشر الروبوتات في المنازل والمصانع حيث تكون المساحة والطاقة والتكلفة محدودة. ولا تدعي الدراسة أن هذه النماذج الصغيرة يمكن أن تحل محل الأنظمة الكبيرة العامة التي تُستخدم للاستكشاف مفتوح النهايات، لكنها تؤكد بقوة أنه بالنسبة لمجموعة ثابتة من المهام، فإن القدرة المطلوبة هي أصغر بكثير مما كان يُعتقد سابقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →