REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
يُعدُّ REFACTOR-VLA إطار عمل لليقظة/النوم يتعلم برامج حركية نمطية قابلة لإعادة الاستخدام عبر تجميع شظايا الأفعال بواسطة نواة تكافؤ سلوكي ونموذج عالم كامن، محققاً أداءً فائقاً في مهام LIBERO طويلة المدى من خلال فك تشفير مشروط بالمكتبة وهدف تدريب يعطي الأولوية لجودة التجميع على سعة النموذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تتحسن الروبوتات في رؤية العالم والتحرك من خلاله، لكنها لا تزال تعاني مع نوع المهام المعقدة متعددة الخطوات التي يتعامل معها البشر بسهولة. فعندما يصنع شخص ما شطيرة، فإنه لا يفكر في كل حركة عضلية فردية مطلوبة للإمساك بالخبز، أو دهن الزبدة، أو تقطيع الطماطم. بدلاً من ذلك، يعتمد على مكتبة ذهنية من الأفعال المألوفة — الإمساك، الدهن، التقطيع — والتي يمكنه ربطها بترتيبات مختلفة. وتفتقر نماذج الذكاء الاصطناዊ الحالي للروبوتات غالباً إلى هذه القدرة على تنظيم السلوك؛ إذ تميل إلى توليد أوامر خام لحظية دون تجميعها في مهارات محددة وقابلة لإعادة الاستخدام. وهذا يجعل من الصعب عليها التخطيط للمهام الطويلة أو شرح ما تعلمته. ويحاول الباحثون الآن تعليم الآلات بناء مكتباتها الخاصة من المهارات، مما يسمح لها بتفكيك الوظائف المعقدة إلى قطع أصغر يمكن إدارتها وإعادة استخدامها ودمجها.
قام فريق من الباحثين في شركة أبل بتطوير نظام جديد يسمى REFACTOR-VLA يحاول حل هذه المشكلة عبر تعليم الروبوت اكتشاف مهاراته الخاصة دون تسميات بشرية. يعمل النظام في مرحلتين متبادلتين، تماماً كما قد يمارس الإنسان حركة جديدة ثم يستريح لترك الدماغ ينظم الذاكرة. في المرحلة الأولى، يتعلم الروبوت التنبؤ بما سيحدث تالياً إذا قام بتسلسل معين من الحركات. إنه يبني نموذجاً ذهنياً للعالم، مدركاً كيف تغير أفعاله البيئة المحيطة. وفي المرحلة الثانية، ينظر النظام إلى الكم الهائل من بيانات الحركة التي جمعها ويحاول إيجاد أنماط؛ حيث يطرح سؤالاً بسيطاً ولكنه صعب: هل ينتج عن تسلسلين مختلفين من الحركات نفس النتيجة؟ إذا حرك الروبوت ذراعه بشكل دائري لالتقاط كوب، أو حركها في خط مستقيم لفعل الشيء نفسه، فيجب على النظام أن يدرك أن كلا المسارين يحققان الهدف ذاته.
للإجابة على ذلك، ابتكر الباحثون أداة خاصة تقيس نتيجة الأفعال بدلاً من مجرد مظهرها. فبدلاً من النظر إلى الفيديو الخام لحركة الروبوت، يقوم النظام بمحاكاة الفعل في نموذجه الذهني المتعلم ليرى أين سينتهي به المطاف وما هي المكافأة التي سيحصل عليها. إذا أدى مساران مختلفان للحركة إلى الحالة النهائية نفسها ونفس المكافأة، فإن النظام يعاملهما كمتكافئين. بعد ذلك، يقوم بتجميع هذه المسارات المتشابهة معاً في مهارة واحدة قابلة لإعادة الاستخدام. وبمجرد تشكيل مجموعة، يحاول النظام كتابة برنامج بسيط ومنظم يصف النمط المشترك لتلك المهارة. ثم يُضاف هذا البرنامج إلى مكتبة، ويمكن للروبوت استخدام هذه المكتبة لاحقاً للتخطيط لمهام جديدة، مستدعياً هذه المهارات الجاهزة بدلاً من حساب كل حركة صغيرة من الصفر.
اختبر الباحثون هذا النهج على مجموعة قياسية من مهام الروبوت التي تتضمن تحريك الأشياء في بيئة محاكية. واكتشفوا شيئاً مفاجئاً حول كيفية تعلم هذه الأنظمة؛ فهناك اعتقاد شائع في الذكاء الاصطناعي بأن جعل النموذج أكبر وأكثر تعقيداً يؤدي دائماً إلى أداء أفضل. ومع ذلك، عندما زاد الباحثون حجم نموذج العالم الخاص بهم من حوالي 188 مليون معلمة إلى 430 مليون معلمة، كان أداء النظام في الواقع أسوأ في كل مجموعة اختبار. لقد فشل النموذج الأكبر في تنظيم المهارات بشكل صحيح، مما يشير إلى أن مجرد إضافة المزيد من القوة الحوسبية ليس هو الحل.
بدلاً من ذلك، كان مفتاح النجاح يكمن في كيفية تدريب النموذج. وجد الباحثون أن إضافة نوع معين من أهداف التعلم خلال مرحلة التدريب الأولية حسّن النتائج بشكل كبير. ساعد هذا الهدف النظام على التمييز بين المهام المختلفة بوضوح أكبر، مما سمح له بتجميع الحركات المتشابهة معاً بفعالية أكبر. ومع هذا التغيير، تفوق النظام على أقوى الأساليب الموجودة في جميع مجموعات الاختبار الأربع الرئيسية، محققاً تحسناً في متوسط درجاته بفارق كبير. نجح النظام في بناء مكتبة من ثلاث مهارات متميزة وقابلة لإعادة الاستخدام لمهمة محددة، وكان الروبوت الذي يستخدم هذه المكتبة قادراً على إعادة كتابة كل عرض توضيحي رآه باستخدام هذه المهارات الجديدة.
كما كشفت الدراسة أن قدرة النظام على إيجاد هذه المهارات تعتمد بشدة على نوع البيانات التي يحللها. فبينما نجح النظام في إنشاء مكتبة من التعليمات القائمة على اللغة، مثل "التقط الشيء وضعه في السلة"، إلا أنه فشل في إيجاد أنماط قابلة لإعادة الاستخدام في الأوامر الحركية الخام نفسها. وهذا يشير إلى أن النظام أفضل في فهم الأهداف عالية المستوى للمهمة مقارنة بالتفاصيل الفيزيائية منخفضة المستوى لكيفية الحركة. وقد قاس الباحثون اتساق نتائجهم عبر العديد من عمليات التدريب المختلفة ووجدوا أن النظام يكتشف باستمرار تجميعات مهارات متشابهة، مع وجود درجة عالية من الاتفاق بين النسخ المختلفة من النموذج.
يوضح هذا العمل أن الطريقة التي ينظم بها الروبوت تجاربه أكثر أهمية من الحجم الهائل لدماغه. فمن خلال التركيز على نتائج الأفعال واستخدام طريقة منظمة لتجميعها، يمكن للنظام بناء مكتبة من المهارات تساعده في مواجهة المهام المعقدة وطويلة الأمد. وتتحدى هذه النتائج فكرة أن "الأكبر هو الأفضل دائماً"، وتشير نحو مستقبل يمكن للروبوتات فيه التعلم من خلال التفكير في أفعال قابلة لإعادة الاستخدام، تماماً كما يفعل البشر. وقد أتاح الباحثون الكود والبيانات الخاصة بهم، مما يسمح للآخرين بالتحقق من هذه النتائج والبناء على هذا النهج الجديد في تعلم الروبوتات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.