RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
يُعد RynnValue نموذجاً تأسيسياً للقيم الروبوتية مفتوح المصدر، يتوسع ليشمل ملايين المقاطع المشروطة بالتعليمات عبر استخدام المسافة الزمنية كهدف للإشراف، متفوقاً بذلك على الأساليب القائمة على التفضيل في التقييم، ومعززاً بشكل كبير نجاح السياسات في العالم الحقيقي دون الحاجة إلى تعليقات توضيحية صريحة للمكافأة أو التقدم.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيفية طهي وجبة، ولكن بدلاً من إعطائه وصفة، تقول له فقط: "اجعلها جيدة!" وتأمل أن يستنتج الباقي بنفسه. هذا هو عالم تعلم الروبوتات (robot learning)، وهو فرع من العلوم يحاول فيه المهندسون تعليم الآلات كيفية التحرك والتفاعل مع العالم المادي. العقبة الأكبر لا تتعلق عادةً بعقل الروبوت (قدرته على الحركة)، بل بـ المكافأة (reward). في عالم الذكاء الاصطناعي، "المكافأة" هي بمثابة بطاقة تسجيل أو "high-five" تخبر الروبوت: "عمل جيد!" أو "حاول مرة أخرى". المشكلة هي أن إعطاء الروبوت بطاقة تسجيل مثالية لكل حركة بمفردها أمر صعب للغاية. إذا كانت بطاقة التسجيل غامضة للغاية، فسيصاب الروبوت بالارتباك. وإذا كانت محددة للغاية لمهمة واحدة، فلن يتمكن الروبوت من تعلم أي شيء جديد. لقد حاول العلماء بناء "بطاقة تسجيل عامة الغرض" تعمل مع أي روبوت يقوم بأي مهمة، لكنهم ظلوا عالقين في كيفية ابتكارها دون الحاجة إلى تدخل بشري لتقييم كل محاولة يدوياً.
هنا يأتي دور فكرة جديدة تسمى RynnValue. فكر فيها كطريقة جديدة لتقييم أداء الروبوت. بدلاً من السؤال: "كم تبعد عن خط النهاية؟" (وهو أمر يصعب قياسه إذا كان شكل خط النهاية يختلف من مهمة لأخرى)، تسأل RynnValue: "كم من الوقت تبقى حتى تنتهي؟" إنها تعامل رحلة الروبوت كأنها مؤقت تنازلي. إذا كان الروبوت بعيداً عن الهدف، يكون المؤقت مرتفعاً. وإذا كان قريباً، يكون المؤقت منخفضاً. سحر هذه الورقة البحثية هو أنها تظهر لك أنك لست بحاجة إلى إنسان يضغط على زر ليقول "عمل جيد" لإنشاء هذا المؤقت. يمكنك ببساطة النظر إلى الساعة. إذا كان فيديو لروبوت يطبخ يبدأ عند 10 دقائق وينتهي عند 0، يمكن للكمبيوتر تلقائياً معرفة أنه عند علامة الـ 5 دقائق، كان يتبقى للروبوت 5 دقائق. هذه الحيلة البسيطة تسمح للروبوت بالتعلم من آلاف الساعات من الفيديوهات دون الحاجة إلى شخص يقوم بتقييمها يدوياً.
المشكلة: فخ "التقدم"
لفترة طويلة، حاول العلماء تعليم الروبوتات عن طريق قياس "التقدم". تخيل روبوتاً يحاول تكويم المكعبات. نموذج التقدم سيحاول التخمين ما إذا كان الروبوت قد أنجز 10%، أو 50%، أو 90%. ولكن إليك الخدعة: "إنجاز 50%" يبدو مختلفاً تماماً عند تكويم المكعبات عنه عند صب الماء. قد يكون الروبوت في منتصف الطريق بناءً على الارتفاع، بينما يكون روبوت آخر في منتصف الطريق بناءً على الوقت. وهذا يجعل من الصعب جداً تدريب روبوت يمكنه القيام بالعديد من الأشياء المختلفة، لأن تعريف "التقدم" يتغير في كل مرة تتغير فيها المهمة. الأمر يشبه محاولة تعليم طالب الرياضيات بقولك له "لقد قطعت نصف الطريق!" دون أن تخبره أبداً ما هي الإجابة النهائية المفترضة.
يجادل مؤلفو هذه الورقة بأن نهج "التقدم" هذا هو طريق مسدود. يقولون إننا بحاجة إلى التوقف عن محاولة تخمين مدى تقدم الروبوت والبدء في العد التنازلي للوقت المتبقي حتى تنتهي المهمة. هم يسمونها المسافة الزمنية (temporal distance). إنها "التكلفة المتبقية للوصول"، أو ببساسا: "كم من الوقت يتبقى لي؟"
الحل: RynnValue والساعة السحرية
قام الفريق في أكاديمية DAMO التابعة لشركة علي بابا ومختبر Hupan ببناء نموذج يسمى RynnValue. بدلاً من محاولة تخمين نسبة مئوية للتقدم، تنظر RynnValue إلى فيديو لروبوت وتعليمات نصية (مثل "ضع الكوب على الطاولة") وتتوقع بالضبط عدد الثواني المتبقية حتى تنتهي المهمة.
الجزء الذكي هنا هو أنهم لم يحتاجوا إلى بشر يكتبون "بقي 5 ثوانٍ" لكل فيديو. لقد استخدموا فقط الطوابع الزمنية (timestamps) الموجودة بالفعل في ملفات الفيديو. إذا بدأ الفيديو عند 0:00 وانتهى الروبوت عند 0:10، فإن الكمبيوتر يعرف أنه عند 0:05، كان يتبقى للروبوت 5 ثوانٍ. هذا يعني أنه يمكنهم تدريب النموذج على مكتبة ضخمة تضم أكثر من 7,000 ساعة من فيديوهات الروبوتات — حوالي 3 ملايين مقطع — دون الحاجة إلى إنسان واحد لتقييمها يدوياً. إنه يشبه تعليم طالب القراءة من خلال السماح له بمشاهدة آلاف الأفلام مع ترجمة، بدلاً من أن يقوم معلم بتقييم كل جملة يقرؤها.
الحيل الخفية (وكيف أوقفوا استخدامها)
قد تعتقد: "إذا كان الروبوت يتعلم فقط النظر إلى الساعة، أليس هذا استغلالاً لطريق مختصر؟" كان العلماء قلقين بشأن هذا أيضاً. كانوا يعلمون أنه إذا عرضوا الفيديوهات على الروبوت بالترتيب، فقد يتعلم الروبوت طريقاً مختصراً: "أوه، الإطار الثالث في الفيديو هو دائماً منتصف المهمة!" أو "إذا كان الفيديو مدته 10 ثوانٍ، فإن المنتصف هو دائماً 5 ثوانٍ متبقية!". سيتوقف الروبوت عن النظر إلى أذرع الروبوت الفعلية وسيبدأ فقط في التخمين بناءً على موقع الفيديو.
ولمنع ذلك، أضافوا بعض "الفوضى" إلى التدريب:
- العينات العشوائية (Random Sampling): لم يعرضوا الفيديو على الروبوت في خط مستقيم. بل اختاروا لحظات عشوائية من الفيديو، بحيث لا يستطيع الروبوت تخمين الوقت بناءً على ترتيب الإطارات.
- الخلط (Shuffling): قاموا أحياناً بعرض الفيديو بشكل عكسي أو بترتيب مختلط. إذا رأى الروبوت حالة "الانتهاء" قبل حالة "البداية"، فسيتعين عليه إدراك أن حالة "الانتهاء" هي في الواقع أبعد في الزمن، مما يجبره على النظر فعلياً إلى صورة الروبوت، وليس مجرد ترتيب الصور.
- العزل (Isolation): تأكدوا من أن الروبوت لا يمكنه استراق النظر إلى الإجابات للإطار التالي أثناء تخمين الإطار الحالي. كان عليه حل كل لحظة بمفرده.
النتائج: هل نجح الأمر؟
اختبر الفريق نموذج RynnValue على مجموعة من الروبوتات والمهام المختلفة التي لم يسبق له رؤيتها من قبل. كانت النتائج جيدة بشكل مفاجئ.
- مهام التصنيف (Ranking Tasks): عندما طُلب منها تصنيف محاولات الروبوت المختلفة من "الأفضل" إلى "الأسوأ"، حصلت RemannValue على درجة 0.675. وكان هذا أفضل من النماذج الأفضل السابقة التي اعتمدت على تقييم البشر اليدوي للفيديوهات (والتي سجلت 0.655).
- الروبوتات في العالم الحقيقي: أخذوا النموذج واستخدموه لتعليم روبوتات حقيقية القيام بمهام صعبة، مثل وضع الخبز في سلة أو تحريك قطعة لحم باستخدام ملعقة مسطحة.
- مع RynnValue، نجحت الروبوتات بنسبة 72.5% عند التعلم عبر الإنترنت (أثناء الحركة).
- بدونها، وباستخدام الطرق القديدة الأفضل، نجحت بنسبة 52.5% فقط.
- في التعلم غير المتصل (Offline Learning) (التعلم من قاعدة بيانات للحركات الماضية)، رفعت RynnValue نسبة النجاح من 63.8% إلى 82.5%.
لماذا هذا مهم؟
الأمر الأكثر إثارة في هذه الورقة البحثية هو أنها تشير إلى أننا لسنا بحاجة إلى أن نكون مثاليين في تقييم الروبوتات لتعليمها. نحن نحتاج فقط إلى معرفة متى انتهوا. من خلال استخدام "ساعة" الوقت البسيطة والتلقائية، تخلق RynnValue لغة عالمية لمكافآت الروبوت. فهي تعمل مع روبوت بذراعين، أو روبوت بعجلة، أو روبوت بيد، طالما يمكننا معرفة متى تنتهي المهمة.
يشير المؤلفون بحذر إلى أن هذا ليس عصا سحرية تحل كل مشاكل الروبوتات فوراً. فقد وجدوا أنه بالنسبة للمهام الصعبة جداً التي تتطلب محاذاة دقيقة (مثل وضع صندوق في درج)، لا يزال النموذج يعاني قليلاً لأن الإشارات البصرية كانت مربكة. ولكن بشكل عام، أظهروا أن المسافة الزمنية (temporal distance) هي طريقة قوية وقابلة للتوسع لتعليم الروبوتات. إنها تحول المشكلة الفوضوية والصعبة لـ "ما هي الحركة الجيدة؟" إلى مشكلة بسيطة وقابلة للحل وهي "كم من الوقت يتبقى؟".
باختصاف، RynnValue تشبه إعطاء الروبوت ساعة توقيت بدلاً من تقرير درجات. إنها تحول عالم تعلم الروبوتات الفوضوي إلى عد تنازلي بسيط، ويبدو أن هذا يعمل بشكل أفضل من الطرق القديمة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.