SeeQ: Training Generalist Value Functions for Long-Horizon Robotic Manipulation
تقدم الورقة البحثية SeeQ، وهو إطار عمل يدرب دوال القيمة العامة عبر التنبؤ بالتسلسل الذاتي للمهام الفرعية النشطة بلغة طبيعية للتغلب على آفاق تخصيص الائتمان الطويلة وتحسين توجيه السياسة في مهام التلاعب الروبوتية المعقدة وطويلة الأمد باستخدام البيانات غير المتصلة بالإنترنت.
البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: SeeQ: تدريب دوال القيمة العامة للمهام طويلة المدى في التلاعب الروبوتي
بيان المشكلة
تعاني سياسات الروبوتات العامة، التي يتم تدريبها غالبًا عبر التعلم بالتقليد (Imitation Learning)، من صعوبة في التعامل مع مهام التلاعب المعقدة وطويلة المدى. تتضمن هذه المهام غالبًا مراحل متعددة أو تتطلب محاولات متكررة وتدبرًا في مراحل معينة قبل النجاح. في مثل هذه الإعدادات، تتراكم الأخطاء بمرور الوقت، وتكون سلوكيات الاسترداد (Recovery behaviors) غير ممثلة بشكل كافٍ في مجموعات بيانات الخبراء. وبينما توفر دوال قيم Q آلية لتوجيه السياسات عبر ترتيب الإجراءات المرشحة، فإن تعلمها للمهام طويلة المدى يواجه تحديات كبيرة. تواجه الطرق القياسية ثلاث عقبات رئيسية:
- آفاق طويلة لربط الائتمان (Long Credit-Assignment Horizons): يتطلب التعلم من المكافآت النادرة على مستوى المهمة (النجاح/الفشل في النهاية فقط) نشر الإشارات عبر تسلسلات طويلة، مما يؤدي إلى عمليات تحديث "بلمان" (Bellman backups) صعبة.
- تغطية البيانات: غالبًا ما تفتقر مجموعات البيانات غير المتصلة (Offline datasets) إلى التغطية الكافية لأزواج الحالة-الإجراء المتنوعة التي يتم مواجهتها خلال المسارات الطويلة، مما يجعل تعلم الفرق الزمني (TD learning) غير موثوق.
- الهشاشة: بدون تعلم فعال للقيمة، لا تستطيع السياسات التمييز بين الإجراءات التي تحقق تقدمًا وتلك التي تؤدي إلى الفشل، خاصة في المهام التي تتطلب دقة عالية أو مهام متعددة المراحل.
إما أن تتجنب الطرق الحالية تعلم الفرق الزمني (باستاستخدام عوائد مونت كارلو، مما يحد من تحسين السياسة خارج نطاق التوزيع)، أو تعتمد على تعلم الفرق الزمني على كامل أفق المهمة، وهو ما يعاني من تراكم الأخطأ.
المنهجية: SeeQ (دوال Q المستخلصة من المهام الفرعية)
يقترح المؤلفون إطار عمل SeeQ لتدريب دوال قيم Q عامة تعمل على تقصير أفق التعلم من خلال التركيز على المهمة الفرعية النشطة حاليًا بدلاً من المهمة بأكملها.
البنية الأساسية والتدريب
يستخدم SeeQ نموذج لغة ورؤية (VLM) مدرب مسبقًا (تحديدًا نموذج PaliGemma بحجم 3 مليار معلمة) ويقدم عملية تدريب مكونة من مرحلتين:
- التدريب المسبق العام: يتم تدريب النموذج مسبقًا على مجموعات بيانات متنوعة للتلاعب الروبوتي مفتوحة المصدر (مثل RoboCOIN) تحتوي على تعليقات توضيحية للمهام الفرعية. تعمل هذه المرحلة على تنظيم فهم النموذج لتقدم المهمة وشرط الإجراء (Action conditioning) عبر مختلف الهياكل الروبوتية.
- الضبط الدقيق للمهام النهائية: يتم ضبط النموذج دقيقًا على مهام مستهدفة محددة.
الابتكارات التقنية الرئيسية
- التنبؤ بالقيمة على مستوى المهمة الفرعية: بدلاً من التنبؤ بالعائد للوصول النهائي للمهمة، تُقدر دالة Q العائد المتوقع لـ المهمة الفرعية النشطة (). وهذا يقلل أفق التنبؤ، مما يجعل تعلم الفرق الزمني أكثر استقرارًا وفعالية.
- فك تشفير المهمة الفرعية ذاتي الانحدار (Autoregressive Subtask Decoding): لإلغاء الحاجة إلى تعليقات بشرية أو متنبئات خارجية للمهام الفرعية وقت الاختبار، تم تعديل بنية دالة Q لتتنبأ بالتسمية النصية للمهمة الفرعية النشطة ذاتيًا بلغة طبيعية قبل تقدير قيمتها.
- أثناء التدريب، يتم الإشراف على النموذج باستخدام خسارة التنبؤ بالرمز التالي (next-token prediction loss) بناءً على التعليقات التوضيحية للمهام الفرعية الحقيقية.
- أثناء الاستدلال، يقوم النموذج بتوليد نص المهمة الفرعية () بناءً على الحالة الحالية وتعليمات المهمة، ثم يشترط التنبؤ بالقيمة بناءً على هذا النص المولد.
- تعلم الفرق الزمني مع أفضل-من-N (TD-BoN): يجمع هدف التدريب بين تعلم الفرق الزمني على مستوى المهمة الفرعية واستراتيجية النسخ الاحتياطي "أفضل-من-N" (Best-of-N).
- يتم أخذ عينات من كتل الإجراءات المرشحة من السياسة الأساسية ().
- يتم حساب القيمة المستهدفة باستخدام كتلة الإجراء ذات أعلى قيمة مقدرة من بين من المرشحين.
- يضمن هذا النهج توافق عملية النسخ الاحتياطي للتدريب مع إجراء التوجيه في وقت الاختبار، ويسمح لدالة Q بتقييم الإجراءات بشكل أفضل من تلك الملاحظة في مجموعة البيانات.
- لا يوجد نسخ احتياطي عبر الحدود: لا يقوم هدف الفرق الزمني (TD target) بعملية نسخ احتياطي عبر حدود المهام الفرعية. إذا انتهت مهمة فرعية ضمن أفق كتلة الإجراء، يتم تصفير حد النسخ الاحتياطي، مما يضمن أن دالة القيمة تعكس بدقة تقدم المهمة الفرعية الحالية فقط.
تجمع دالة الخسارة الإجمالية بين خسارة TD لقيمة المهمة الفرعية وخسارة التنبؤ بالرمز التالي لنص المهمة الفرعية:
الاستدلال عند الاختبار
عند النشر، يقوم SeeQ بتوجيه السياسة الأساسية () عبر اختيار أفضل-من-N:
- بالنظر إلى الحالة وتعليمات المهمة ، يتنبأ SeeQ ذاتيًا بالمهمة الفرعية النشطة .
- تقترح السياسة الأساسية من كتل الإجراءات المرشحة.
- تقوم دالة Q بتسجيل درجات كل كتلة إجراء مشروطة بـ و و المتنبأ به.
- يتم تنفيذ كتلة الإجراء ذات الدرجة الأعلى.
المساهمات الرئيسية
- صياغة مستوى المهمة الفرعية: يقدم البحث طريقة لإعادة صياغة تعلم القيمة طويل المدى كتعلم قصير المدى على مستوى المهمة الفرعية، مما يتجاكنجح التحديات المرتبطة بالمكافآت النادرة عبر الآفاق الطويلة.
- الاستدلال المشروط باللغة للمهام الفرعية: بنية مبتكرة تتنبأ صراحة بالمهمة الفرعية النشطة بلغة طبيعية، مما يلغي الحاجة إلى أنظمة تنبؤ بالمهام الفرعية نمطية أو تعليقات بشرية وقت الاختبار.
- استراتيجية التدريب المسبق العامة: يوضح أن التدريب المسبق لبنية VLM على بيانات روبوتية متنوعة أمر بالغ الأهمية لتعلم شرط الإجراء القوي وتقليل الإفراط في التخصيص لميزات صور معينة أثناء الضبط الدقيق للمهام النهائية.
- التحقق التجريبي: تقييم واسع النطاق على أربع مهام تلاعب ثنائية اليد في العالم الحقيقي (تعليق القميص، إغلاق الغطاء، تعبئة البقالة، وتفكيك الليغو) عبر منصتين روبوتيتين.
النتائج
قام المؤلفون بتقييم SeeQ في أربع مهام واقعية تتضمن أجسامًا قابلة للتشكيل، ومحاذاة دقيقة، وتنسيقًا متعدد المراحل.
- أداء توجيه السياسة: حسن SeeQ معدلات نجاح السياسات الأساسية بشكل كبير عبر جميع المهام.
- تعليق القميص: تحسن من 10/24 (41.7%) إلى 22/24 (91.7%).
- إغلاق الغطاء: تحسن من 10/24 (41.7%) إلى 15/24 (62.5%).
- تعبئة البقالة: تحسن من 9/24 (37.5%) إلى 17/24 (70.8%).
- تفكيك الليغو: تحسن من 5/24 (20.8%) إلى 10/24 (41.7%).
- إجمالي متوسط معدل النجاح ارتفع من 35.4% إلى 66.7% (تحسن بمقدار 1.88 ضعفًا).
- دراسات الاستئصال (Ablation Studies):
- التدريب المسبق: أدى إزالة التدريب المسبق لبيانات الروبوت إلى انخفاض كبير في الأداء (من 22/24 إلى 8/24 في تعليق القميص)، مما يبرز ضرورة البيانات المتنوعة للتعميم.
- الاشتراط بالمهمة الفرعية: كان فك التشفيد والاشتراط الصريح بالمهمة الفرعية أمرًا حاسمًا. أدى إزالة التنبؤ بالمهمة الفرعية إلى أداء أقل من السياسة الأساسية (8/24)، بينما أدى إضافة التنبؤ دون الاشتراط إلى تحسينه إلى 15/24. حقق SeeQ الكامل 22/24.
- المقارنة مع الخطوط المرجعية: تفوق SeeQ على انحدار مونت كارلو للمهمة الكاملة، وتعلم TD للمهمة الكاملة، وSARSA على مستوى المهمة الفرعية (الذي يستخدم إجراءات مجموعة البيانات بدلاً من أخذ عينات أفضل-من-N).
الأهمية والادعاءات
يدعي البحث أن قيم مستوى المهمة الفرعية توفر هدف تعلم أكثر فعالية من إشارات النجاح النادرة طويلة المدى عند تدريب دوال Q العامة. من خلال الاستفادة من التفكيك الطبيعي لمهام التلاعب إلى معالم وسيطة، يمكّن SeeQ من تعلم فعال للفرق الزمني (TD learning) دون تراكم الأخطاء المرتبط عادةً بالآفاق الطويلة.
يؤكد المؤلفون أن نهجهم يسمح بـ تعلم القيمة العام الذي يمكن تطبيقه على مهام جديدة بحد أدنى من الضبط الدقيق، بشرط إمكانية تفكيك المهام إلى مهام فرعية. إن الاستخدام الصريح للغة للتنبؤ بالمهام الفرعية يربط تقدير القيمة بقدرات توليد النصوص لنموذج VLM، مما يحسن المتانة بالقرب من انتقالات المهام الفرعية.
يشير العمل إلى أن الجمع بين أهداف التعلم قصيرة المدى والاستدلال المهيكل لغويًا يعد مسارًا واعدًا نحو تلاعب روبوتي أكثر قوة وطويل المدى، خاصة عند الاستفيد من التدريب المسبق واسع النطاق على بيانات روبوتية متنوعة. يقر المؤلفون بوجود قيود، مثل غموض حدود المهام الفرعية والاعتماد على جودة الإجراءات المرشحة للسياسة الأساسية، لكنهم يعتبرون أن إطار عملهم يمثل خطوة مهمة نحو جعل دوال القيم عملية في مجال الروبوتات الواقعية المعقدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.