Reinforcement Learning for Real-Time Vision-Language-Action Policies
تقدم هذه الورقة البحثية إطار عمل Real-Time EXPO-FT، وهو إطار تعلم تعزيزي يفصل بين توليد الأفعال التعبيري البطيء وتحرير الأفعال التفاعلي السريع لتمكين التكيف عالي الأداء وذي الكفاءة في العينات لنماذج الرؤية واللغة والأفعال الضخمة مع الديناميكيات الواقعية رغم زمن انتقال الاستدلال.
المؤلفون الأصليون:Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn
لطالما عانت الروبوتات من أجل التحرك بمرونة الكائنات الحية. وبينما يمكن برمجتها لاتباع مجموعة صارمة من التعليمات في المصنع، فإن العالم الحقيقي فوضوي، وغير متوقع، ويتحرك بسرعة. وللتنقل في هذا الوسط، لجأ الباحثون إلى نوع من الذكاء الاصطناعي يُعرف بنموذج "الرؤية واللغة والعمل" (vision-language-action model). هذه البرامج الحاسوبية الضخمة مدربة على كميات هائلة من البيانات، مما يسمح لها بفهم ما تراه عبر الكاميرا، وقراءة تعليمات نصية، وتحديد كيفية تحريك ذراع روبوتية. إنها قوية لأنها رأت الكثير من الأمثلة حول كيفية عمل العالم، فهي تعمل مثل مكتبة ضخمة من الخبرات. ومع ذلك، هناك عقبة كبيرة: نظرًا لأن هذه النماذج ضخمة ومعقدة للغاية، فإنها تستغرق وقتًا ملحوظًا للتفكير. وفي الجزء من الثانية الذي يستغرقه الكمبيوتر لمعالجة صورة واتخاذ قرار بشأن حركة ما، يكون العالم المادي قد تغير بالفعل. فإذا كان الروبوت يحاول الإمساك بكرة أو موازنة جسم ما، فإن المعلومات التي استخدمها لاتخاذ قراره تكون قد أصبحت قديمة بحلول الوقت الذي يبدأ فيه الحركة فعليًا، مما يؤدي غالبًا إلى فشل الإجراء.
قام فريق من الباحثين في جامعة ستانفورد بتطوير طريقة جديدة لتعليم هذه النماذج الضخمة كيفية العمل في الوقت الفعلي، حتى عندما تكون بطيئة في التفكير. يعالج نهجهم، المسمى "Real-Time EXPO-FT"، مشكلة التأخير عن طريق تقسيم عملية اتخاذ القرار في الروبوت إلى جزأين متميزين. فبدلاً من إجبار النموذج الضخم والبطيء على القيام بكل تعديل بسيط في كل جزء من الثانية، فإنهم يتركونه يقوم بالعمل الشاق المتمثل في التخطيط لمسار عام، بينما يتولى برنامج حاسوبي أصغر وأسرع التعامل مع التصحيحات الفورية. تخيل قائد أوركسترا يقود الفرقة؛ القائد يحدد الإيقاع واللحن العام، لكن العازفين الأفراد يجب أن يعدلوا عزفهم فورًا للبقاء في تناغم. في هذا النظام، يعمل النموذج الضخم كقائد أوركسترا، حيث يقترح تسلسلًا من الحركات بناءً على ما رآه قبل لحظة. ثم يقوم مساعد خفيف الوزن بمراقبة الحالة الراهنة للعالم وإجراء تعديلات سريعة وصغيرة على تلك الحركات المقترحة لضمان أنها لا تزال صحيحة للحظة التي يحتاج فيها الروبوت للتحرك فعليًا. وهذا يسمح للروبوت باستخدام المعرفة العميقة للنموذج الضخم دون أن يعيقه بطء سرعة تفكيره.
اختبر الباحثون هذه الطريقة في بيئتين مختلفتين تمامًا: عالم محاكي للفيزياء، والعالم المادي الفعلي. في المحاكاة، تحدى الباحثون الروبوت بعشر مهام ديناميكية مختلفة، مثل موازنة كرة على طبق، وركل كرة قدم أثناء تجنب مدافع، والإمساك بجسم متحرك. وقارنوا طريقتهم الجديدة بالعديد من التقنيات الموجودة التي حاولت التعامل مع التأخير. كانت النتائج واضحة: سمح النهج الجديد للروبوت بالنجاح في كل تجربة تقريبًا، متفوقًا على جميع الأساليب الأخرى، بما في ذلك تلك التي لم تكن مضطرة للتعامل مع التأخير على الإطلاق. كان هذا اكتشافًا مهمًا لأنه أظهر أنه من خلال تعليم النظام صراحةً كيفية مراعاة بطئه الخاص، يمكن للروبوت أن يصبح أكثر موثوقية من الأنظمة التي هي نظريًا أسرع ولكنها أقل قدرة على التكيف.
لإثبات نجاح ذلك في العالم الحقيقي، نقل الفريق الروبوت إلى مختبر وأعطاه أربع مهام صعبة تتطلب رد فعل سريعًا ومستمرًا. شمل ذلك الحفاظ على توازن كرة تنس طاولة على طبق دوار، والتقاط مكعب من سطح دوار، والإمساك بجسم تمرره ذراع روبوتية أخرى، وركل كرة نحو هدف بينما يتحرك مدافع حولها. حدد الباحثون وقت التدريب بعشر دقائق فقط من تفاعل الروبوت مع البيئة، مما يضمن قدرة النظام على التعلم بسرعة دون الحاجة إلى ساعات لا نهاية لها من الممارسة. قبل تطبيق طريقتهم، كان معدل نجاح الروبوت في هذه المهام منخفضًا للغاية، حيث بلغ في المتوسط حوالي 42 بالمائة. وبعد استخدام إطار التدريب في الوقت الفعلي الجديد، قفز معدل النجاح إلى 97 بالمائة. تعلم الروبوت التكيف مع الحركات الفوضوية للأجسام والقيود الزمنية للمهام دون أي تدخل بشري أثناء عملية التدريب.
كما استكشفت الدراسة مدى صمود النظام تحت ظروف مختلفة. فعندما زاد الباحثون التأخير في عملية تفكير الروبوت بشكل اصطناعي، حافظت الطريقة الجديدة على مستواها العالي من الأداء، بينما فشلت الأساليب الأخرى مع زيادة طول مدة التأخير. وبالمثل، عندما زادت سرعة الأجسام المتحركة، استمر الروبوت الذي يستخدم هذا الإطار الجديد في النجاح، بينما عانت الأساليب الأخرى لمواكبة السرعة. يوضح هذا أن النظام لا يعمل فقط لسرعة أو تأخير محددين، بل هو قوي بما يكفي للتعامل مع الطبيعة غير المتوقعة للبيئة الديناميكية. وأشار الباحثون إلى أنه على الرغم من أن نظامهم فعال للغاية، إلا أنه لا يزال يعتمد على إنسان لإعادة ضبط الروبوت بعد انتهاء المهمة، ويتطلب طريقة محددة لتحديد النجاح لكل مهمة. ومع ذلك، فإن الإنجاز الجوهري هو تقديم دليل على أن نماذج الذكاء الاصطناعي الضخمة والقوية يمكن جعلها تعمل في الوقت الفعلي، مما يسد الفجوة بين التخطيط البطيء والمتأني للذكاء الاصطناعي والمتطلبات السريعة والتفاعلية للعالم المادي.
ملخص تقني: EXPO-FT في الوقت الفعلي (Real-Time EXPO-FT)
بيان المشكلة يعد الضبط الدقيق لتعلم التعزيز (RL) لنماذج الرؤية واللغة والعمل (VLA) الضخمة والمسبقة التدريب أمراً واعداً لنشر الروبوتات بشكل موثوق. ومع ذلك، فإن حجم هذه النماذج يتسبب في تأخير كبير في الاستنتاج (Inference Latency). في البيئات الواقعية الديناميكية، غالباً ما تكون الملاحظة المستخدمة لتوليد إجراء ما قد أصبحت قديمة بحلول وقت التنفيذ. يؤدي هذا إلى حدوث انزياح في التوزيع (Distribution Shift)، حيث يعمل السياسة (Policy) بناءً على معلومات حالة قديمة، مما يقلل بشكل كبير من الموثوقية والأداء. وبينما استكشفت الأعمال السابقة التنفيذ غير المتزامن (مثل Chunking في الوقت الفعلي) للتخفيف من حدة التأخير، إلا أن هذه الطرق تعتمد أساساً على التعلم بالتقليد وتفتقر إلى الآليات التي تسمح بتجاوز توزيع التدريب. علاوة على ذلك، فإن التطبيق المباشر لتعلم التعزيز القياسي على السياسات المتأخرة يفشل في تحقيق كامل مكاسب الموثوقية التي يوفرها تعلم التعزيز، لأن الإجراءات يتم التنبؤ بها من ملاحظات سابقة، مما يكسر خاصية ماركوف (Markov property) المطلوبة لعمليات تخصيص الائتمان (Credit Assignment) القياسية.
المنهجية: EXPO-FT في الوقت الفعلي (Real-Time EXPO-FT) يقترح البحث إطار عمل Real-Time EXPO-FT، الذي يقوم بفصل توليد الأفعال التعبيرية البطيئة عن تعديل الأفعال التفاعلية السريعة لتمكين الضبط الدقيق لتعلم التعزيز تحت قيود الوقت الفعلي. يعتمد هذا النهج على EXPO-FT، وهو نظام تعلم تعزيز فعال من حيث العينات لضبط نماذج VLA، ويدمج معه مفاهيم التجزئة في الوقت الفعلي أثناء التدريب (Training-Time Real-Time Chunking - RTC).
تتكون البنية الأساسية من ثلاثة مكونات تعمل على أزمنة مختلفة:
توليد أفعال VLA غير المتزامن (بطيء): تعمل سياسة أساسية ضخمة ومسبقة التدريب (πVLA) بشكل غير متزامن في الخلفية. تقوم بتوليد عدة مجموعات مرشحة من الأفعال (Action Chunks) بناءً على ملاحظة st والبادئة الملتزم بها (at:t+dprev) من المجموعة السابقة لمراعاة تأخير الاستنتاج d. تستخدم هذه الخطوة تقنية "مطابقة التدفق" (Flow-matching) لأخذ عينات متنوعة.
التعديلات المتزامنة السريعة (سريع): بمجرد وصول الروبوت إلى وقت التنفيذ t+d والحصول على أحدث ملاحظة st+d، تقوم سياسة تعديل خفيفة الوزن (πedit) بعملية اتخاذ قرار تفاعلي. تأخذ هذه السياسة مجموعات الأفعال المرشحة التي ولدتها الـ VLA وتقوم بتعديلها بناءً على الحالة الحالية لتصحيح أي تغييرات حدثت في الحالة خلال فترة تأخير الاستنتاج.
الاختيار عبر دالة Q (Selection via Q-Function): تقوم دالة Q متعلمة (Qϕ) بتقييم كل من مرشحات VLA الأصلية والمرشحات المعدلة تحت الحالة الحالية st+d. يختار النظام مجموعة الأفعک (Action Chunk) ذات قيمة Q الأعلى للتنفيذ.
إجراء التدريب
الضبط الدقيق لـ VLA: يتم ضبط نموذج VLA الأساسي باستخدام هدف "مطابقة تدفق" معدل يحاكي تأخير الاستنتاج أثناء التدريب. يتم حجب الخسارة (Loss Masking) لاستبعاد أول d من الأفعال (نافذة التأخير)، مما يجبر النموذج على تعلم التنبؤ بالأفعال المتبقية مشروطة بالبادئة الملتزم بها.
تدريب سياسة التعديل: يتم تدريب سياسة التعديل لتعظيم قيمة Q للأفعال المعدلة، مما يسمح لها فعلياً بتحريك مخرجات السياسة الأساسية نحو مناطق ذات قيمة أعلى في فضاء الأفعال.
تدريب الناقد (Critic Training): يتم تدريب الناقد باستخدام تعلم الفرق الزمني (Temporal-difference learning) على مجموعات الأفعال الكاملة. ولتقليل التكلفة الحسابية أثناء عملية "Bellman backup"، تستخدم الطريقة آلية تصفية في فضاء الضجيج (مستوحاة من FASTER). يقوم ناقد خفيف الوزن (Qψdn) بتقييم نواقل الضجيج المرشحة قبل عملية فك الترميز الكاملة، مما يسمح للنظام بتصفية المرشحين في فضاء الضجيج وإجراء عملية فك ترميز واحدة فقط لنموذج VLA للمرشح الأفضل قبل تطبيق التعديلات.
المساهمات الرئيسية
إطار عمل لتعلم التعزيز في الوقت الفعلي: يقدم البحث أول إطار عمل يتيح الضبط الدقيق لتعلم التعزيز لنماذج VLA الضخمة مع مراعاة تأخير الاستنتاج صراحةً مع الحفاظ على ترددات التحكم في الوقت الفعلي.
بنية تحكم مفصولة: يقترح الفصل بين توليد السلوك عالي السعة والبطيء (VLA) وتصحيح الحالة التفاعلي السريع (Edit Policy)، مما يسمح للنظام بالاستفيد من المعرفة المسبقة لـ VLA مع الاحتفاظ بالقدرة على التفاعل.
التكيف الفعال من حيث العينات: من خلال الجمع بين كفاءة العينات في EXPO-FT واستراتيجيات التنفيذ في الوقت الفعلي، يحقق الأسلوب تكيفاً سريعاً مع البيئات الديناميكية بأقل قدر من البيانات عبر الإنترنت.
النتائج التجريبية قام المؤلفون بتقييم Real-Time EXPO-FT على اختبار Kinetix (10 مهام محاكاة) وأربع مهام واقعية ديناميكية (تمرير الأشياء للروبوت، موازنة الكرة، ركل كرة القدم، والالتقاط الديناميكي للأشياء).
المحاكاة: في اختبار Kinetix، حقق Real-Time EXPO-FT أفضل أداء بين الطرق المتأخرة وغير المتأخرة في 10 من أصل 10 بيئات. وقد تفوق بشكل كبير على النماذج المرجعية المتأخرة (DSRL، وEXPO-FT مع أو بدون RTC)، بل وتجاوز نموذج RLPD غير المتأخر (بنسبة نجاح متوسطة 96.2% مقابل 81.4%) رغم عمله مع تأخير استنتاج قدره 4 خطوات.
الواقع الحقيقي: في التجارب الواقعية التي اقتصرت على 10 دقائق من بيانات الروبوت عبر الإنترنت، رفع Real-Time EXPO-FT متوسط معدل نجاح السياسة من 42% (12.5/30) إلى 97% (29/30). حقق أداءً يقترب من المثالية (30/30) في مهام الالتقاط الديناميكي وتمرير الأشياء، و28/30 في موازنة الكرة وركل كرة القدم، متفوقاً بشكل كبير على جميع النماذج المرجعية.
المتانة: أظهرت الطريقة أداءً مستقراً عبر تأخيرات الاستنتاج وسرعات البيئة المتفاوتة، بينما تدهورت النماذج المرجعية مثل RTC بشكل ملحوظ مع زيادة التأخير.
الأهمية والادعاءات يدعي البحث أن Real-Time EXPO-FT ينجح في سد الفجوة بين الموثوقية العالية للضبط الدقيق لتعلم التعزيز والقدرة التفاعلية المطلوبة للتحكم في المهام الواقعية الديناميكية. ومن خلال نمذجة تأخير الاست الاستنتاج صراحةً وفصل توليد الفعل عن التنفيذ، يسمح هذا الأسلوب بنشر نماذج VLA الضخمة في حلقات تحكم عالية التردد دون التضحية بالأداء. وتثبت النتائج أنه من الممكن تحقيق تكيف سريع وفعال من حيث العينات مع الديناميكيات الواقعية الصعبة دون تدخل بشري أثناء التدريب، والتغلب على الانزياح في التوزيع الناتج عن تأخير النموذج.
القصور يقر المؤلفون بأن تنفيذهم الحالي يعتمد على المشغلين البشر لإعادة ضبط البيئة، مما يضيف عبئاً تشغيلياً. بالإضافة إلى ذلك، تعتمد إشارة المكافأة على مصنفات نجاح خاصة بالمهمة (قائمة على القواعد أو متعلمة)، مما يتطلب تصميماً يدوياً لكل مهمة جديدة. ويشير البحث إلى أن أتمتة عمليات إعادة الضبط واستكشاف صيغ بديلة للمكافآت تظل أسئلة مفتوحة للعمل المستقبلي.