CycleVLA: Proactive Self-Correcting Vision-Language-Action Models via Subtask Backtracking and Minimum Bayes Risk Decoding
يُعد CycleVLA نظاماً استباقياً ذاتي التصحيح لنماذج الرؤية واللغة والعمل (Vision-Language-Action)، حيث يتنبأ بالإخفاقات الناشئة ويتعافى منها من خلال التراجع عن المهام الفرعية وفك ترميز الحد الأدنى من مخاطر بايز (Minimum Bayes Risk decoding)، مما يتفوق بشكل كبير على النماذج المرجعية الحالية في كل من مهام المحاكاة ومهام التلاعب الروبوتية في العالم الحقيقي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيفية صنع شطيرة. تقول له: "ضع اللحم على الخبز". قد يلتقط روبوت قياسي قطعة اللحم، ويمشي نحو الخبز، ثم يسقطها على الأرض لأنه لم يلاحظ أن قابضته مائلة قليلاً. وبحلول الوقت الذي يدرك فيه أن اللحم أصبح على الأرض، تكون الشطيرة قد فسدت. يتعين عليه البدء من الصفر، أو الأسوأ من ذلك، يترك الفوضالية خلفه فحسب. هكذا تعمل معظم "أدمغة" الروبوتات الحالية: فهي لا تدرك أنها ارتكبت خطأً إلا بعد وقوع الكارثة بالفعل.
لكن البشر مختلفون. إذا شعرت بكأس تنزلق من يدك، فإنك تشد قبضتك قبل أن تتحطم. إذا رأيت سيارتك تنحرف نحو الرصيف، فإنك توجهها للعودة قبل أن تصطدم. يُسمى هذا التصحيح الذاتي الاستباقي. وهو القدرة على استشعار أن شيئًا ما يسير بشكل خاطئ أثناء القيام به وإصلاحه فورًا. يحاول مجال الروبوتات منح الروبوتات هذه القوة الخارقة ذاتها. ولتحقيق ذلك، يستخدم الباحثون نماذج الرؤية واللغة والحركة (VLA). فكر في هذه النماذج كأنها روبوتات يمكنها رؤية العالم (الرؤية)، وفهم تعليماتك المنطوقة (اللغة)، ومعرفة كيفية تحريك أذرعها بدقة للقيام بالمهمة (الحركة). السؤال الكبير هو: هل يمكننا تعليم هذه الروبوتات أن تكون حذرة وواعية بذاتها مثل البشر، بحيث تكتشف أخطاءها قبل أن تتحول إلى إخفاقات؟
تقدم هذه الورقة نظامًا جديدًا يسمى CycleVLA، والذي يمنح الروبوتات آلية "فرصة ثانية" للإمساك بالأخطاء قبل أن تفسد المهمة. بدلاً من انتظار وقوع التصادم، يعمل CycleVLA مثل مدرب يقظ يقف بجانب الروبوت، يراقب كل خطوة. يقوم النظام بتقسيم المهام الكبيرة إلى خطوات صغيرة يمكن التحكم بها (مثل "التقط اللحم" و"ضعه على الخبز"). ومع انتهاء الروبوت من كل خطوة صغيرة، يتحقق النظام من تقدمه. إذا كان الروبوت على وشك الانتهاء من خطوة ما ولكنه يبدو مهتزًا بعض الشيء — مثل قابضة ليست محاذية تمامًا — يتوقف النظام ويطلب من "عقل ذكي" قوي (نموذج رؤية ولغة) إلقاء نظرة.
يعمل هذا العقل الذكي كالمحقق؛ إذ يسأل: "هل أوشك الروبوت على إسقاط اللحم؟". إذا كانت الإجابة بنعم، فإن الروبوت لا ينتظر السقوط. بدلاً من ذلك، يضغط على زر "إعادة التشغيل" (Rewind). يعود إلى بداية تلك الخطوة المحددة، تمامًا مثل شخصية في لعبة فيديو تعيد الظهور عند آخر نقطة حفظ (Checkpoint). ثم يحاول مجددًا، ولكن هذه المرة يستخدم خدعة خاصة تسمى فك التشفير باستخدام الحد الأدنى من مخاطر بايز (MBR decoding). تخيل أن الروبوت يحاول تخمين أفضل طريقة لتحريك ذراعه؛ فبدلاً من اختيار تخمين واحد فقط، فإنه يولد ثمانية تحركات محتملة مختلفة، ويطلع على جميعها، ثم يختار التحرك الذي يتفق الجميع على أنه الأكثر أمانًا والأكثر احتمالية للنجاح. هذا التحرك القائم على "الإجماع" يكون أكثر موثوقية بكما.
اختبر الباحثون هذا في طريقتين: في محاكاة حاسوبية وعلى ذراع روبوت حقيقي. في عمليات المحاكاة، طرحوا أنواعًا مختلفة من المشكلات على الروبوتات، مثل تحريك الأشياء أو تغيير الإضاءة. تمكن نظام CycleVLA من إصلاح حوالي 80% من الأخطاء التي أُدخلت عمدًا في النظام. وفي الروبوت الحقيقي، حقق معدل نجاح بنسبة 91% في مهام صعبة، مثل تعليق إبريق شاي على وتد صغير حيث لم تكن هناك مساحة تزيد عن 1.5 سم. وحتى عندما كان الروبوت "غير مدرب كفاية" (بمعنى أنه لم يتدرب بما يكفي وكان عادةً سيئًا في المهمة)، ساعده نظام CycleVLA على الأداء بشكل أفضل بكثير، ليقترب من أداء روبوت مدرب بالكامل.
تجادل الورقة ضد فكرة وجوب انتظار الروبوتات حتى تفشل لكي تتعلم أو تصحح مسارها. وتظهر أنه من خلال تقسيم المهام، ومراقبة علامات التحذير، وامتلاك استراتيجية "الرجوع وإعادة المحاولة"، يمكن جعل الروبوتات أكثر قوة ومتانة. ومع ذلك، يوضح المؤلفون بحذر أن هذا ليس حلًا سحريًا لكل شيء؛ فالنظام يعتمد على قدرة الروبوت على "إعادة الحالة الفيزيائية" (Rewind physical state)، وهو أمر قد يكون صعبًا في البيئات الفوضوية حيث لا يمكن التراجع عن الأشياء. أيضًا، إن فحص الأخطاء وتوليد تخمينات متعددة يستغرق وقتًا وقوة حوسبة أكبر من مجرد تنفيذ المهمة مرة واحدة. ولكن في الوقت الحالي، يشير نظام CycleVLA إلى أن منح الروبوتات "فحصًا داخليًا" استباقيًا هو وسيلة قوية لجعلها أكثر أمانًا وموثوقية كمساعدين.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.