Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies
تقترح هذه الورقة طريقة لاتساق الأفعال عبر الرؤى المتعددة تعمل على تنظيم سياسات الرؤية-اللغة-الأفعال القائمة على التدفق لتحقيق المتانة ضد تغيرات زوايا رؤية الكاميرا والمشهد باستخدام الصور اللونية (RGB) والبيانات الحسية الخاصة فقط، مما يحسن الأداء بشكل كبير في مهام الروبوتات المحاكاتية والواقعية دون الحاجة إلى تسميات الكاميرا أو مدخلات العمق.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تصبح الروبوتات التي تتعلم من العروض البشرية أكثر قدرة بشكل متزايد، ومع ذلك، فإنها غالباً ما تعاني من هشاشة غريبة: فهي تظل مرتبطة بـوجهة النظر المحددة التي عُلّمتت منها. تخيل روبوتاً تم تدريبه على التقاط كوب بينما توضع كاميرا على رف فوق الطاولة. إذا تم تحريك هذه الكاميرا، أو إزاحتها جانباً، أو رفعها للأعلى، فقد يفشل الروبوت فجأة، رغم أن الكوب والطاولة وجسم الروبوت نفسه لم يتحركوا على الإطلاق. يحدث هذا لأن "دماغ" الروبوت، وهو نوع من الذكاء الاصطناعي الذي يربط بين ما يراه وما يجب أن يفعله، قد تعلم التعرف على المهمة بناءً على الزاوية الدقيقة للكاميرا الأصلية. في العالم الحقيقي، تتحرك الكاميرات، وتتحرك الروبوتات، وتتغير الإضاءة، لذا فإن النظام الذي لا يستطيع التكيف مع تغير وجهة النظر ليس مفيداً حقاً. حاول الباحثون حل هذه المشكلة عبر تزويد الروبوتات بمستشعرات أكثر تعقيداً، مثل كاميرات العمق التي ترى بالأبعاد الثلاثية، أو بتعليمها فهم هندسة الغرفة، لكن هذه الحلول غالباً ما تتطلب أجهزة باهظة الثمن أو معايرة معقدة يصعب الحفاظ عليها.
وجد فريق من الباحثين في جامعة تسينغ هوا وجامعة أمستردام طريقة لجعل سياسات الروبوت قوية في مواجهة حركة الكاميرا دون إضافة أي مستشعرات جديدة أو تغيير كيفية عمل الروبوت في العالم الحقيقي. لقد ركزوا على نوع محدد من متحكمات الروبوت التي تتعلم من خلال التنبؤ بـ "تدفق" الأفعال، تماماً كما يتدفق الماء نحو وجهة معينة، بدلاً من مجرد تخمين الخطوة التالية. ويكمن جوهر اكتشافهم في طريقة تدريب تجبر الروبوت على الاتفاق مع نفسه. فقد أنشأوا أزواجاً من صور التدريب التي تُظهر نفس المشهد الفيزيائي تماماً من زاويتين مختلفتين: واحدة من موقع الكاميرا الأصلي، وأخرى من موقع مُزاح قليلاً. والأهم من ذلك، أنهم تأكدوا من إخبار الروبوت بضرورة تنفيذ الفعل ذاته لكلتا الصورتين. ومن خلال تدريب الروبوت على التنبؤ بنفس تدفق الحركة لكلا المنظرين، علموه كيف يتجاهل التغيير في موقع الكاميرا ويركز فقط على المهمة المنشودة.
اختبر الباحثون هذه الفكرة في بيئة محاكاة باستخدام معيار مرجعي يسمى (LIBERO-Plus)، وهو مصمم خصيصاً لاختبار مدى قدرة الروبوتات على التعامل مع انزياح الكاميرا. وقارنوا طريقتهم الجديدة بتقنيات التدريب القياسية. عندما تم تحريك الكاميرا، نجح الروبوت المدرب بالطرق القياسية في حوالي 17% فقط من المحاولات. أما الروبوت الذي تم تدريبه على زوايا كاميرا متعددة دون قاعدتهم الخاصة للاتساق، فقد تحسن ليصل إلى معدل نجاح بنسبة 75%. ومع ذلك، فإن الروبوت الذي تدرب باستخدام قاعدة اتساق الرؤية المتقاطعة الجديدة وصل إلى معدل نجاح بلغ 87.2%. كان هذا التحسن كبيراً ومتسقاً عبر مختلف نقاط البداية العشوائية للتدريب. كما أثبت الباحثون أن النجاح اعتمد كلياً على حقيقة أن الصورتين تُظهران نفس الحالة الفيزيائية. فعندما قاموا بخلط بيانات التدريب بحيث حاول الروبوت مطابقة مشهد لكوب مع فعل مخصص لحالة مختلفة، انهار الأداء ليصل إلى 25.8% فقط، مما أظهر أن الروبوت لم يكن مجرد يقوم بتنعيم إجاباته، بل كان يتعلم حقاً ربط الرؤى المختلفة للواقع نفسه بنفس الفعل.
ولضمان أن هذه النتيجة لم تكن مجرد نتاج لمحاكاة الحاسوب، نقل الفريق طريقتهم إلى ذراع روبوت حقيقية في المختبر. لقد جمعوا بيانات التدريب باستخدام ثلاث كاميرات متزامنة تراقب نفس الطاولة، مما سمح لهم بإنشاء أزواج الرؤى اللازمة من العالم الحقيقي. ثم اختبروا الروبوت باستخدام كاميرا واحدة وُضعت في موضع لم يره أبداً أثناء التدريب. نجح الروبوت المدرب بطريقتهم الجديدة في 74.4% من اختبارات الكاميرا غير المرئية هذه، بينما نجحت الطريقة القياسية في 53.3% فقط. وكان التحسن أكثر دراماتيكية في المهام الصعبة، مثل إزالة سماعات الرأس من حاملها، حيث فشلت الطريقة القياسية تماماً في مواضع الكاميرا الجديدة، بينما نجحت الطريقة الجديدة في قرابة نصف المحاولات. تؤكد الدراسة أنه من خلال تعليم الروبوت رؤية اتساق أفعاله عبر زوايا مختلفة، يمكن جعله أكثر موثوقية في العالم الحقيقي، وكل ذلك دون الحاجة إلى كاميرات إضافية، أو مستشعرات عمق، أو خرائط هندسية معقدة. فالروبوت ببساطة يتعلم أن المهمة تظل كما هي، حتى لو تغيرت الصورة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.