SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation
إن SWIM هو إطار عمل مرتكب على الرؤية واللغة، يُمكّن الروبوتات المستمرة اللينة من أداء عمليات معالجة تفاعلية معقدة لكامل الجسم عبر دمج سياسة (VLA) قائمة على الانتشار مع الاستقبال الحسي البصري اللين لتوليد تسلسلات تشغيل قابلة للتنفيذ تستفيد من الامتثال الجوهري من أجل تنفيذ فيزيائي قوي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الروبوتات، يوجد انقسام واضح بين الآلات المبنية من هياكل معدنية صلبة وتلك المصنوعة من مواد ناعمة ومرنة. تتحرك الروبوتات الصلبة، مثل الأذرع التي تُرى في مصانع السيارات، بيقين مبرمج مسبقاً ودقة عالية، لكنها تواجه صعوبة عندما تحتاج إلى التسلل في مساحات ضيقة أو التعامل مع أشياء غير منتظمة وحساسة دون سحقها. وفي المقابل، تُصنع الروبوتات اللينة من مواد مطاوعة يمكنها الانحناء والتمدد والالتواء مثل الأنسجة الحية. تتيح هذه المرونة لها الالتفاف حول الأشياء وتكييف شكلها مع محيطها، مما يقدم حلاً محتملاً للمهام في المساحات الضيقة أو للتفاعل بأمان مع البشر. ومع ذلك، فإن هذه المرونة ذاتها تخلق مشكلة جديدة: التحكم في جسد يمكن أن يتشوه بطرق لا حصر لها هو أمر صعب للغاية. فعندما يعطي الإنسان أمراً بسيطاً مثل "التقط ذلك"، يستطيع الروبوت الصلب حساب مسار واحد لتحريك يده، أما الروبوت اللين، وبما أن جسده بالكامل قادر على تغيير شكله، فعليه أن يكتشف كيفية ليّ كامل هيئته لتحقيق الهدف نفسه، وهي مهمة تتطلب ليس فقط فهم الشيء المراد التقاطه، بل وفهم الهندسة المعقدة للروبوت نفسه في الوقت الفعلي.
قام باحثون مؤخراً بتطوير نظام جديد يسمى SWIM لحل هذا التحدي تحديداً، حيث يعلم الروبوت اللين فهم اللغة والمشاهد البصرية لأداء عمليات التحكم بالجسم بالكامل. ركز الفريق على روبوت حلزوني الشكل يعمل بواسطة الكابلات، بشكل يشبه الطريقة التي تسحب بها العضلات العظام، مما يسمح له بالالتفاف والوصول والالتفاف حول الأشياء. تمثلت الصعوبة الجوهرية التي عالجوها في أن الطرق السابقة كانت غالباً ما تحاول التحكم في هذه الروبوتات من خلال التركيز فقط على طرف الذراع، متجاهلة الشكل المعقد لبقية الجسم. وقد فشل هذا النهج لأن موقع الطرف لا يصف بشكل كامل كيفية انحناء بقية جسم الروبوت أو كيفية ملامسته للعالم. ولإصلاح ذلك، أنشأ الباحثون نظام تعلم ينظر إلى شكل جسم الروبوت بالكامل، والمشهد البصري، والتعليمات المنطوقة في آن واحد. لقد دربوا هذا النظام في بيئة محاكاة حيث يمكن للروبوت التدرب آلاف المرات، ليتعلم التنبؤ بتسلسل من حركات الكابلات التي من شأنها تحقيق هدف ما، مثل إبعاد شيء ما، أو الوصول إلى هدف، أو الإمساك به.
يكمن الابتكار الرئيسي في طريقتهم في تقنية يسمونها "الإدراك الحسي البصري اللين" (visual soft proprioception). وببساły، يعني هذا أن الروبوت يتعلم "رؤية" شكل جسمه من خلال صورة كاميرا، مكملاً معرفته الداخلية لشد الكابلات. خلال التدريب، استخدم النظام متجه طول الوتر الحالي كمدخل للإدراك الحسي لفهم تكوينه، بينما عُرضت عليه أيضاً الإحداثيات الدقيقة لعدة نقاط على طول جسم الروبوت في المحاكاة. ومن خلال إجبار النموذج الحاسوبي على التنبؤ بمواقع هذه النقاط، تعلم النظام الاحتفاظ بخريطة ذهنية لهندسة الروبوت. وقد سمح له ذلك بفهم أنه للوصول إلى جسم معين، قد يحتاج الروبوت إلى ثني قسمه الأوسط بشكل مختلف عما قد يفعله لإبعاد شيء ما. بالإضافة إلى ذلك، بدلاً من محاولة التنبؤ بمسار واحد مثالي نحو الهدف، تعلم النظام التنبؤ بنطاق من الحركات الناجحة الممكنة. وهذا أمر بالغ الأهمية، لأنه مع وجود جسم لينة، غالباً ما تكون هناك طرق مختلفة عديدة للالتفاف حول جسم ما، وكان على النظام أن يكون مرناً بما يكفي لاختيار أي خيار صالح بدلاً من التعثر في خطة واحدة جامدة.
اختبر الباحثون هذا النهج بطريقتين: أولاً في محاكاة حاسوبية، ثم على الروبوت الحقيقي. في المحاكاة، حقق النظام نجاحاً ملحوظاً، حيث أتم مهام الإبعاد بنسبة 100%، والوصول إلى الأهداف بنسبة 96%، والإمساك بالأشياء بنسبة 88%. وكانت هذه النتائج أفضل بكثير من الطرق الأخرى التي لم تستخدم الوعي بشكل الجسم أو نموذج التنبؤ المرن. ومع ذلك، كان الاختبار الحقيقي عندما نقلوا النظام إلى العالم الحقيقي. فعندما حاولوا تشغيل "دماغ" الروبوت مباشرة على الآلة الفيزيائية، وربطه بالكاميرا والمحركات في الوقت الفعلي، انخفض الأداء بشكل حاد. فقد فشل الروبوت في الإمساك بالأشياء في 75% من المحاولات، ويرجع ذلك أساساً إلى التأخيرات الطفيفة في المعالجة والاختلافات بين المحاكاة والواقع التي جعلت الروبوت يعمل بناءً على معلومات قديمة.
وللتغلب على ذلك، قدم الباحثون استراتيجية نشر ذكية. فبدلاً من مطالبة الروبوت بالتفكير والاستجابة في الوقت الفعلي أثناء حركته، جعلوا يقوم بتخطيط تسلسل الحركات بالكامل في محاكاة افتراضية أولاً. ينظر الروبوت إلى العالم الحقيقي، وينشئ نسخة رقمية مطابقة للمشهد، ثم يمر عبر المهمة في عقله، مولداً قائمة كاملة من الأوامر. وبمجرد أن يصبح هذا التسلسل الكامل جاهزاً، ينفذه الروبوت دون توقف للنظر أو التفكير مجدداً. ولأن جسم الروبوت لين ومرن بطبيعته، فإنه يمكنه التعامل مع الصدمات الطفيفة واختلافات التلامس من تلقاء نفسه دون الحاجة إلى تصحيح حاسوبي مستمر. وعندما استخدموا طريقة "التخطيط ثم التنفيذ" هذه، ارتفعت معدلات نجاح الروبوت الفيزيائي مجدداً لتصل إلى 100% في الإبعاد، و80% في الوصول، و75% في الإمساك. وقد أثبت ذلك أنه من خلال الجمع بين الفهم العميق لشكل الروبوت الخاص واستراتيجية تستفيد من مرونته الفيزيائية الطبيعية، يمكن توجيه الروبوتات اللينة عبر لغة بسيطة لأداء مهام معقدة تعتمد على حركة الجسم بالكامل، والتي كانت بعيدة المنال في السابق.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.