Compliance for Free: Learning Identifiable Impedance via Bilateral Teleoperation
تقترح هذه الورقة طريقة تستخدم التحكم عن بُعد ثنائي الاتجاه رباعي القنوات لتحديد وتسجيل صلابة المشغل من مستشعرات عزم دوران المفاصل الموجودة، مما يتيح الضبط الدقيق لنماذج الفعل واللغة والرؤية لتوليد تسميات امتثال تعتمد على الاتجاه بتكلفة ترميز صفرية للمهام الغنية بالتلامس.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
أصبحت الروبوتات بارعة بشكل ملحوظ في رؤية العالم واتخاذ القرار بشأن حركتها التالية. يمكن للذكاء الاصطناعي الحديث أن ينظر إلى صورة لغرفة فوضوية ويخبر ذراعاً روبوتية بدقة كيف تلتقط كوباً أو تفتح درجاً. ولكن هناك خطوة نهائية وحرجة تتعلق بالتعثر غالباً: اللحظة التي تلمس فيها شيئاً ما. فبينما يمكن إخبار الروبوت أين يذهب، فإنه يعاني لمعرفة مدى قوة الدفع المطلوبة. المهام التي تتطلب لمسة لطيفة، مثل مسح سبورة بيضاء دون خدشها، أو إدخال وتد في ثقب ضيق، تعتمد على خاصية تسمى "الامتثال" (compliance). وهذا هو القدرة على الاستجابة للضغط أو مقاومته بطريقة محكومة. ولفترة طويلة، كان تعليم الروبوت هذه المهارة أمراً صعباً لأن الطرق القياسية التي يُظهر بها البشر للروبوتات ما يجب فعله تسجل فقط الموقع النهائي للروبوت، وهي تغفل عن القوة غير المرئية التي كان يطبقها الإنسان، مما يترك الروبوت في حالة تخمين عما إذا كان يجب أن يكون صلباً أم ناعماً.
وجد فريق من الباحثين في برشلونة طريقة لحل هذه المعلومة المفقودة دون إضافة مستشعرات قوة أو لمس باهظة الثمن. فقد اكتشفوا أنه باستخدام نوع معين من إعدادات التحكم عن بعد، يمكنهم رياضياً فصل الهدف المقصود من قبل الإنسان عن القوة التي طبقها باستخدام مستشعرات عزم دوران المفاصل الموجودة بالفعل في الذراع الروبوتية. وفي تجاربهم، قام مشغل بشري بالتحكم في ذراع روبوتية عبر نظام حيث تحرك ذراعه الخاصة ذراعاً روبوتية ثانية مطابقة لها. ومن خلال مراقبة كيفية حركة ذراع المشغل مقارنة بكيفية حركة الذراع الروبوتية الفعلية، تمكن الباحثون من حساب مدى الصلابة أو النعومة التي أرادها المشغل في كل لحظة بدقة. وقد استخدموا هذه البيانات الجديدة لتدريب نموذج ذكاء اصطناعي يمكنه الآن استقبال تعليمات بسيطة منطوقة، مثل "امسح هذه العلامة بقوة"، ويعدل صلابته لتطابق ذلك، بدلاً من مجرد التحرك إلى موقع ما.
إن جوهر المشكلة التي عالجها الباحثون هو الارتباك الذي يحدث عندما نحاول تعليم الروبوت من خلال مراقبة الإنسان. تخيل إنساناً يدفع ذراع روبوت ضد جدار. إذا انتهى بالروبوت إلى مكان معين، فنحن لا نعرف ما إذا كان الإنسان قد دفع بقوة ضد زنبرك صلب أو بلطف ضد زنبرك ناعم؛ فكلا السيناريوهين يمكن أن يؤديا إلى وصول الروبوت إلى نفس المكان بالضبط. أجهزة التسجيل القياسية ترى فقط الموقع النهائي، لذا لا يمكنها التمييز بينهما. وهذا يجعل من المستحيل تعليم الروبوت مفهوم "القوة" مقابل "اللطف" بمجرد مراقبة أين ذهب الروبوت. أدرك الباحثون أنه لإصلاح ذلك، يحتاجون إلى قياس ثانٍ مستقل لمكان ما أراد الإنسان الذهاب إليه، متميزاً عن المكان الذي انتهى إليه الروبوت بالفعل.
ولحل ذلك، استخدموا نظام تحكم عن بعد ثنائي القنوات مكون من أربع قنوات. في هذا الإعداد، يمسك إنسان بذراع روبوت "قائد"، وتحاول ذراع روبوت "تابع" تقليدها. ومن الأهمية بمكان أن النظام لا يرسل أوامر الموقع فحسب؛ بل يرسل أيضاً معلومات القوة ذهاباً وإياباً. فعندما يصطدم الذراع التابع بعائق، يشعر الإنسان بتلك المقاومة في يده. ولأن الإنسان يشعر بالاتصال بنشاط، فإن حركة ذراعه نفسها تمثل نيته الحقيقية، بينما يظهر تحرك الذراع التابع كيفية تفاعل الروبوت مع البيئة. ومن خلال مقارنة مسار القائد بمسار التابع، استطاع الباحثون حساب الفرق بين المكان الذي أراد الإنسان الوصول إليه والمكان الذي كان يتواجد فيه الروبوت بالفعل. هذا الفرق، مقترناً بالقوة التي شعر بها الروبوت (والتي تم تقديرها باستخدام مستشعرات عزم دوران المفاصل الأصلية للروبوت)، سمح لهم بالعمل عكسياً وتحديد درجة الصلابة التي كان يطبقها الإنسان بدقة.
باستخدام هذه الطريقة، جمع الفريق مجموعة كبيرة من العروض التوضيحية حيث قام البشر بمسح سبورة بيضاء. لقد وجهوا البشر لمسح علامات على السبورة إما "بشكل طبيعي" أو "بقوة". وبفضل طريقة الحساب الجديدة هذه، تمكنوا من استخراج تسمية دقيقة للصلابة المستخدمة في كل لحظة من حركة المسح، دون الحاجة إلى أي مستشعرات قوة خاصة على معصم الروبوت. ثم استخدموا هذه التسميات لضبط نموذج لغوي بصري كبير، وهو نوع من الذكاء الاصطناعي الذي يفهم الصور والنصوص. لقد علموا هذا النموذج أن يخرج ليس فقط موقعاً مستهدفاً، بل أيضاً قيمة صلابة مستهدفة لكل حركة يقوم بها.
أظهرت النتائج أن هذا النهج عمل تماماً كما هو مخطط له. فعندما اختبر الباحثون سياسة الروبوت الجديدة، وجدوا أنه يمكنه حقاً تغيير مدى قوة ضغطه بناءً على التعليمات اللغوية. فعندما طُلب منه المسح "بقوة"، زاد الروبوت قوة تلامسه لتصل في المتوسط إلى 9.1 نيوتن. وعندما طُلب منه المسح "بشكل طبيعي"، خفض تلك القوة إلى 6.4 نيوتن. كان هذا التغيير ذا دلالة إحصائية ومتسقاً. في المقابل، فشلت سياسات روبوتية أخرى تم اختبارها في نفس الدراسة في تغيير سلوكها بناءً على التعليمات. بعض السياسات التي أُعطيت بيانات القوة كمدخلات ظلت تتحرك بجمود شديد، بينما لم تستطع سياسات أخرى حاولت تخمين الصلابة بناءً على قواعد ثابتة التكيف على الإطلاق. فقط السياسة التي تدربت بالتسميات المستخرجة حديثاً نجحت في ربط كلمة "بقوة" بزيادة فيزيائية في الضغط.
تحقق الباحثون أيضاً من أن الروبوت تعلم أن يكون صلباً بشكل انتقائي. فهو لم يصبح صلباً بشكل موحد في جميع الاتجاهات؛ بل أصبح صلباً في اتجاه حركة المسح لمقاومة الانحراف عن المسار، بينما ظل أكثر نعومة في الاتجاهات الأخرى. هذا السلوك متباين الخواص (anisotropic behavior)، أو الصلابة المعتمدة على الاتجاه، هو سمة متطورة تحاكي كيفية تعديل اليد البشرية طبيعياً للمهمة. حقق الروبوت نسبة نجاح قدرها 50 بالمائة في إزالة الحبر من السبورة، وهي أعلى نسبة بين السياسات الخمس المختلفة التي تم اختبارها، وفعل ذلك مع تفعيل عدد أقل من توقفات السلامة الناتجة عن القوة المفرطة.
وعلى الرغم من هذه النجاحات، تقر الدراسة بوجود بعض القيود. تعتمد الطريقة على امتلاك الروبوت لمستشعرات تقيس عزم الدوران في مفاصله، وهي شائعة في روبوتات الأبحاث ولكنها ليست موجودة دائماً في النماذج التجارية الأرخص ثمناً. كما تطلبت التقنية بقاء الروبوت في وضعية محددة أثناء المعايرة لضمان بقاء حسابات القوة دقيقة. علاوة على ذلك، كان من الصعب قياس الصلابة الدورانية، أو كيفية مقاومة الروبوت للالتواء، لأن مهمة المسح لم تتضمن حركات التواء كافية لتوليد بيانات واضحة. وأشار الباحثون إلى أنه بينما تعمل طريقتهم بشكل جيد لهذه المهمة المحددة، إلا أنها ليست حلاً عالمياً لكل أنواع التلامس التي قد يواجهها الروبوت.
تكمن أهمية هذا العمل في كيفية تجاوزه للحاجة إلى أجهزة لمس أو قوة متخصصة وباهظة الثمن لتعليم الروبوتات حول اللمس. فمن خلال استخدام مستشعرات عزم دوران المفاصل الموجودة بالفعل في ذراع الروبوت ونهج رياضي ذكي لتفسير النية البشرية، خلق الباحثون طريقة لتوليد بيانات تدريب عالية الجودة للامتثال دون تكلفة إضافية. وهذا يشير إلى أن الروبوتات يمكنها تعلم التعامل مع المهام الدقيقة أو المتغيرة القوة بشكل أكثر فعالية في المستقبل، ببساال عبر مراقبة البشر من خلال نظام يلتقط كلاً من الحركة والشعور بالمقاومة. وتثبت الدراسة أن المفتاح لتحسين لمسة الروبوت قد لا يكون مستشعرات أفضل، بل طرقاً أفضل لقراءة الإشارات التي نمتلكها بالفعل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.