Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
تقدم هذه الورقة TacThru، وهو مستشعر "رؤية عبر الجلد" قادر على الإدراك البصري واللمسي القوي في آن واحد، وTacThru-UMI، وهو إطار عمل للتعلم بالتقليد يدمج هذه الإشارات متعددة الوسائط عبر سياسة انتشار قائمة على المحولات (Transformer-based Diffusion Policy) لتحسين أداء التلاعب الروبوتي بشكل كبير في المهام المعقدة.
تخيل أنك تحاول التقاط حبة عنب صغيرة ومنزلقة وأنت ترتدي قفازات فرن سميكة وثقيلة. يمكنك الشعور بأن هناك "شيئاً ما" موجود، لكن لا يمكنك رؤية مكانه بدقة أو كيف يتحرك. الآن، تخيل أنك تحاول التقاط خصلة شعر واحدة وأنت ترتدي قفازات حريرية رقيقة. يمكنك رؤية الشعر، لكن حاسة اللمس لديك باهتة جداً لدرجة أنك لا تستطيع معرفة ما إذا كنت قد أمسكت به بالفعل.
في عالم الروبوتات، تعاني معظم "الأصابع" من هذه المشكلة تحديداً: فهي إما جيدة في "الرؤية" (باستخدام الكاميرات) أو جيدة في "الشعور" (باستخدام المستشعرات اللمسية)، لكنها تكافح للقيام بالاثنين في نفس الوقت، خاصة عندما يعيق الجسم الرؤية.
تقدم هذه الورقة البحثية TacThru، وهو نوع جديد من "الجلد الخارق" لأصابع الروبوت التي تحل هذه المعضلة.
المشكلة: تأثير "العصابة"
تستخدم معظم الروبوتات نهج "المفتاح" (التبديل). فعندما يمد الروبوت يده نحو جسم ما، فإنه يستخدم عينيه. ولكن في اللحظة التي يلمس فيها الإصبع الجسم، غالباً ما يحجب الإصبع نفسه رؤية الكاميرا — مثل محاولة قراءة كتاب بينما تضغط براحة يدك على الصفحة. أنت تفقد "بصرك" في اللحظة التي تحتاج فيها بشدة لرؤية كيف يتحرك الجسم.
الحل: إصبع "الجلد الزجاجي"
ابتكر الباحثون TacThru، الذي يعمل مثل عدسة لاصقة عالية التقنية للروبوت. إليكم كيف فعلوا ذلك:
الجلد الشفاف (النافذة الواضحة): بدلاً من استخدام مطاط صلب ومعتم، استخدموا مادة شفافة تماماً. هذا يسمح للكاميرا الموجودة داخل الإصبع بـ "الرؤية عبر" الجلد للنظر إلى الجسم، حتى أثناء التلامس. الأمر يشبه امتلاك إصبع مصنوع من هلام (جيلي) شفاف.
علامات الخطوط الرئيسية (النقاط السحرية): من أجل "الشعور" بالضغط، وضعوا أنماطاً خاصة صغيرة (تسمى علامات الخطوط الرئيسية) داخل الهلام الشفاف. عندما يلمس الروبوت شيئاً ما، تتمدد هذه الأنماط وتتحرك. ولأن الجلد شفاف، يمكن للروبوت تتبع هذه النقاط المتحركة بدقة، حتى لو كانت الخلفية غير واضحة. الأمر يشبه مراقبة كيفية تمدد نمط على بالون عند ضغطه.
الدماغ (TacThru-UMI): لم يكتفوا ببناء إصبع أفضل فحسب؛ بل بنوا دماغاً أفضل. لقد استخدموا "تعلم التقليد" (Imitation Learning)، وهو في الأساس تعليم الروبوت من خلال إظهار كيفية قيام الإنسان بذلك. يتعلم دماغ الروبوت الاستماع إلى "العين" و"اللمس" في آن واحد، ويقرر أيهما يثق به أكثر في تلك اللحظة.
لماذا يهم هذا (القوى الخارقة)
بفضل هذا الاستشعار المزدوج، اكتسب الروبوت ثلاث "قوى خارقة" جديدة:
لمسة "الشبح": يمكنه اكتشاف الأشياء الرقيقة والناعمة للغاية، مثل قطعة واحدة من ورق المناديل، والتي عادة ما "تُربك" المستشعرات اللمسية التقليدية.
رؤية "الأشعة السينية": يمكنه التمييز بين برغيين يبدوان متطابقين بالنسبة لكاميرا عادية، لكنهما يشعران بشكل مختلف قليلاً، أو رؤية لون برغي صغير لا تستطيع كاميرا المعصم رؤيته بسبب بُعد المسافة.
رد الفعل "التكيفي": إذا كان الروبوت يحاول وضع غطاء على زجاجة وحُجبت رؤيته، فإنه لا يصاب بالذعر. فهو ينتقل تلقائياً من "استخدام عينيه" إلى "استخدام لمسه" لإتمام المهمة، تماماً كما قد تجد ثقب المفتاح في الظلام عن طريق اللمس.
الخلاصة
يحول TacThur إصبع الروبوت من أداة فظة إلى عضو حسي متطور. ومن خلال السماح للروبوتات بـ الرؤية عبر جلدها الخاص، يمكنها أخيراً التعامل مع المهام الدقيقة، الفوضوية، والمعقدة التي يقوم بها البشر يومياً دون كسر الأشياء أو إسقاطها.
يتطلب التحكم الروبوتي انتقالاً سلسًا من مرحلة ما قبل التلامس (الاقتراب) إلى مرحلة ما بعد التلامس (التفاعل). تواجه وسائط الاستشعار الحالية "فجوة إدراكية":
الرؤية (Vision): توفر سياقًا عالميًا ولكنها تعاني من الانسداد (occlusions) الشديد أثناء مرحلة التحكم الفعلية.
المستشعرات اللمسية القائمة على الرؤية (VBTS): توفر بيانات تلامس عالية الدقة ولكنها تكون "عمياء" خلال مرحلة الاقتراب، وتوفر فقط إشارات محلية متفرقة.
مستشعرات "الرؤية عبر الجلد" (STS) الموجودة: بينما تحاول الجمع بين الاثنين، إلا أنها تعتمد عادةً على تبديل الأنماط (mode-switching) (مثل تغيير الإضاءة أو تحريك الأجزاء الميكانيكية)، مما يؤدي إلى تعقيد في التحكم، وزمن استجابة (latency)، ويمنع الإدراك متعدد الوسائط المتزامن حقًا. علاوة على ذلك، فإن تتبع العلامات (markers) في مستشعرات STS غالبًا ما يكون غير موثوق بسبب الخلفيات الضوضائية وغير المتوقعة.
أ. تصميم مستشعر TacThru: لتحقيق الإدراك المتزامن دون تبديل الأنماط، يتبع المستشعر ثلاثة مبادئ تصميم أساسية:
المادة المرنة الشفافة والإضاءة المستمرة: على عكس مستشعرات VBTS التقليدية غير الشفافة، يستخدم TacThru مادة مرنة شفافة تمامًا وإضاءة LED ثابتة. وهذا يسمح للكاميرا بالرؤية من خلال "الجلد" لإدراك قرب الجسم ومظهره، مع اكتشاف التلامس في الوقت نفسه عبر تغيرات انعكاس الضوء وتشوه العلامات.
علامات الخطوط الرئيسية (Keyline Markers): لحل مشكلة عدم وضوح العلامات أمام الخلفيات الشفافة أو اختلاطها بضوضاء البيئة، قدم المؤلفون "علامات الخطوط الرئيسية" — وهي دوائر متمركزة (داخلية سوداء وخارجية بيضاء). يضمن ذلك بقاء الحافة قابلة للكشف بغض النظر عن الخلفية.
تتبع العلامات القوي: تم تنفيذ خوارزمية تتبع تعتمد على مرشح كالمان (Kalman filter) للحفاظ على حالة العلامة (xt) رغم ضوضاء البيئة. وتستخدم الخوارزمية خطوة ربط البيانات لاستبعاد الكتل (blobs) الناتجة عن "الإيجابيات الكاذبة" من البيئة، مما يحقق وقت معالجة فعال يبلغ حوالي 6.08 مللي ثانية لكل إطار.
ب. إطار التعلم TacThru-UMI: يوسع المؤلفون واجهة التحكم العالمية (UMI) وسياسة الانتشار (Diffusion Policy) للتعامل مع التدفقات متعددة الوسائط:
ترميز متعدد الوسائط (Multimodal Tokenization): يقوم النظام بتشفير صور كاميرا المعصم (عبر DINOv2 ViT-B)، وصور مستشعر TacThru (عبر DINOv2 ViT-S)، وانحرافات العلامات (عبر MLP)، والوعي بالحالة الجسدية (Proprioception) (عبر MLP) إلى رموز (tokens) موحدة.
سياسة الانتشار القائمة على المحولات (Transformer-based Diffusion Policy): يتعلم هيكل المحول (Transformer) الانتباه إلى هذه الإشارات المتنوعة ديناميكيًا، مما يسمح للروبوت بالتبديل بين الاستراتيجيات التي تعتمد بكثافة على الرؤية والاستراتيجيات التي تعتمد بكثافة على اللمس بناءً على سياق المهمة.
3. المساهمات الرئيسية
ابتكار عتادي: مستشعر STS جديد يتيح إدراكًا لمسيًا وبصريًا متزامنًا حقًا دون الحاجة إلى تبديل الأنماط الميكانيكي أو الإضاءة.
إدراك قوي: تقديم علامات الخطوط الرئيسية واستراتيجية ترشيح كالمان متخصصة تتيح تتبعًا لمسيًا مستقرًا وعالي التردد (يصل إلى 120 هرتز) في البيئات المعقدة.
التكامل التعلمي: إطار العمل TacThru-UMI، الذي يوضح كيفية دمج الرموز البصرية عالية الأبعاد مع الإشارات اللمسية/الجسدية منخفضة الأبعاد بفعالية باستخدام التعلم بالتقليد الحديث.
4. النتائج التجريبية
تم تقييم النظام في خمس مهام واقعية صعبة (الالتقاط والوضع، سحب الأنسجة، فرز البراغي، تعليق المقص، وإدخال الغطاء).
معدلات نجاح متفوقة: حقق TacThru-UMI متوسط معدل نجاح قدره 85.5%، متفوقًا بشكل كبير على الأساس المعتمد على اللمس فقط (66.3%) والأساس المعتمد على الرؤية فقط (55.4%).
التعامل مع الأجسام الرقيقة/الناعمة: في مهمة "سحب الأنسجة"، حيث فشلت المستشعرات اللمسية التقليدية في اكتشاف التلامس بسبب انخفاض الضغط، نجح TacThru باستخدام التغذية الراجعة البصرية لمراقبة موضع النسيج.
التمييز البصري: في مهمة "فرز البراغي"، نجح المستشعر في التمييز بين البراغي ذات الألوان والأشكال المختلفة التي كانت أصغر من أن تحلها كاميرا المعصم، وأكثر تشابهًا هندسيًا من أن يتم رصدها باللمس الصرف.
السلوك التكيفي: في مهمة "إدخال الغطاء"، أظهرت السياسة ذكاءً ناشئًا: حيث استخدمت التحكم البصري (visual servoing) عندما كان الهدف مرئيًا، وانتقلت تلقائيًا إلى المحاذاة القائمة على اللمس عندما أصبح المنظر محجوبًا.
5. الأهمية
يعمل هذا العمل على جسر الفجوة بين التوجيه البصري عالي المستوى والدقة اللمسية منخفضة المستوى. ومن خلال إثبات أن المشفرات البصرية المدربة مسبقًا (مثل DINOv2) يمكن استخدامها بفعالية مع عتاد لمسي جديد، يوفر المؤلفون مسارًا قابلاً للتوسع لدمج الاستشعار المعقد متعدد الوسائط في خطوط أنابيب تعلم الروبوت الحالية. وهذا يمكّن الروبوتات من التعامل مع مجموعة أوسع من الأجسام — لا سيما تلك الرقيقة أو الناعمة أو التي تتطلب دقة بمستوى المليمتر — مما يجعلها أكثر قدرة في البيئات الواقعية غير المهيكلة.