← أحدث الأبحاث
💻 computer science

Visible Touch: Rendering Contact for Visuomotor Policies

تقدم هذه الورقة البحثية "اللمس المرئي" (Visible Touch)، وهي طريقة تدمج التغذية الراجعة اللمسية مباشرة في الإطار البصري باستخدام مستشعر مخصص منخفض التكلفة، مما يُمكّن سياسات التحكم البصري الحركي القائمة على الصور ونماذج الرؤية واللغة والعمل المسبقة التدريب من الاستفادة من معلومات الاتصال دون تغييرات هيكلية، ويحسن معدلات نجاح عمليات المناولة بشكل كبير.

المؤلفون الأصليون: Metin Alp Dogan, Edward Sun, Feng Xu, Daniel Wu, Allen Peng, Dennis Hong, Yuchen Cui

نُشر 2026-09-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Metin Alp Dogan, Edward Sun, Feng Xu, Daniel Wu, Allen Peng, Dennis Hong, Yuchen Cui

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات بارعة في التعامل مع العالم المفتوح، حيث تجيد التحرك عبر الغرف والتعرف على الأشياء الموجودة على الرفوف. ومع ذلك، عندما يتعلق الأمر بالعمل البدني الدقيق المتمثل في الإمساك بالأشياء والتحكم بها، فإنها غالباً ما تعاني. يعتمد البشر بشكل كبير على حاسة اللمس لمعرفة متى أمسكوا بجسم ما بإحكام، أو متى لامسوا سطحاً ما، أو مدى قوة الضغط المطلوبة. وفي المقابل، تعمل الروبوتات الحديثة عادةً باستخدام عيونها فقط وحس موقع جسمها، متجاهلة التلامس الجسدي الذي غالباً ما يكون الدليل الأكثر أهمية لإنجاز المهمة. وبينما حاول العلماء منح الروبوتات القدرة على الشعور، فقد ثبت أن دمج هذا الحس في البرامج الحاسوبية التي تتحكم بها أمر صعب؛ إذ لا يكمن التحدي في بناء مستشعر فحسب، بل في تعليم "دماغ" الروبوت فهم هذا الشعور دون إجباره على تعلم طريقة تفكير جديدة تماماً.

لقد وجد فريق من الباحثين في جامعة كاليفورنيا، لوس أنجلوس، حلاً بسيطاً بشكل مفاجئ لهذه المشكلة. فقد طوروا طريقة تسمى "اللمس المرئي" (Visible Touch)، والتي تسمح للروبوتات بـ "رؤية" حاسة اللمس الخاصة بها. فبدلاً من تغذية بيانات اللمس الخام في جزء منفصل من دماغ الروبوت، يقومون بطلاء معلومات التلامس مباشرة على الصور التي تلتقطها الكاميرا التي ينظر إليها الروبوت بالفعل. تخيل روبوتاً يرتدي نظارات ترسم سهماً ملوناً صغيراً على رؤيته للعالم كلما لمست أصابعه شيئاً ما؛ يشير هذا السهم إلى اتجاه القوة ويتغير حجمه بناءً على شدة اللمس. ولأن الروبوت مدرب بالفعل على البحث عن الأنماط في هذه الصور، فإنه يفهم التلامس فوراً دون الحاجة إلى أي برمجة خاصة أو تغييرات في البنية الهيكلية.

ولجعل هذا العمل ممكناً، بنى الفريق مستشعراً مخصصاً ومنخفض التكلفة لأصابع الروبوت. وهو جهاز بسيط مصنوع من مطاط ناعم مدمج به مغناطيسات صغيرة ومستشعر يكتشف التغيرات في المجال المغناطيسي عند ضغط المطاط. هذا المستشعر غير مكلف في البته ويمكن طباعته ثلاثية الأبعاد لتناسب أي شكل تقريباً. ثم أنشأ الباحثون مساراً برمجياً يأخذ البيانات الخام من هذا المستشعر ويعرضها على بث كاميرا الروبوت في الوقت الفعلي. فإذا ضغط إصبع الروبوت الأيسر على كوب، يظهر سهم في المكان الذي يوجد فيه الكوب تماماً، موضحاً اتجاه وكثافة الضغط. يتم بعد ذلك تغذية هذه الصورة المعززة مباشرة في نظام التحكم الخاص بالروبوت، سواء كان ذلك النظام نموذج تعلم أساسياً أو ذكاءً اصطناعياً متطوراً ومدرباً مسبقاً.

كانت نتائج هذا النهج مذهلة. فقد اختبر الباحثون طريقتهم على مجموعة واسعة من المهام، من المحاكاة البسيطة إلى التحديات المعقدة في العالم الحقيقي. وفي مجموعة قياسية من مهام المحاكاة المصممة لاختبار التحكم الروبوتي، نجحت الروبوتات التي استخدمت تراكب اللمس المرئي بنسبة تزيد بمقدار 15.7 نقطة مئوية عن تلك التي اعتمدت فقط على الرؤية ووضعية الجسم. وكان التحسن أكثر دراماتيكية للروبوتات التي تستخدم نماذج الذكاء الاصطناعي المتطورة والمدربة مسبقاً، حيث قفزت معدلات النجاح بمقدار 25 نقطة مئوية في المحاكاة وبمقدار 3اً0 نقطة مئوية في المهام الواقعية. وشملت هذه المهام عمليات دقيقة مثل التقاط أنبوب اختبار، أو وضع كوب في غسالة الأطباق، أو توصيل شاحن بمقبس كهرباء — وهي سيناريوهات يكون فيها معرفة كيفية وأين يلمس الروبوت الشيء أمراً ضرورياً.

كما كشفت الدراسة أن ليست كل طرق عرض هذه المعلومات متساوية. فقد جرب الباحثون أساليب بصرية مختلفة، مثل رسم سهم واحد للإصبع بأكمله مقابل رسم سهم منفصل لكل نقطة استشعار صغيرة في الإصبع. في العالم الافتراضي، كان السهم الواحد المتوسط يعمل بشكل أفضل، ويرجع ذلك على الأرجح إلى أن كثرة التفاصيل خلقت زحاماً بصرياً أدى لتشتيت الروبوت. ومع ذلك، في العالم الحقيقي، انعكس الوضع؛ حيث حققت الروبوتات أفضل أداء عندما تمكنت من رؤية الأسهم الفردية لكل نقطة استشعار. يشير هذا إلى أن التلامس في العالم الحقيقي أكثر اتساقاً واستقراراً من المحاكاة، مما يسمّح للروبوت بالاستفيد من التفاصيل الإضافية. والمكتشف الرئيسي هو أن الطريقة تعمل عبر مختلف أنواع "أدمغة" الروبوت وتتدرج من المحاكاة البسيطة إلى البيئات الفيزيائية المعقدة.

والأهم من ذلك، أن هذا النهج يلغي الحاجة إلى مستشعرات ضخمة ومكلفة أو بنيات برمجية معقدة جديدة. لقد أثبت الباحثون أن مجرد وضع بيانات التلامس فوق البث البصري الحالي هو وسيلة أكثر فعالية لدمج اللمس من إضافته كتدفق منفصل من المعلومات أو كقائمة من الأرقام. ومن خلال التعامل مع اللمس كإشارة بصرية، سمحوا للروبوت باستخدام مهارات الاستنتاج البصري الموجودة لديه لحل المشكلات الفيزيائية. أثبتت هذه الطريقة قوتها عبر تصميمات الروبوتات المختلفة وصعوبات المهام المختلفة، حيث ظهرت أكبر المكاسب في المهام التي تتطلب خطوات متعددة وعمليات إمساك متكررة. ويشير هذا العمل إلى أن مستقبل التحكم الروبوتي قد لا يتطلب اختراع طرق جديدة تماماً لتفكير الروبوتات، بل يتطلب إيجاد طرق أفضل لإظهار ما هي قادرة بالفعل على رؤيته.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →