← أحدث الأبحاث
💻 computer science

UniDex-ViTac: Learning Unified Visuo-Tactile Dexterous Manipulation Policy from Human Video Data

يُعد UniDex-ViTac إطار عمل يستفيد من العروض التوضيحية البشرية بالفيديو لتوليد مسارات روبوتية محاكية غنية بالتغذية الراجعة اللمسية، مما يتيح تدريب سياسة بصرية-لمسية موحدة تحقق معدلات نجاح أعلى بكثير في المناولة الماهرة على كل من الأجسام المرئية وغير المرئية مقارنة بالنماذج الأساسية التي تعتمد على الرؤية فقط، وكل ذلك دون الحاجة إلى عروض توضيحية لروبوت حقيقي أو ضبط دقيق.

المؤلفون الأصليون: Hyesung Lee, Si-Hwan Heo, Sungwook Yang

نُشر 2026-09-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hyesung Lee, Si-Hwan Heo, Sungwook Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات بارعة في المهام المتكررة في المصانع، حيث تتحرك بدقة مثالية وفق مسارات مبرمجة مسبقاً. ومع ذلك، فإن منح الروبوت البراعة التي تمتلكها يد الإنسان لالتقاط بيضة هشة أو زجاجة منزلقة يظل أحد أصعب التحديات في العلم الحديث. تكمن الصعوبة ليس فقط في رؤية الجسم، بل في الشعور به. فأيدي البشر مغطاة بمستشعرات تخبرنا فوراً عندما نلمس شيئاً ما، ومدى قوة ضغطنا، وما إذا كانت قبضتنا تنزلق. وفي المقابل، غالباً ما تعاني الروبوتات في ترجمة ما تراه إلى القدر المناسب من القوة، فكثيراً ما تسحق ما تحاول الإمساك به أو تسقطه تماماً. ولتعليم الروبوتات هذه المهارات، يحتاج العلماء عادةً إلى ساعات من البيانات التي يتم جمعها بواسطة بشر يتحكمون فعلياً في الروبوت، وهي عملية بطيئة ومكلفة ويصعب توسيع نطاقها. علاوة على ذلك، تفتقر تسجيلات الفيديو القياسية للأشخاص أثناء أداء المهام إلى بيانات اللمس الجوهرية، مما يترك فجوة بين ما يراه الروبوت وما يشعر به.

لقد طور فريق من الباحثين طريقة جديدة لسد هذه الفجوة، حيث أنشأوا نظاماً يسمح للروبوت بتعلم مهارات الإمساك المعقدة من فيديوهات بشرية عادية، رغم أن الروبوت لم يشاهد في الواقع إنساناً يلمس الجسم. يعتمد نهجهم، المسمى UniDex-ViTac، على مزيج ذكي من المحاكاة الحاسوبية ونوع محدد من التعلم لتوليد آلاف المحاولات التدريبية. وبدلاً من محاولة نسخ الحركات البشرية مباشرة، يقوم النظام أولاً بترجمة فيديو ليد الشخص إلى دليل تقريبي للروبوت. ثم يقوم بتشغيل هذا الدليل عبر عالم افتراضي عالي السرعة حيث يحاول الروبوت تنفيذ المهمة. وإذا فشل الروبوت، تقوم خوارزمية تعلم متخصصة بإجراء تعديلات طفيفة على حركاته حتى ينجح. ومن الأهمية بمكان أنه نظراً لأن هذا يحدث في محاكاة، يمكن للنظام تسجيل ما شعرت به أطراف أصابع الروبوت بالضبط خلال كل محاولة ناجحة، مما يخلق مجموعة بيانات من "اللمس" لا توجد في الفيديو الأصلي. تُستخدم هذه المجموعة الضخمة من التجارب المحاكية لتدريب "دماغ" روبوت واحد متعدد الاستخدامات، يمكنه التقاط ورفع مجموعة متنوعة من الأشياء باستخدام الكاميرا وحسه الخاص باللمس فقط.

اختبر الباحثون هذه الطريقة على عشرة أجسام مختلفة، تتراوح بين مثقاب كهربائي ثقيل وكوب رقيق. بدأوا بخمسين فيديو قصيراً فقط لبشر يتفاعلون مع هذه العناصر. ومن هذه الفيديوهات، أنتج النظام عشرة آلاف مسار محاكى، أو جولات تدريبية، حيث تعلم الروبوت كيفية تكييف الحركات البشرية مع جسده الميكانيكي. وكانت النتيجة هي سياسة واحدة، أو مجموعة من التعليمات، يمكنها التعامل مع جميع الأشياء العشرة دون الحاجة إلى إعادة التدريب لكل منها. في البيئة الافتراضية، نجح هذا الروبوت المدرك للمس في رفع الأجسام بنسبة 68.3% من المرات. وكان هذا تحسناً كبيراً عن نسخة الروبوت التي اعتمدت فقط على البيانات المرئية، والتي نجحت بنسبة 55.5% فقط. ويسلط هذا الفرق الضوء على أن رؤية الجسم ليست كافية؛ فمعرفة متى وأين تلامس الأصابع الجسم أمر ضروري لضمان قبضة آمنة.

وللتأكد من أن هذا لم يكن مجرد نتاج عرضي للمحاكاة، نقل الفريق الروبوت المدرب إلى العالم الحقيقي. واختبروه على ستة أجسام رآها أثناء التدريب وخمسة أجسام جديدة تماماً لم يسبق له مواجهتها. ودون أي ضبط إضافي أو عروض توضيحية واقعية، نجح الروبوت في 73 من أصل 110 تجربة فيزيائية، بنسبة نجاح بلغت 66.4%. وقد أدى إصدار الروبوت الذي يستطيع الشعور بأطراف أصابعه أداءً أفضل باستمرار من ذاك الذي يمكنه الرؤية فقط، حيث حقق معدل نجاح أعلى بنحو 12 نقطة مئوية. وقد ظل هذا الفارق قائماً حتى بالنسبة للأجسام الجديدة، مما يثبت أن الروبوت قد تعلم مهارة عامة وليس مجرد حفظ حركات محددة. عمل النظام من خلال الجمع بين عرض ثلاثي الأبعاد للمشهد وإشارة بسيطة من أربعة مستشعرات على أطراف أصابعه، تشير كل منها إلى ما إذا كان يلمس شيئاً أم لا. كانت هذه المعلومات الثنائية (on-or-off)، جنباً إلى جنب مع معرفة الروبوت بموضع ذراعه، كافية لتوجيهه نحو إمساك ناجح.

تشير الدراسة إلى أنه من الممكن تعليم الروبوتات مهارات لمس متطورة باستخدام الفيديوهات البشرية فقط كنقطة انطلاق، بشرط وجود وسيلة لتوليد حاسة اللمس المفقودة من خلال المحاكاة. ويشير الباحثون إلى أن نظامهم الحالي يستخدم شكلاً أساسياً جداً من اللمس، حيث يعتمد على إشارات بسيطة (موجود/غير موجود) بدلاً من خرائط الضغط التفصيلية. كما أوضحوا أن العالم الافتراضي الذي استخدموه للتدريب ليس مطابقاً تماماً للواقع، وهذا هو السبب في أن بعض الأجسام كانت أصعب في الإمساك بها من غيرها. ورغم هذه القيود، فإن هذا العمل يوضح مساراً واضحاً للمضي قدماً: فمن خلال استخدام الفيديوهات البشرية لتوجيه عمليات المحاكاة التي تولد بيانات حسية غنية، يمكن للروبوتات تعلم التحكم في العالم المادي بمستوى من البراعة كان بعيد المنال سابقاً، وكل ذلك دون الحاجة إلى إنسان يمسك بيده خلال كل تجربة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →