← أحدث الأبحاث
💻 computer science

NestDex: Nested Policy Learning with Copilot Assisted Teleoperation for Dexterous Manipulation

يُعد NestDex إطار عمل لتعلم السياسات المتداخلة يعمل على تبسيط عملية جمع بيانات المناولة الماهرة من خلال السماح للمشغلين بالتحكم في الأذرع الروبوتية واختيار مهارات يد عالية المستوى عبر قابض، مما يؤدي إلى توليد نماذج توضيحية موثوقة لتدريب سياسات الرؤية الحركية المستقلة.

المؤلفون الأصليون: James Zhao, Jinhe Tang, Mingyuan Ba, Weiming Zhi

نُشر 2026-08-14
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: James Zhao, Jinhe Tang, Mingyuan Ba, Weiming Zhi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

رقصة اليد الروبوتية

تخيل أنك تحاول تعليم روبوت القيام بشيء دقيق مثل تقشير حبة عنب أو لضم إبرة. لا يتعلق الأمر بمجرد تحريك ذراع ميكانيكية من النقطة (أ) إلى النقطة (ب)؛ بل يتعلق بأصابع الروبوت. في عالم الروبوتات، يُسمى هذا "التحكم الماهر" (dexterous manipulation). وبينما يشبه قابض الروبوت القياسي زوجًا من الملاقط التي تفتح وتغلق فقط، فإن اليد الماهرة تمتلك العديد من المفاصل، تمامًا مثل اليد البشرية، مما يتطلب تنسيقًا معقدًا للمس الأشياء وإمساكها وتدويرها دون سحقها.

إن العقبة الأكبر في تعليم الروبوتات هذه المهارات ليست في كون الروبوتات غبية جدًا بحيث لا تتعلم؛ بل في صعوبة شديدة في إظهار كيفية القيام بذلك لها. لتعليم روبوت من خلال المثال (وهي طريقة تسمى "التعلم بالتقليد")، يجب على الإنسان أداء المهمة بشكل مثالي بينما يراقب الروبوت. ولكن بالنسبة ليد ماهرة، يعد هذا كابوسًا. إذ يتعين على المشغل البشري توجيه ذراع الروبوت وفي الوقت نفسه تنسيق كل مفصل إصبع على حدة للحفاظ على قبضة لطيفة. الأمر يشبه محاولة قيادة سيارة بيد واحدة بينما تعزف مقطوعة بيانو معقدة باليد الأخرى في آن واحد. إذا أخطأ الإنسان ولو قليلاً، فستفسد البيانات، ولن يتعلم الروبوت شيئًا. تتناول هذه الورقة البحثية هذه المشكلة تحديدًا: كيف نجعل الروبوتات تتعلم حيل الأصابع البارعة هذه دون أن نصيب المشغل البشري بالجنون؟

تعرف على NestDex: "المساعد الطيار" للروبوت

قدم الباحثون وراء هذه الدراسة، جيمس تشاو وفريقه، نظامًا جديدًا يسمى NestDex. فكر في الأمر كأنك تمنح الروبوت "مساعد طيار" لأصابعه. بدلاً من مطالبة الإنسان بالتحكم في كل حركة إصبع مباشرة، يقوم NestDex بتقسيم المهمة إلى جزأين. لا يزال المشغل البشري يتحكم في الحركات الكبيرة — توجيه الذراع وتحديد الوجهة — ولكن يتم التعامل مع الأصابع بواسطة "سياسة داخلية" ذكية ومُدربة مسبقًا.

تخيل أنك تقود سيارة مزودة بنظام مثبت للسرعة متطور يعرف تمامًا كيفية التوجيه حول حفرة في الطريق. أنت فقط تخبر السيارة "تقدمي للأمام"، ويتولى مثبت السرعة التعديلات الصغيرة والسريعة لعجلة القيادة للحفاظ على سلاسة الرحلة. في نظام NestDex، يستخدم الإنسان "قابضًا" بسيطًا (تحكم واحد) ليخبر أصابع الروبوت بمدى تقدمها في مهارة معينة. إذا دفع الإنسان القابض للأمام، تنفذ أصابع الروبوت تلقائيًا مهارة تعلمها مسبقًا، مثل "إمساك زجاجة" أو "الضغط على زر". وإذا سحب الإنسان للخلف، يقوم الروبوت بإعادة حركة الأصابع إلى الوراء. لا يحتاج الإنسان لمعرفة كيفية قرص كوب ورقي؛ بل يحتاج فقط لمعرفة متى يضغط على القابض لبدء مهارة "القرص".

يعمل هذا النظام في طبقتين. أولاً، يجمع الفريق البيانات باستخدام طريقة "المساعد الطيار" هذه. يقوم الإنسان بتوجيه الذراع وتفعيل مهارات الأصابع، مما يخلق مكتبة من العروض المثالية. بعد ذلك، يقومون بتدريب "سياسة خارجية" منفصلة لتولي المهمة بالكامل. هذه السياسة الخارجية هي عقل الروبوت للمهمة النهائية؛ فهي تتعلم من عروض المساعد الطيار، لكنها في النهاية تدير العرض بمفردها، حيث تتحكم في كل من الذراع والأصابع دون أي مساعدة بشرية أو نظام مساعد طيار.

سحر الضغط والتنعيم

إحدى الحيل الذكية التي يستخدمها NestDex هي "المشفر التلقائي التبايني لحركة اليد" (أو H-VAE). يمكنك التفكير في هذا كخوارزمية ضغط لحركات الروبوت. تحتوي يد الروبوت على 20 مفصلًا، مما يعني وجود الملايين من الطرق لتحريكها. إن محاولة تعليم الروبوت التنبؤ بـ 20 رقمًا في وقت واحد تشبه مطالبة طالب بحفظ صفحة كاملة من موسوعة صفحة بصفحة. يقوم H-VAE بضغط حركات الأصع المعقدة هذه إلى "كود سري" أصغر وأبسط (فضاء حركة كامن) يسهل على الروبوت تعلمه. وعندما يكون الروبوت مستعدًا لأداء المهمة، يقوم بفك تشفير هذا الكود السري مرة أخرى إلى حركة الـ 20 مفصلًا الكاملة. وجدت الورقة البحثية أن استخدام هذا الضغط جعل الروبوت يتعلم بشكل أسرع ويؤدي بشكل أفضل من محاولة تعلم الحركات الخام والمعقدة مباشرة.

اختبر الباحثون أيضًا كيفية تعامل الروبوت مع الفيزياء الواقعية، مثل عندما يلمس الإصبع جسمًا زلقًا. وقارنوا بين ثلاث طرق يمكن للروبوت التحرك بها:

  1. إعادة التشغيل الثابت (Fixed Replay): تشغيل فيديو مسجل لحركة ناجحة تمامًا كما حدثت.
  2. الحلقة المغلقة بدون تنعيم (Closed-Loop No Smoothing): ينظر الروبوت إلى وضعه الحالي ويقرر الحركة التالية، لكنه يفعل ذلك بطريقة متقطعة ومترددة.
  3. الحلقة المغلقة مع التجميع الزمني (Closed-Loop with Temporal Ensembling): ينظر الربوت إلى وضعه، ويقوم بالتنبؤ، ثم يقوم بمتوسط هذا التنبؤ مع تنبؤاته الأخيرة لتنعيم الحركة.

كانت النتائج واضحة. فشلت طريقة "إعادة التشغيل الثابت" كثيرًا لأنها إذا تحرك الجسم بشكل مختلف قليًا عما هو متوقع، يصطدم الروبوت. كانت طريقة "الحلقة المغلقة" أكثر قوة ولكنها كانت متقطعة. أما طريقة "التجميع الزمني" فكانت الفائزة: فقد كانت سلسة وقابلة للتكيف في آن واحد. في الاختبارات المتعلقة بإمساك زجاجة مياه، نجحت الطريقة السلسة والمتكيفة في 9 من أصل 10 مرات، بينما نجحت إعادة التشغيل الثابت في 3 من أصل 10 مرات فقط. وهذا يشير إلى أنه لكي تتمكن الروبوتات من التعامل مع المهام الدقيقة، يجب أن تكون قادرة على تعديل قبضتها في الوقت الفعلي وأن تفعل ذلك بسلاسة، بدلاً من مجرد إعادة تشغيل سيناريو مكتوب.

من المساعد الطيار إلى الطيار المنفرد

اختبر الفريق نظام NestDex في ست مهام مختلفة وصعبة، تتراوح من استخدام الملاقط لنقل جزرة إلى ترتيب الأوراق في ملف. وقارنوا نظام "المساعد الطيار" الخاص بهم بالطريقة القياسية حيث يحاول الإنسان التحكم في الأصابع مباشرة (تسمى AnyTeleop). كانت النتائج مذهلة. فشلت الطريقة القياسية تمامًا في عدة مهام، حيث سجلت نسبة نجاح 0% في جمع عروض جيدة لأشياء مثل "تحضير التوست" أو "تعبئة الملف". في المقابل، حقق NestDex نسبة نجاح 100% في جمع العروض لجميع المهام الست.

الأهم من ذلك، تُظهر الورقة البحثية أن البيانات التي جمعها NestDex تعمل بالفعل. فعندما قاموا بتدريب روبوت للقيام بالمهام بمفرده باستخدام بيانات NestDex، نجح في 100% من مهام "نقل الملاقط" و"نقل المكونات". وحتى بالنسبة للمهام الأصعب، كانت معدلات النجاح أعلى بكثير مما كانت عليه عند استخدام البيانات من الطريقة القياسية. وتجادل الورقة صراحةً ضد فكرة أن الروبوت يحتاج إلى تشغيل نظام المساعد الطيار أثناء المهمة النهائية؛ فالمساعد الطيار هو مجرد أداة لجمع البيانات. وبمجرد أن يتعلم الروبوت "السياسة الخارجية"، يمكنه أداء المهمة بشكل مستقل، مستخدمًا "الكود السري" المدمج لأصابعه واستراتيجيات التحكم السلسة والمتكيفة التي تعلمها.

باختصار، يشير NestDec إلى أننا لسنا بحاجة لإجبار البشر على أن يصبحوا خبراء في رقص الأصابع الروبوتية. بدلاً من ذلك، يمكننا منحهم جهاز تحكم بسيط يطلق مهارات الأصابع الذكية المتعلمة مسبقًا. هذا يجعل من السهل جدًا جمع البيانات عالية الجودة التي تحتاجها الروبوتات للتعلم، وينتج روبوتات أفضل في التعامل مع العالم المادي الفوضوي والمعقد. وجد المؤلفون أن هذا النهج لا يجعل جمع البيانات أسرع وأكثر موثوقية فحسب، بل يؤدي أيضًا إلى روبوتات يمكنها حقًا إتقان المهام الماهرة بمفردها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →