← أحدث الأبحاث
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

يقدم HIL-UMI إطار عمل يعتمد على وجود الإنسان في الحلقة (human-in-the-loop) وخالٍ من الروبوتات لتدريب نماذج الرؤية واللغة والعمل (Vision-Language-Action) ما بعد التدريب، والذي يستفيد من واجهة تلاعب عالمية محمولة يدوياً ودرجة طاقة موجهة بالسياسة لجمع بيانات مستهدفة بكفاءة وتحسين مقدِّرات الميزة، مما يتغلب على قيود الضبط الدقيق الخاضع للإشراف الثابت ويُمكِّن من التحسين التكراري القابل للتوسع دون الحاجة لنشر روبوتات فيزيائية.

المؤلفون الأصليون: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

نُشر 2026-09-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تصبح الروبوتات قادرة بشكل متزايد على فهم العالم من خلال الرؤية واللغة، حيث تتعلم من كميات هائلة من البيانات لأداء مهام معقدة. ومع ذلك، لا تزال هناك فجوة كبيرة بين ما تتعلمه هذه الأنظمة من الذكاء الاصطناعي بشكل عام وما يمكنها فعله بالفعل في مطبخ أو ورشة عمل أو مصنع محدد. فعندما يتم نشر روبوت في بيئة حقيقية، فإنه غالباً ما يواجه مواقف لم يرها من قبل، مما يؤدي إلى أخطاء قد تتراكم حتى تفشل المهمة. ولإصلاح ذلك، يعتمد الباحثون تقليدياً على "الضبط الدقيق الخاضع للإشراف"، وهي عملية يقوم فيها البشر بتقديم نماذج للأفعال الصحيحة على الروبوت نفسه، ويتعلم الجهاز محاكاتها. وبينما يساعد هذا، إلا أنه بطيء ومكلف، وغالباً ما يغفل اللحظات المحددة التي من المرجح أن يخطئ فيها الروبوت، لأن الروبوت يتعلم فقط من الأمثلة التي أُعطيت له، وليس من الأخطاء التي يرتكبها أثناء محاولة حل المشكلة بمفرده.

لقد طور فريق من الباحثين نهجاً جديداً يسمى HIL-UMI يغير كيفية تعلم الروبوتات من البشر، مما يلغي الحاجة إلى وجود الروبوت خلال مرحلة التدريب. فبدلاً من مراقبة تعثر الروبوت ثم تصحيحه، يستخدم هذا الأسلوب جهازاً محمولاً باليد يشبه القابض الروبوتي، ويمسكه مشغل بشري. يقوم المشغل بأداء المهمة باستخدام هذا الجهاز بينما يقوم برنامج حاسوبي، يعمل بـ "دماغ" الروبوت الحالي، بمراقبة بث الفيديو نفسه ويحاول تخمين ما سيفعله الإنسان بعد ذلك. لا يقوم النظام بتحريك الروبوت؛ بل يكتفي بمقارنة حركات الإنسان الفعلية مع توقعاته الخاصة. وعندما يفعل الإنسان شيئاً لم يتوقعه الكمبيوتر، يقوم النظام بتحديد تلك اللحظة كفرصة للتعلم وتسجيلها. وهذا يتيح للروبوت التعلم من نقاط ضعفه دون الحاجة أبداً إلى محاولة تنفيذ المهمة جسدياً والمخاطرة بالفشل.

يتضمن جوهر هذه الطريقة حلقة مستمرة من الملاحظة والتحسين. فبينما يقوم الإنسان بأداء مهمة ما، يتحقق الكمبيوتر باستمرار مما إذا كانت توقعاته تتطابق مع أفعال الإنسان. وإذا كان تخمين الكمبيوتر مختلفاً تماماً عما يفعله الإنسان، فإن النظام يعرف أنه في "نقطة عمياء" — وهي حالة لا يفهمها الروبوت جيداً. عند تلك النقطة، يُطلب من الإنسان الاستمرار في العرض التوضيحي، ويقوم النظام بحفظ هذا الجزء المحدد من البيانات. كما أضاف الباحثون طبقة ثانية من الذكاء: طريقة للحكم على مدى تقدم المهمة. فإذا اعتقد النظام أن المهمة تسير بشكل سيء، حتى لو كان الإنسان يتحرك بشكل صحيح، فإنه يسجل تلك اللحظة لمساعدة الكمبيوتر على تعلم كيفية الحكم بشكل أفضل على النجاح. ومن خلال الجمع بين هذين النوعين من البيانات، لا يتعلم الروبوت ما يجب فعله فحسب، بل يتعلم أيضاً أي الأفعال هي الأكثر فائدة لإنجاز العمل.

ولاختبار هذه الفكرة، طبق الباحثون هذا النهج على أربع مهام متميزة في العالم الحقيقي باستخدام ذراع روبوتية قياسية. وتراوحت المهام بين طي منشفة وتنظيف طاولة إلى تكديس المكعبات وختم ورقة بدقة عالية. وفي كل حالة، بدأ الروبوت بمجموعة أساسية من التعليمات ثم مر بعدة جولات من التدريب باستخدام الطريقة اليدوية الجديدة. وأظهرت النتائج تحسناً واضحاً مقارنة بالطرق التقليدية؛ فبينما تصل تقنيات التدريب القياسية غالباً إلى سقف لا تفيد بعده إضافة المزيد من البيانات، سمحت الطريقة الجديدة للروبوت بأن يصبح أفضل باستمرار مع كل جولة تدريب. لقد تعلم الروبوت التعامل مع تسلسلات طويلة ومعقدة من الأفعال والحركات الدقيقة والرقيقة بشكل أكثر فعالية من ذي قبل.

كانت إحدى النتائج الأكثر لفتاً للنظر هي السرعة التي جمعت بها هذه الطريقة الجديدة معلومات مفيدة. فالطرق التقليدية التي تتطلب تحريك الروبوت جسدياً وتصحيحه من قبل إنسان هي بطيئة وصعبة التوسع. وفي المقابل، وُجد أن النهج المحمول باليد أسرع بأكثر من خمس مرات في جمع البيانات اللازمة. وذلك لأن المشغل البشري يمكنه تحريك الجهاز بحرية دون انتظار إعادة ضبط الروبوت أو تدخل بشري في آلة ثقيلة. وقد نجح النظام في تحديد اللحظات الدقيقة التي يحتاج فيها الروبوت إلى المساعدة، مركزاً التدريب على الأجزاء الأكثر صعوبة في المهمة بدلاً من إضاعة الوقت في الأجزاء التي يفهمها الروبوت بالفعل.

تشير الدراسة إلى أن هذا النهج يوفر مساراً قابلاً للتوسع لتعليم الروبوتات مهارات جديدة عبر مواقع مختلفة ومن قبل أشخاص مختلفين. وبما أن التدريب يتم عبر جهاز محمول باليد، فمن المحتمل أن يتمكن عدة مشغلين من جمع البيانات في وقت واحد في أماكن مختلفة، لتصب جميعها في عملية تعلم نفس الروبوت. وقد وجد الباحثون أنه من خلال التركيز على الفجوات المحددة في معرفة الروبوت واستخدام نظام يكافئ التقدم، استطاعوا إنشاء روبوت أكثر موثوقية وكفاءة. ويشير هذا العمل نحو مستقبل يمكن فيه تكييف الروبوتات مع بيئات جديدة بسرعة وأمان، دون الحاجة إلى تجارب فيزيائية متكررة ومكلفة ومستهلكة للوقت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →