← أحدث الأبحاث
💻 computer science

UniReflex: Plug-and-Play Force Control for Pretrained Generative Policies via Fast-Slow Reflex

يُعد UniReflex إطار عمل عالمي، جاهز للتشغيل المباشر، يعمل على تعزيز السياسات التوليدية مسبقة التدريب عبر التحكم في المعاوقة المتغيرة ذات الحلقة المغلقة من خلال آلية منعكس سريع-بطيء، مما يتيح تنظيمًا قويًا للتلامس وانتقالات سلسة بين تنفيذ الموضع والقوة دون الحاجة إلى إعادة تدريب الشبكة.

المؤلفون الأصليون: Yan Huang, Shoujie Li, Ziwu Song, Wenbo Ding

نُشر 2026-08-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yan Huang, Shoujie Li, Ziwu Song, Wenbo Ding

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لقد أصبحت الروبوتات بارعة بشكل ملحوظ في مراقبة وتقليد الحركات البشرية. فمن خلال دراسة آلاف العروض التوضيحية بالفيديو، يمكن لأنظمة الذكاء الاصطناعي الحديثة أن تتعلم كيفية التقاط الأشياء، أو تكديس الكتل، أو تحريك الأدوات عبر الطاولة بدقة مبهرة. هذه الأنظمة، التي تُسمى غالباً السياسات التوليدية (generative policies)، تعمل مثل مخطط بطيء ومتأنٍ يقرر أين يجب أن تذهب يد الروبوت تالياً. ومع ذلك، هناك فجوة كبيرة بين التحرك عبر الهواء الفراغي والتفاعل مع العالم المادي. فعندما يحتاج الروبوت إلى مسح سطح ما، أو الضغط على زر، أو ربط شيء ما، يجب عليه إدارة القوى التي يبذلها. فإذا ضغط الروبوت بقوة زائدة، قد يكسر الشيء أو ينزلق؛ وإذا ضغط بنعومة زائدة، سيفشل في إتمام المهمة. غالباً ما تعاني الروبوتات الحالية هنا لأنها مصممة لاتباع مسار بصري بدقة، وتتعامل مع العالم كما لو كان مصنوعاً من زجاج لا ينثني ولا يقاوم أبداً. فهي تفتقر إلى القدرة على الشعور بالمقاومة وتعديل قبضتها أو ضغطها في الوقت الفعلي، وهي مهارة تأتي بشكل طبيعي للبشر ولكن من الصعب تعليمها للآلات التي تكتفي بالرؤية فقط.

لقد طور باحثون من جامعة تسينغ هوا وجامعة نانيانغ التكنولوجية نهجاً جديداً يسمى "UniReflex" لسد هذه الفجوة دون إعادة بناء عقل الروبوت بالكامل. فبدلاً من محاولة إعادة تدريب نماذج الذكاء الاصطناعي الضخمة والمعقدة التي تعرف بالفعل كيفية التحرك، قاموا بإضافة طبقة خفيفة وسريعة الاستجابة فوقها. تخيل الذكاء الاصطناعي الرئيسي كأنه سائق يعرف الطريق والوجهة، بينما هذا الإضافة الجديدة تعمل كمنعكس (reflex) يعدل عجلة القيادة فوراً عندما تصطدم السيارة بمطبات. يعمل النظام من خلال الاستماع إلى أفكار الروبوت الداخلية حول المكان الذي يريد الذهوة إليه، بينما يراقب في الوقت نفسه القوى التي تضرب معصم الروبوت. إذا واجه الروبوت مقاومة غير متوقعة، تتولى هذه الطبقة السريعة زمام الأمور لجزء من الثانية لتلطيف اللمسة أو تغيير الزاوية، مما يضمن بقاء التلامس مستقراً. والأهم من ذلك، أن هذه الطبقة الجديدة لا تتطلب إعادة تدريب الذكاء الاصطناعي الأصلي أو تعديله، مما يسمه إمكانية توصيلها بعقول روبوتية مختلفة موجودة بالفعل على الفور.

اختبر الفريق هذه الطريقة على مجموعة متنوعة من المهام الصعبة التي تتطلب اتصالاً جسدياً مستمراً، مثل مسح سطح منحني، أو تقشير ملصق من ورقة ملاحظات، أو إدخال شاحن في منفذ. وفي هذه التجارب، استخدموا ثلاثة أنواع مختلفة من عقول الروبوتات المدربة مسبقاً، تتراوح من النماذج الصغيرة إلى النماذج الضخمة التي تحتوي على مليارات المعلمات. وعندما تُركت الروبوتات لتعمل بقدراتها التخطيطية الأصلية فقط، كانت تفشل غالباً بمجرد لمس جسم ما، إما بالانزلاق أو بتطبيق ضغط زائد. ومع ذلك، عندما تم تفعيل طبقة UniReflex، ارتفع معدل النجاح في هذه المهام التي تعتمد على التلامس بشكل كبير. على سبيل المثال، في مهمة تتضمن تقشير ملصق، تحسن معدل النجاح من خط أساس منخفض إلى ما يقرب من تسعين بالمائة. كان النظام فعالاً بشكل خاص في الحفاظ على القدر الصحيح من الضغط، مما حافظ على ثبات يد الروبوت حتى عندما يتحرك الجسم أو يكون السطح غير مستوٍ.

إن النتيجة الرئيسية للبحث هي أن هذا التحسن يأتي دون التضحو بقدرة الروبوت الأصلية على التحرك بدقة نحو الهدف. فالطبقة الجديدة تعمل كمفتاح يعرف متى يترك المخطط الرئيسي يقوم بالعمل ومتى يتولى التحكم لإجراء تعديلات دقيقة. وقبل أن يلمس الروبوت أي شيء، يتحرك تماماً كما أراد الذكاء الاصطناعي الأصلي، محافظاً على مهارات التخطيط رفيعة المستوى لديه. وفي اللحظة التي يتم فيها اكتشاف التلامس، تنخرط طبقة المنعكس السريع لإدارة القوى، مما يضمن عدم اصطدام الروبوت بالجسم أو فقدان قبضته. هذا الفصل في المهام يسمح للروبوت بأن يكون دقيقاً في حركاته ولطيفاً في تفاعلاته في آن واحد. كما وجد الباحثون أن هذا النهج فعال للغاية؛ فبما أنهم دربوا فقط طبقة المنعكس الصغيرة والسريعة وتركوا الذكاء الاصطناعي الرئيسي الضخم ثابتاً، فقد انخفض الوقت المطلوب لتدريب النظام بمقدار 25 إلى 66 ضعفاً مقارنة بالطرق التي تحاول إعادة تدريب عقل الروبوت بالكامل من الصفر.

كما استكشفت الدراسة مدى قدرة النظام على التعامل مع الاضطرابات غير المتوقعة، مثل سطح يتحرك أثناء مسحه من قبل الروبوت أو جزء موضوع في مكان غير دقيق قليلاً. في هذه السيناريوهات، غالباً ما تفقد نماذج الروبوت القياسية التلامس وتفشل في المهمة تماماً. ومع ذلك، كانت الروبوتات المعززة بـ UniReflex قادرة على التعافي بسرعة، وإعادة إنشاء قوة التلامس الصحيحة في ثانية واحدة أو أقل. يشير هذا الصمود إلى أن النظام يمكنه التكيف مع عدم القدرة على التنبؤ في العالم الحقيقي بشكل أفضل من الطرق السابقة. وأشار الباحثون إلى أنه بينما يعمل الأسلوب بشكل ممتاز للمهام المستمرة مثل المسح أو الضغط، فإنه يواجه تحديات أكبر مع الأفعال قصيرة المدى وعالية السرعة مثل إدخال قابس في مقبس ضيق، حيث تكون النافذة الزمنية للتعديل صغيرة للغاية. ومع ذلك، فإن النتائج تثبت وجود طريقة جديدة قوية لمنح الروبوتات حاسة اللمس التي كانت تفتقدها، مما يسمح لها بالتفاعل مع العالم المادي بشكل أكثر أماناً وفعالية دون الحاجة إلى إعادة تصميمها بالكامل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →