← أحدث الأبحاث
💻 computer science

SteadyTray: Learning Object Balancing Tasks in Humanoid Tray Transport via Residual Reinforcement Learning

تقدم هذه الورقة البحثية ReST-RL، وهو إطار عمل للتعلم التعزيزي الهرمي يفصل بين حركة الروبوت البشري واستقرار الحمولة عبر وحدة متبقية، محققاً توازناً قوياً للأجسام من المحاكاة إلى الواقع دون أي تأخير (zero-shot) على روبوت Unitree G1 دون المساس باستقرار المشية.

المؤلفون الأصليون: Anlun Huang, Zhenyu Wu, Soofiyan Atar, Yuheng Zhi, Michael Yip

نُشر 2026-03-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Anlun Huang, Zhenyu Wu, Soofiyan Atar, Yuheng Zhi, Michael Yip

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تسير في شارع مزدحم وغير مستوٍ وأنت تحمل صينية عليها كأس من النبيذ وطبق من السباغيتي. هدفك هو الوصول إلى الجانب الآخر دون سكب قطرة واحدة أو إسقاط الطبق.

الآن، تخيل أنك أنت "روبوت". ليس مجرد روبوت عادي، بل روبوت بشري يمشي على قدمين. عليك أن تمشي، وتلتف، وتحافظ على التوازن في آن واحد. في كل مرة تخطو فيها خطوة، يهتز جسمك ويتمايل بشكل طبيعي. إذا حاولت إمساك الصينية بثبات تام أثناء المشي، فقد تتعثر. وإذا ركزت فقط على المشي، فسوف ينسكب النبيذ.

هذه هي المشكلة التي يحلها بحث "SteadyTray". وإليك كيف فعلوا ذلك، مشروحاً ببساطة:

١. المشكلة: المشية "المتذبذبة"

الروبوتات البشرية بارعة في المشي، لكن المشي يولد اهتزازات. فكر في الأمر كسيارة تسير على طريق حصوي؛ السيارة بأكملها تهتز. إذا وضعت كوباً من القهوة على لوحة قيادة تلك السيارة، فسوف ينسكب.

حاولت الروبوتات السابقة حل هذه المشكلة بجعل "دماغ" واحد ضخم يحاول تعلم كيفية المشي والحفاظ على ثبات الصينية في نفس الوقت. كان الأمر يشبه مطالبة طالب بحل مسائل التفاضل والتكامل المتقدمة بينما يقوم في الوقت نفسه بمهارة "اللاعب بالكرات" (juggling). وغالباً ما كانوا يفشلون، خاصة عندما يصطدم شخص ما بالروبوت أو عندما يضطر الروبوت للالتفاف بسرعة.

٢. الحل: "المدرب واللاعب" (ReST-RL)

ابتكر الباحثون نظاماً ذكياً يتكون من خطوتين يسمى ReST-RL. بدلاً من دماغ واحد ضخم، استخدموا نهج "المعلم" و"الطالب" مع لمسة خاصة.

  • السياسة الأساسية (الماشي الخبير): أولاً، قاموا بتدريب روبوت ليكون ماشياً بارعاً. هذا الروبوت يعرف كيف يمشي، ويلتف، ويحافظ على توازنه على قدمين. إنه يشبه راقصاً محترفاً يعرف الخطوات تماماً. هذا الجزء "مجمد"، مما يعني أننا لا نغير طريقة مشيه.
  • وحدة المتبقي (مدرب التثبيت): بعد ذلك، أضافوا "دماغًا" ثانياً أصغر فوقه. هذا الدماغ لا يخبر الروبوت كيف يمشي، بل يعمل كـ مدرب يراقب الراقص.
    • المدرب يرى كأس النبيذ وهو يتأرجح.
    • يهمس المدرب بتصحيحات صغيرة وسريعة لذراعي الراقص: "مل بيدك يساراً قليلاً"، "حرك يدك للأمام"، "اهدأ".
    • يستمر الراقص (الماشي الأساسي) في أداء خطوات رقصة، لكن لمسات المدرب الصغيرة تلغي أثر التمايل.

هذا الفصل هو المفتاح. لا يتعين على الروبوت إعادة تعلم كيفية المشي؛ هو فقط يتعلم كيفية تعديل مشيته للحفاظ على ثبات الصينية.

٣. السر الخفي: "التدريب مع وجود تأخير"

واحدة من أذكى الحيل في البحث هي كيفية تدريب الروبوت. في العالم الحقيقي، الكاميرات والمستشعرات بطيئة. بحلول الوقت الذي "يرى" فيه الروبوت كأس النبيذ وهو يميل، يكون قد مضى جزء من الثانية بالفعل.

للتحضير لذلك، تعمد الباحثون إبطاء رؤية الروبوت أثناء التدريب. جعلوا الروبوت يتدرب وهو ينظر إلى بيانات "قديمة".

  • التشبيه: تخيل أنك تتعلم ركوب الدراجة وأنت ترتدي نظارات تعرض لك أين كنت قبل ٠.٥ ثانية. قد يكون الأمر صعباً في البدا٠، ولكن بمجرد أن تعتاد عليه، ستصبح بارعاً للغاية في التنبؤ بمكانك المستقبلي.
  • النتيجة: عندما نزعوا النظارات (وشغلوا الروبوت في العالم الحقيقي)، كان الروبوت بارعاً جداً في التنبؤ بالمستقبل، مما مكنه من تثبيت الصينية حتى عندما كانت المستشعرات بطيئة أو عندما دفعه شخص ما.

٤. النتائج: اختبار "Unitree G1"

اختبروا ذلك على روبوت حقيقي يسمى Unitree G1.

  • الاختبار: جعلوا الروبوت يمشي وهو يحمل صينية بها كأس نبيذ مليء بسائل، وكوب قهوة، وحتى أدوات طبية.
  • الفوضى: قاموا بركل الروبوت، ودفع الصينية، وجعلوه يمشي بسرعة وببطء.
  • النتيجة: حافظ الروبوت على استواء الصينية. لم ينسكب النبيذ، ولم تسقط الأدوات. لقد نجح الأمر جيداً لدرجة أنه استطاع التعامل مع هذه المهام دون الحاجة إلى إعادة التدريب لكل جسم جديد.

لماذا هذا مهم؟

الأمر لا يتعلق فقط بروبوتات تحمل المشروبات. بل يتعلق بجعل الروبوتات مفيدة في عالمنا الفوضوي.

  • وظائف المستقبل: تخيل نادلاً آلياً في مطعم مزدحم لا يسكب المشروبات أبداً، حتى لو اصطدم به أحد الزبائن.
  • المستشفيات: تخيل روبوتاً يحمل أدوات معقمة عبر ممر مزدحم دون أن تهتز.
  • رعاية المسنين: تخيل روبوتاً يحضر صينية دواء لشخص مسن، ويتنقل حول الأثاث والأشخاص دون أن يسقط أي شيء.

باختصار: يعلم هذا البحث الروبوت كيف يكون "راقصاً" يعرف كيف يمشي، و"ساحراً" يعرف كيف يبقي الصينية ثابتة تماماً، وذلك من خلال استخدام نظام تعلم ذكي متعدد الطبقات يستعد لتأخيرات وضجيج العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →