← أحدث الأبحاث
💻 computer science

Learning Agile Striker Skills for Humanoid Soccer Robots from Noisy Sensory Input

تقدم هذه الورقة إطار عمل للتعلم التعزيزي مكوناً من أربع مراحل يُمكّن الروبوتات البشرية لكرة القدم من تنفيذ ركل مستمر وقوي للكرة تحت مدخلات حسية مشوشة واضطرابات خارجية، وذلك عبر تدريب سياسة معلم باستخدام بيانات الحقيقة المطلقة وتلخيصها في سياسة طالب متكيفة من خلال التعلم التعزيزي المقيد ونمذجة الضوضاء الواقعية لسد فجوة المحاكاة إلى الواقع.

المؤلفون الأصليون: Zifan Xu, Myoungkyu Seo, Dongmyeong Lee, Hao Fu, Jiaheng Hu, Jiaxun Cui, Yuqian Jiang, Zhihan Wang, Anastasiia Brund, Joydeep Biswas, Peter Stone

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zifan Xu, Myoungkyu Seo, Dongmyeong Lee, Hao Fu, Jiaheng Hu, Jiaxun Cui, Yuqian Jiang, Zhihan Wang, Anastasiia Brund, Joydeep Biswas, Peter Stone

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا لعب كرة القدم. تحديدًا، تريد منه أن يركض في الملعب، ويرصد كرة متحركة، ثم يركلها مباشرة نحو المرمى. الآن، تخيل القيام بذلك بينما يتوازن الروبوت على قدم واحدة، وعيناه "مشوشتان"، ودماغه بطيء أحيانًا في معالجة ما يراه. هذا هو التحدي الذي تعالجه هذه الورقة البحثية.

قام الباحثون في جامعة تكساس في أوستن وشركة سوني AI بتطوير نظام تدريب يحول روبوتًا أخرق إلى "مهاجم" يمكنه التعامل مع هذه الظروف الواقعية الفوضوية. إليكم كيف فعلوا ذلك، مشروحًا من خلال تشبيهات بسيطة.

المشكلة الجوهرية: الرياضي "مشوش الرؤية"

في لعبة فيديو مثالية، يعرف الروبوت مكان الكرة بالضبط ومدى سرعتها. أما في العالم الحقيقي، فإن الكاميرات مليئة بالضجيج، والبيانات تتأخر، وقد تختفي الكرة للحظة وجيزة. إذا علمت الروبوت باستخدام معلومات مثالية فقط، فسيفشل بمجرد خروجه من شاشة الكمبيوتر.

كان هدف الورقة البحثية هو تعليم روبوت بشري (Humanoid) كيفية ركل الكرة بشكل مستمر (يركض، يركل، يستدير، ثم يركض مجددًا) حتى عندما تكون مدخلاته الحسية غير مثالية.

الحل: نظام "مدرسة" من أربع مراحل

بدلاً من محاولة تعليم الروبوت كل شيء دفعة واحدة، بنى الفريق مسار تدريب مكونًا من أربع مراحل. فكر في هذا كأنه أكاديمية رياضية ذات تدرج صارم من "مدرب ذي امتيازات" إلى "لاعب في العالم الحقيقي".

المرحلة الأولى: المدرب ذو الامتيازات (المطاردة بعيدة المدى)

أولاً، قاموا بتدريب روبوت "معلم". هذا الروبوت يمتلك قوى خارقة: يمكنه رؤية الكرة والمرمى بشكل مثالي، دون أي تشويش أو تأخير.

  • المهمة: يتعلم المعلم كيفية الركض نحو الكرة من مسافة بعيدة، بغضًا عن مكان بدايتها.
  • الحيلة: قاموا بجعل المعلم يفقد توازنه (عن طريق دفعه أو دفع الكرة) لتعليمه كيفية استعادة توازنه والاستمرار في الركض. الأمر يشبه مدربًا يتدرب على "الترامبولين" ليتعلم كيف يظل منتصبًا حتى عندما تهتز الأرض.

المرحلة الثانية: الركلة المثالية (الركل الاتجاهي)

الآن، يتم تعليم نفس الروبوت "المعلم" كيفية الركل.

  • المهمة: يتعلم كيفية أرجحة ساقه، ضرب الكرة، وتوجيهها نحو المرمى.
  • الحيلة: تمامًا كما في المرحلة الأولى، يستمرون في دفع الروبوت أثناء محاولته الركل. هذا يجبر الروبوت على تعلم كيفية الركل بدقة حتى لو كان فاقدًا للتوازن قليلاً أو إذا كانت الكرة تتحرك بشكل غريب.

المرحلة الثالثة: الطالب يتعلم (التقطير/Distillation)

الآن يأتي الجزء الصعب. لقد قدموا روبوتًا "طالبًا". هذا الروبوت عادي: رؤيته مشوشة، تحديثاته بطيئة، وأحيانًا تختفي الكرة من مجال رؤيته (مثل عندما تمر خلف ساقه).

  • المنهج: يحاول الطالب تقليد المعلم. ولكن هنا تكمن الخدعة: يتم تدريب الطالب باستخدام تقنية تسمى DAgger.
  • التشبيه: تخيل سائقًا مبتدئًا يتعلم من معلم محترف. المعلم يقود ببراعة، لكن الطالب يرتكب أخطاءً. عندما ينحرف الطالب عن المسار، لا يكتفي المعلم بالقول "حاول مجددًا"؛ بل يأخذ المعلم المقود في تلك اللحظة تحديدًا ليظهر للطالب الحركة الصحيحة لهذا الخطأ المحدد. يتعلم الطالب ليس فقط من مسار المعلم المثالي، بل من كيفية التعافي من أخطائه الخاصة.

المرحلة الرابعة: اللمسة النهائية (التكيف)

حتى بعد تقليد المعلم، ظل الروبوت "الطالب" مهتزًا بعض الشيء. كان يقوم بحركات حادة ومتقطعة أو يركل بشكل عشوائي للغاية لأنه كان مرتبكًا بسبب "الضجيج" في مستشعراته.

  • الإصلاح: استخدم الباحثون خوارزمية "التعلم المعزز المقيد" (Constrained RL).
  • التشبيه: فكر في مدرب رياضي صارم يقول: "يمكنك الركض بسرعة، لكن لا يمكنك التواء ركبتك". يُسمح للروبوت بالتعلم، ولكنه يُعاقب إذا قام بحركات متقطعة جدًا أو غير آمنة. هذا يجعل حركة الروبوت أكثر سلاسة، مما يجعله يبدو مثل رياضي طبيعي وليس مثل شخصية فيديو جيم مليئة بالأخطاء التقنية.

النتائج: من المحاكاة إلى الواقع

اختبر الفريق هذا النظام بطريقتين:

  1. في الكمبيوتر (المحاكاة): وضعوا الروبوت في آلاف السيناريوهات المختلفة. ركل الروبوت الكرة في المرمى بنسبة 79.5% من المرات، حتى مع وجود "العيون المشوشة".
  2. في العالم الحقيقي: وضعوا الكود البرمجي على روبوت حقيقي يسمى Booster T1.
    • النتيجة: حقق الروبوت نسبة نجاح بلغت 66.7% في تسجيل الأهداف من أوضاع مختلفة.
    • الكفاءة: تعلم الروبوت أيضًا أن يكون ذكيًا بشأن استهلاك الطاقة. فإذا كانت الكرة قريبة من المرمى، يركل بلطف لتوفير الطاقة. وإذا كانت بعيدة، يركل بقوة أكبر.

لماذا يهم هذا؟

تخلص الورقة البحثية إلى أن نهج "المعلم-الطالب"، مقترنًا بـ "التعلم المعزز المقيد" (المدرب الصارم)، أمر ضروري. فبدون مرحلة اللمسة النهائية، سيكون الروبوت مهتزًا للغاية بحيث لا يمكنه العمل في العالم الحقيقي. وبدون التدريب "المشوش"، سيفشل الروبوت بمجرد مغادرته للكمبيوتر.

باختصار: لقد علموا روبوتًا كيف يكون مهاجمًا في كرة القدم من خلال السماكن أولاً بممارسة اللعب برؤية مثالية، ثم إجباره على الممارسة برؤية سيئة مع التعلم من أخطائه الخاصة، وأخيرًا تدريبه على تنعيم حركاته حتى لا يتعثر في قدميه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →