Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data
تقدم هذه الورقة نظام LATENT، الذي يُمكّن الروبوتات البشرية من تعلم مهارات تنس قوية وطبيعية عبر الاستفادة من بيانات الحركة البشرية غير المكتملة والمجزأة كمعلومات سابقة للمهارات الأولية، والتي يتم بعد ذلك صقلها وتركيبها لتحقيق تبادلات كرات مستقرة متعددة الضربات على روبوت Unitree G1.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيف يلعب التنس الاحترافي. ما هي أكبر مشكلة؟ نحن لا نملك لقطات فيديو مثالية لكيفية قيام البشر بذلك بالفعل.
مباريات التنس الحقيقية فوضوية. اللاعبون يركضون مسافات شاسعة، ويؤرجحون مضاربهم بسرعة البرق، وتلتوي معاصمهم بطرق يصعب تصويرها بدقة بالغة باستخدام الكاميرات. محاولة تسجيل مباراة تنس كاملة ومثالية ليقوم الروبوت بتقليدها تشبه محاولة تصوير حركة جناح طائر طنان بكاميرا مهتزة ومنخفضة الدقة من مسافة 50 قدمًا. ستحصل على الفكرة العامة، لكن التفاصيل ستكون ضبابية.
تقدم الورقة البحثية نظامًا يسمى LATENT (والذي يرمز إلى تعلم مهارات التنس البشرية الرياضية من حركة بشرية غير مثالية). فكر في LATENT كأنه مدرب طبخ عبقري يعلم طباخًا آليًا ليس من خلال إظامه وصفة مثالية، بل من خلال إظهار بعض الرسومات الأولية الخشنة لكيفية التقطيع والتحريك والتقليب، ثم ترك الروبوت يستنتج الباقي بنفسه.
إليك كيف يعمل هذا النظام، مقسمًا إلى خطوات بسيطة:
1. "الرسم الأولي" للبيانات (الحركة غير المثالية)
بدلاً من محاولة تصوير مباراة تنس كاملة، طلب الباحثون من خمسة لاعبين هواة فقط ممارسة الحركات الأساسية في غرفة صغيرة:
- كيف تؤرجح المضرب في الضربة الأمامية (forehand).
- كيف تؤرجح المضرب في الضربة الخلفية (backhand).
- كيف تتحرك جانبًا (shuffle).
- كيف تقاطع قدميك للجري.
قاموا بتصوير هذه المقاطع القصيرة. وهذه البيانات "غير مثالية" لأنها:
- ضبابية: لم تستطع الكاميرات التقاط حركات المعصم الصغيرة والسريعة بدقة.
- غير مكتملة: المقاطع لا تظهر كيفية استخدام هذه الحركات لضرب الكرة؛ بل تظهر الحركات نفسها فقط.
2. "اللغة السرية" (فضاء العمل الكامن - Latent Action Space)
يحتاج الروبوت لتعلم هذه الحركات، ولكن إذا حاول تقليد حركات المعصم الضبابية بدقة، فسيفشل. لذا، أنشأ الباحثون "لغة سرية" (فضاء كامن).
تخيل أن لدى الروبوت مكتبة من "بطاقات الحركات".
- بدلاً من حفظ إحداثيات العضلات بدقة، يتعلم الروبوت اختيار بطاقة تقول "قم بأرجحة الضربة الأمامية".
- يدرك الروبوت أن هذه البطاقة تؤدي عادةً إلى أرجحة جيدة، لكنه يعلم أيضًا أن "جزء المعصم" في هذه البطاقة ضبابي نوعًا ما.
3. "تصحيح المدرب" (السياسة رفيعة المستوى - High-Level Policy)
هذا هو الجزء السحري. يمتلك الروبوت "مدربًا رفيع المستوى" (عقل الذكاء الاصطناعي) يراقب اللعبة.
- يختار المدرب "بطاقة الحركة" المناسبة من المكتبة (مثل: "اركض نحو الكرة وأرجح الضربة الأمامية").
- الأهم من ذلك، يُسمى المدرب مسموحًا له بإصلاح الأجزاء الضبابية. إذا قالت "بطاقة الحركة" "أرجح المعصم هكذا"، ولكن الكرة قادمة بسرعة، يقول المدرب: "في الواقع، لَوِّ المعصم أكثر لضربها بقوة أكبر".
وضع الباحثون قاعدة خاصة تسمى "حاجز العمل الكامن" (Latent Action Action Barrier). فكر في هذا كـ شبكة أمان. فهي تخبر المدرب: "يمكنك إصلاح حركة المعصم، لكن لا تبالغ. ابقَ قريبًا من الأسلوب الطبيعي للبشر." هذا يمنع الروبوت من ابتكار حركات غريبة ومتشنجة تشبه حركات الآلات.
4. "المعسكر التدريبي" (النقل من المحاكاة إلى الواقع - Sim-to-Real Transfer)
قبل أن يلعب الروبوت ضد إنسان حقيقي، يتدرب في محاكاة لألعاب الفيديو. ولكن ألعاب الفيديو ليست مثالية. وللتأكد من أن الروبوت لن يرتبك عند انتقاله إلى العالم الحقيقي، جعل الباحثون المحاكاة فوضوية:
- جعلوا مفاصل الروبوت زلقة أو لزجة بشكل عشوائي.
- جعلوا كرة التنس أثقل أو أخف وزنًا.
- أضافوا "تشويشًا" إلى رؤية الروبوت بحيث لا يمكنه رؤية الكرة بدقة مثالية.
هذا يشبه تدريب سباح في مسبح ذي مياه مضطربة، وأوزان ثقيلة، ونظارات ضبابية. عندما يصل أخيرًا إلى المحيط الواضح والهادئ (العالم الحقيقي)، سيشعر وكأنه يسبح بالحركة البطيئة لأن استعداده كان ممتازًا.
النتيجة
عندما وضعوا هذا النظام على روبوت Unitility G1 (روبوت حقيقي يمشي)، كانت النتائج مفاجئة:
- استطاع الروبوت تبادل الضربات (Rally) مع لاعب بشري (ضرب الكرة ذهابًا وإيابًا) عدة مرات.
- استطاع ضرب الكرات التي تتحرك بسرعات عالية (أكثر من 30 ميلًا في الساعة).
- تحرك بشكل طبيعي، وبدا كرياضي وليس كآلة جامدة.
لماذا يهم هذا؟
سابقًا، كان تعليم الروبوتات الرياضة يتطلب بيانات مثالية أو فيزياء مستحيلة (مثل امتلاك الروبوتات لقوة لا نهائية). يثبت نظام LATENT أنه يمكنك تعليم الروبوت أن يكون رياضيًا باستخدام بيانات بشرية غير مثالية وفوضوية، طالما أعطيت الروبوت طريقة ذكية لملء الفجوات وتصحيح أخطائه بنفسه.
إنه الفرق بين محاولة نسخ لوحة بكسل بكسل (وهو ما يفشل إذا كانت الأصلية ضبابية) وبين تعليم الفنان تقنية الرسم، وتركه يتدرب، ثم السماح له بتعديل ضربات فرشاته لتناسب اللوحة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.