← أحدث الأبحاث
🤖 machine learning

Learning to Race in Minutes: Infoprop Dyna on the Mini Wheelbot

تُثبت هذه الورقة أن إطار عمل Infoprop Dyna يُمكّن روبوت Mini Wheelbot من تعلم السباق عالي السرعة على مسار في العالم الحقيقي خلال 11 دقيقة فقط، مما يلغي الحاجة إلى محاكيات قائمة على الفيزياء وتقنيات التوزيع العشوائي للمجال التي تُتطلب عادةً لعملية النقل من المحاكاة إلى الواقع.

المؤلفون الأصليون: Devdutt Subhasish, Henrik Hose, Sebastian Trimpe

نُشر 2026-05-05
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Devdutt Subhasish, Henrik Hose, Sebastian Trimpe

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم طفل صغير ركوب دراجة أحادية العجلة (يونيسيكل) على حبل مشدود. إذا حاولت تعليمه من خلال تركه يسقط ثم النهوض مجدداً، فسيستغرق الأمر وقتاً طويلاً جداً وسيتعرض للأذى. عادةً ما يحاول المهندسون حل هذه المشكلة ببناء "عالم افتراضي" مثالي (محاكي) حيث يمكن للروبوت التدرب على السقوط ملايين المرات دون خدش واحد. ثم يأملون أن تعمل المهارات التي تعلمها في "لعبة الفيديو" في الحياة الواقعية.

تقول هذه الورقة البحثية: "لماذا نرهق أنفسنا مع لعبة الفيديو؟ دعونا نعلم الروبوت في العالم الحقيقي، ولكن بطريقة ذكية للغاية."

إليك تفصيل كيف فعلوا ذلك، باستخدام تشبيهات بسيطة:

الروبوت: الـ "Mini Wheelbot"

تخيل الروبوت كأنه دراجة أحادية عجلة صغيرة، غير مستقرة للغاية. إنه يشبه "البلبل" (الدوامة) الذي يحاول خوض سباق. من الصعب التحكم فيه لأنه:

  • غير مستقر: إذا دفعته قليلاً، فقد ينقلب.
  • سريع: يستجيب في لمح البصر.
  • منزلق: عندما يتحرك بسرعة، تنزلق عجلته على الأرض بطرق يصعب التنبؤ بها رياضياً.

المشكلة: "فخ المحاكي"

تتعلم معظم الرونات عن طريق التدرب في محاكاة حاسوبية أولاً. الأمر يشبه جهاز محاكاة الطيران للطيارين. لكن بناء محاكي مثالي لدراجة أحادية العجلة متأرجحة ومنزلقة هو أمر صعب للغاية. إذا لم يكن المحاكي مثالياً، فسوف يتعلم الروبوت حِيلاً خاطئة ويفشل عندما يصل إلى المسار الحقيقي.

الحل: "Infoprop Dyna" (الحالم الذكي)

استخدم المؤلفون طريقة جديدة تسمى Infoprop Dyna. فكر في هذا كأن الروبوت هو حالم كفء للغاية.

بدلاً من الحاجة إلى لعبة فيديو مثالية، يقوم الروبوت بما يلي:

  1. يجرب شيئاً ما في الحياة الواقعية (مثلاً: ينعطف يساراً).
  2. يتذكر ما حدث (مثلاً: "انعطفت يساراً، لكنني انزلقت قليلاً").
  3. "يحلم" بآلاف التنويعات لتلك اللحظة في رأسه. يتخيل: "ماذا لو انعطفت بقوة أكبر قليلاً؟ ماذا لو كانت الأرض مبللة قليلاً أكثر؟".
  4. يتعلم من أحلامه. ولأنه يستطيع تخيل ملايين السيناريوهات في جزء من الثانية، فإنه يتعلم بشكل أسرع بكثير مما لو انتظر فقط وقوع الحوادث في الحياة الواقعية.

"السحر" في هذه الطريقة هو أنها تعرف أن أحلامها ليست مثالية. فهي تستخدم خدعة رياضية خاصة لتصفية "الضجيج" (الأخطاء في خيالها) حتى لا ترتبك بسبب أحلام اليقظة الخاصة بها.

السباق: من التمايل إلى الاحتراف في 11 دقيقة

وضع الفريق هذا الروبوت على مسار حقيقي وبدأوا حساب الوقت. إليك الجدول الزمني لما حدث:

  • الدقيقة 0–1: يقود إنسان الروبوت حول المسار باستخدام عصا تحكم لمنحه "إحماءً" حتى لا يصطدم فوراً.
  • الدقيقة 1–5: يبدأ الروبوت التعلم بمفرده. لا يزال حذراً جداً، مثل سائق جديد في رحلة تجريبية.
  • الدقيقة 6: الدورة الأولى! ينجح الروبوت في إنهاء دورة كاملة حول المسار.
  • الدقيقة 7–8: يصبح أكثر سلاسة، لكنه لا يزال مهتزاً قليلاً عند المنعطفات الحادة.
  • الدقيقة 9–11: الإتقان. يكتشف الروبوت سرّاً: الانزلاق المتحكم به.
    • التشبيه: تخيل سائق سيارة سباق يلتف حول منحنى. السائق العادي يضغط على المكابح وينعطف بحذر. أما هذا الروبوت، فقد أدرك أنه عند السرعات العالية، من الأسرع ترك العجلة الخلفية تنزلق قليلاً (التفحيط/Drifting) ليدور حول المنعطف بسرعة.
    • اكتشف الروبوت استراتيجية "التفحيط" هذه من تلقاء نفسه، فقط من خلال التجربة في العالم الحقيقي.

النتائج

  • السرعة: انتقل الروبوت من متوسط سرعة 0.15 م/ث (مشية بطيئة) إلى 0.5 م/ث (ركض سريع) في 11 دقيقة فقط.
  • الكفاءة: أكمل أكثر من ثلاث مرات عدد الدورات التي أكملها الروبوت الذي يتم التحكم فيه بشرياً في نفس الوقت.
  • لا توجد محاكيات: لم يستخدموا سطراً واحداً من الكود لمحاكاة الفيزياء. تعلم الروبوت بالكامل من خلال التفاعل مع الأرض الحقيقية والهواء الحقيقي.

الخلاصة

تظهر هذه الورقة البحثية أنك لست بحاجة إلى لعبة فيديو مثالية لتعليم الروبوت كيفية السباق. من خلال استخدام طريقة تسمح للروبوت بـ "الحلم" بتجاربه مع تصفية الأخطاء، يمكن لروبوت صعب التحكم وغير مستقر أن يتعلم السباق بقوة وأمان في الوقت الذي يستغرقه إعداد كوب من القهوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →