← أحدث الأبحاث
💻 computer science

Continual Domain Randomization

تقترح هذه الورقة البحثية "التعشية النطاقية المستمرة" (CDR)، وهي نهج مبتكر يجمع بين التعشية النطاقية والتعلم المستمر لتدريب سياسات التعلم المعزز تسلسلياً على مجموعات فرعية من معاملات المحاكاة، مما يتغلب على عدم المثالية في التعشية المتزامنة ويحقق انتقالاً قوياً من المحاكاة إلى الواقع في المهام الروبوتية.

المؤلفون الأصليون: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

نُشر 2026-04-29
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية التقاط كوب. الطريقة الأذكى للقيام بذلك هي عادةً ترك الروبوت يتدرب ملايين المرات في محاكاة حاسوبية أولاً، حتى لا يكسر الروبوت الحقيقي أو يؤذي أي شخص. ولكن إليك المشكلة: المحاكاة الحاسوبية لا تكون أبداً مطابقة تماماً للعالم الحقيقي. قد يكون الروبوت الحقيقي أثقل قليلاً، أو المحركات أبطأ قليلاً، أو المستشعرات "مشوشة" قليلاً. هذا الاختلاف يسمى "فجوة الواقع" (Reality Gap). إذا دربت الروبوت في محاكاة مثالية، فإنه غالباً ما سيفشل فشلاً ذريعاً عند وضعه في العالم الحقيقي لأنه تعلم الاعتماد على كمال المحاكاة.

لحل هذه المشكلة، يستخدم العلماء حيلة تسمى "تعشية النطاق" (Domain Randomization). بدلاً من محاولة جعل المحاكاة مثالية، هم يعمدون إلى إفسادها عمداً. يجعلون الروبوت أثقل في جولة واحدة، وأخف في الجولة التالية، ويضيفون ضجيجاً وهمياً للمستشعرات، أو تأخيراً في التحكم. الفكرة هي أنه إذا تعلم الروبوت التعامل مع كل هذه النسخ "المفسدة"، فسيكون قوياً بما يكفي للتعامل مع العالم الحقيقي، والذي هو مجرد نسخة أخرى من النسخ "المفسدة".

المشكلة في الطريقة القديمة
الطريقة التقليدية تشبه محاولة تعلم السباحة عبر القفز في محيط عاصف به تيارات قوية، وأمواج ثقيلة، ومياه باردة، وكل ذلك في يومك الأول فقط. هذا صعب جداً! سيشعر الروبوت بالارتباك والارتباك، وسيتعلم استراتيجية سيئة (أو يفشل في تعلم أي شيء على الإطلاق) لأن المهمة صعبة للغاية.

الحل الجديد: تعشية النطاق المستمرة (CDR)
يقترح مؤلفو هذه الورقة طريقة أذكى للتعلم، والتي يسمونها "تعشية النطاق المستمرة" (Continual Domain Randomization - CDR). فكر في الأمر كتعلم قيادة السيارة:

  1. ابدأ بالسهل: أولاً، تتعلم القيادة في موقف سيارات مثالي وخالٍ، بلا رياح، ولا سيارات أخرى، وإطارات مثالية. أنت تتقن الأساسيات أولاً.
  2. أضف تحدياً واحداً في كل مرة: بمجرد أن تصبح جيداً في ذلك، لا تلقي بك فجأة في وسط إعصار. بدلاً من ذلك، أضف تحدياً واحداً جديداً فقط. ربما تقود تحت المطر. بمجرد إتقانك للقيادة في المطر، تضيف الرياح. بمجرد إتقان الرياح، تضيف حركة المرور الكثيفة.
  3. تذكر كل شيء: الجزء الصعب هو أنه عندما تتعلم القيادة في المطر، لا ينبغي أن تنسى كيفية القيادة على الرصيف الجاف. هذا هو المكان الذي يأتي فيه جزء "التعلم المستمر". يستخدم الروبوت تقنية ذاكرة خاصة (تسمى "توطيد الوزن المرن" - Elastic Weight Consolidation) والتي تعمل مثل "شبكة أمان". فهي تسمح للروبوت بتعلم مهارات جديدة (مثل التعامل مع المطر) دون "نسيان" المهارات القديمة (مثل القيادة على الرصيف الجاف).

كيف اختبروا ذلك
اختبر الباحثون هذه الفكرة في مهمتين:

  • الوصول (Reaching): ذراع روبوت تحاول لمس نقطة محددة.
  • الإمساك (Grasping): مهمة أكثر تعقيداً حيث يتعين على ذراع الروبوت العثور على صندوق، ومحاذاة قابضها بشكل مثالي، والتقاطه.

وقاموا بمقارنة طريقتهم "خطوة بخفظ" (CDR) مقابل طريقتين أخريين:

  • المحاكي "المثالي": التدريب فقط في عالم نظيف ومثالي (والذي يفشل في الواقع).
  • محاكي "الفوضى": إلقاء جميع المشاكل (المطر، الرياح، حركة المرور) في وجه الروبوت في وقت واحد.
  • الطريقة "الناسية": إضافة المشاكل واحداً تلو الآخر ولكن بدون استخدام شبكة أمان الذاكرة (لذا ينسى الروبوت الخطوات السابقة).

النتائج
كانت النتائج مبهرة:

  • الروبوت الذي تدرب باستخدام CDR تعلم بفعالية في المحاكاة.
  • عندما نقلوا الروبوت إلى العالم الحقيقي، كان أداؤه أفضل أو مساوياً لأداء الروبوت المدرب في وضع "الفوضى".
  • والأهم من ذلك، كان نظام CDR أكثر استقراراً. لم يهم إذا أضافوا التحديات بترتيب مختلف (المطر أولاً مقابل الرياح أولاً)؛ فقد تعلم الروبوت جيداً في كلتا الحالتين. أما الطريقة "الناسية"، فقد عانت إذا تغير ترتيب التحديات.

باختصار
تظهر هذه الورقة أنه بدلاً من إغراق الروبوت في بحر من المتغيرات العشوائية دفعة واحدة، فمن الأفضل تعليمه خطوة بخطوة، بإضافة صعوبة واحدة في كل مرة مع ضمان تذكره لكيفية التعامل مع ما سبق. هذا يخلق روبوتاً مستعداً للعالم الحقيقي الفوضوي وغير المتوقع دون الحاجة إلى اختباره في العالم الحقيقي أثناء التدريب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →