← أحدث الأبحاث
💻 computer science

SmoothRL: Online Reinforcement Learning During Asynchronous Execution

يُعد SmoothRL إطار عمل للتعلم التعزيزي عبر الإنترنت يتيح الضبط الدقيق عالي الكفاءة في استهلاك العينات لسياسات الروبوتات مسبقة التدريب ضمن حلقات الاستدلال غير المتزامنة، وذلك من خلال نمذجة الجدول الزمني للتنفيذ صراحةً ونشر التدرجات فقط عبر مناطق الإجراءات المنفذة حديثاً لضمان الموثوقية في الوقت الفعلي والتحكم السلس.

المؤلفون الأصليون: Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

نُشر 2026-09-01
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Guang Gao, Yuxuan Nong, Baifu Huang, Jianan Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات في سبيل التحرك بمرونة الكائنات الحية. وبينما علّم الذكاء الاصطناعي الآلات فهم اللغة والتعرف على الأشياء بدقة مذهلة، فإن ترجمة هذا الفهم إلى حركة جسدية لا تزال تشكل عقبة مستعصية. المشكلة لا تكمن فقط في ضرورة أن تكون الروبوتات ذكية؛ بل يجب أن تكون سريعة وسلسة أيضاً. ففي العالم الحقيقي، لا يمكن لذراع الروبوت أن تتوقف لتفكر بين كل حركة صغيرة وأخرى. إذا توقفت لحساب خطوتها التالية، ستصبح الحركة متقطعة وتفشل المهمة. وللتحرك بسلاسة، يجب على الروبوت التنبؤ بسلسلة من الحركات المستقبلية وتنفيذها بينما يقوم في الوقت نفسه بحساب المجموعة التالية. وهذا يخلق مشكلة توقيت معقدة: فالروبوت يعمل بناءً على تعليمات تم إنشاؤها قبل لحظة، بينما يعمل الكمبيوتر بالفعل على التعليمات الخاصة باللحظة التي تليها. وإذا حاول الروبوت التعلم من أخطائه أثناء العمل تحت هذه الظروف، فإن عملية التعلم غالباً ما تنهار، لأن الروبوت يُحاسب على أفعال لم يكملها فعلياً، أو أفعال أُجبر على التخلي عنها في منتصف الطريق.

لقد طور فريق من الباحثين في "أستريبوت" (Astribot) طريقة جديدة تسمى "SmoothRL" لحل لغز التوقيت هذا تحديداً. يسمح عملهم للروبوتات بالتعلم من الخبرة في الوقت الفين، حتى وهي تعمل وفق جدول زمني معقد ومتداخل حيث يحدث التفكير والحركة في آن واحد. ركز الباحثون على عدم تطابق جوهري في كيفية تدريب الروبوتات مقابل كيفية استخدامها. في الماضي، كان العلماء يدربون الروبوتات بافتراض أن الآلة ستتوقف، تفكر، ثم تتحرك في إيقاع متزامن ومثالي. لكن في العالم الحقيقي، وللحفاظ على سلاسة الحركة، تستخدم الروبوتات نظاماً تولد من خلاله "كتلة" من الحركات المستقبلية، وترسل الجزء الأول منها إلى المحركات، وتبدأ فوراً في حساب الكتلة التالية بينما لا يزال الجزء الأول قيد التنفيذ. وهذا يخلق وضعاً يتخلص فيه الروبوت باستمرار من أجزاء من خططه لأنه وصلت خطة أحدث وأكثر حداثة. أدرك الباحثون أنه لكي يتعلم الروبوت بفعالية في هذه البيئة، يجب أن يتوقف عن محاولة التعلم من أجزاء خطته التي تم التخلص منها، ويركز فقط على الأجزاء التي نفذها بالفعل.

يكمن جوهر حلهم في طريقة لتعليم الروبوت تجاهل الأفعال "الشبحية" التي أنشأها ولم يستخدمها. عندما يضع الروبوت خطة للثواني القليلة القادمة، فإنه يقسم تلك الخطة إلى ثلاث مناطق متميزة. تحتوي المنطقة الأولى على الأفعال التي تقرر قرارها بالفعل في دورة الحساب السابقة؛ ولا يمكن للروبوت تغييرها الآن. وتحتوي المنطقة الثانية على الأفعال الجديدة التي ينفذها الروبوت فعلياً أثناء حدوث عملية الحساب التالية. أما المنطقة الثالثة، فتتضمن بقية الأفعال المستقبلية التي من المرجح أن تُستبدل بالحساب التالي قبل أن يصل إليها الروبوت أبداً. لقد بنى الباحثون نظام تدريب ينظر فقط إلى المنطقة الثانية — أي الأفعال التي نفذها الروبوت بالفعل. إنهم يعلمون الروبوت تعديل سلوكه بناءً فقط على عواقب الحركات التي قام بها حقاً، مما يؤدي فعلياً إلى قطع إشارة التعلم عن أجزاء الخطة التي تم التخلص منها. وهذا يضمن أن الروبوت يتعلم من الواقع، وليس من مستقبل افتراضي لم يحدث قط.

ولاختبار ذلك، أعد الباحثون ثلاث مهام فيزيائية صعبة باستخدام روبوت متنقل بذراعين. تضمنت المهمة الأولى رمي جسم في سلة، وهي حركة تتطلب أرجحة مستمرة وغير منقطعة. فإذا تردد الروبوت أو تحرك بشكل متقطع عند الانتقال بين دورات الحساب، ستفشل عملية الرمي. وتطلبت المهمة الثانية من الروبوت وضع غطاء على قلم بدقة متناهية، عبر محاذاة جسمين صغيرين ضمن سماحية لا تتجاوز بضعة مليمترات. أما المهمة الثالثة، فقد تضمنت شق صندوق كرتوني عن طريق توجيه شفرة على خط رفيع جداً، وهي مهمة تتطلب دقة بمستوى المليمتر لتجنب قطع الصندوق نفسه. في جميع الحالات الثلاث، بدأ الروبوت بـ "دماغ" مدرب مسبقاً وكان جيداً ولكنه ليس مثالياً. وعندما ترك الباحثون الروبوت يمارس باستخدام طريقة التعلم غير المتزامنة الجديدة الخاصة بهم، كانت النتائج مذهلة. فقد قفزت قدرة الروبوت على رمي الجسم بنجاح من تسعة وثلاثين بالمائة إلى أربعة وتسعين بالمائة. وارتفحت مهارته في وضع الغطاء على القلم من ثمانية بالمائة فقط إلى ثلاثة وثمانين بالمائة. وارتفع معدل نجاحه في فتح الصندوق من ثلاثين بالمائة إلى تسعين بالمائة.

لم يكن التحسن يتعلق فقط بإنجاز المهمة بشكل أكثر تكراراً؛ بل كان يتعلق بكيفية حركة الروبوت. فقد قاس الباحثون سلاسة حركة الروبوت ووجدوا أن الطريقة الجديدة قللت من الهزات المفاجئة والتسارعات المتشنجة بنسبة تقارب النصف. كانت هذه السلاسة حاسمة لمهمة الرمي الديناميكية، حيث قد تؤدي أي وقفة في الحركة إلى سقوط الجسم قبل وصوله. كما أثبت النظام مرونة كافية للتعامل مع المساعدة البشرية. فإذا احتاج مشغل بشري للتدخل لتصحيح خطأ ما، يمكن للروبوت استيعاب هذا الفعل البشري مباشرة في عملية تعلمه دون الحاجة إلى ترجمته إلى كود مختلف. أصبح التصحيح البشري مجرد مثال آخر للطريقة الصحيحة للحركة، مما سمح للروبوت بالتعلم من تجاربه الخاصة ومن التوجيه البشري في آن واحد.

وجد الباحثون أن تعلم الروبوت لم يكن دائماً خطاً مستقيماً. ففي مهمة فتح الصندوق، انخفض أداء الروبوت فعلياً قبل أن يتحسن، مما يشير إلى أن النظام كان يستكشف طرقاً جديدة للحركة بدت في البداية أسوأ قبل العثور على المسار الصحيح. وهذا يشير إلى أن الروبوت كان يتعلم حقاً كيف يتكيف بدلاً من مجرد حفظ مجموعة ثابتة من الحركات. ومع ذلك، لاحظ الباحثون أيضاً حدود نهجهم. فقدرة الروبوت على التعلم لا تزال مرتبطة بجودة دماغه المدرب مسبقاً. فإذا كان الروبوت الأساسي مرتبكاً بشكل جوهري حول مهمة ما، فقد لا تكون التعديلات الصغيرة التي يجريها نظام التعلم هذا كافية لإصلاح المشكلة. علاوة على ذلك، يعتمد النظام على انتهاء حسابات الروبوت ضمن حد زمني صارم؛ فإذا أصبح الكمبيوتر بطيئاً جداً، يمكن أن يختل توقيت الحركات، مما يؤدي إلى زعزعة استقرار العملية برمتها.

في نهاية المطاف، يوضح هذا العمل أنه لكي تصبح الروبوتات مفيدة حقاً في العالم الحقيقي، يجب أن تتوافق خوارزميات التعلم الخاصة بها مع الواقع المتداخل والمعقد لكيفية حركتها. فمن خلال تعليم الروبوت التركيز فقط على الأفعال التي أكملها بالفعل وتجاهل تلك التي تخلص منها، خلق الباحثون مساراً للآلات لتعلم مهام معقدة وعالية السرعة دون التضحية بالسلاسة المطلوبة لأدائها. والنتيجة هي روبوت يمكنه الرمي، ووضع الأغطية، والقطع بمستوى من الموثوقية والانسيابية كان بعيد المنال سابقاً، مما يثبت أن مفتاح تحسين تعلم الروبوتات يكمن في فهم اللحظة الدقيقة التي تتحول فيها الخطة إلى واقع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →