← أحدث الأبحاث
💻 computer science

StructRL: Structured Action-Space Exploration for Flow-Based VLAs

تقدم الورقة البحثية StructRL، وهو إطار عمل للتعلم المعزز لنماذج الرؤية واللغة والعمل القائمة على التدفق، والذي يتغلب على مشكلة "تخفيف الضجيج الهيكلي" التي تعاني منها الأساليب الحالية عن طريق نقل العشوائية الهيكلية مباشرة إلى فضاء العمل عبر وحدة فك تشفير (ODE) حتمية وإعادة تشغيل الخطوة الأخيرة، مما يحسن بشكل كبير من كفاءة الاستكشاف والأداء خارج نطاق التوزيع في مهام المناولة الروبوتية.

المؤلفون الأصليون: Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

نُشر 2026-08-18
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لم تعد الروبوتات التي يمكنها فهم لغة البشر واتباع تعليمات معقدة مجرد حلم من أحلام الخيال العلمي؛ بل أصبحت واقعاً في المختبرات حول العالم. هذه الأنظمة، المعروفة بنماذج (الرؤية-اللغة-الفعل)، تعمل بمثابة عقل للروبوت، حيث تستقبل ما يراه الروبوت وما يقوله الإنسان، ثم تقرر بدقة كيفية تحريك ذراعيه ويديه لإكمال مهمة ما. ولجعل هذه الحركات سلسة ودقيقة، غالباً ما يستخدم الباحثون تقنية تعمل مثل النحات الذي يصقل كتلة من الطين؛ حيث يبدأ الكمبيوتر بتخمين خشن ومشوش لما يجب أن يفعله الروبوت، ثم يقوم بتنقيته تدريجياً، خطوة بخطوة، حتى تظهر حركة مثالية وانسيابية. هذه العملية قوية للغاية، لكنها تصطدم بحائط مسدود عندما يحاول الروبوت تعلم مهام جديدة بمفرده. فلكي يتعلم، يجب على الروبوت أن يستكشف، عبر تجربة أفعال مختلفة ليرى ما ينجح وما يفشل. ومع ذلك، إذا حاول الروبوت التعلم عن طريق إضافة اهتزازات عشوائية إلى حركاته أثناء عملية التنقية هذه، فإن فعل التنقية نفسه قد يؤدي بالخطأ إلى تنعيم تلك الاهتزازات قبل أن يتمكن الروبوت من تجربتها فعلياً. وينتهي الأمر بالروبوت باستكشاف يكون إما عشوائياً جداً لدرجة لا تجعله مفيداً، أو فوضوياً جداً لدرجة تجعله غير آمن.

لقد اكتشف فريق من الباحثين طريقة أفضل لتعليم هذه الروبوتات كيف تتعلم من أخطائها. فقد وجدوا أن المشكلة لم تكن في فكرة إضافة الضجيج لتشجيع الاستكشاف، بل في "مكان" إضافة هذا الضجيج. ففي الطرق السابقة، كانت التباينات العشوائية تُحقن في مرحلة مبكرة من عملية التنقية، ليتم مسحها جزئياً بواسطة الخطوات اللاحقة التي تصقل الحركة. ويطلق الباحثون على هذه الظاهرة اسم "تخفيف الضجيج الهيكلي"، حيث يتم غسل أنماط الاستكشاف المحددة والمفيدة قبل أن تؤثر على سلوك الروبوت الفعلي. ولحل هذه المشكلة، طوروا نهجاً جديداً يسمى (StructRL). فبدلاً من إضافة الضجيج بينما لا يزال الكمبيوتر يحدد ماهية الحركة، تركوا الكمبيوتر ينهي مهمته أولاً، لينتج خطة حركة نظيفة ومثالية. وفقط بعد اكتمال تلك الخطة، يقومون بإضافة التباينات اللازمة مباشرة إلى الحركة النهائية. وهذا يضمن أن الروبوت سيجرب بالفعل أفعالاً جديدة ومختلفة قليلاً، بدلاً من أن يتم تنعيم هذه الأفعال بواسطة الحسابات الداخلية للكمبيوتر.

كان المفتاح لجعل هذا العمل ناجحاً هو إدراك أن حركات الروبوت لها هيكل محدد يتجاهله الضجيج العشوائي غالباً. إذ يتحرك ذراع الروبوت بثلاث طرق متميزة: فهو يغير موقعه في الفضاء، ويغير اتجاه دورانه، ويفتح أو يغلق قابضه. وهذه الأنواع الثلاثة من الحركة مختلفة عن بعضها البعض؛ فقد تكون إزاحة صغيرة في الموقع آمنة، بينما قد يكون دوران بنفس الحجم خطيراً، كما أن القابض يحتاج إلى نوع مختلف تماماً من التحكم. وقد صمم الباحثون طريقتهم الجديدة لتحترم هذه الاختلافات؛ حيث أضافوا ضجيجاً سلساً بمرور الوقت، حتى لا يهتز الروبوت ذهاباً وإياباً، وقاموا بتغيير حجم الضجيج بشكل مختلف لكل جزء من الحركة. وهذا يعني أن الروبوت يمكنه استكشاف مواضع جديدة بمدى حركة واسع، مع الحفاظ على دوراناته وأفعال قابضه أكثر حذراً وتحكماً. ومن خلال إبقاء عملية التنقية الداخلية للكمبيوتر حتمية وقابلة للتنبؤ، وإدخال العشوائية الضرورية فقط في النهاية، ضمن الباحثون أن يكون استكشاف الروبوت آمناً وفعالاً في آن واحد.

اختبر الفريق هذه الطريقة الجديدة على مجموعة متنوعة من المهام المحاكاتية وعلى ذراع روبوت حقيقي في مختبر. وفي عمليات المحاكاة، طُلب من الروبوتات أداء مهام معالجة معقدة، مثل التقاط الأشياء، ونقلها إلى مواقع محددة، وتجميع الأجزاء. وأظهرت النتائج ميزة واضحة للنهج الجديد؛ ففي مجموعة من المهام الصعبة طويلة المدى، حققت الروبوتات التي تستخدم الطريقة الجديدة معدل نجاح يقترب من 99 بالمائة، متفوقة بشكل كبير على الطرق القديمة التي تضيف الضجيج أثناء عملية التنقية. وكان التحسن أكثر وضوحاً عندما واجهت الروبوتات مواقف لم ترها من قبل، مثل وضع الأشياء في مواقع جديدة أو تحت ظروف إضاءة مختلفة. فقد تمكنت الروبوتات المدربة بالطريقة الجديدة من التكيف بشكل أسرع، وتعلمت كيفية التعامل مع هذه التغييرات غير المتوقعة بعدد أقل من المحاولات. ويشير هذا إلى أن الحفاظ على هيكل الاستكشاف أمر بالغ الأهمية لمساعدة الروبوتات على تعميم مهاراتها في العالم الحقيقي الفوضوي وغير المتوقع.

ولإثبات نجاح ذلك خارج نطاق الكمبيوتر، قام البالباحثون بتثبيت أفضل نموذج لديهم على ذراع روبوت مادي في مختبر حقيقي. وقد أعطوا الروبوت تحديين محددين: التقاط موزة وتوصيل شاحن في مقبس حائط. في البداية، لم يكن لدى الروبوت سوى عدد قليل من العروض التوضيحية لهذه المهام، وفشل تماماً عندما طُلب منه القيام بها بمفرده. ثم ترك الباحثون الروبوت يتعلم من خلال التجربة والخطأ، باستخدام طريقة الاستكشاف الهيكلي الجديدة. وبالنسبة لمهمة الموز، تعلم الروبوت التقاط الثمرة بنجاح بنسبة 84 بالمائة بعد ساعة واحدة فقط من التعلم المباشر، بينما نجح الروبوت الذي استخدم الطريقة القديمة الأقل هيكلية بنسبة 56 بالمائة فقط. أما بالنسبة لمهمة الشاحن، التي تتطلب مهارات حركية دقيقة لمحاذاة القابس مع المقبس، فقد سمحت الطريقة الجديدة للروبوت بالوصول إلى حالة مستقرة وناجحة أسرع بنحو خمس دقائق من الطريقة القديمة. وقد أكدت هذه النتائج الواقعية أن التحسينات النظرية تُرجمت مباشرة إلى تعلم أسرع وأكثر موثوقية للآلات الفيزيائية.

يسلط نجاح هذا العمل الضوء على تحول جوهري في كيفية تعليم الروبوتات. فهو يوضح أن الطريقة التي يستكشف بها الروبوت بيئته لا تقل أهمية عن الذكاء الذي يستخدمه لاتخاذ القرارات. ومن خلال فهم أن عملية "التفكير" الداخلية للروبوت يجب أن تظل ثابتة وقابلة للتنبؤ، بينما تكون عملية "الفعل" هي المكان الذي يحدث فيه التجريب، يمكن للباحثين إنشاء أنظمة تتعلم بكفاءة وأمان أكبر. وتشير النتائج إلى أنه لكي تتقن الروبوتات الحركات المستمرة والمعقدة المطلوبة للمهام في العالم الحقيقي، يجب أن نتوقف عن معاملة أفعالها كسلسلة من التخمينات العشوائية، ونبدأ في معاملتها كتجارب مهيكلة وهادفة. هذا النهج لا يجعل الروبوتات أفضل في اتباع التعليمات فحسب، بل يمنحها القدرة على استنتاج تعليمات جديدة بمفردها، وهي خطوة حاسمة نحو آلات يمكنها حقاً مساعدتنا في حياتنا اليومية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →