← أحدث الأبحاث
🤖 machine learning

Reinforcement Learning for Real-Time Vision-Language-Action Policies

تقدم هذه الورقة البحثية إطار عمل Real-Time EXPO-FT، وهو إطار تعلم تعزيزي يفصل بين توليد الأفعال التعبيري البطيء وتحرير الأفعال التفاعلي السريع لتمكين التكيف عالي الأداء وذي الكفاءة في العينات لنماذج الرؤية واللغة والأفعال الضخمة مع الديناميكيات الواقعية رغم زمن انتقال الاستدلال.

المؤلفون الأصليون: Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn

نُشر 2026-09-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات من أجل التحرك بمرونة الكائنات الحية. وبينما يمكن برمجتها لاتباع مجموعة صارمة من التعليمات في المصنع، فإن العالم الحقيقي فوضوي، وغير متوقع، ويتحرك بسرعة. وللتنقل في هذا الوسط، لجأ الباحثون إلى نوع من الذكاء الاصطناعي يُعرف بنموذج "الرؤية واللغة والعمل" (vision-language-action model). هذه البرامج الحاسوبية الضخمة مدربة على كميات هائلة من البيانات، مما يسمح لها بفهم ما تراه عبر الكاميرا، وقراءة تعليمات نصية، وتحديد كيفية تحريك ذراع روبوتية. إنها قوية لأنها رأت الكثير من الأمثلة حول كيفية عمل العالم، فهي تعمل مثل مكتبة ضخمة من الخبرات. ومع ذلك، هناك عقبة كبيرة: نظرًا لأن هذه النماذج ضخمة ومعقدة للغاية، فإنها تستغرق وقتًا ملحوظًا للتفكير. وفي الجزء من الثانية الذي يستغرقه الكمبيوتر لمعالجة صورة واتخاذ قرار بشأن حركة ما، يكون العالم المادي قد تغير بالفعل. فإذا كان الروبوت يحاول الإمساك بكرة أو موازنة جسم ما، فإن المعلومات التي استخدمها لاتخاذ قراره تكون قد أصبحت قديمة بحلول الوقت الذي يبدأ فيه الحركة فعليًا، مما يؤدي غالبًا إلى فشل الإجراء.

قام فريق من الباحثين في جامعة ستانفورد بتطوير طريقة جديدة لتعليم هذه النماذج الضخمة كيفية العمل في الوقت الفعلي، حتى عندما تكون بطيئة في التفكير. يعالج نهجهم، المسمى "Real-Time EXPO-FT"، مشكلة التأخير عن طريق تقسيم عملية اتخاذ القرار في الروبوت إلى جزأين متميزين. فبدلاً من إجبار النموذج الضخم والبطيء على القيام بكل تعديل بسيط في كل جزء من الثانية، فإنهم يتركونه يقوم بالعمل الشاق المتمثل في التخطيط لمسار عام، بينما يتولى برنامج حاسوبي أصغر وأسرع التعامل مع التصحيحات الفورية. تخيل قائد أوركسترا يقود الفرقة؛ القائد يحدد الإيقاع واللحن العام، لكن العازفين الأفراد يجب أن يعدلوا عزفهم فورًا للبقاء في تناغم. في هذا النظام، يعمل النموذج الضخم كقائد أوركسترا، حيث يقترح تسلسلًا من الحركات بناءً على ما رآه قبل لحظة. ثم يقوم مساعد خفيف الوزن بمراقبة الحالة الراهنة للعالم وإجراء تعديلات سريعة وصغيرة على تلك الحركات المقترحة لضمان أنها لا تزال صحيحة للحظة التي يحتاج فيها الروبوت للتحرك فعليًا. وهذا يسمح للروبوت باستخدام المعرفة العميقة للنموذج الضخم دون أن يعيقه بطء سرعة تفكيره.

اختبر الباحثون هذه الطريقة في بيئتين مختلفتين تمامًا: عالم محاكي للفيزياء، والعالم المادي الفعلي. في المحاكاة، تحدى الباحثون الروبوت بعشر مهام ديناميكية مختلفة، مثل موازنة كرة على طبق، وركل كرة قدم أثناء تجنب مدافع، والإمساك بجسم متحرك. وقارنوا طريقتهم الجديدة بالعديد من التقنيات الموجودة التي حاولت التعامل مع التأخير. كانت النتائج واضحة: سمح النهج الجديد للروبوت بالنجاح في كل تجربة تقريبًا، متفوقًا على جميع الأساليب الأخرى، بما في ذلك تلك التي لم تكن مضطرة للتعامل مع التأخير على الإطلاق. كان هذا اكتشافًا مهمًا لأنه أظهر أنه من خلال تعليم النظام صراحةً كيفية مراعاة بطئه الخاص، يمكن للروبوت أن يصبح أكثر موثوقية من الأنظمة التي هي نظريًا أسرع ولكنها أقل قدرة على التكيف.

لإثبات نجاح ذلك في العالم الحقيقي، نقل الفريق الروبوت إلى مختبر وأعطاه أربع مهام صعبة تتطلب رد فعل سريعًا ومستمرًا. شمل ذلك الحفاظ على توازن كرة تنس طاولة على طبق دوار، والتقاط مكعب من سطح دوار، والإمساك بجسم تمرره ذراع روبوتية أخرى، وركل كرة نحو هدف بينما يتحرك مدافع حولها. حدد الباحثون وقت التدريب بعشر دقائق فقط من تفاعل الروبوت مع البيئة، مما يضمن قدرة النظام على التعلم بسرعة دون الحاجة إلى ساعات لا نهاية لها من الممارسة. قبل تطبيق طريقتهم، كان معدل نجاح الروبوت في هذه المهام منخفضًا للغاية، حيث بلغ في المتوسط حوالي 42 بالمائة. وبعد استخدام إطار التدريب في الوقت الفعلي الجديد، قفز معدل النجاح إلى 97 بالمائة. تعلم الروبوت التكيف مع الحركات الفوضوية للأجسام والقيود الزمنية للمهام دون أي تدخل بشري أثناء عملية التدريب.

كما استكشفت الدراسة مدى صمود النظام تحت ظروف مختلفة. فعندما زاد الباحثون التأخير في عملية تفكير الروبوت بشكل اصطناعي، حافظت الطريقة الجديدة على مستواها العالي من الأداء، بينما فشلت الأساليب الأخرى مع زيادة طول مدة التأخير. وبالمثل، عندما زادت سرعة الأجسام المتحركة، استمر الروبوت الذي يستخدم هذا الإطار الجديد في النجاح، بينما عانت الأساليب الأخرى لمواكبة السرعة. يوضح هذا أن النظام لا يعمل فقط لسرعة أو تأخير محددين، بل هو قوي بما يكفي للتعامل مع الطبيعة غير المتوقعة للبيئة الديناميكية. وأشار الباحثون إلى أنه على الرغم من أن نظامهم فعال للغاية، إلا أنه لا يزال يعتمد على إنسان لإعادة ضبط الروبوت بعد انتهاء المهمة، ويتطلب طريقة محددة لتحديد النجاح لكل مهمة. ومع ذلك، فإن الإنجاز الجوهري هو تقديم دليل على أن نماذج الذكاء الاصطناعي الضخمة والقوية يمكن جعلها تعمل في الوقت الفعلي، مما يسد الفجوة بين التخطيط البطيء والمتأني للذكاء الاصطناعي والمتطلبات السريعة والتفاعلية للعالم المادي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →