← أحدث الأبحاث
💻 computer science

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

تقدم هذه الورقة برامج SUN (الموحدة دلاليًا) ونظام Kuafu، اللذين يجسران الفجوة بين التحكم القائم على النماذج والسياسات المتعلمة من خلال التوليف التلقائي لبرمجيات قابلة للتنفيذ ذات أنواع ومسندة لغويًا توحد بين التحقق من التحكم التنبئي بالنماذج (MPC) وتدريب التعلم المعزز (RL)، مما يتيح معالجة قوية طويلة المدى دون الحاجة إلى مكافآت كثيفة يدوية أو عروض توضيحية بشرية.

المؤلفون الأصليون: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

نُشر 2026-09-01
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما كانت الروبوتات أسياداً في أرض المصنع، حيث تكرر نفس الحركة الدقيقة آلاف المرات دون خطأ. ولكن عندما يُطلب منها تنفيذ مهمة معقدة متعددة الخطوات في بيئة منزلية فوضوية وغير متوقعة — مثل فتح درج، وإخراج زجاجة، ووضعها على طاولة — فإنها غالباً ما تتعثر. تكمن الصعوبة في سد الفجوة بين طريقتين مختلفتين للتفكير في الحركة. تعتمد إحدى الطريقتين على قواعد رياضية صارمة لحساب كل زاوية مفصل وقوة، مما يضمن عدم اصطدام الروبوت، لكن هذه الطريقة تتسم بالهشاشة وتفشل إذا تغير العالم قليلاً. أما الطريقة الأخرى فتستخدم التعلم عن طريق التجربة والخطأ، حيث يتدرب الروبوت حتى يتقن المهمة، ولكن هذا غالباً ما يتطلب آلاف الساعات من العروض البشرية أو مكافآت مصممة بعناية يصعب وضع معاييرها. لسنوات طويلة، عملت هاتان الطريقتان في مسارات منفصلة، حيث عجز المخططون الصارمون عن التكيف، وعجز المتعلمون عن فهم المنطق العميق للمهمة.

قدم باحثون في جامعة كاليفورنيا، لوس أنجلوس، وزملاؤهم نظاماً جديداً يسمى "كوافّو" (Kuafu) يحاول نسج هاتين الطريقتين معاً. فبدلاً من معاملة تعليمات الروبوت كمجموعة عابرة من الأهداف أو نص جامد، ابتكروا برنامجاً مستمراً ومحدد النوع يعمل كمصدر وحيد للحقيقة للعملية بأكملها. هذا البرنامج، الذي يسمونه برنامج "الموحد دلالياً" (SUN Program)، مكتوب بطريقة تمكن الحاسوب من فهم العلاقات الفيزيائية بين الأشياء، مثل الاتجاه الذي يواجه به مقبض الدرج أو المسافة التي يجب رفع الزجاجة بها. والأهم من ذلك، يُستخدم هذا البرنامج نفسه للتحقق من أفعال الروبوت، ولتعليمه كيفية الحركة، ولتوليد البيانات اللازمة ليتعلم من الصفر. ومن خلال الحفاظ على المعنى الجوهري للمهمة ثابتاً من مرحلة التخطيط الأولية وصولاً إلى مرحلة التعلم النهائية، يمنع النظام الروبوت من الانحراف عما كان من المفترض القيام به فعلياً.

يبدأ النظام بأخذ تعليمات لغوية بسيطة من الإنسان، مثل "افتح الدرج وضع الكوب بداخله". يقرأ وكيل ذكاء اصطناعي هذه التعليمات ويبني برنامج (SUN) عبر اختيار وحدات بناء محددة مسبقاً تصف الأفعال والقيود الفيزيائية. ثم يختبر هذا البرنامج في محاكاة عالية الدقة، باستخدام طريقة تحكم متطورة لمعرفة ما إذا كانت المهمة ممكنة فيزيائياً. وإذا كشفت المحاكاة أن التعليمات معيبة أو مستحيلة التنفيذ، يقوم النظام تلقائياً بإصلاح البرنامج قبل بدء أي عملية تعلم. وتعد عملية الفرز هذه حيوية لأنها تضمن عدم مطالبة الروبوت بتعلم مهمة لا يمكن إنجازها، مما يستبعد الأفكار السيئة قبل أن تهدر الوقت وقدرة الحوسبة.

بمجرد التحقق من صحة البرنامج، يستخدمه النظام لتوليد آلاف الأمثلة الناجحة لأداء الروبوت للمهمة. وهذه الأمثلة ليست مجرد حركات عشوائية؛ بل هي موجهة بالبرنامج المستمر الذي يتتبع كل مرحلة من مراحل المهمة، بدءاً من اللحظة التي يلمس فيها القابض المقبض وحتى اللحظة التي يفتح فيها الدرج بالكامل. يتعلم الروبوت بعد ذلك من هذه الأمثلة، أولاً من خلال محاكاة الحركات الناجحة، ثم من خلال صقلها عبر عملية تجربة وخطأ محكومة بصرامة بالبرنامج الأصلي. يضمن هذا أنه بينما يتعلم الروبوت أن يكون مرناً وتفاعلياً، فإنه لا يفقد أبداً رؤية الهدف النهائي. والنتيجة هي سياسة يمكنها تنفيذ مهام معقدة متعددة المراحل بمستوى من الموثوقية لم تستطع الطرق السابقة تحقيقه.

في سلسلة من الاختبارات شملت تسع مهام تلاعب مختلفة، تتراوح بين تكديس المكعبات وإعادة توجيه الزجاجات وفتح الأدراج، أظهر النظام تحسناً ملحوظاً مقارنة بالطرق الحالية. وبينما عانت النهج الأخرى التي تعتمد على مكافآت نادرة أو تخطيط آني من صعوبة النجاح في أكثر من ثلث الحالات، حقق هذا النظام الجديد معدل نجاح يزيد عن 82 بالمائة. ووجد الباحثون أن النظام كان فعالاً بشكل خاص في التعامل مع المهام التي تتطلب خطوات عديدة، محافظاً على أدائه حتى مع زيادة تعقيد التسلسل. علاوة على ذلك، كانت البيانات التي ولدها هذا النظام ذات جودة عالية لدرجة أنها سمحت لنموذج تعلم بصري بالنجاح في 46 بالمائة من التجارب، وهو رقم يزيد عن ضعف معدل النجاح للنماذج المدربة على بيانات من طرق توليد أخرى.

إن الاختبار الحقيقي لأي نظام روبوتي هو ما إذا كان بإمكانه الانتقال من أمان محاكاة الكمبيوتر إلى العالم الحقيقي. وللتحقق من ذلك، قام الباحثون بنشر السياسات المدربة على روبوتات فيزيائية من صنع شركتي "فرانكا" (Franka) و"كينوفا" (Kinova)، باستخدام كاميرات لتوجيه أفعال الروبوت دون أي معرفة مسبقة بهيكل المهمة المحددة. ودون أي ضبط إضافي أو ممارسة في العالم الحقيقي، أكملت الروبوتات بنجاح 34.7 بالمائة من التجارب الفيزيائية عبر تكوينات متنوعة. ويشير هذا الانتقال "صفري الخطوات" (zero-shot transfer)، حيث يعمل الروبوت المدرب بالكامل في المحاكاة فوراً على آلة حقيقية، إلى أن البرنامج المستمر قد نجح في التقاط المنطق الجوهري للمهمة، مما سمح للسلوك المتعلم بالتعميم في العالم المادي.

يقر الباحثون بأن هذا النهج له حدود؛ فهو يعتمد حالياً على مكتبة محددة مسبقاً من الأفعال الفيزيائية ويتطلب فهماً واضحاً للأشياء في المشهد، مما يعني أنه لا يمكنه بعد التعامل مع الأجسام القابلة للتشكيل مثل القماش أو السوائل دون برمجة جديدة كبيرة. بالإضافة إلى ذلك، يتقدم النظام عبر المهام في اتجاه واحد ولا يمكنه التراجع إذا حدث خطأ فيزي، مما يحد من قدرته على التعافي من بعض أنواع الأخطاء. ومع ذلك، فإن النتائج ترسي مبدأً جديداً لتعلم الروبوتات: وهو أن الحفاظ على المعنى الدلالي للمهمة متسقاً عبر التخطيط والتحقق والتعلم يخلق أساساً قوياً للأتمتة. ومن خلال ضمان عدم انحراف فهم الروبوت للمهمة، يجسّر النظام الفجوة بين التحكم الصارم والتعلم المرن، مما يفتح مساراً نحو روبوتات يمكنها تنفيذ مهام معقدة بموثوقية في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →