← أحدث الأبحاث
💻 computer science

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

تقترح هذه الورقة إطار عمل LEACL، الذي يسخر النماذج اللغوية الكبيرة لتفكيك مهام التلاعب طويلة المدى تلقائيًا وتوليد المواصفات اللازمة، مما يمكّن وكلاء التعلم التعزيزي من تحقيق أداء فائق من خلال التعلم المنهجي التلقائي باستخدام المكافآت الشحيحة فقط دون الحاجة إلى وظائف مكافأة كثيفة مصممة يدويًا.

المؤلفون الأصليون: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

نُشر 2026-07-28
📖 7 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيفية إعداد وجبة معقدة، مثل شطيرة فاخرة. لا يمكنك فقط أن تقول للروبوت "اصنع شطيرة"، وتتوقع منه أن يستنتج كيفية تقطيع الطماطم، ودهن الخبز بالزبدة، ورص الطبقات بشكل مثالي. إذا أعطيت الروبوت فقط إشارة "عمل جيد" أو "عمل سيئ" في النهاية، فمن المرجح أن يظل يتخبط بلا هدف لسنوات، دون أن يتعلم الخطوات المحددة. هذا هو عالم التعلم التعزيزي (Reinforcement Learning - RL)، حيث تتعلم الوكلاء البرمجية من خلال التجربة والخطأ. الجزء الصعب هو مشكلة "المكافأة الشحيحة": إذا حصل الروبوت على مكافأة فقط عندما تكتمل المهمة بنسبة 100%، فلن يعرف ما إذا كان يقترب من الهدف أم يبتعد عنه. ولحل هذه المشكلة، يستخدم العلماء غالبًا التعلم المنهجي (Curriculum Learning)، وهو أسلوب يجعل الروبوت يتدرب على نسخ سهلة من المهمة أولاً (مثل مجرد التقاط الخبز) قبل الانتقال إلى مهام أصعب (مثل تقطيع الطماطم). ولكن هنا تكمن العقبة: تصميم هذه الخطوات من السهل إلى الصعب يتطلب عادةً من خبير بشري كتابة كل قاعدة وإعداد للصعوبة يدويًا، وهو أمر بطيء وممل ويصعب القيام به لكل مهمة جديدة.

هنا يأيد LEACL (التعلم المنهجي التلقائي المعزز بالنماذج اللغوية الكبيرة)، وهو نهج جديد يطرح سؤالًا ذكيًا للغاية: "هل يمكننا جعل نموذج لغوي فائق الذكاء يقوم بعمل التخطيط الممل نيابة عنا؟" أراد الباحثون وراء هذه الورقة البحثية معرفة ما إذا كان بإمكانهم استخدام نموذج لغوي كبير (LLM) — وهو نفس نوع التقنية التي تشغل برامج الدردشة الآلية — ليعمل كمعلم ماهر. فبدلاً من قيام البشر بكتابة خطط الدروس يدويًا، سيقوم النموذج اللغوي الكبير بقراءة هدف بلغة طبيعية (مثل "افتح الدرج") وتقسيمه تلقائيًا إلى سلسلة من الخطوات الأصغر والقابلة للإدارة. والأفضل من ذلك، سيقوم النموذج اللماغي الكبير بعد ذلك بتصميم "عجلات التدريب" الخاصة بكل خطوة (إعدادات الصعوبة والمعلمات)، مما يسمح للروبوت بالتعلم باستخدام إشارة بسيطة وهي "النجاح/الفشل" في نهاية كل مهمة، دون الحاجة إلى تعليمات مكافأة معقدة مكتوبة يدويًا لكل حركة صغيرة.

تختبر الورقة هذه الفكرة على خمس مهام روبوتية صعبة، مثل فتح درج خزانة، أو وضع وعاء على طبق، أو تشغيل موقد. والنتائج واعدة للغاية. فقد وجد الباحثون أنه عندما تركوا النموذج اللغوي الكبير يصمم المنهج الدراسي، تعلم الروبوت هذه المهام الطويلة والمعقدة بشكل أسرع وأكثر نجاحًا مما لو حاول تعلمها دفعة واحدة دون مساعدة. في الواقع، حقق النظام المصمم بواسطة النموذج اللغماغي الكبير أداءً يضاهي، وأحيانًا يتفوق على، الأنظمة التي قضى فيها خبراء بشريون ساعات في صياغة خطوات التدريب وقواعد المكافأة يدويًا. تشير الدراسة إلى أنه من خلال ترك الذكاء الاصطناعي يتولى عملية "تخطيط الدروس"، يمكننا تعليم الروبات القيام بمهام معقدة متعددة الخطوات دون الحاجة إلى تدخل بشري لإدارة كل تفصيل صغير في عملية التدريب.

يوم دراسي للروبوت: كيف يعمل LEACL

تخيل روبوتًا يحاول تعلم مهمة طويلة الأمد (و"المهمة طويلة الأمد" هي مجرد طريقة منمقة لوصف وظيفة تتطلب خطوات عديدة لإتمامها) مثل طالب يحاول اجتياز امتحان نهائي. إذا منح المعلم درجة في النهاية فقط، فقد يدرس الطالب الأشياء الخاطئة أو يستسلم تمامًا. التعلم المنهجي التلقائي (Automatic Curriculum Learning - ACL) يشبه معلمًا خصوصيًا يضع منهجًا دراسيًا، يبدأ بأسئلة سهلة ثم يزيد صعوبتها تدريجيًا. ولكن عادةً ما يتعين على البشر كتابة هذا المنهج.

يغير LEACL قواعد اللعبة بجلب نموذج لغوي كبير ليكون بمثابة "رئيس المعلمين". تتم العملية عبر ثلاث مراحل ممتعة:

  1. التفكيك (Task Decomposition):
    تخيل أنك قلت للروبوت: "افتح الدرج العلوي للخزانة". قد يفكر الإنسان: "حسنًا، هذه مجرد وظيفة واحدة". لكن النموذج اللغماغي ينظر إليها ويقول: "لا، هذه في الواقع ثلاث وظائف: أولاً، مد يدك نحو الدرج. ثانًا، أمسك بالمقبض. ثالثًا، اسحب الدرج لفتحه". يستخدم النموذج اللغماغي معرفته الهائلة بكيفية عمل العالم (مثل معرفة أنه لا يمكنك سحب الدرج إذا لم تكن ممسكًا بالمقبض) لتفكيك الهدف الكبير إلى سلسلة منطقية من المهام الفرعية الأصغر. وهو يكتب هذه المهام بلغة "وصفة" خاصة تسمى PDDL، والتي يمكن للروبوت فهمها.

  2. خطة الدرس (Meta-Task Generation):
    الآن بعد أن أصبح لدى الروبوت الخطوات، فإنه يحتاج لمعرفة كيفية ممارسة تلك الخطوات. هل يبدأ والدرج مفتوح قليلاً؟ أم مغلق تمامًا؟ هل يجب أن يكون المقبض قريبًا أم بعيدًا؟ هنا يتألق النموذج اللغماغي مرة أخرى؛ إذ يعمل كمصمم منهج إبداعي، حيث يولد "فضاء مهام" لكل خطوة. فهو ينشئ نصًا برمجيًا بلغة بايثون يمكنه توليد آلاف النسخ المختلفة قليلاً من مهمة "أمسك المقبض". بعضها سهل جدًا (المقبض أمام الروبوت مباشرة)، وبعضها أصعب (المقبب بعيد قليلاً). كما يحدد النموذج اللغماغي أي النسخ "أصعب" من غيرها، مما يخلق سلماً مثالياً من الصعوبة يتسلقه الروبوت.

  3. الممارسة (Automatic Curriculum Learning):
    أخيرًا، يبدأ الروبوت التدريب. يستخدم خوارزمية تراقب مدى جودة أداء الروبوت. إذا كان الروبوت يتقن النسخ "السهلة" من المهمة، ينتقل النظام تلقائيًا إلى النسخ ذات الصعوبة "المتوسطة". وإذا كان الروبوت يعاني، يعود إلى النسخ السهلة. يتعلم الروبوت باستخدام إشارة بسيطة وهي "1" للنجاح و"0" للفشل في نهاية كل مهمة فرعية. لا يحتاج إلى إنسان ليقول له: "عمل جيد، لقد حركت ذراعك بوصتين باتجاه الهدف". فالمنهج الذي خطط له النموذج اللغماغي يقوم بكل العمل الشاق لتوجيه الروبوت.

النتائج: هل نجح الروبوت في الاختبار؟

اختبر الباحثون هذا النظام على خمس تحديات متميزة باستخدام محاكاة تسمى LIBERO (والتي قاموا بترقيتها إلى LIBERO+ للتعامل مع هذه الأنواع الجديدة من المهام). تضمنت المهام:

  • فتح درج سفلي.
  • وضع وعاء أبيض على طبق.
  • التقاط زجاجة كاتشب ووضعها في سلة.
  • تشغيل موقد ووضع قدر عليه.
  • وضع كوب في الميكروويف وإغلاق الباب.

قارنوا نظامهم المدعوم بالنموذج اللغماغي (LEACL) بعدة طرق أخرى:

  • نهج "عدم فعل شيء": مجرد ترك الروبوت يحاول تعلم المهمة كاملة باستخدام مكافأة شحيحة. (النتيجة: فشل تمامًا، وحقق نسبة نجاح 0% في معظم المهام).
  • نهج "بدون منهج دراسي": تقسيم المهمة ولكن ترك الروبوت يتعلم كل خطوة دون سلم صعوبة ذكي. (فشل هذا النهج أيضًا بشكل ذريع، بنسب نجاح قريبة من 0% أو منخفضة جدًا).
  • نهج "الخبير البشري": حيث يقوم البشر بتصميم الخطوات ودوال المكافأة يدويًا (إعطاء الروبوت نقاطًا إضافية لكل اقتراب من الهدف). وهذا يُعتبر عادةً المعيار الذهبي.
  • نهج "LEAGUE": وهو أسلوب سابق يستخدم النماذج اللغامية لكتابة دوال مكافأة "كثيفة" (قواعد تسجيل نقاط معقدة) لكل خطوة.

إليكم ما حدث:
تفوق نظام LEACL، الذي استخدم النموذج اللغماغي لتخطيط المنهج الدراسي ولكنه اعتمد فقط على إشارة "النجاح/الفشل" البسيطة، على الأنظمة التي حاولت التعلم بدون منهج دراسي. والأكثر إثارة للإعجاب، أنه تفوق على نظام LEAGUE (الذي استخدم قواعد مكافأة معقدة ومعدلة يدويًا) في أربع من أصل خمس مهام.

من حيث الأرقام الخام، حقق نظام LEACL معدلات نجاح مثل 99.8% لفتح الدرج و90.7% لوضع الوعاء على الطبق. كانت هذه الأرقام قريبة جدًا، وفي بعض الحالات مطابقة، لأداء "المنهج البشري" حيث صمم الخبراء كل شيء يدويًا. على سبيل المثال، في مهمة "فتح الدرج السفلي"، حقق النظام المصمم بشريًا 99.8 ± 0.2%، بينما حقق LEACL نسبة 99.8 ± 0.1%. وفي مهمة "وضع الكوب في الميكروويف"، حقق النظام البشري 89.0 ± 7.5%، بينما حقق LEACL نسبة 75.9 ± 3.4%.

لماذا يهم هذا (وما الذي لا يستطيع فعله)

الاستنتاج الرئيسي هو أن تصميم دوال مكافأة معقدة أمر صعب وغالبًا ما يكون غير ضروري. تجادل الورقة بأن محاولة إعطاء الروبوت مكافأة "كثيفة" (مثل "تحصل على 0.5 نقطة لأنك اقتربت من الهدف") هي في الواقع فخ. يمكن أن تربك الروبوت، مما يجعله يعطي الأولوية للأشياء الخاطئة أو يطور عادات "مهملة" حيث يقترب من الهدف لكنه لا ينهي المهمة تمامًا. من خلال ترك النموذج اللغماغي يتولى هيكل التعلم (المنهج الدراسي) وترك الروبوت يتعلم من الحقيقة البسيطة للنجاح أو الفشل، يتعلم الروبوت مهارات أكثر دقة وموثوقية.

ومع ذلك، تشير الورقة بحذر إلى بعض الحدود. لا يزال النموذج اللغماغي يحتاج إلى "قاموس" لما هو ممكن (مجموعة محددة مسبقًا من القواعد أو الخصائص) ليعمل. لا يمكنه ابتكار فيزياء أو أشياء جديدة من العدم؛ بل يجب أن يعمل ضمن قواعد المحاكاة (مثل بيئة LIBERO+). وأيضًا، بينما قام النموذج اللغماغي بعمل رائع، إلا أن المنهج المصمم بشريًا لا يزال يتفوق عليه قليًا في ثلاث من أصل خمس مهام، مما يشير إلى أن الحدس البشري لا يزال يلعب دورًا، حتى لو كان الذكاء الاصطناعي يقترب من مستواه كثيرًا.

باختصر، يشير LEACL إلى أننا لسنا بحاجة لأن نكون نحن من يكتب أدلة التعليم التفصيلية للروبات بعد الآن. يمكننا فقط إعطاء الروبوت هدفًا، وترك نموذج ذكاء اصطناعي لغوي يحدد أفضل طريقة لتعليمه، ومشاهدة الروبوت وهو يتعلم القيام بمهام معقدة متعددة الخطوات بمفرده.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →