تقدم الورقة البحثية GEM (صانع الخبرة العام)، وهو محاكي بيئة وأدوات تقييم مفتوحة المصدر ومعيارية مصممة لتسريع أبحاث النماذج اللغوية الكبيرة الوكيلية من خلال تسهيل التعلم القائم على الخبرة عبر التنفيذ عالي الإنتاجية، والبيئات المتنوعة، والاختبارات الشاملة التي تقارن بين خوارزميات مثل REINFORCE وPPO وGRPO.
المؤلفون الأصليون:Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, YeZichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Yee Whye Teh, Wee Sun Lee, Min Lin
تخيل أنك تريد تعليم روبوت كيف يلعب الشطرنج، أو يحل مسائل رياضية، أو يكتب كوداً برمجياً. في الماضي، كنا نعلم الروبوتات عبر عرض آلاف الأمثلة الثابتة عليها، مثل البطاقات التعليمية. لكن العالم الحقيقي ليس مجرد كومة من البطاقات التعليمية؛ بل هو ملعب ديناميكي فوضوي يتطلب منك التجربة، والفشل، والتعلم، ثم المحاولة مرة أخرى.
تقدم هذه الورقة البحثية GEM (صانع الخبرة العام - General Experience Maker)، وهو "ملعب" جديد صُمم خصصاً لمساعدة النماذج اللغوية الكبيرة (LLMs) على التعلم من خلال الفعل، وليس فقط من خلال القراءة.
إليك تفصيل للورقة باستخدام تشبيهات بسيطة:
1. المشكلة: فخ "البطاقات التعليمية"
حالياً، معظم تدريب الذكاء الاصطناعي يشبه الدراسة للاختبار باستخدام البطاقات التعليمية فقط. ترى سؤالاً، فتعطي إجابة، وتحصل على درجة. إنه تفاعل أحادي الدور.
القصور: الحياة الواقعية هي محادثة متعددة الأدوار. إذا كنت تلعب مباراة شطرنج، فأنت تقوم بنقلة، ثم يرد الخصم، ثم تفكر، ثم تقوم بنقلة أخرى. إذا كنت تقوم بتصحيح كود برمجي، فإنك تكتب سطراً، فيحدث خطأ، فتصلحه، ثم تشغله مرة أخرى.
المشكلة: العديد من طرق تدريب الذكاء الاصطناعي الحالية (مثل GRPO) بارعة في التعامل مع البطاقات التعليمية، لكنها سيئة جداً في الألعاب الطويلة والمعقدة. فهي تعاني لتحديد أي خطوة محددة في سلسلة طويلة من الأحداث كانت هي الخطوة "الجيدة" وأيها كانت "السيئة".
2. الحل: GEM (الصالة الرياضية)
بنى المؤلفون GEM، وهو للذكاء الاصطناعي "الوكيل" (Agent AI) كما كان OpenAI Gym للروبوتات التقليدية.
التشبيه: فكر في OpenAI Gym كصالة رياضية معيارية تحتوي على أجهزة مشي، وأوزان، وأكياس ملاكمة تبدو جميعها متشابهة حتى تتمكن من اختبار أي روبوت عليها. GEM هو نفس تلك الصالة الرياضية، ولكن لـ "وكلاء" الذكاء الاصطناعي (الذكاء الاصطناعي الذي يمكنه الفعل، وليس فقط الكلام).
ماذا يوجد بالداخل؟ يأتي GEM محملاً مسبقاً بأكثر من 100 "تمرين" مختلف:
الألعاب: مثل لعبة "خمن الرقم" أو "سودوكو"، حيث يتعين على الذكاء الاصطناعي التفكير خطوة بخطوة.
الأدوات: يمكن للذكاء الاصطناعي استخدام آلة حاسبة (Python)، أو البحث في الويب، أو كتابة أوامر في طرفية كمبيوتر وهمية.
الاستنتاج: مسائل رياضية وألغاز منطقية.
3. السر المكنون: "تطبيع الدفعة العائد" (ReBN)
تقدم الورقة طريقة جديدة لتعليم الذكاء الاصطناعي، أطلقوا عليها اسم REINFORCE with ReBN.
التشبيه: تخيل طالباً يؤدي امتحاناً طويلاً.
الطريقة القديمة (GRPO): ينتظر المعلم حتى نهاية الامتحان تماماً ليعطي درجة واحدة فقط (امتياز، جيد، أو مقبول). الطالب هنا لا يعرف أي إجابة محددة كانت خاطئة.
الطريقة الجديدة (ReBN): يقدم المعلم ملاحظات بعد كل سؤال. ولكن إليك الخدعة: بدلاً من مجرد قول "صح" أو "خطأ"، ينظر المعلم إلى كيفية أداء الطالب في جميع الأسئلة في الدفعة بأكملها ويقول: "لقد أبليت بلاءً حسناً فوق المتوسط في هذا السؤال، ولكنك كنت دون المتوسط في ذاك".
لماذا يهم هذا؟ يساعد هذا الذكاء الاصطناعي على فهم أي خطوة بالضبط في سلسلة طويلة من الاستنتاج كانت هي المفتاح للنجاح. إنه يسمح للذكاء الاصطناعي بتعلم المهام المعقدة متعددة الخطوات بشكل أسرع وأكثر دقة من الطرق السابقة.
4. "عامل الخصم" (مقياس الصبر)
تظهر الورقة أنه يمكنك ضبط مدى "صبر" الذكاء الاصطناعي باستخدام إعداد يسمى عامل الخصم (γ).
التشبيه: تخيل أنك تلعب لعبة "خمن الرقم".
إذا جعلت الذكاء الاصطناعي غير صبور (خصم منخفض)، فسوف يتعلم حل اللغز في أقل عدد ممكن من الخطوات (باستخدام استراتيجية ذكية تسمى "البحث الثنائي"). سيدرك قائلاً: "أريد المكافأة الآن، لذا سأخمن بكفاءة".
إذا جعلت الذكاء الاصطناعي صبوراً (خصم مرتفع)، فلن يهتم بعدد الأدوار التي تستغرقها، طالما أنه سيفوز في النهاية. قد يخمن عشوائياً ويستغرق 50 دوراً للوصول إلى الإجابة.
الاكتشاف: وجد المؤلفون أنه من خلال ضبط "مقياس الصبر" هذا، يمكنهم إجبار الذكاء الاصطناعي على تعلم الاستراتيجيات الأكثر كفاءة، وهو أمر لم تستطع الطرق القديمة فعله بسهولة.
5. لماذا يعد هذا أمراً كبيراً؟
إنه محول عالمي: يعمل GEM مع خمسة من أطر عمل تدريب الذكاء الاصطناعي الرئيسية. إنه يشبه قابس الطاقة العالمي الذي يناسب أي مقبس حائط. لا يحتاج الباحثون إلى إعادة بناء أدواتهم في كل مرة يريدون فيها اختبار فكرة جديدة.
إنه معيار قياسي: قبل هذا، كان الجميع يختبر ذكاءهم الاصطناعي على ألعاب مختلفة ومصممة خصيصاً، مما يجعل من المستحيل مقارنة من هو الأفضل حقاً. يوفر GEM "لوحة نتائج" موحدة حتى نتمكن أخيراً من رؤية أي الخوارزميات هي المتفوقة حقاً.
إنه جاهز للعالم الحقيقي: من خلال اختبار الذكاء الاصطناعي على أشياء مثل استخدام قاعدة بيانات، والبحث في الويب، وكتابة الكود، يجهز GEM الذكاء الاصطناعي لأنواع الوظائف المعقدة متعددة الخطوات التي نريدها منهم في المستقبل.
الملخص
GEM هو ملعب معياري مفتوح المصدر يسمح لوكلاء الذكاء الاصطناعي بالتعلم من خلال التفاعل مع بيئات معقدة ومتعددة الخطوات. يقدم طريقة تعليم أكثر ذكاءً (ReBN) تساعد الوكيل الذكي على معرفة أي الإجراءات المحددة أدت إلى النجاح في سلاسل طويلة من الأحداث. ومن خلال توفير أرضية مشتركة للباحثين لاختبار ومقارنة أفكارهم، يهدف GEM إلى تسريع تطوير وكلاء أذكياء يتمتعون باستقلالية حقيقية، ويمكنهم التخطيط والاستنتاج واستخدام الأدوات تماماً كما يفعل البشر.
إليك ملخص تقني مفصل لورقة البحث "GEM: A GYM FOR AGENTIC LLMS".
1. بيان المشكلة
يشهد النموذج الحالي لتدريب النماذج اللغوية الكبيرة (LLMs) تحولاً من مجموعات البيانات الثابتة إلى التعلم القائم على الخبرة عبر التعلم التعزيزي (RL). ومع ذلك، تواجه الأبحاث والبنية التحتية الحالية قيوداً كبيرة:
تبسيط مفرط للتفاعلات: يركز معظم التعلم التعزيزي للنماذج اللغوية الكبيرة على المهام ذات الدور الواحد (مثل حل مسألة رياضية في خطوة واحدة). وهذا يفشل في استيعاب تعقيد التفاعلات متعددة الأدوار طويلة الأمد المطلوبة للسلوك الوكيل الحقيقي (مثل تصحيح الأخطاء المتكرر، استخدام الأدوات، والتخطيط الاستراتيجي).
عدم التوافق الخوارزمي: الخوارزميات الشهيرة مثل GRPO (تحسين السياسة النسبي للمجموعات) فعالة للغاية في المهام ذات الدور الواحد، لكنها غير متوافقة جوهرياً مع إعدادات التعلم التعزيزي كاملة تعدد الأدوار. تعتمد GRPO على المكافآت على مستوى المسار وتفترض معامل خصم قدره γ=1، مما يمنع الوكلاء من تعلم الكفاءة (تقليل عدد الأدوار) ويفتقر إلى التخصيص الدقيق للائتمان (credit assignment) للخطوات المتوسطة.
الافتقار إلى بنية تحتية موحدة: على عكس التعلم التعزيزي التقليدي الذي استفاد من OpenAI Gym، لا يوجد إطار عمل موحد ومفتوح المصدر للنماذج اللغوية الكبيرة الوكيلية. غالباً ما يبني الباحثون بيئات مخصصة مرتبطة ارتباطاً وثيقاً بكود تدريب محدد، مما يجعل المقارنة العادلة وإعادة الإنتاج أمراً صعباً.
2. المنهجية: إطار عمل GEM
يقدم المؤلفون GEM (General Experience Maker)، وهو محاكي بيئة مفتوح المصدر مصمم لسد الفجوة بين بنية التعلم التعزيزي التقليدية والنماذج اللغوية الكبيرة الوكيلية الحديثة.
تكامل الأدوات: يدعم GEM الأدوات النمطية (تنفيذ Python، البحث، والأدوات الخارجية المتوافقة مع MCP). ومن الأهمية بمكان أنه يعامل استخدام الأدوات كجزء من حلقة التفاعل متعددة الأدوار، مما يسمح للوكلاء بتعلم متى وكيف يستدعون الأدوات.
التنفيذ المتجه (Vectorized Execution): يدعم التنفيذ المتوازي غير المتزامن مع آليات إعادة الضبط التلقائي (autoreset). هذا يسهل عملية جمع البيانات من خلال إعادة ضبط الحلقات المنتهية تلقائياً، مما يسمح بتوليد دفعات مستمرة دون منطق معقد من جانب المستخدم.
ب. الابتكار الخوارزمي: REINFORCE + ReBN
تقترح الورقة خوارزمية أساسية تعالج قيود GRPO في الإعدادات متعددة الأدوار:
تعريف الإجراء: يعامل الاستجابة الكاملة (تسلسل الرموز/tokens) كإجراء واحد، بدلاً من الرموز الفردية. هذا يتجنب "انفجار السياق" المرتبط بالتعلم التعزيزي على مستوى الرمز مع الحفاظ على القدرة على تعدد الأدوار.
تطبيع العائد (ReBN):
يمكن أن تعاني خوارزمية REINFORCE القياسية من تباين عالٍ وتقارب ضعيف في الإعدادات متعددة الأدوار.
قدم المؤلفون ReBN، الذي يقوم بتطبيع العوائد (Gt) عبر كامل دفعة الانتقالات قبل حساب تدرج السياسة.
الصيغة:AReBN,t=(Gt−mean(G))/std(G).
الميزة: بخلاف GRPO، يتوافق ReBN مع المكافآت الكثيفة لكل دور ومعاملات الخصم التعسفية (γ<1). وهذا يسمح للوكيل ليس فقط بتعلم ماذا يفعل، بل وأيضاً كيف يفعل ذلك بكفاءة (على سبيل المثال، حل مشكلة في عدد أقل من الأدوار).
3. المساهمات الرئيسية
إطار عمل GEM: مكتبة موحدة ومنفصلة توفر واجهة معيارية للنماذج اللغوية الكبيرة الوكيلية، تدعم التجهيز المتجه غير المتزامن، أغلفة الأدوات النمطية، والتوافق مع خمسة أطر عمل رئيسية للتعلم التعزيزي (Oat, Verl, OpenRLHF, ROLL, RL2).
الخوارزمية الأساسية: تقديم REINFORCE مع ReBN، وهي خوارزمية بسيطة وقوية تتفوق على أو تضاهي PPO وGRPO في الإعدادات متعددة الأدوار دون الحاجة إلى ناقد متعلم (value function) أو أخذ عينات شجرية مكلفة.
التقييم الشامل: أول مقارنة "بالمستوى نفسه" (apples-to-apples) بين متغيرات PPO وGRPO وREINFORCE عبر 24 بيئة متنوعة، والتي كشفت أن GRPO تفشل في سيناريوهات المكافآت الكثيفة متعددة الأدوار بينما تتفوق REINFORCE+ReBN.
أدوات التقييم: يعمل GEM كمنصة تقييم موحدة للنماذج اللغوية القوية (مثل GPT-5، Gemini-2.5-Pro، Claude-Sonnet-4) في مهام معقدة مثل عمليات قواعد بيانات MCP وتفاعلات Terminal-Bench.
4. النتائج التجريبية
أجرى المؤلفون تجارب واسعة النطاق باستخدام نماذج مبنية على Qwen3 (بمعلمات 1.7B و 4B):
مقارنة الخوارزميات (الشكل 4):
المهام ذات الدور الواحد: تؤدي GRPO أداءً جيداً.
المهام متعددة الأدوار (الألعاب، استخدام الأدوات): تعاني GRPO بسبب تقدير الميزة الثابت عبر الخطوات. تؤدي PPO أداءً جيداً ولكنها تتطلب تعلم ناقد (critic). أما REINFORCE + ReBN فتتحقق باستمرار أفضل أداء أو أداء مماثل عبر جميع البيئات، مما يوفر مقايضة متفوقة بين الأداء والتكلفة الحسابية.
تأثير معامل الخصم (γ) (الشكل 5a):
في مهمة GuessTheNumber، أدى ضبط γ<1 (مثل 0.9) إلى تحفيز الوكيل بنجاح لتعلم البحث الثنائي (الاستراتيجية المثلى بحوالي 5.6 دورة).
مع γ≈1 (أسلوب GRPO)، يفشل الوكلاء في تقليل عدد الأدوار، وغالباً ما يستنفدون ميزانية المحاولات. وهذا يثبت أن γ<1 أمر بالغ الأهمية لتعلم الكفاءة في المهام الوكيلية.
تكامل الأدوات (الجداول 1 و 2):
يحسن التدريب التعزيزي الأداء بشكل كبير في مهام الرياضيات والأسئلة والأجوبة مقارنة بالنماذج الأساسية.
الوكلاء المجهزون بالأدوات (Python للرياضيات، البحث للأسئلة والأجوبة) يحققون أعلى دقة، مما يدل على قدرة GEM على تسهيل التعلم المعزز بالأدوات.
التعميم (الشكل 6): أظهر الوكلاء الذين تم تدريبهم على Sudoku انتقالاً إيجابياً إلى مهام أخرى في ReasoningGym (مثل Circuit Logic، وNeedle-in-Haystack)، مما يشير إلى قدرات التعميم عبر المهام.
تقييم الوكلاء المتعددين (الشكل 12): في عمليات محاكاة التجزئة في TAU-bench، أدت وكلاء المستخدم الأقوى (التي تمت محاكاتها بواسطة نماذج لغوية أقوى) باستمرار إلى تحسين معدلات نجاح وكلاء المساعدين، مما يسلط الض الضوء على أهمية محاكاة المستخدم الواقعية في التعلم التعزيزي متعدد الوكلاء.
5. الأهمية والتأثير المستقبلي
تحول النموذج: يسهل GEM الانتقة من تدريب "مجموعات البيانات الثابتة" إلى التعلم الوكيلي "القائم على الخبرة"، مما يمكن النماذج اللغوية الكبيرة من إتقان التخطيط طويل الأمد والتحسين المتكرر.
الديمقراطية: من خلال توفير إطار عمل مفتوح المصدر ومنفصل مع سكربتات تكامل أحادية الملف، يخفض GEM حاجز الدخول للباحثين، مما يسمح لهم بالتركيز على الابتكار الخوارزمي بدلاً من هندسة البيئة.
الرؤية الخوارزمية: تثبت الورقة أنه بالنسبة للمهام الوكيلية المعقدة، فإن المكافآت الكثيفة ومعاملات الخصم < 1 ضرورية. وهي تتحدى هيمنة GRPO في الإعدادات متعددة الأدوار وتعزز النهج القائمة على REINFORCE مع تقنيات التطبيع.
التقييس: يهدف GEM إلى أن يصبح "OpenAI Gym" لعصر النماذج اللغوية الكبيرة الوكيلية، مما يضمن إمكانية مقارنة الأبحاث المستقبلية بشكل عادل وقابل لإعادة الإنتاج عبر بيئات متنوعة ومعقدة.