← أحدث الأبحاث
💬 NLP

GEM: A Gym for Agentic LLMs

تقدم الورقة البحثية GEM (صانع الخبرة العام)، وهو محاكي بيئة وأدوات تقييم مفتوحة المصدر ومعيارية مصممة لتسريع أبحاث النماذج اللغوية الكبيرة الوكيلية من خلال تسهيل التعلم القائم على الخبرة عبر التنفيذ عالي الإنتاجية، والبيئات المتنوعة، والاختبارات الشاملة التي تقارن بين خوارزميات مثل REINFORCE وPPO وGRPO.

المؤلفون الأصليون: Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Ye
نُشر 2026-03-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Yee Whye Teh, Wee Sun Lee, Min Lin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت كيف يلعب الشطرنج، أو يحل مسائل رياضية، أو يكتب كوداً برمجياً. في الماضي، كنا نعلم الروبوتات عبر عرض آلاف الأمثلة الثابتة عليها، مثل البطاقات التعليمية. لكن العالم الحقيقي ليس مجرد كومة من البطاقات التعليمية؛ بل هو ملعب ديناميكي فوضوي يتطلب منك التجربة، والفشل، والتعلم، ثم المحاولة مرة أخرى.

تقدم هذه الورقة البحثية GEM (صانع الخبرة العام - General Experience Maker)، وهو "ملعب" جديد صُمم خصصاً لمساعدة النماذج اللغوية الكبيرة (LLMs) على التعلم من خلال الفعل، وليس فقط من خلال القراءة.

إليك تفصيل للورقة باستخدام تشبيهات بسيطة:

1. المشكلة: فخ "البطاقات التعليمية"

حالياً، معظم تدريب الذكاء الاصطناعي يشبه الدراسة للاختبار باستخدام البطاقات التعليمية فقط. ترى سؤالاً، فتعطي إجابة، وتحصل على درجة. إنه تفاعل أحادي الدور.

  • القصور: الحياة الواقعية هي محادثة متعددة الأدوار. إذا كنت تلعب مباراة شطرنج، فأنت تقوم بنقلة، ثم يرد الخصم، ثم تفكر، ثم تقوم بنقلة أخرى. إذا كنت تقوم بتصحيح كود برمجي، فإنك تكتب سطراً، فيحدث خطأ، فتصلحه، ثم تشغله مرة أخرى.
  • المشكلة: العديد من طرق تدريب الذكاء الاصطناعي الحالية (مثل GRPO) بارعة في التعامل مع البطاقات التعليمية، لكنها سيئة جداً في الألعاب الطويلة والمعقدة. فهي تعاني لتحديد أي خطوة محددة في سلسلة طويلة من الأحداث كانت هي الخطوة "الجيدة" وأيها كانت "السيئة".

2. الحل: GEM (الصالة الرياضية)

بنى المؤلفون GEM، وهو للذكاء الاصطناعي "الوكيل" (Agent AI) كما كان OpenAI Gym للروبوتات التقليدية.

  • التشبيه: فكر في OpenAI Gym كصالة رياضية معيارية تحتوي على أجهزة مشي، وأوزان، وأكياس ملاكمة تبدو جميعها متشابهة حتى تتمكن من اختبار أي روبوت عليها. GEM هو نفس تلك الصالة الرياضية، ولكن لـ "وكلاء" الذكاء الاصطناعي (الذكاء الاصطناعي الذي يمكنه الفعل، وليس فقط الكلام).
  • ماذا يوجد بالداخل؟ يأتي GEM محملاً مسبقاً بأكثر من 100 "تمرين" مختلف:
    • الألعاب: مثل لعبة "خمن الرقم" أو "سودوكو"، حيث يتعين على الذكاء الاصطناعي التفكير خطوة بخطوة.
    • الأدوات: يمكن للذكاء الاصطناعي استخدام آلة حاسبة (Python)، أو البحث في الويب، أو كتابة أوامر في طرفية كمبيوتر وهمية.
    • الاستنتاج: مسائل رياضية وألغاز منطقية.

3. السر المكنون: "تطبيع الدفعة العائد" (ReBN)

تقدم الورقة طريقة جديدة لتعليم الذكاء الاصطناعي، أطلقوا عليها اسم REINFORCE with ReBN.

  • التشبيه: تخيل طالباً يؤدي امتحاناً طويلاً.
    • الطريقة القديمة (GRPO): ينتظر المعلم حتى نهاية الامتحان تماماً ليعطي درجة واحدة فقط (امتياز، جيد، أو مقبول). الطالب هنا لا يعرف أي إجابة محددة كانت خاطئة.
    • الطريقة الجديدة (ReBN): يقدم المعلم ملاحظات بعد كل سؤال. ولكن إليك الخدعة: بدلاً من مجرد قول "صح" أو "خطأ"، ينظر المعلم إلى كيفية أداء الطالب في جميع الأسئلة في الدفعة بأكملها ويقول: "لقد أبليت بلاءً حسناً فوق المتوسط في هذا السؤال، ولكنك كنت دون المتوسط في ذاك".
  • لماذا يهم هذا؟ يساعد هذا الذكاء الاصطناعي على فهم أي خطوة بالضبط في سلسلة طويلة من الاستنتاج كانت هي المفتاح للنجاح. إنه يسمح للذكاء الاصطناعي بتعلم المهام المعقدة متعددة الخطوات بشكل أسرع وأكثر دقة من الطرق السابقة.

4. "عامل الخصم" (مقياس الصبر)

تظهر الورقة أنه يمكنك ضبط مدى "صبر" الذكاء الاصطناعي باستخدام إعداد يسمى عامل الخصم (γ\gamma).

  • التشبيه: تخيل أنك تلعب لعبة "خمن الرقم".
    • إذا جعلت الذكاء الاصطناعي غير صبور (خصم منخفض)، فسوف يتعلم حل اللغز في أقل عدد ممكن من الخطوات (باستخدام استراتيجية ذكية تسمى "البحث الثنائي"). سيدرك قائلاً: "أريد المكافأة الآن، لذا سأخمن بكفاءة".
    • إذا جعلت الذكاء الاصطناعي صبوراً (خصم مرتفع)، فلن يهتم بعدد الأدوار التي تستغرقها، طالما أنه سيفوز في النهاية. قد يخمن عشوائياً ويستغرق 50 دوراً للوصول إلى الإجابة.
  • الاكتشاف: وجد المؤلفون أنه من خلال ضبط "مقياس الصبر" هذا، يمكنهم إجبار الذكاء الاصطناعي على تعلم الاستراتيجيات الأكثر كفاءة، وهو أمر لم تستطع الطرق القديمة فعله بسهولة.

5. لماذا يعد هذا أمراً كبيراً؟

  • إنه محول عالمي: يعمل GEM مع خمسة من أطر عمل تدريب الذكاء الاصطناعي الرئيسية. إنه يشبه قابس الطاقة العالمي الذي يناسب أي مقبس حائط. لا يحتاج الباحثون إلى إعادة بناء أدواتهم في كل مرة يريدون فيها اختبار فكرة جديدة.
  • إنه معيار قياسي: قبل هذا، كان الجميع يختبر ذكاءهم الاصطناعي على ألعاب مختلفة ومصممة خصيصاً، مما يجعل من المستحيل مقارنة من هو الأفضل حقاً. يوفر GEM "لوحة نتائج" موحدة حتى نتمكن أخيراً من رؤية أي الخوارزميات هي المتفوقة حقاً.
  • إنه جاهز للعالم الحقيقي: من خلال اختبار الذكاء الاصطناعي على أشياء مثل استخدام قاعدة بيانات، والبحث في الويب، وكتابة الكود، يجهز GEM الذكاء الاصطناعي لأنواع الوظائف المعقدة متعددة الخطوات التي نريدها منهم في المستقبل.

الملخص

GEM هو ملعب معياري مفتوح المصدر يسمح لوكلاء الذكاء الاصطناعي بالتعلم من خلال التفاعل مع بيئات معقدة ومتعددة الخطوات. يقدم طريقة تعليم أكثر ذكاءً (ReBN) تساعد الوكيل الذكي على معرفة أي الإجراءات المحددة أدت إلى النجاح في سلاسل طويلة من الأحداث. ومن خلال توفير أرضية مشتركة للباحثين لاختبار ومقارنة أفكارهم، يهدف GEM إلى تسريع تطوير وكلاء أذكياء يتمتعون باستقلالية حقيقية، ويمكنهم التخطيط والاستنتاج واستخدام الأدوات تماماً كما يفعل البشر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →