← أحدث الأبحاث
🤖 AI

AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

تقدم هذه الورقة البحثية AEM، وهو أسلوب لتعيين الائتمان بدون إشراف للتعلم التعزيزي الوكيل متعدد الدورات، والذي يعمل على تعديل ديناميكيات الإنتروبيا على مستوى الاستجابة بشكل تكيفي لتحسين المقايضة بين الاستكشاف والاستغلال وتحقيق أداء رائد في المعايير المرجعية الصعبة مثل SWE-bench-Verified.

المؤلفون الأصليون: Haotian Zhao, Yuxin Zhang, Songlin Zhou, Stephen S. -T. Yau, Wenyu Zhang, Lun Tian, Tianshu Zhu, Yifeng Huang, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu

نُشر 2026-05-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haotian Zhao, Yuxin Zhang, Songlin Zhou, Stephen S. -T. Yau, Wenyu Zhang, Lun Tian, Tianshu Zhu, Yifeng Huang, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم مساعد آلي (روبوت) ذكي جداً ولكنه يفتقر للخبرة، كيفية حل الألغاز المعقدة متعددة الخطوات، مثل التنقل في منزل افتراضي للعثور على عنصر معين أو تصحيح خطأ في كود برمجي. يحاول الروبوت تجربة إجراءات مختلفة، لكنه لا يتلقى سوى عبارة "عمل جيد!" أو "حاول مرة أخرى" في نهاية العملية بأكملة. هو لا يعرف أي خطوة محددة ساعدت أو أضرت بالنتيجة النهائية. هذه هي المشكلة الجوهرية التي تعالجها الورقة البحثية: كيف تمنح الفضل للخطوات الصحيحة عندما تحصل فقط على مكافأة عند خط النهاية؟

يقترح المؤلفون طريقة جديدة تسمى AEM (تعديل الإنتروبيا التكيفي - Adaptive Entropy Modulation). وإليك كيف تعمل باستخدام تشبيهات بسيطة:

المشكلة: المعلم "الأعمى"

في التدريب التقليدي، يتخذ الروبوت مساراً طويلاً من الإجراءات (مساراً). إذا نجح، يقول له المعلم: "عمل رائع!" ويفترض الروبوت أن كل خطوة اتخذها كانت جيدة. إذا فشل، يقول له المعلم: "عمل سيء!" ويفترض الروبوت أن كل خطوة اتخذها كانت سيئة.

  • الخلل: هذا يشبه طالباً يجري اختبار رياضيات مكوناً من 10 أسئلة. إذا حصل على درجة كاملة، يمدح المعلم الطالب على السؤال الثالث، رغم أن السؤال الثالث كان مجرد تخمين محظوظ، بينما كان السؤال السابع هو الجزء الصعب الذي عانى فيه. يصاب الروبوت بالارتباك بشأن ما يجب الاستمرار في فعله وما يجب التوقف عنه.

الحل: AEM (مقياس الثقة)

تقدم ورقة البحث طريقة تجعل الروبوت ينظر إلى "ثقته" الخاصة (والتي تسميها الورقة الإنتروبيا - Entropy) ليعرف ما إذا كانت الخطوات التي اتخذها جيدة أم سيئة حقاً.

فكر في الإنتروبيا على أنها مقياس عدم اليقين لدى الروبوت:

  • إنتروبيا عالية (عدم يقين عالٍ): الروبوت يخمن بعشوائية. إنه يستكشف مسارات جديدة ومخاطرة. الأمر يشبه طالباً يخمن الإجابات لأنه لا يعرف المادة العلمية.
  • إنتروبيا منخفضة (ثقة عالية): الروبوت متأكد من إجابته. إنه يستغل ما يعرفه بالفعل. الأمر يشبه طالباً يكتب معادلة حفظها عن ظهر قلب بكل ثقة.

كيف يعمل AEM: "المدرب الذكي"

يعمل AEM كمدرب ذكي يراقب مقياس ثقة الروبوت في الوقت الفعلي ويعدل "الثناء" أو "النقد" بناءً على الموقف.

  1. عندما يكون الروبوت في مرحلة الاستكشاف (بداية التدريب):

    • الروبوت غير متأكد ويجرب أشياء كثيرة مختلفة (إنتروبيا عالية).
    • إذا ارتكب خطأ، يقول له المدرب: "لا بأس! كنت تستكشف. لنحاول شيئاً مختلفاً تماماً في المرة القادمة". (يقوم AEM بزيادة الضغط للاستكشاف).
    • إذا حالفه الحظ ونجح، يقول له المدرب: "رائع! ولكن بما أنك كنت تخمن فقط، فلا تكن مغروراً جداً بعد". (يبقي AEM عملية الاستكشاف مستمرة).
  2. عندما يكون الروبوت في مرحلة الاستغلال (نهاية التدريب):

    • الروبوت تعلم القواعد وهو واثق (إنتروبيا منخفضة).
    • إذا ارتكب خطأ، يقول له المدرب: "انتظر، كان من المفترض أن تكون متأكداً من هذا! عليك إعادة التفكير في استراتيجيتك". (يزيد AEM من الضغط للتغيير).
    • إذا نجح، يقول له المدرب: "ممتاز! أنت تعرف ما تفعله. استمر في فعل هذا بالضبط". (يعزز AEM السلوك الواثق).

الخدعة السحرية:
تثبت الورقة البحثية رياضياً أنه يمكنك استخدام مستوى "المفاجأة" الخاص بالروبوت (مدى عدم توقع إجابته مقارنة بسلوكه المعتاد) لتقرر تلقائياً ما إذا كان يجب تشجيعه ليكون أكثر جرأة (استكشاف) أو أكثر حذراً (استغلال). لا تحتاج إلى إنسان ليقيم كل خطوة، ولا تحتاج إلى بيانات إضافية. يستخدم الروبوت "ثقته" الداخلية لتصحيح مساره ذاتياً.

النتائج: استراتيجية فائزة

اختبر المؤلفون هذه الطريقة على ثلاثة أنواع مختلفة من "الألغاز":

  1. ALFWorld: لعبة تعتمد على النصوص حيث يتعين على الروبوت تنظيف، طبخ، وتنظيم منزل افتراضي.
  2. WebShop: مهمة تسوق عبر الإنترنت محاكية حيث يتعين على الروبوت البحث عن عناصر محددة وشرائها.
  3. SWE-bench: مهمة صعبة للغاية حيث يتعين على الروبوت إصلاح أخطاء في كود برمجيات حقيقي.

ماذا حدث؟

  • تعلم الروبوت بشكل أسرع وحل المزيد من الألغاز مقارنة بالطرق السابقة.
  • في اختبار هندسة البرمجيات الأكثر صعوبة (SWE-bench)، أدت إضافة AEM إلى أفضل طريقة موجودة إلى تحسين معدل النجاح بنسبة 1.4%. ورغم أن هذا الرقم قد يبدو صغيراً، إلا أنه في عالم الذكاء الاصطناعي، يعتبر قفزة هائلة لمثل هذه المهمة الصعبة.
  • عملت الطريقة بشكل جيد مع النماذج الصغيرة والكبيرة جداً من الذكاء الاصطناج (من 1.5 مليار إلى 32 مليار "خلية دماغية").

لماذا هذا الأمر مهم؟

تدعي الورقة البحثية أن AEM هي أداة "قابلة للتركيب" (Plug-in). وهذا يعني أنه يمكنك أخذ أي نظام تدريب ذكاء اصطناعي موجود وإضافة "مقياس الثقة" هذا إليه دون الحاجة إلى إعادة بناء النظام بالكامل أو توظيف المزيد من الأشخاص لتقييم عمل الروبوت. إنها تساعد الذكاء الاصطناعي على معرفة متى يكون مستكشفاً جامحاً ومتى يكون خبيراً مركزاً، مما يؤدي إلى نتائج أفضل بجهد أقل.

باخت تختصر، يعلم AEM وكلاء الذكاء الاصطناعي الاستماع إلى "شعورهم الداخلي" (عدم اليقين) لمعرفة متى يجربون أشياء جديدة ومتى يتمسكون بما ينجح، مما يجعلهم أفضل بكثير في حل المشكلات المعقدة متعددة الخطوات دون الحاجة إلى إشراف بشري دقيق لكل خطوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →