Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents
تقدم هذه الورقة "التقييم القائم على الحالة الوسيطة" (Proxy State-Based Evaluation)، وهو إطار محاكاة مدفوع بالنماذج اللغوية الكبيرة يتيح تقييماً قابلاً للتوسع وموثوقاً لوكلاء استدعاء الأدوات متعدد الخطوات عبر استنتاج حالات وسيطة مهيكلة من آثار التفاعل، مما يوفر بديلاً عملياً للأنظمة الخلفية الحتمية المكلفة مع دعم كل من ترتيب النماذج والتدريب في السياسة المتبعة (on-policy training).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم موظف جديد (الوكيل الذكي - AI Agent) كيفية التعامل مع طلبات العملاء المعقدة، مثل العثور على الحذاء المثالي أو إدارة حساب بنكي. للقيام بذلك، تحتاج إلى وسيلة لاختباره.
الطريقة القديمة: بناء محاكاة مثالية ومكلفة
تقليديًا، لكي تقوم الشركات باختبار هؤلاء الوكلاء الأذكياء، كانت تبني "عالمًا مثاليًا" للمحاكاة. فكر في الأمر كأنك تبني نموذجًا يعمل بكامل طاقته لبنك أو متجر، بمال حقيقي، ومخزون حقيقي، وقواعد صارمة.
- المشكلة: بناء هذا "العالم المثالي" مكلف للغاية وبطيء للغاية. الأمر يشبه استئجار فريق من المهندسين لبناء مدينة وهمية فقط لاختبار سائق توصيل. إذا أردت تغيير الاختبار (على سبيل المثال: "ماذا لو لم يكن لدى العميل مال؟")، فسيتعين عليك إعادة كتابة الكود البرمجي للمدينة الوهمية بأكملها. تشير الورقة البحثية إلى أن أحد هذه الأنظمة تطلب ما يقرب من 100,000 سطر من الكود البرمجي وأكثر من عام من العمل لمجرد تشغيل المحرك.
الطريقة الجديدة: "الحالة البديلة" (السيناريو الذكي)
يقترح مؤلفو هذه الورقة طريقة أذكى وأسرع تسمى التقييم القائم على الحالة البديلة (Proxy State-Based Evaluation). بدلاً من بناء مدينة وهمية، يستخدمون فريقًا من "المخرجين" الأذكياء جدًا لإدارة مسرحية.
إليك كيف يعمل هذا التشبيه:
- السيناريو (النص المسرحي):
بدلاً من قاعدة بيانات، يقومون بكتابة نص تفصيلي. هذا النص يقول:
- من هو العميل؟ (مثلاً: سارة، التي تحب الأحذية البيضاء).
- ما هو الهدف؟ (مثلاً: العثور على أحذية تستطيع تحمل تكلفتها).
- كيف يجب أن تبدو النتيجة النهائية؟ (مثلاً: لدى سارة 300 دولار في حسابها، لكنها لم تشترِ أي شيء بعد).
- الممثلون (محاكيات الذكاء الاصطناعي):
- محاكي المستخدم: ذكاء اصطناعي يلعب دور العميل، ويتحدث مع الوكيل.
- محاكيات الأدوات: ذكاء اصطناعي آخر يتظاهر بأنه البنك أو المتجر. هم لا يملكون حسابًا بنكيًا حقيقيًا؛ بل "يمثلون" فقط وكأن لديهم حسابًا بناءً على النص.
- متتبع الحالة (حافظ الذاكرة): هذا هو الجزء الجديد والأهم. بينما تجري المحادثة، يراقب ذكاء اصطناعي خاص كل شيء ويقوم بتحديث "لوحة نتائج ذهنية" (الحالة البديلة). إنه يتتبع: هل طلب الوكيل المال؟ هل وافق "البنك"؟ ما هو الرصيد الآن؟ إنه يبني صورة للموقف خطوة بخطوة دون الحاجة إلى قاعدة بيانات حقيقية.
- القاضي (المخرج):
في نهاية المحادثة، ينظر "قاضٍ" (ذكاء اصطناعي نهائي) إلى "لوحة النتائج الذهنية" وإلى نص المحادثة. ويسأل: "هل حقق الوكيل الهدف المحدد في السيناريو؟"
- إذا وجد الوكيل الأحذية وقام بتحديث الرصيد بشكل صحيح في "لوحة النتائج الذهنية"، فإنه ينجح.
- إذا قام الوكيل بتأليف معلومات (هلوسة) أو نسي التحقق من الرصيد، فإنه يفشل.
لماذا هذه الطريقة أفضل؟
- السرعة والمرونة: لا تحتاج لبناء بنك وهمي. أنت فقط تكتب سيناريو جديدًا. إذا أردت اختبار سيناريو مختلف، فأنت تغير النص وليس الكود البرمجي.
- الموثوقية: اختبر المؤلفون هذا النظام من خلال جعل خبراء بشريين يراجعون تقييم الذكاء الاصطناعي. وقد اتفق الخبراء مع قضاة الذكاء الاصطناعي في أكثر من 90% من الحالات.
- التدريب: نظرًا لأن هذا النظام سريع، يمكنه توليد آلاف المحادثات التدريبية. يمكن للوكيل الذكي أن يتعلم من هذه الجولات التدريبية (سواء عندما يشارك في اللعب أو عندما يشاهد وكيلًا أفضل منه يلعب)، مما يجعله أكثر ذكاءً بسرعة أكبر.
النتائج
اختبرت الورقة البحثية هذا النظام مع نماذج ذكاء اصطناٍ مختلفة. ووجدوا أن:
- النماذج الأكثر ذكاءً (أو النماذج التي تفكر لفترة أطول قبل الإجابة) حصلت على درجات أعلى.
- تدريب الذكاء الاصطناعي باستخدام هذا النظام جعله أفضل بشكل ملحوظ في حل المشكلات، حتى في السيناريوهات التي لم يسبق له رؤيتها.
- كان النظام جيدًا جدًا في رصد الحالات التي يكذب فيها الذكاء الاصطناعي أو يرتكب فيها أخطاء، مع وجود شبه انعدام للأخطاء "الزائفة" الناتجة عن عملية المحاكاة نفسها.
باخت مختصر
تقدم هذه الورقة طريقة لاختبار وتدريب الوكلاء الأذكياء من خلال "مسرحية مكتوبة" تضم ممثلين من الذكاء الاصطناعي وذكاءً اصطناعيًا حافظًا للذاكرة، بدلاً من بناء محاكاة واقعية ضخمة ومكلفة. إنها أسرع، وأرخص، وبنفس القدر من الدقة، مما يسمح للشركات بتطوير وتحسين وكلائها الأذكياء بسرعة أكبر بكثير.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.