PolicyBank: Evolving Policy Understanding for LLM Agents
تقدم الورقة البحثية PolicyBank، وهو آلية ذاكرة تمكن وكلاء النماذج اللغوية الكبيرة من صقل فهمهم للسياسات التنظيمية الغامضة ذاتياً من خلال التفاعل التكراري والتغذية الراجعة التصحيحية، مما يقلص بشكل كبير الفجوة بين سلوك الوكيل والمتطلبات الحقيقية حيث تفشل الأساليب الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك وظفت مساعداً شخصياً ذكياً للغاية ومدرباً تدريباً عالياً (وكيل ذكاء اصطناعي - LLM Agent) لإدارة خدمة العملاء في شركتك. لقد أعطيته كتاب قواعد مكتوباً باللغة الإنجليزية البسيطة (السياسة).
المشكلة هي أن كتاب القواعد ليس مثالياً؛ فهو يحتوي على أخطاء مطبعية، وصياغات غامضة، وتفاصيل ناقصة. على سبيل المثال، قد يقول كتاب القواعد: "إذا اشتكى العميل من تأخير، فامنحه بطاقة هدايا بقيمة 50 دولاراً فقط إذا أراد أيضاً تغيير رحلته".
في الواقع، تريد شركتك في الحقيقة منح بطاقة الهدايا لأي شخص عانى من تأخير سيء، حتى لو أراد فقط الاحتفاظ برحلته كما هي. ولكن لأن المساعد مطيع جداً، فإنه يتبع كتاب القواعد حرفياً. وبذلك، يرفض منح بطاقة الهدايا للعميل الوفي الذي يريد فقط الحفاظ على مقعده. المساعد يفعل بالضبط ما أُمر به، لكنه يفشل في تحقيق هدف الشركة الفعلي.
هذه هي المشكلة الجوهرية التي يحلها بحث PolicyBank.
الطريقة القديمة: "الأسطوانة المشروخة"
حالياً، تتعامل معظم مساعدات الذكاء الاصطناعي مع كتاب القواعد كأنه حقيقة مطلقة لا تقبل التغيير. إذا قال الكتاب "لا"، فإن الذكاء الاصطناعي يقول "لا"، حتى لو كان الكتاب خاطئاً.
فكر في الأمر كجهاز تحديد مواقع (GPS) عالق على خريطة قديمة. إذا كان الطريق مغلقاً، سيستمر جهاز الـ GPS في إخبارك بأن تقود نحو جدار لأن الخريطة تقول إن الطريق مفتوح. حتى لو قلت للجهاز: "مهلاً، هناك جدار هنا!"، سيتجاهلك جهاز الـ GPS ويحاول القيادة عبره مرة أخرى، لأنه يثق في الخريطة أكثر مما يثق في عينيك.
أنظمة ذاكرة الذكاء الاصطناعي الحالية تشبه هذا النظام. فهي تتذكر كيفية أداء المهام (مثل "كيفية حجز رحلة طيران")، لكنها لا تتذكر لماذا قد تكون قاعدة ما خاطئة. إنها فقط تعزز الخطأ.
الطريقة الجديدة: PolicyBank (كتاب القواعد الحي)
يقترح المؤلفون نظام PolicyBank، وهو نظام يسمح للذكاء الاصطناعي بتطوير فهمه للقواعد.
تخيل بدلاً من كتاب قواعد ثابت، أن لدى الذكاء الاصطناعي دفتر ملاحظات حياً ومتجدداً يقوم بتحديثه في الوقت الفعلي.
تجربة القيادة (ما قبل النشر): قبل أن يبدأ الذكاء الاصطناعي العمل فعلياً، يقوم مختبر بشري ("مهندس ضمان الجودة") بتجربة سيناريوهات مختلفة.
- السيناريو: عضو ذهبي يشتكي من تأخير ولكنه لا يريد تغيير رحلته.
- إجراء الذكاء الاصطناعي: يرفض منح بطاقة الهدايا (اتباعاً لكتاب القواعد المعيب).
- تعليق البشر: "توقف! هذا خطأ. الأعضاء الذهبيون يحصلون على بطاقة الهدايا حتى لو لم يغيروا رحلاتهم. كتاب القواعد مضلل".
التحديث (عمل PolicyBank في الواقع):
- بدلاً من مجرد قول "حسناً، سأحاول مجدداً"، يأخذ PolicyBank الخاص بالذكاء الاصطناعي هذا التعليق ويعيد كتابة منطقه الداخلي.
- ينشئ ملاحظة جديدة ودقيقة: "بالنسبة للأعضاء الذهبيين، قاعدة 'تغيير الرحلة' هي مجرد تفصيل غير ذي صلة. تجاهلها. فقط تحقق مما إذا كان العضو ذهبياً وما إذا كانت الرحلة قد تأخرت".
- تُخزن هذه الملاحظة في "بنك" مهيكل من الرؤى، جاهز للاستدعاء فوراً في المرة القادمة.
النتيجة:
- في المرة الق próxima التي يشتكي فيها عضو ذهبي، لا يقوم الذكاء الاصطناعي بمجرد "التخمين" بشكل أفضل، بل يسترجع بنشاط الرؤية المحددة من PolicyBank الخاص به: "آه، أتذكر هذا! شرط 'تغيير الرحلة' لا ينطبق هنا".
- يمنح بطاقة الهدايا بشكل صحيح.
الأنواع الثلاثة لـ "أخطاء كتاب القواعد"
حدد البحث ثلاثة طرق شائعة تفشل بها كتب القواعد، والتي يعالجها PolicyBank:
- فخ "النطاق الضيق جداً" (غموض النطاق): يقول كتاب القواعد: "نحن نعيد الأموال لأسباب صحية أو جوية فقط". لكن في الواقع، يجب أن نعيد الأموال لأي سبب صالح إذا كان لديك تأمين. يتعلم الذكال الاصطناعي تجاهل القائمة الضيقة والنظر إلى الصورة الأكبر.
- فخ "الاستثناء المفقود" (نقص التحديد): يقول كتاب القواعد: "لا يمكنك تغيير وجهتك". لكنه ينسى ذكر أن التغيير من مطار نيويورك (JFK) إلى مطار آخر (LGA) هو أمر مسموح به. يتعلم PolicyBank هذا الاستثناء.
- فخ "الرابط الزائف" (التناقض المنطقي): يقول كتاب القواعد: "إذا كنت تريد استرداد الأموال، فيجب أن ترغب أيضاً في إلغاء الحجز". لكن في بعض الأحيان تريد استرداد الأموال دون الحاجة للإلغاء. يتعلم PolicyBank كسر الرابط بين هاتين الفكرتين غير المرتبطتين.
لماذا هذا مهم؟
في العالم الحقيقي، القواعد فوضوية. يكتبها البشر للبشر، وغالباً ما تحتوي على ثغرات.
- بدون PolicyBank: يكون الذكاء الاصطناعي روبوتاً جامداً يتبع تعليمات سيئة، مما يثير إحباط العملاء ويضر بالعلامة التجارية. إنه يفشل مراراً وتكراراً لأنه يحاول حل لغز بقطعة مكسورة.
- بوجود PolicyBank: يصبح الذكاء الاصطناعي متدرباً ذكياً. يرتكب خطأً، فيتم تصحيحه، فيقوم بتحديث "ورقة الغش" الداخلية الخاصة به، ويصيب الهدف مباشرة في المرة التالية. إنه لا يتعلم فقط كيف يؤدي الوظيفة؛ بل يتعلم ما هي الوظيفة في الحقيقة.
الخلا الخلاصة
PolicyBank يشبه منح وكيل الذكاء الاصطناعي الخاص بك جهاز GPS ذاتي التحديث. عندما تكون الخريطة خاطئة، لا يصطدم الوكيل بالحائط؛ بل يستمع للراكب، ويحدث الخريطة، ويجد الطريق الصحيح. إنه يحول الروبوت "المطيع ولكن المخطئ" إلى مساعد متعاون وقابل للتكيف حقاً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.