Cross-Domain Off-Policy Evaluation and Learning for Contextual Bandits
تقترح هذه الورقة إطار عمل جديدًا لتقييم وتعلم السياسات خارج السياسة عبر المجالات، يستفيد من مجموعات البيانات التاريخية من كل من المجالات المستهدفة والمصدرية للتغلب على التحديات الحرجة مثل ندرة البيانات، وسياسات التسجيل الحتمية، والإجراءات الجديدة، مما يتيح تقييم وتحسين السياسات بفعالية في السيناريوهات التي تفشل فيها الطرق الحالية بسبب التباين العالي أو الاستكشاف المحدود.
المؤلفون الأصليون: Yuta Natsubori, Masataka Ushiku, Yuta Saito
المؤلفون الأصليون: Yuta Natsubori, Masataka Ushiku, Yuta Saito
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: التقييم والتعلم خارج السياسة عبر النطاقات للمتطلبات السياقية (Contextual Bandits)
1. صياحة المشكلة
يتناول البحث القيود التي تواجهها طرق التقييم خارج السياسة (OPE) والتعلم خارج السياسة (OPL) الحالية في المتطلبات السياقية (contextual bandits) عند مواجهة ثلاثة سيناريوهات محددة وصعبة سائدة في التطبيقات الواقعية (مثل الطب الشخصي، الإعلانات، والتعليم):
- سياسات التسجيل الحتمية (Deterministic Logging Policies): تختار سياسة التسجيل التاريخية إجراءً معينًا باحتمالية واحد، مما يترك مجالاً لعدم وجود استكشاف عشوائي.
- إجراءات جديدة (New Actions): الإجراءات المتاحة للسياسة الجديدة لم يتم رصدها مطلقًا في البيانات المسجلة تاريخيًا.
- البيانات قليلة العينات (Few-Shot Data): النطاق المستهدف يحتوي على بيانات مسجلة محدودة للغاية.
تعتمد المقدرات القياسية مثل حساب نسب الاحتمالية العكسية (IPS) والتقدير المزدوج المتين (DR) على فرضية الدعم المشترك (Common Support) (الشرط 2.1)، والتي تتطلب أن يكون لأي إجراء تتخذه السياسة الجديدة احتمالية غير صفرية لأن يتخذ من قبل سياسة التسجيل. عندما يتم انتهاك هذه الفرضية (بسبب الحتمية أو الإجراءات الجديدة)، تعاني هذه المقدرات من انحياز شديد لأنها تفتقر إلى معلومات المكافأة للإجراءات غير المستكشفة. علاوة على ذلك، فإن المحاولات الساذجة للتخفيف من ذلك عبر دمج البيانات من نطاقات متعددة (مثل IPS-ALL) غالبًا ما تؤدي إلى انحياز كبير من خلال تجاهل الاختلافات في عمليات توليد البيانات (DGPs) عبر النطاقات.
لحل ذلك، يقترح المؤلفون صياغة جديدة للمشكلة: التقييم والتعلم خارج السياسة عبر النطاقات (Cross-Domain OPE/L). في هذا الإعداد، الهدف هو تقييم وتحسين سياسة في نطاق مستهدف (T) من خلال الاستفاء ليس فقط من البيانات المسجلة المحدودة في T، ولكن أيضًا من مجموعات البيانات المسجلة التاريخية من عدة نطاقات مصدرية (S). قد تمتلك هذه النطاقات المصدرية توزيعات سياق، وتوزيعات مكافأة، وسياسات تسجيل مختلفة، لكنها تشترك في نفس مساحة الإجراءات.
2. المنهجية
2.1 تفكيك دالة المكافأة
جوهر الطريقة المقترحة هو تفكيك دالة المكافأة المتوقعة qk(x,a) لأي نطاق k إلى مكونين:
qk(x,a)=تأثير عنقود النطاقg(x,a,ϕ(k))+التأثير الخاص بالنطاقh(x,a,k)
- تأثير عنقود النطاق (g): مكون مشترك للنطاقات داخل نفس العنقود ϕ(k). يلتقط هذا المكون التأثيرات السببية المشتركة (على سبيل المثال، الفعالية العامة لعلاج ما عبر مستشفيات متشابهة).
- التأثير الخاص بالنطاق (h): مكون فريد لكل نطاق محدد k، ويمثل الانحرافات عن متوسط العنقود.
2.2 مُقدر COPE
يقترح المؤلفون التقييم خارج السياسة عبر النطاقات (COPE)، وهو مُقدر يستفيد من هذا التفكيك للتعامل مع نقص الدعم:
- تقدير تأثير العنقود: بالنسبة لتأثير عنقاق النطاق g، يطبق COPE الوزن المتعدد للأهمية (MIW) باستخدام بيانات من جميع النطاقات داخل العنقود المستهدف ϕ(T). يسمح هذا للمقدر باستخدام بيانات الاستكشاف من النطاقات المصدرية لتقييم الإجراءات غير المستكشفة في النطاق المستهدف، بشرط أن تكون مستكشفة داخل العنقود.
- تقدير التأثير الخاص: بالنسبة للتأثير الخاص بالنطاق h، يستخدم COPE انحدار المكافأة (q^T) المدرب حصريًا على البيانات المسجلة للنطاق المستهدف. هذا يصحح الخصائص الفريدة للنطاق المستهدف.
يجمع مُقدر COPE النهائي بين هذين الجزأين:
V^COPE(π;Dϕ(T))=MIW على بيانات العنقودnϕ(T)1k∈ϕ(T)∑i=1∑nkpϕ(T)(aik∣xik)π(aik∣xik)(rik−q^T(xik,aik))+الانحدار على بيانات النطاق المستهدفnT1i=1∑nTa∈A∑π(a∣xiT)q^T(xiT,a)
هنا، pϕ(T)(a∣x) هو التوزيع المشترك للسياق والإجراء المتوسط عبر العنقود المستهدف، والذي يعمل كمقام لأوزان الأهمية.
2.3 التوسع إلى تعلم السياسة (COPE-PG)
يتم توسيع الإطار إلى التعلم خارج السياسة (OPL) عبر اشتقاق مُقدر تدرج السياسة (COPE-PG). يستخدم هذا المُقدر نفس التفكيك لتحديث معاملات السياسة θ، مما يمكّن من تعلم سياسات تختار إجراءات جديدة أو تتعامل مع سيناريوهات التسجيل الحتمية من خلال الاستفادة من تدرجات النطاقات المصدرية.
2.4 الخصائص النظرية
- شرط دعم مخفف: تعتمد الطريقة على دعم العنقود المشترك (الشرط 3.1)، والذي يتحقق إذا كانت سياسة التسجيل تمتلك دعمًا مشتركًا داخل عنقود النطاقات، وليس بالضرورة داخل النطاق المستهدف وحده. يسمح هذا بالتقييم حتى عندما تكون سياسة التسغيل في النطاق المستهدف حتمية أو توجد إجراءات جديدة، طالما أن العنقود يحتوي على بيانات استكشاف.
- تحليل الانحياز: يتم توصيف انحياز COPE من خلال الفرق بين المتوسط الموزون لأخطاء الانحدار في العنقود والخطأ في النطاق المستهدف. تحت شرط الصحة الزوجية الشرطية (CPC) (حيث يحافظ نموذج الانحدار بدقة على فروق المكافأة النسبية بين النطاقات في العنقود والنطاق المستهدف)، يُثبت أن COSE غير منحاز.
- التعميم: يُظهر COPE أنه تعميم صارم للمقدرات الموجودة. إذا كان حجم العنقود 1 (النطاق المستهدف فقط)، فإنه يتقلص إلى DR القياسي. إذا كان العنقود يشمل جميع النطاقات، فإنه يقترب من DR-ALL (مع تعديلات الانحياز).
3. المساهمات الرئيسية
- صياغة المشكلة: تقديم التقييم والتعلم خارج السياسة عبر النطاقات (Cross-Domain OPE/L)، وهي صياغة جديدة تستخدم بيانات النطاقات المصدرية لحل تحديات OPE/L (التسجيل الحتمي، الإجراءات الجديدة، والبيانات قليلة العينات) في النطاق المستهدف.
- مُقدر جديد (COPE): مُقدر مبتكر يعتمد على تفكيك دالة المكافأة (تأثير العنقود مقابل التأثير الخاص) والوزن المتعدد للأهمية. يحقق نظريًا عدم الانحياز تحت شروط أخف من شروط IPS/DR القياسية.
- التوسع في تدرج السياسة: تطوير COPE-PG، مما يتيح تعلم السياسات في السيناريوهات التي تفشل فيها مقدرات التدرج التقليدية بسبب نقص الاستكشاف.
- التحقق التجريبي: تجارب شاملة على مجموعة بيانات توصية واقعية (KuaiRec) وبيانات اصطناعية تُظهر أداءً متفوقًا في متوسط مربع الخطأ (MSE)، وتقليل الانحياز، وتحسين قيمة السياسة مقارنة بالنماذج المرجعية (IPS، DR، وDM، وإصدارات "ALL" الخاصة بها).
4. النتائج التجريبية
قيم المؤلفون COPE وCOPE-PG مقابل النماذج المرجعية (IPS(T)، DR(T)، DM(T)، IPS-ALL، DR-ALL، DM-ALL) تحت ظروف متغيرة:
- الإجراءات الجديدة: مع زيادة نسبة الإجراءات الجديدة في النطاق المستهدف، حافظ COPE على انحياز و MSE منخفضين، بينما عانت الطرق المقتصرة على النطاق المستهدف (IPS(T)، DR(T)) من انحياز عالٍ، وفشلت طرق التجميع الساذجة (IPS-ALL) بسبب عدم تطابق الـ DGPs.
- التسجيل الحتمي: عندما كان جزء كبير من المستخدمين في النطاق المستهدف لديهم سياسات تسجيل حتمية، ظل COPE قويًا بانحياز منخفض، بينما أظهرت الطرق القياسية انحيازًا متزايدًا بسرعة.
- البيانات قليلة العينات: في أنظمة البيانات المنخفضة (مثل نقطة بيانات واحدة لكل إجراء)، تفوق COPE بشكل كبير على أفضل نموذج مرجعي (DM)، محققًا انخفاضًا قدره 6.79 ضعفًا في MSE في أحد السيناريوهات.
- أداء OPL: نجح COPE-PG في تعلم سياسات تختار إجراءات جديدة ذات مكافأة عالية، وهي قدرة تفتقر إليها الطرق المقتصرة على النطاق المستهدف. كما حافظ على قيم سياسة عالية حتى مع زيادة درجة التسجيل الحتمي.
- الحساسية للمعلمات الفائقة: أظهرت الطة متانة تجاه حجم العنقود المستهدف ∣ϕ(T)∣، حيث عملت بشكل جيد عبر مجموعة من أحجام العناقيد، وإن كانت الأحجام المتوسطة (مثل 6-8) تعطي أفضل النتائج.
5. الأهمية والادعاءات
يزعم البحث أن طرق OPE/L الحالية محدودة جوهريًا بشرط دعم المشترك، مما يجعلها غير فعالة في السيناريوهات الواقعية التي تتضمن التسجيل الحتمي، أو الإجراءات الجديدة، أو البيانات الشحيحة. ومن خلال صياغة المشكلة كـ Cross-Domain OLE/L، يوفر المؤلفون حلاً عمليًا يستفيد من وفرة البيانات التاريخية المتاحة في النطاقات ذات الصلة (مثل المستشفيات الأخرى، أو البلدان، أو شرائح المستخدمين).
تكمن أهمية هذا العمل في قدرته على:
- تمكين التقييم والتعلم الآمن للسياسات الجديدة في البيئات عالية المخاطر حيث يكون اختبار A/B عبر الإنترنت خطرًا أو مستحيلاً.
- التغلب على مقايضة "التباين مقابل الانحياز" في إعدادات البيانات القليلة من خلال نقل معلومات الاستكشاف من النطاقات المصدرية دون إدخال الانحياز المرتبط بتجميع البيانات الساذج.
- تقديم نهج مؤصل نظريًا (عبر تفكيك المكافأة وMIW) يضمن تحليليًا عدم الانحياز في الظروف التي تفشل فيها الطرق القياسية.
يختتم المؤلفون بأنه بينما يعتمد تقسيم النطاقات الحالي لديهم على الاستدلالات (متوسط المكافآت التجريبي)، فإن الإطار يفتح اتجاهًا جديدًا للبحث في النقل عبر النطاقات المنهجي في مسائل المتطلبات السياقية (bandits)، مستهدفًا بشكل خاص قضايا التسجيل الحتمي والإجراءات الجديدة التي لم تُحل بعد.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث machine learning كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.