A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems
تقدم هذه الورقة PRL-PUTS، وهو إطار عمل للتعلم التعزيزي جاهز للإنتاج ومستقل عن نظام الترتيب (ranker-independent)، يقوم بأتمتة ضبط أوزان المنفعة الشخصية عبر مسح باريتو (Pareto sweeping) لتحسين المقايضات متعددة الأهداف ديناميكيًا في الصفحة الرئيسية لـ Pinterest، مما أدى إلى تحسينات كبيرة في التفاعل دون إضافة أي تأخير في وقت الخدمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل "بينتيريست" (Pinterest) كمكتبة ضخمة وصاخبة حيث تُوصى ملايين الكتب (الدبابيس/Pins) باستمرار للزوار. لهذه المكتبة أمين مكتبة ذكي جداً (المصنف/Ranker) ينظر في كل كتاب ويتنبأ بمدى إعجاب زائر معين به بناءً على معايير مختلفة: "هل سينقرون على هذا؟" "هل سيحفظونه في لوحاتهم؟" "هل سيرون صورة ذات صلة؟"
الطريقة القديمة: كتاب القواعد "الواحد للجميع"
في الماضي، كان على مديري المكتبة تحديد كيفية دمج هذه التنبؤات في درجة واحدة لتحديد الكتب التي يجب عرضها أولاً. استخدموا معادلة بسيطة:
الدرجة الإجمالية = (النقرات × الوزن أ) + (الحفظ × الوزن ب)
المشكلة كانت أن الوزن أ والوزن ب تم تحديدهما يدوياً. إذا أراد المديرون المزيد من عمليات "الحفظ"، فسيقومون يدوياً برفع الوزن ب. لكن هذه الطريقة كانت بطيئة، جامدة، وتطبق نفس القاعدة تماماً على الجميع. المراهق الذي يبحث عن أفكار للحفلات والمحترف الذي يبحث عن ديكور المنزل حصلوا على نفس "الوصفة" تماماً لتوصياتهم، رغم أن احتياجاتهم كانت مختلفة تماماً. كان الأمر يشبه طاهياً يستخدم نفس كمية الملح بالضبط لحساء مخصص لطفل رضيع وحساء مخصص لناقد طعام محترف.
الحل الجديد: PRL-PUTS (مساعد الطاهي الذكي والمتكيف)
يقدم البحث نظام PRL-PUTS، وهو نظام يعمل كمساعد طاهٍ ذكي ومتكيف يقف مباشرة بجانب أمين المكتبة.
- لا يعيد كتابة عمل أمين المكتبة: يبقى أمين المكتبة الرئيسي (المصنف) كما هو تماماً. لا يحاول PRL-PUTS إعادة تدريب المصنف أو تغيير طريقة قراءته للكتب. هو فقط يجلس فوقه.
- يعدل الوصفة في الوقت الفعلي: لكل طلب من الزوار، ينظر PRL-PUTS في السياق (من هو هذا الشخص؟ ماذا يفعل الآن؟) ويقرر فوراً: "بالنسبة لهذا الشخص تحديداً، دعونا نركز على 'الحفظ' قليلاً أكثر"، أو "بالنسبة لهذا الشخص، دعونا نركز على 'الصور ذات الصلة' أكثر".
- يتعلم من الخبرة: بدلاً من التخمين، يعد PRL-PUTS وكيل تعلم تعزيزي (Reinforcement Learning agent). فهو يجرب "وصفات" مختلفة (مجموعات الأوزان) بطريقة آمنة ومسيطر عليها، ويرى ما يحدث (هل تفاعل المستخدم؟)، ويتعلم أي وصفة تعمل بشكل أفضل لأي نوع من الأشخاص.
خدعة "مسح باريتو": قائمة الخيارات
أحد أصعب أجزاء إدارة نظام التوصيات هو أنه لا يمكنك دائماً الفوز في كل شيء. إذا ضغطت بقوة من أجل "الحفظ"، فقد تحصل على عدد أقل من "النقرات".
يقدم البحث أداة حوكمة ذكية تسمى "مسح باريتو" (Pareto Sweeping). تخيل أن النظام لا يختار فقط وصفة واحدة مثالية. بدلاً من ذلك، يقوم بإنشاء قائمة كاملة من الوصفات الممكنة ("جبهة باريتو").
- الوصفة أ: تعظم عمليات "الحفظ"، مع خفض طفيف في "النقرات".
- الوصفة ب: توازن مثالي.
- الوصفة ج: تعظم "النقرات"، مع خفض طفيف في "الحفظ".
يمكن لقادة الأعمال (أصحاب المصلحة) النظر إلى هذه القائمة والقول: "هدفنا اليوم هو الحصول على المزيد من الحفظ، لذا دعونا نحول النظام إلى الوصفة أ". يمكنهم القيام بذلك فوراً عن طريق تحريك قرص واحد (معلمة تسمى ) دون الحاجة إلى إعادة تدريب نموذج الذكاء الاصطناعي بالكامل أو الانتظار لأسابيع من أجل تحديث جديد.
كيف يعمل في العالم الحقيقي (الصفحة الرئيسية لبينتيريست)
قام الفريق باختبار ذلك على الصفحة الرئيسية لبينتيريست (التي يراها المستخدمون عند تسجيل الدخول).
- السرعة: يعمل بسرعة كبيرة لدرجة أن المستخدمين لا يلاحظون أي تأخير. إنه يشبه النادل الذي يهمس باقتراح للطاهي بينما يتم وضع الطعام بالفعل في الأطباق.
- الأمان: إذا حدث خلل في النظام، فإنه يعود فوراً إلى الأوزان اليدوية القديمة والآمنة.
- النتائج: عندما قاموا بتحريك القرص لصالح "الحفظ" لبعض المستخدمين، لاحظوا زيادة بنسبة 0.13% في "الجلسات الناجحة" (الجلسات التي قام فيها المستخدمون بشيء إيجابي فعلياً). قد يبدو هذا الرقم صغيراً، ولكن على منصة تضم ملايين المستخدمين، يعد هذا نجاحاً هائلاً.
الخلاصة الأساسية
يثبت البحث أنه ليس عليك إعادة بناء محرك التوصية الخاص بك بالكامل لجعله أكثر ذكاءً. من خلال إضافة طبقة صغيرة وذكية فوقه تخصص "الوصفة" لكل مستخدم وتمنح المديرين قائمة من خيارات المقايضة، يمكنك الحصول على نتائج أفضل، والتكيف بشكل أسرع مع تغيرات الأعمال، والحفاظ على استقرار النظام.
باختصار: يحول PRL-PUTS كتاب القواعد العالمي الجامد إلى محادثة مرنة وشخصية بين النظام والمستخدم، تُدار بواسطة قرص بسيط يمكن لقادة الأعمال تدويره كلما احتاجوا إلى تغيير الأولويات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.