PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models
تقدم هذه الورقة PageLLM، وهو إطار عمل للمكافأة متعدد الحبيبات يستفيد من التغذية الراجعة الضمنية للمستخدم لتحسين تماسك الصفحة الكلي (coarse page-level coherence) وتنسيق العناصر الدقيق (fine item-level placement) في آن واحد لعمليات البحث والتوصية على مستوى الصفحة الكاملة، مما يحقق تحسينات كبيرة في مقاييس التصنيف ومؤشرات الأداء الرئيسية للأعمال الإنتاجية دون الحاجة إلى عمليات تعليق بشري مكلفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك مدير لمتجر رقمي ضخم ومزدحم. في كل مرة يدخل فيها عميل، يتعين عليك عرض مستودع هائل من المنتجات له. مهمتك ليست مجرد اختيار بعض العناصر الجيدة؛ بل يجب عليك ترتيب صفحة تسوق كاملة لهم.
هذا هو تحدي تحسين الصفحة الكاملة (WPO). لا يكفي فقط العثور على الحذاء المناسب؛ بل عليك أن تقرر:
- أين تضع الأحذية في الصفحة؟
- هل يجب أن تعرضها بجانب الجوارب أم بجانب خيمة؟
- هل تعرض الكثير من الأحذية الحمراء ولا تعرض ما يكفي من الزرقاء؟
- هل الصفحة مزدحمة للغاية، أم أنها مملة ومتكررة؟
لفترة طويلة، عانت الحواسيب لأنها كانت "غبية" للغاية لدرجة عدم قدرتها على فهم الصورة الكاملة، أو لأنها كانت تحتاج إلى مديرين بشريين مكلفين لتقييم كل تخطيط صفحة يدوياً.
إليك PageLLM، وهو نظام جديد يستخدم "مساعداً فائق الذكاء" (نموذج لغوي كبير) لتصميم هذه الصفحات تلقائياً. لكن هناك عقبة؛ فقد وجد المؤلفون أن مجرد إخبار الذكاء الاصطناعي "اصنع صفحة جيدة" لا يعمل بشكل جيد. الأمر يشبه إخبار طاهٍ: "اصنع وجبة لذيذة"، دون تحديد ما إذا كان يجب عليه التركيز على مذاق شريحة اللحم (العنصر الفردي) أم على توازن قائمة الطعام بأكملها (تخطيط الصفحة).
إليك كيف يحل PageLLM هذه المشكلة، باستخدام تشبيهات بسيطة:
1. المشكلة: الطاهي "الأعمى"
واجهت المحاولات السابقة لاستخدام الذكاء الاصطناعي في هذا المجال مشكلتين كبيرتين:
- عقبة "التقييم البشري": لتعليم الذكاء الاصطناعي، تحتاج عادةً إلى بشر ينظرون إلى صفحتين مختلفتين ويقولون: "أنا أفضل الصفحة (أ) على الصفحة (ب)". القيام بهذا لملايين المستخدمين أمر مكلف وبطيء للغاية.
- خطأ "الحبيبات الواحدة": نظرت معظم أنظمة الذكاء الاصطناعي إلى المشكلة بطريقة واحدة فقط.
- بعضها نظر فقط إلى العناصر الفردية (مثلاً: "هل نقر المستخدم على هذا الحذاء تحديداً؟"). هذا يشبه طاهياً يهتم فقط بنضج شريحة اللحم، متجاهلاً أن الحساء بارد والسلطة ذابلة.
- والبعض الآخر نظر فقط إلى الصفحة بأكملها (مثلاً: "هل تبدو هذه الصفحة متنوعة؟"). هذا يشبه طاهياً يهتم بتوازن القائمة ولكنه لا يلاحظ أن شريحة اللحم محترقة.
2. الحل: نظام مكافأة "بذات العينين"
أدرك المؤلفون أنه لتعليم الذكاء الاصطناعي، تحتاج إلى نوعين مختلفين من التغذية الراجعة تعملان معاً، مثل طاهٍ بعينين اثنتين: عين للتدقيق في التفاصيل، وعين للصورة الكبيرة.
لقد بنوا نظاماً يسمى PageLLM يستخدم "التغذية الراجعة الضمنية" (ما يفعله المستخدمون بالفعل، مثل النقرات والمشتريات) بدلاً من سؤال البشر لتقييم الصفحات. لقد حولوا هذه البيانات الفوضوية إلى أربعة أنواع من "سيناريوهات التدريب":
- الصلة (Relevance): عرض عناصر لا يريدها المستخدم بالتأكيد.
- الترتيب (Ranking): تبديل ترتيب العناصر لمعرفة ما إذا كان المستخدم يهتم بمن يأتي أولاً.
- التنوع (Diversity): عرض صفحة مليئة بنوع واحد فقط من العناصر (مثل أحذية حمراء فقط) لتعليم الذكاء الاصطناعي أن التنوع أمر جيد.
- التكرار (Redundancy): عرض الكثير من العناصر المتشابهة متجمعة معاً لتعليم الذكاء الاصطنا- أنه يجب توزيع الأشياء.
3. الخدعة السحرية: المكافآت "الخشنة" و"الدقيقة"
هذا هو الابتكار الجوهري. يقوم PageLLM بتدريب رأسي مكافأة منفصلين (فكر فيهما كحكمين مختلفين) على نفس البيانات:
- الحكم (أ) (مدرب مستوى الصفحة): ينظر هذا الحكم إلى صفحة التسوق بأكملها دفعة واحدة. ويسأل: "هل هي قائمة متوازنة ومتماسكة؟ هل تغطي فئات مختلفة؟". إنه بارع في اكتشاف ما إذا كانت القائمة بأكملها مملة أو متكررة.
- الحكم (ب) (مدرب مستوى العنصر): ينظر هذا الحكم إلى العناصر الفردية ومواقعها. ويسأل: "هل جعل نقل هذا العنصر من المركز 5 إلى المركز 2 المستخدم ينقر أكثر؟". إنه بارع في اكتشاف التفاصيل الصغيرة والحاسمة التي تغفل عنها الصورة الكبيرة.
لماذا كلاهما؟
وجد البحث أنه إذا استخدمت الحكم (أ) فقط، فسيصنع الذكاء الاصطناعي صفحة تبدو جميلة ولكنها تفقد العناصر المحددة التي يريد المستخدم شراءها. وإذا استخدمت الحكم (ب) فقط، فسيختار الذكاء الاصطناعي عناصر رائعة ولكن سيقوم بترتيبها بطريقة فوضوية ومربكة.
- النتيجة: عندما تجمع بين كلا الحكمين، يصبح الذكاء الاصطناعي أفضل بنسبة 46.8% في ترتيب العناصر بشكل صحيح مقارنة باستخدام حكم واحد فقط. الأمر يشبه وجود قائد أوركسترا (الحكم أ) يضمن عزف الأوركسترا معاً، بينما يضمن مدرب العازف المنفرد (الحكم ب) أن كل عازف كمان يعزف النوتة الصحيحة.
4. إثبات من الواقع
لم يكتف الفريق باختبار ذلك في المختبر؛ بل جربوه على موقع تجارة إلكترونية حقيقي يضم 10 ملايين مستخدم.
- النتيجة: زاد النظام من إجمالي حجم المبيعات (GMV) بنسبة 0.44% وعدد النقرات بنسبة 0.14%.
- لماذا يهم هذا؟ في عمل تجاري يضم ملايين العملاء، تترجم نسبة ضئيلة كهذه إلى عشرات الآلاف من المبيعات الإضافية.
5. ميزة النشر "الكسول"
أحد الآثار الجانبية الذكية لهذا النظام هو سهولة نشره. نظرًا لأن "مدرب مستوى الصفحة" (الحكم أ) بارع جداً في النظر إلى القائمة بأكملها، يمكن للشركة استخدام هذا الجزء فقط على خوادم الكمبيوتر الحالية الأبطأ (CPUs) بينما يقومون بترقية خوادمهم القوية (GPUs) تدريجياً لتشغيل الذكاء الاصطناعي الكامل. إنه يشبه القدرة على استخدام مسودة للقائمة قبل أن تكون لديك الصورة الكاملة عالية الدقة جاهزة.
الملخص
PageLLM هو طريقة جديدة لتنظيم صفحات التسوق عبر الإنترنت. بدلاً من طلب تقييم البشر لكل صفحة، فإنه يعلم الذكاء الاصطناعي من خلال إظهار "أمثلة سيئة" لتخطيطات الصفحات (مكررة للغاية، ترتيب خاطئ، نقص في التنوع). إنه يستخدم حلقتي تغذية راجعة مختلفتين — واحدة للصورة الكبيرة وأخرى للتفاصيل الدقيقة — لضمان إنشاء صفحات متوازنة منطقياً وموقوتة بشكل مثالي لما يريد المستخدم النقر عليه. النتيجة هي تجربة تسوق أكثر ذكاءً وربحية دون الحاجة إلى فريق من المقيمين البشريين.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.