Action-Aware Generative Sequence Modeling for Short Video Recommendation
تقترح هذه الورقة البحثية شبكة التسلسل التوليدية المدركة للأفعال (A2Gen)، وهي نموذج مبتكر يستفيد من الأنماط الزمنية لأفعال المستخدمين للتغلب على قيود التصنيف الثنائي التقليدي في توصية الفيديوهات القصيرة، محققةً تحسينات كبيرة في وقت المشاهدة، ومعدلات التفاعل، واستبقاء المستخدمين من خلال اختبارات A/B غير متصلة بالإنترنت واسعة النطاق واختبارات A/B عبر الإنترنت واسعة النطاق على كوايشو (Kuaishou).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تشاهد مقطع فيديو قصيرًا على هاتفك. إنه مزيج من أشياء مختلفة: ربما نكتة مضحكة، مقطع إخباري جاد، أغنية جذابة، ثم إعلان مفاجئ.
الطريقة القديمة (نهج "النموذج الواحد للجميع")
تعامل أنظمة التوصية التقليدية مقطع الفيديو بالكامل كأنه كتلة واحدة صلبة من الجبن. إذا ضغطت على زر "أعجبني"، يفترض النظام أنك أعجب بكل شيء في هذا المقطع.
- المشكلة: لنفترض أن الفيديو عبارة عن مقابلة اختار فيها الضيف "ميسي" بدلاً من "رونالدو". أنت تضغط على "أعجبني" للفيديو في تلك اللحظة تحديداً لأنك تحب ميسي. لكن بقية الفيديو هي مجرد لقطات لأفضل لحظات رونالدو. النظام القديم يعتقد: "أوه، لقد أعجبهم الفيديو، إذًا لا بد أنهم يحبون رونالدو أيضًا!" ويبدأ في إظهار فيديوهات لرونالدو لك. ستشعر بالانزعاج لأنك أحببت جزء ميسي فقط.
الرؤية الجديدة (التوقيت هو كل شيء)
أدرك مؤلفو هذه الورقة البحثية أن "متى" تضغط على الزر يهم بقدر أهمية "أنك" ضغطت عليه.
- التشبيه: فكر في مقطع الفيديو كأنه إعلان ترويجي لفيلم. إذا صفقت (بمعنى "أعجبني") في اللحظة التي ينقذ فيها البطل الموقف، فأنت تتفاعل مع تلك اللحظة المحددة. أما إذا صفقت في النهاية تماماً، فقد تكون تفعل ذلك لمجرد اللياقة. التوقيت يخبر النظام بالضبط أي جزء من الفيديو جعلك سعيداً.
- الاكتشاف: من خلال النظر في ملايين الفيديوهات، وجدوا أن "الإعجابات" و"المتابعات" غالباً ما تحدث في "قمم" محددة (لحظات ذروة). إذا قمت بـ "متابعة" صانع محتوى حتى قبل أن تنهي مشاهدة الفيديو، فهذا يعني أنك تحب "الشخص"، وليس بالضرورة المحتوى المحدد الذي شاهدته للتو.
الحل: A2Gen (نموذج "الحكواتي")
تقدم الورقة البحثية نموذجاً جديداً يسمى A2Gen (الشبكة التوليدية للتسلسل الواعي بالأفعال). بدلاً من التخمين ما إذا كنت ستعجب بالفيديو أم لا، يحاول A2Gen التنبؤ بالقصة الكاملة لكيفية مشاهدتك له.
إليك كيف يعمل، مقسماً إلى أجزاء بسيطة:
وحدة الانتباه المدركة للسياق (CAM) – "القارئ الذكي"
تخيل قارئاً لا يقرأ الكلمات فحسب، بل يفهم أيضاً مزاج الغرفة. يقوم CAM بالنظر إلى أفعالك السابقة ومحتوى الفيديو المحدد معاً. هو يعلم أن "الإعجاب" بفيديو كوميدي يختلف عن "الإعجاب" بفيديو إخباري. إنه ينتبه لـ سياق اللحظة.المشفر التسلسلي الهرمي (HSE) – "مخزن الذاكرة"
هذا الجزء يتذكر عاداتك طويلة المدى. ينظر إلى تاريخك مثل أمين مكتبة ينظم الكتب. هو لا يرى فقط "المستخدم X شاهد 100 فيديو"، بل يرى أنماطاً: "المستخدم X عادةً ما يتخطى الإعلانات لكنه يحب فيديوهات الموسيقى، ويميل إلى 'متابعة' صناع المحتوى بعد 15 ثانية". إنه يبني ملفاً تعريفياً عميقاً لأسلوبك الفريد.المولد التوليدي المتسلسل للأفعال (AAG) – "البلورة السحرية"
هذا هو الجزء السحري. بدلاً من مجرد قول "نعم/لا"، يعمل AAG كبلورة سحرية تتنبأ بالتسلسل الكامل لأفعالك المستقبلية.
- هو يسأل: "إذا عرضنا هذا الفيديو، هل سيبدأ المستخدم في المشاهدة؟ هل سيضغط 'أعجبني' عند الثانية الخامسة؟ هل سيقوم بـ 'متابعة' صانع المحتوى عند الثانية العاشرة؟ متى سيتوقف؟"
- إنه يتنبأ بـ ترتيب و التوقيت الدقيق لكل نقرة، تماماً مثل التنبؤ بحبكة فيلم قبل حدوثها.
لماذا هذا مهم (النتائج)
اختبر الفريق هذا النموذج على Kuaishou، وهي منصة فيديوهات قصيرة ضخمة تضم مئات الملايين من المستخدمين. استبدلوا نظامهم القديم بـ A2Gen وأجروا تجربة ضخمة (اختبار A/B).
- النتيجة: لأن النظام الآن يفهم أي أجزاء من الفيديو تستمتع بها حقاً، فإنه يقترح محتوى أفضل.
- الأرقام:
- شاهد الناس وقت فيديو أكثر بنسبة 0.34% (قد يبدو الرقم صغيراً، ولكن مع ملايين المستخدمين، فهذا يعني وقتاً طويلاً جداً).
- تفاعل الناس (إعجاب، متابعة، تعليق) أكثر بنسبة 8.1%.
- والأهم من ذلك، عاد المزيد من الناس في اليوم التالي (ارتفع معدل الاحتفاظ بالمستخدمين بنسبة 0.162%)، وهو ما يترجم إلى حوالي مليون مستخدم إضافي يومياً بقوا في المنصة.
باختم ملخصاً
تجادل الورقة البحثية بأنه لا ينبغي لنا معاملة مقطع الفيديو كعنصر واحد "نعم/لا". بدلاً من ذلك، يجب معاملته كجدول زمني من اللحظات. من خلال استخدام نموذج يتنبأ بـ متى وبأي ترتيب ستتفاعل، يمكن للتطبيق أخيراً فهم ذوقك الحقيقي وإظهار الفيديوهات التي تريد مشاهدتها حقاً، بدلاً من مجرد التخمين بناءً على نقرة واحدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.