HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming
يُعد HiVid إطار عمل مبتكرًا يستفيد من النماذج اللغوية الكبيرة كوكيل بشري قابل للتوسع لتوليد أوزان بروز فيديو عالية الدقة ومرتبطة بالمحتوى لكل من الفيديو حسب الطلب والبث المباشر، متجاوزًا بذلك تحديات الأنماط وزمن الاستجابة من خلال وحدات إدراك وترتيب وتنبؤ متخصصة لتحسين جودة تجربة المستخدم الذاتية بشكل كبير.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تدير خدمة بث فيديو ضخمة (مثل نتفليكس أو يوتيوب لايف). هدفك هو ضمان تجربة مشاهدة سلسة وعالية الجودة للجميع، حتى عندما يكون اتصال الإنترنت لديهم غير مستقر.
لتحقيق ذلك، يستخدم نظامك خوارزمية ذكية تسمى ABR (معدل البث التكيفي). فكر في هذه الخوارزمية كأنها شرطي مرور للبيانات. هي من تقرر كمية "وقود البيانات" التي يجب إرسالها إلى شاشتك. إذا كان الطريق سالكاً، ترسل وقوداً عالي الدقة. وإذا كان الطريق مزدحماً، تنتقل إلى جودة أقل لتجنب توقف الفيديو (التحميل المستمر/Buffering).
المشكلة:
تقليدياً، يعامل شرطي المرور هذا كل ثانية من الفيديو بنفس الطريقة. فهو لا يعرف ما إذا كنت تشاهد محاضرة مملة أو مشهد ذروة لفيلم مثير.
- الطريقة القديمة: تعطي نفس كمية البيانات لمشهد ممل كما تفعل لمشهد انفجار. هذا هدر للبيانات.
- الطريقة البشرية: يمكنك توظيف آلاف الأشخاص لمشاهدة كل فيديو وقول: "هذا الجزء ممل، أعطوه بيانات قليلة، وهذا الجزء رائع، أعطوه بيانات عالية!" لكن هذا مكلف جداً وبطيء للغاية.
- طريقة الذكاء الاصطناعي: يمكنك استخدام رؤية الكمبيوتر (Computer Vision)، لكنها غالباً ما تكون "غبية" فيما يتعلق بالسياق. فقد تظن أن لقطة ثابتة لوجه ما هي مشهد ممل، رغم أنها قد تكون اللحظة الأكثر تأثيراً عاطفياً في الفيلم.
الحل: HiVid
قام مؤلفو هذه الورقة البحثية ببناء HiVid، وهو نظام جديد يعمل مثل ناقد سينمائي فائق الذكاء ولا يكل، مدعوم بنموذج لغوي كبير (LLM) (نفس التقنية التي تقف وراء روبوتات الدردشة مثلي).
إليك كيف يعمل HiVid، مقسماً إلى ثلاث خطوات بسيطة باستخدام تشبيه الحفل الموسيقي:
1. وحدة الإدراك: الناقد "المُركّز"
التحدي: لا يستطيع النموذج اللغوي الكبير (LLM) قراءة فيلم مدته ساعتان دفعة واحدة (لديه حد للذاكرة). إذا حاولت تغذيته بالفيلم كاملاً، فسيصاب بالارتباك أو ينفد منه الذاكرة.
حل HiVid: بدلاً من مطالبة الناقد بمشاهدة الحفل الموسيقي بأكمله في وقت واحد، يقوم HiVid بتقسيم الحفل إلى أجزاء صغيرة مدة كل منها 5 دقائق.
- يعرض للناقد بعض الإطارات (Frames) الرئيسية من الجزء الحالي.
- يقول الناقد: "حسناً، هذا الجزء بطيء نوعاً ما، لكن المغني يبني طاقته الآن".
- والأهم من ذلك، يحتفظ الناقد بـ مذكرات جارية (ملخص) لما حدث في الأجزاء السابقة. لذا، عندما يرى المغني يبدأ في عزف منفرد (Solo)، يتذكر قائلاً: "آه، هذه هي لحظة الذروة التي كنا ننتظرها!".
- النتيجة: يعطي النظام "درجة حماس" (Hype Score) لكل جزء من الفيديو، مدركاً تماماً أين تكمن الأجزاء المثيرة.
2. وحدة التصنيف: "المحرر العالمي" (للفيديوهات المسجلة)
التحدي: إذا قام الناقد بتقييم أجزاء الحفل (الخمس دقائق) بشكل منفصل، فقد يكون غير متسق. فقد يعطي 9/10 للحظة هادئة في الجزء الأول، و6/10 للحظة أكثر صخباً في الجزء الأخير، فقط لأنه نسي الصورة الكبيرة.
حل HiVid: بمجرد أن يقوم الناقد بتقييم جميع الأجزاء، يعمل HiVid كـ محرر عالمي.
- يأخذ جميع الدرجات ويعيد تنظيمها.
- يستخدم خوارزمية خاصة تسمى "الفرز بالدمج" (Merge Sort) حيث يعمل النموذج اللغوي كحكم يقارن بين جزئين في كل مرة. "هل مشهد الانفجار هذا أكثر أهمية من مشهد الحوار ذاك؟"
- النتيجة: القائمة النهائية من الدرجات متسقة تماماً. تحصل اللحظات الأكثر إثارة على أعلى أولوية، واللحظات المملة تحصل على أدنى أولوية، مما يخلق خريطة منطقية وسلسة لأهمية الفيديو.
3. وحدة التنبؤ: "العراف" (للبث المباشر)
التحدي: في البث المباشر، الفيديو يحدث الآن. لا يمكنك الانتظار حتى يشاهد الناقد الخمس دقائق القادمة قبل أن تقرر كمية البيانات التي ستُرسل. أنت بحاجة لمعرفة ما سيحدث قبل وقوعه. كما أن الناقد بطيء (يحتاج وقتاً للتفكير).
حل HiVid: يستخدم HiVid بلورة سحرية للتنبؤ بالزمن.
- بينما يقوم الناقد بتقييم الجزء الحالي ببطء، يقوم "نموذج تنبؤ" منفصل بالنظر في نمط التقييمات الماضية.
- يتنبأ: "بناءً على إيقاع الموسيقى حتى الآن، فإن الثلاثين ثانية القادمة ستكون عبارة عن رقصة حماسية عالية الطاقة".
- يقوم بتعديل سرعة تنبؤه لتتناسب مع سرعة عمل الناقد. إذا كان الناقد بطيئاً، فإن البلورة السحرية تتنبأ بمسافة أبعد في المستقبل لسد الفجوة.
- النتيجة: يحصل شرطي المرور (ABR) على البيانات التي يحتاجها قبل عرض الفيديو حتى، مما يضمن عدم توقف البث المباشر، حتى خلال اللحظات الأكثر كثافة.
لماذا يهم هذا الأمر؟
- بالنسبة لك (المشاهد): تحصل على جودة أفضل خلال الأجزاء المثيرة، وتوقفات أقل أثناء الأجزاء المملة. وبالتالي ترتفع "جودة التجربة" (QoE) لديك.
- بالنسبة لمالك البث: يوفرون المال في استهلاك النطاق الترددي (Bandwidth) لأنهم لا يهدرون البيانات على المشاهد المملة.
- السر الحقيقي: أثبت HiVid في الاختبارات أنه أكثر دقة بنسبة 11.5% من أفضل أنظمة الذكاء الاصطناعي الموجودة للفيديوهات المسجلة، وأفضل بنسبة 26% للبث المباشر. إنه يسد الفجوة بين سرعة الذكاء الاصطناعي الرخيصة ودقة البشر المكلفة.
باختصار: HiVid هو نظام يستخدم ناقداً ذكياً من الذكاء الاصطناعي لقراءة "الخريطة العاطفية" للفيديو، وينظم تلك الخريطة بحيث تكون منطقية، ويتنبأ بمستويات الإثارة القادمة لضمان أن بث الفيديو الخاص بك دائماً سلس وواضح.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.