VIRTUE: Versatile Video Retrieval Through Unified Embeddings
تُعد VIRTUE إطار عمل متعدد الاستخدامات لاسترجاع الفيديو، حيث تستفيد من نموذج لغوي كبير موحد متعدد الوسائط مع محاذاة تباينية وتدريب باستخدام تقنية LoRA لتحقيق أداء رائد في استرجاع البيانات الصفرية (zero-shot) عبر استرجاع المجموعات، وتحديد اللحظات، والاستعلامات متعددة الوسائط المركبة، مما يضاهي الأنظمة المتخصصة التي تتدرب على مجموعات بيانات أكبر بكثير.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مكتبة ضخمة تحتوي على ملايين مقاطع الفيديو، ولكن بدلاً من الكتب، فإنها جميعاً تطفو في غرفة مظلمة. أنت تريد العثور على مشهد محدد، مثل "كلب يطارد كرة في الثلج"، أو حتى طلب أكثر تعقيداً مثل "أرني مقطع فيديو لشاطئ، ولكن اجعله يبدو وكأنها تمطر".
حالياً، العثور على هذه الفيديوهات يشبه محاولة العثور على إبرة في كومة قش باستخدام أدوات مختلفة لمهام مختلفة. بعض الأدوات بارعة في العثور على فيديوهات كاملة بناءً على وصف نصي، لكنها ترتبك إذا عرضت عليها صورة وطلبت منها تغيير الطقس. وهناك أدوات أخرى بارعة في الأسئلة المعقدة، لكنها سيئة جداً في العثور على الفيديو الصحيح بسرعة.
إليك VIRTUE (الاسترجاع متعدد الوسائط عبر التضمينات الموحدة). فكر في VIRTUE كأنه أمين مكتبة فائق الذكاء وشامل يمكنه القيام بكل شيء.
المشكلة: "المتخصص" مقابل "العام"
- المتخصصون: تخيل فريقاً من أمناء المكتبة، أحدهم يعرف فقط كيفية فرز الكتب حسب العنوان، والآخر يعرف فقط كيفية فرزها حسب المؤلف. هم سريعون ودقيقون جداً في مهمتهم المحددة، ولكن إذا طلبت من أمين مكتبة "العناوين" فرز الكتب حسب "لون الغلاف"، فلن يعرف ماذا يفعل. في تقنية الفيديو، هذه هي النماذج المتخصصة. إنهم رائعون في العثال على الفيديوهات من النص، لكنهم لا يستطيعون التعامل مع الطلبات المختلطة والمعقدة (مثل "هذا الفيديو، ولكن بخلفية مختلفة").
- العامون: ثم لديك "نماذج اللغات الكبيرة متعددة الوسائط" (MLLMs). هؤلاء يشبهون أمين مكتبة يمكنه القراءة، ورؤية الصور، وفهم القصص المعقدة. هم أذكياء جداً ويمكنهم التعامل مع أي طلب تلقيه عليهم. ومع ذلك، غالباً ما يكونون بطيئين وغير دقيقين تماماً عندما يتعلق الأمر بالعثور على الفيديو المحدد في مكتبة ضخمة. قد يخمنون الإجابة الصحيحة، لكنهم ليسوا بحدة المتخصصين.
الحل: VIRTUE
إن VIRTUE هو نظام جديد يأخذ "العام" (النموذج الذكي MLLM) ويدربه ليكون "متخصصاً" دون أن يفقد مرونته. وهو يفعل ذلك من خلال ثلاث حيل رئيسية:
1. "بطاقة الهوية العالمية" (التضمينات الموحدة)
تخيل أن كل فيديو وكل وصف نصي يحصل على بطاقة هوية فريدة (تضمين - embedding).
- كيف يعمل: يعلم VIRTUE الذكاء الاصطناعي كيف ينظر إلى فيديو ووصف نصي (مثل "قطة نائمة") ويحول كلاهما إلى نفس نوع بطاقة الهوية. إذا تطابق الفيديو والنص، فستبدو بطاقتا هويتهما متطابقتين تقريباً.
- السحر: لأن الذكاء الاصطناعي يستخدم "لغة" مشتركة لكل من الصور والكلمات، يمكنه المقارنة بينهما فوراً. إنه يشبه وجود مترجم يتحدث لغتي "الفيديو" و"النص" بطلاقة، مما يسمح له بإيجاد المطابقات فوراً دون الحاجة لمشاهدة كل فيديو.
2. "البحث بخطوتين" (الاسترجاع + إعادة التصنيف)
العثور على الفيديو الصحيح في مكتبة تضم الملايين أمر صعب. يستخدم VIRTUE عملية من خطوتين:
- الخطوة 1: المسح السريع (بحث التضمين): يقوم الذكاء الاصطناعي بمسح المكتبة بأكملها بسرعة باستخدام بطاقات الهوية تلك للعثور على أفضل 50 مرشحاً محتملاً. هذه العملية سريعة وفعالة.
- الخطوة 2: التعمق (إعادة التصنيف): الآن، يأخذ الذكاء الاصطناعي هؤلاء المرشحين الخمسين ويتفحصهم بدقة شديدة، واحداً تلو الآخر، مقارناً تفاصيل الفيديو المحددة بطلبك. إنه يعمل مثل محرر أول يدقق في القائمة المختصرة للتأكد من أن أفضل مطابقة هي التي في المقدمة.
- لماذا يهم هذا: هذا يمنحك سرعة المسح السريع مع دقة المراجعة العميقة.
3. "المسافر عبر الزمن" (تحديد اللحظة)
أحياناً لا تريد الفيديو بأكمله؛ تريد فقط الخمس ثوانٍ التي يحدث فيها الانفجار.
- كيف يفعلها VIRTUE: بدلاً من الحاجة إلى تدريب خاص للعثور على هذه اللحظات، ينظر VIRTUE إلى الفيديو إطاراً تلو الآخر. يسأل نفسه: "هل هذا الإطار المحدد يطابق وصفك؟" ثم يقوم بتنعيم الإجابات للعثور على قطعة زمنية مستمرة.
- التشبيه: الأمر يشبه مشاهدة فيلم وإيقافه تماماً عندما يخرج البطل سيفه، دون الحاجة لإخباره صراحةً بالبحث عن السيوف. يفعل ذلك بشكل طبيعي، دون الحاجة إلى تعليمات إضافية.
حيلة "تغيير العالم" (الاستعلامات المركبة)
هنا يتألق VIRTUE حقاً. تخيل أنك تعرض على الذكاء الاصطناعي فيديو لشاطئ مشمس وتقول له: "اجعله يثلج".
- الأنظمة القديمة: كانت ستصاب بالارتباك. قد تبحث ببساطة عن "الثلج" وتتجاهل فيديو الشاطح، أو قد تحاول تعديل الفيديو (وهو ما لا تستطيع فعله).
- VIRTUE: يفهم مفهوم التغيير. ينظر إلى فيديو الشاطئ المشمس، ويفهم تعليمات "الثلج"، ويبحث عن فيديو يناسب تلك الصورة الذهنية الجديدة. إنه يشبه سؤال طباخ: "أريد بيتزا، ولكن بدون جبنة"، فيعرف الطباخ فوراً أي بيتزا يسحبها من الفرن.
لماذا يهم هذا
- إنه سريع: لا يحتاج لمشاهدة ملايين الفيديوهات للعثود على الفيديو الصحيح.
- إنه مرن: يمكنك طرح أسئلة بسيطة ("جد قطة") أو معقدة ("جد فيديو لقطة، ولكن اجعلها تبدو وكأنها في الفضاء").
- إنه فعال: لقد تم تدريبه على كمية محدودة نسبياً من البيانات (مقارنة بمجموعات البيانات الضخمة التي تستخدمها الأنظمة الأخرى)، ومع ذلك فإنه يتفوق على أنظمة "المتخصصين" التي تم تدريبها على كميات هائلة من البيانات.
باختصار: VIRTUE هو محرك بحث الفيديو الأمثل. إنه يجمع بين سرعة محركات البحث وذكاء البشر، مما يسمح لك بالعثور على ما تريده بالضبط، سواء وصفته بالكلمات، أو الصور، أو بمزيج منهما، وسواء كنت تريد الفيديو بأكمله أو مجرد لحظة محددة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.