E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching
يُعد E.M.Ground نموذج لغة فيديو لغويًا مبتكرًا لتحديد المواقع الزمنية للفيديو، حيث يعمل على تحسين دقة تحديد مواقع الأحداث من خلال تقديم رمز خاص للاستمرارية الدلالية الشمولية، وتنعيم "سافيتزكي-جولاي" للحد من الضوضاء، وتجميع سمات الإطارات متعددة الحبيبات للتغلب على قيود الطرق الحالية المعتمدة على الطوابع الزمنية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعد فيديو ذكي جداً (نموذج لغوي كبير للفيديو) يمكنه مشاهدة فيلم والإجابة على أسئلة حوله. ومع ذلك، عندما تسأله: "أرني الجزء الذي يتلقى فيه القط حقنة"، غالباً ما يواجه المساعد صعوبة في تحديد وقت البداية والنهاية بدقة. قد يخمن الوقت الذي يظهر فيه القط، لكنه قد يخطئ في لحظة ملامسة الإبرة، أو قد يتوقف مبكراً جداً.
يقدم هذا البحث نظاماً جديداً يسمى E.M.Ground لحل هذه المشكلة. فكر في الأمر كترقية للمساعد من مجرد "ساعة إيقاف" إلى "راوٍ للقصص".
إليك كيف يعمل E.M.Ground، مشروحاً عبر تشبيهات بسيطة:
1. الطريقة القديمة: ساعتا إيقاف منفصلتان
حاولت الأساليب السابقة (مثل نظام يسمى E.T.Chat) العثور على الإجابة باستخدام رمزين منفصلين (مثل ساعتي إيقاف مختلفتين).
- ساعة الإيقاف (أ) تحاول تخمين متى يبدأ الحدث بالضبط.
- ساعة الإيقاف (ب) تحاول تخمين متى ينتهي الحدث بالضبط.
المشكلة: هذا يشبه محاولة العثور على مشهد محدد في فيلم من خلال النظر فقط إلى الإطار الأول والإطار الأخير فقط. أنت تفقد كل ما يحدث في المنتصف. إذا كان الفيلم طويلاً، سيصاب المساعد بالارتباك لأنه يتجاهل "جوهر" القصة. وغالباً ما يختار وقت البداية أو النهاية بشكل خاطئ لأنه لا يفهم الحدث بأكمله كقصة واحدة مستمرة.
2. الطريقة الجديدة: "رمز قصة" واحد
يغير E.M.Ground الاستراتيجية. فبدلاً من ساعتي إيقاف، يستخدم رمزاً خاصاً واحداً يسمى <evt> (اختصار لـ "event" أو "حدث").
- التشبيه: تخيل أنك تبحث عن فصل محدد في كتاب. بدلاً من السؤال: "أين يبدأ الفصل؟" و "أين ينتهي؟" بشكل منفصل، ترفع علامة مرجعية (فاصل كتاب) مكتوب عليها "الفصل بأكمله".
- كيف يعمل: ينظر هذا الرمز الواحد
<evt>إلى كل إطار في الفيديو في آن واحد. هو يسأل: "هل هذا الإطار ينتمي لقصة 'تلقي القط للحقنة'؟" إنه يحافظ على تماسك القصة، مما يضمن فهم المساعد للبداية والمنتصف والنهاية كحدث واحد متماسك ومستمر. يساعد هذا في التعامل مع الفيديوهات الطويلة بشكل أفضل بكثير لأنه لا يفقد خيط القصة في المنتصف.
3. تنعيم "الاضطرابات"
حتى مع وجود "رمز القصة" الجديد، يمكن أن يكون ثبات الكمبيوتر "مضطرباً" نوعاً ما. فقد يكون متأكداً بنسبة 90% في ثانية واحدة من أن إطاراً ما جزء من الحدث، ثم تنخفض النسبة في الثانية التالية إلى 40% لمجرد حدوث خلل بصري بسيط، ثم تقفز مرة أخرى.
- التشبيه: تخيل يداً ترتجف وهي ترسم خطاً على رسم بياني. الخط يصعد وينزل كثيراً، مما يجعل من الصعب رؤية الشكل الحقيقي.
- الحل: يستخدم E.M.Ground تقنية رياضية تسمى تنعيم Savitzky-Golay. فكر في الأمر كاستخدام مكواة دافئة فوق قميص مجعد. إنها تقوم بتنعيم التجاعيد الصغيرة والمزعجة (الاضطرابات) دون تغيير الشكل العام للقميص (الحدث الفعلي). يساعد هذا النظام في اختيار أوقات البداية والنهاية بدقة أكبر من خلال تجاهل الضجيج.
4. إعادة بناء التفاصيل المفقودة
لجعل الفيديوهات أسهل في المعالجة بالنسبة للكمبيوتر، تقوم الأنظمة غالباً بـ "ضغطها"، مما يؤدي للتخلص من بعض التفاصيل البصرية (مثل تحويل صورة عالية الدقة إلى صورة مصغرة). وهذا عادة ما يتسبب في فقدان الكمبيوتر لبعض الأدلة المهمة.
- التشبيه: الأمر يشبه محاولة التعرف على وجه من صورة ضبابية ومنخفضة الجودة.
- الحل: يستخدم E.M.Ground ميزات متعددة المستويات (multi-grained features). فبدلاً من مجرد النظر إلى صورة مصغرة ضبابية، فإنه ينظر إلى الصورة بمستويات مختلفة من التفاصيل (الحواف الحادة، الألوان، الأنسجة) ويقوم بدمجها. إنه يشبه استخدام عدسة مكبرة، وعدسة واسعة الزاوية، ومرشح ألوان في آن واحد لإعادة بناء التفاصيل المفقودة، مما يضمن عدم تفويت الكمبيوتر لأي شيء مهم.
النتائج
اختبرت ورقة البحث E.M.Ground على العديد من مجموعات بيانات الفيديو.
- دقة أفضل: لقد تفوق باستمرار على الأساليب الأفضل السابقة (مثل E.T.Chat) بفارق كبير.
- الفيديوهات الطويلة: بينما تضعف الأنظمة القديمة كلما طالت الفيديوهات، ظل E.M.Ground قوياً لأنه فهم القصة بأكملها، وليس فقط البداية والنهاية.
- أخطاء أقل: ارتكب أخطاءً أقل بكثير في الحالات التي لا يتداخل فيها الوقت المتوقع مع الحدث الحقيقي، أو حيث وجد منتصف الحدث فقط وفقد البداية/النهاية.
باخت-صار: يتوقف E.M.Ground عن محاولة تخمين أوقات البداية والنهاية بشكل منفصل. بدلاً من ذلك، يعامل الحدث كقصة واحدة مستمرة، ويعمل على تنعيم ارتباك الكمبيوتر، ويستخدم جميع التفاصيل البصرية المتاحة للعثور على اللحظة الدقيقة التي يحدث فيها الحدث.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.