Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation
تقدم هذه الورقة إطار عمل لتقسيم الأفعال الزمنية بنظام الصفر المعرفة، مفتوح المفردات، وغير معتمد على التدريب، يستفيد من قدرات نماذج الرؤية واللغة المتنوعة لتقسيم أفعال الفيديو دون إشراف خاص بالمهمة، مما يظهر إمكاناتها القوية للفهم الزمني المهيكل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تشاهد مقطع فيديو منزلياً لشخص يصنع شطيرة. يقوم دماغك بشكل طبيعي بتقسيم هذا التدفق المستمر من الصور إلى "فصول" متميزة: إحضار الخبز، دهن زبدة الفول السوداني، إضافة الهلام، ثم أخذ قضمة.
لفترة طويلة، عانت الحواسيب من صعوبة في القيام بذلك تلقائياً. إنها تشبه طالباً حفظ كتاباً معيناً عن ظهر قلب، لكنه يفشل عندما يُطلب منه وصف موضوع جديد لم يدرسه من قبل. هذه هي مشكلة "تجزئة العمليات الزمنية" (Temporal Action Segmentation - TAS): تعليم الكمبيوتر كيفية تقطيع الفيديو إلى قطع ذات معنى.
إليك تفصيل بسيط لما يفعله هذا البحث، باستخدام بعض التشبيهات من الحياة اليومية.
المشكلة: "المكتبة المغلقة"
نماذج الرؤية الحاسوبية الحالية تشبه الطلاب الذين يمتلكون مكتبة مغلقة. يمكنهم فقط التعرف على الأفعال إذا كانوا قد رأوها من قبل في بيانات تدريبهم.
- إذا قمت بتدريب نموذج على "صنع الشاي"، فسيعرف "غلي الماء" و"صب الشاي".
- ولكن إذا عرضت عليه "صنع القهوة"، فسيصاب بالارتباك لأن "القهوة" ليست موجودة في مكتبته المغلقة.
- علاوة على ذلك، فإن العالم الحقيقي فوضوي. قد يسمي شخص ما خطوة ما "تقطيع البصل"، بينما يسميها آخر "تحضير الخضروات". إن جمع مجموعة بيانات لكل طريقة ممكنة لوصف كل فعل ممكن هو أمر مستح المستحيل.
الحل: "المترجم العالمي" (VLMs)
يقدم المؤلفون نظام OVTAS (التجزئة الزمنية للعمليات مفتوحة المفردات - Open-Vocabulary Zero-Shot Temporal Action Segmentation). فكر في هذا كإعطاء الكمبيوتر مترجماً عالمياً (تحديداً نموذج رؤية-لغة أو VLM) بدلاً من مكتبة مغلقة.
هذه النماذج (مثل CLIP أو SigLep) قد "قرأت" بالفعل مليارات الكتب و"رأت" مليارات الصور. إنها تدرك أن صورة الكلب وكلمة "كلب" مرتبطان ببعضهما، حتى لو لم يروا هذا الكلب المحدد من قبل.
يسأل البحث: هل يمكننا استخدام هذا المترجم العالمي لمشاهدة فيديو وتسمية الأفعال في الوقت الفعلي، دون تدريبه أبداً على بيانات الفيديو؟
كيف يعمل: العملية المكونة من مرحلتين
يقترح المؤلفون مسار عمل "خالٍ من التدريب"، مما يعني أنهم لا يعلمون النموذج أي شيء جديد، بل يستخدمونه كما هو. يستخدمون عملية من خطوتين يسمونها "التجزئة عن طريق التصنيف" (Segmentation-by-Classification).
المرحلة الأولى: "لعبة التخمين" (FAES)
تخيل أنك تشاهد فيديو إطاراً تلو الآخر.
- لديك قائمة بالأفعال المحتملة (مثل "الصب"، "التقطيع"، "التحريك").
- لكل إطار منفرد من الفيديو، يسأل الكمبيوتر نموذج (VLM): "هل تبدو هذه الصورة أقرب لعملية 'الصب' أم 'التقطيع'؟"
- يعطي النموذج درجة لكل فعل.
العقبة: نموذج (VLM) مشتت الذهن قليلاً. فهو ينظر إلى كل إطار بمعزل عن غيره. قد يقول: "الإطار 10 هو صب"، ثم "الإطار 11 هو تقطيع"، ثم "الإطار 12 هو صب" مرة أخرى. في الحياة الواقعية، أنت لا تقطع، ثم تصب، ثم تقطع مجداً في لحظة واحدة. تخمينات الكمبيوتر تكون غير متسقة زمنياً (مبعثرة للغاية).
المرحلة الثانية: "المحرر" (SMTS)
هنا يحدث السحر. يستخدم المؤلفون أداة رياضية تسمى "النقل الأمثل" (Optimal Transport) (فكر فيها كمحرر ذكي للغاية).
- ينظر المحرر إلى قائمة التخمينات الفوضوية من المرحلة الأولى.
- هو يعلم أن الأفعال عادة ما تتدفق بشكل منطقي. أنت لا تنتقل من "بدء الطبخ" إلى "أكل الحلوى" في ثانية واحدة.
- يقوم بإعادة ترتيب التسميات لجعل القصة سلسة ومنطقية. فهو يجبر الكمبيوتر على القول: "حسناً، طوال الـ 5 ثواني القادمة، نحن بالتأكيد في مرحلة 'التقطيع'، وبعد ذلك ننتقل إلى 'التحريك'".
التجارب: اختبار "المترجم العالمي"
لم يكتفِ المؤلفون ببناء أداة واحدة؛ بل اختبروا 14 نسخة مختلفة من هذه المترجمات العالمية (أحجام وعائلات مختلفة مثل CLIP وSigLIP، إلخ) على ثلاث مجموعات بيانات قياسية (صنع الإفطار، صنع السلطات، ومهام الطبخ).
النتائج الرئيسية:
- إنه يعمل بدون تدريب: حققوا نتائج مبهرة دون عرض نموذج واحد من الفيديوهات المصنفة عليهم. لقد أعطوا النماذج فقط قائمة بأسماء الأفعال وتركوا الـ VLM يتولى الباقي.
- الأكبر ليس دائماً الأفضل: عادةً في الذكاء الاصطنا cut، النماذج الأكبر تكون أذكى. لكن هنا، وجدوا أن النماذح الأكبر لم تكن بالضرورة تؤدي عملاً أفضل في تقطيع الفيديوهات. أحياناً، كان النموذج الأصغر والأسرع يؤدي وظيفة مماثلة.
- الفيديوهات القصيرة صعبة: واجه النظام أكبر صعوبة مع الفيديوهات التي تحتوي على أفعال سريعة وصغيرة جداً (مثل مجموعة بيانات GTEA حيث تستمر الأفعال لمدة ثانيتين فقط). الأمر يشبه محاولة تحرير فيلم تتغير فيه المشاهد كل 0.5 ثانية؛ لا يوجد وقت كافٍ لـ "المحرر" ليفهم تسلسل التدفق.
ملخص التشبيه
- الطريقة القديمة: روبوت يعرف 50 حركة رقص محددة فقط. إذا طلبت منه أداء رقصة جديدة، فإنه يتجمد.
- الطريقة الجديدة (OVTAS): روبوت يتحدث لغة البشر ويفهم المفاهيم. تقول له: "هذا الفيديو عن 'صنع شطيرة'". ينظر إلى الفيديو، ويفهم مفاهيم "الخبز"، "السكين"، و"زبدة الفول السوداني"، ويكتب تلقائياً نصاً يقول: "أولاً، امسك الخبز. ثم، ادهن الزبدة". وهو يفعل ذلك فوراً، دون الحاجة لممارسة الرقصة أولاً.
لماذا هذا مهم؟
هذا البحث يمثل خطوة كبيرة للأمام لأنه يكسر حاجز "المفردات المغلقة". إنه يشير إلى أنه يمكننا بناء أنظمة تفهم الأنشطة البشرية بأي لغة، وبأي مستوى من التفصيل، دون الحاجة لقضاء سنوات وملايين الدولارات في جمع بيانات الفيديو المصنفة. إنه يحول الكمبيوتر من مجرد حافظ جامد إلى مراقب مرن وفهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.