ملخص تقني: InteracVid
بيان المشكلة
بينما أرست النماذج اللغوية الكبيرة (LLMs) النص كوسط افتراضي للتفاعل بين الإنسان والذكاء الاصطناعي، فإن النص وحده غير كافٍ للمساعدين متعدد الأنماط، والصور الرمزية (avatars)، والوكلاء المتجسدين الذين يتطلبون استجابات تعبيرية ومترابطة بالواقع. وعلى الرغم من أن نماذج التوليد الصوتي-البصري الحديثة قد حسنت دقة التركيب والمزامنة، إلا أن الإشراف عليها لا يزال وصفياً بشكل كبير: حيث تُدرب النماذج على تقديم محتوى محدد بواسطة نصوص وصفية مدخلة، بدلاً من إنتاج استجابات ناجمة عن تفاعلات مستخدم خارجية.
تعاني مجموعات البيانات الحالية لتوليد الوسائط الصوتية والبصرية التفاعلية من ثلاث قيود رئيسية:
- الافتقار إلى البنية السببية: غالباً ما تربط سياق الفيديو بالنص، لكنها تفشل في تحديد مقاطع الفيديو التفاعلية المحددة أو توفير الاستعلام (query) من جانب المستخدم الذي أدى إليها.
- قيود الأنماط: تقتقى العديد من مجموعات البيانات في سلوكيات "الرؤوس المتحدثة" أو السلوكيات البشرية الكلامية، وتفتقر إلى تفاعلات الأشياء المتنوعة، أو الإجراءات القائمة على الشاشة، أو العروض التوضيحية المتجسدة.
- غياب الإشراف: لا توفر الموارد الحالية بيانات كافية لتعلم الاستجابات التفاعلية المترابطة بالسياق والمحفزة بالاستعلام، حيث يجب على النموذج توليد رد صوتي-بصري مناسب لمحفز مستخدم محدد.
المنهجية
تنسيق مجموعة البيانات: InteracVid
يقدم المؤلفون InteracVid، وهي أول مجموعة بيانات مفتوحة المصدر وواسعة النطاق مصممة لمعالجة نقص الإشراف في توليد الاستجابة الصوتية البصرية التفاعلية. تم بناء مجموعة البيانات من فيديوهات الدردشة المباشرة (live-chat)، والتي تلتقط حلقة التفاعل الطبيعية حيث يتفاعل مقدمو البث (streamers) مع تعليقات المشاهدين.
يستخدم مسار التنسيق نهجاً يعتمد على البيانات الوصفية (metadata-aware) ويتكون من فرعين للتعامل مع تشتت وضجيج البث المباشر الخام:
فرع الاستعلام الحقيقي (التفاعلات الطبيعية):
- بالنسبة للفيديوهات التي تحتوي على بيانات وصفية زمنية للدردشة المباشرة، يقوم النظام بمحاذاة تعليقات المشاهدين مع أقوال مقدم البث اللاحقة.
- يتم إنشاء خط زمني دلالي على مستوى الجملة من الترجمة النصية (subtitles) لتحديد أدوار الخطاب (المونولوج الاستباقي مقابل الاستجابة التفاعلية).
- يقوم نموذج لغوي كبير (LLM) بتصفية الأزواج لضمان وجود رابط سببي منطقي بين الاستعلام والاستجابة، واستخراج هيكل التفاعل الكامل: السياق السابق (C)، واستعلام المستخدم (Q)، والاستجابة الصوتية البصرية الحقيقية (Y).
فرع الاستعلام المُعاد بناؤه (المحفزات الاصطناعية):
- بالنسبة للفيديوهات التي تفتقر إلى بيانات الدردشة الوصفية (مثل فيديوهات VOD)، يحدد النظام لحظات الاستجابة التفاعلية في النص بناءً على تصنيف دور الخطاب.
- يقوم نموذج لغة رؤية (VLM) بمراقبة سياق الفيديو المحلي ونص الاستجابة لـ إعادة بناء استعلام منطقي يمكن أن يكون قد حفز تلك الاستجابة.
- من الضروري ملاحظة أن الاستجابة المستهدفة (Y) تُستخرج دائماً من لقطات حقيقية؛ فقط شرط الاستعلام المدخل هو الاصطناعي. وهذا يضمن بقاء مجموعة البيانات متجذرة في ردود فعل بشرية حقيقية.
معالجة البيانات وضبط الجودة
- النطاق: ينتج المسار أكثر من 454 ألف ثلاثية (سياق-استعلام-استجابة) من أكثر من 59 ألف فيديو بث مباشر، تشمل سيناريوهات تركز على المحادثة، والأشياء، والإجراءات، والتجسيد، والعمليات القائمة على الشاشة.
- التصفية متعددة الأنماط: يضمن ضبط الجودة الصارم المحاذاة الدلالية بين الكلام والمرئيات. كما يتم إزالة المقاطع ذات الانتقالات المشهدية المفاجئة، ويُعاد تشغيل التعرف الآلي على الكلام (ASR) على المقاطع المستخرجة لتحسين النصوص والختم الزمني على مستوى الكلمات.
- الوصف المساعد: يتم توليد وصف صوتي-بصري مساعد (T) لكل مقطع، يجمع بين الكلام والملاحظات البصرية لدعم التدريب والتحليل.
الإطار التجريبي
يقترح المؤلفون مسار توليد يتكون من مرحلتين لمعالجة تعقيد التوليد التفاعلي:
- مخطط التفاعل (Interaction Planner): يأخذ نموذج لغة رؤية (VLM) السياق (C) والاستعلام (Q) للتنبؤ بوصف نصي مدرك للتفاعل (T).
- المولد المشترك للصوت والفيديو (Audio-Video Co-Generator): يأخذ نموذج انتشار (diffusion-based) وهو (MOVA) الوصف (T) والسياق (C) لتخليق الاستجابة متعددة الأنماط النهائية (Y).
تتضمن التجارب ضبط النموذج (fine-tuning) لكل من المخطط والمولد على InteracVd، ومقارنتهما بالنماذج المرجعية (baselines) التي تعمل بدون ضبط (zero-shot) وبالحد الأعلى للوصف المثالي (oracle-caption).
المساهمات الرئيسية
- مجموعة بيانات InteracVid: مجموعة بيانات ضخمة وعالية الجودة تضم أكثر من 454 ألف ثلاثية تفاعلية (C,Q,Y) تنمذج صراحةً الرابط السببي بين المحفزات الخارجية والاستجابات الصوتية البصرية. وهي مجموعة البيانات الوحيدة التي تدعم المدخلات والمخرجات الصوتية البصرية مع السياق السابق عبر مجالات فيديو متنوعة.
- مسار التنسيق المعتمد على البيانات الوصفية: طريقة مبتكرة لاستخراج المقاطع التفاعلية من عمليات البث المباشر الطويلة والمليئة بالضجيج، باستخدام استراتيجية مزدعة الفروع (استعلامات حقيقية ومُعاد بناؤها) لتعظيم تغطية البيانات مع الحفاظ على السلامة السببية.
- التحقق البشري: أكدت دراسة شملت عشرة مقيمين أن الاستعلامات الحقيقية والمُعاد بناؤها هي استعلامات سببية، طبيعية، ومكتملة زمنياً. وقد سجلت الاستعلامات المُعاد بناؤها درجات أعلى قليلاً في الطبيعية بسبب إزالة المصطلحات العامية والعبارات الناقصة الشائعة في الدردشة الحية الخام.
- التحقق التجريبي من البيانات المهيكلة تفاعلياً: أظهرت التجارب أن الضبط الدقيق على InteracVid يحسن بشكل كبير كلاً من مخطط التفاعل العلوي والمولد الصوتي-البصري السفلي، مما يثبت أن البيانات المهيكلة تفاعلياً هي أساس حاسم للوكلاء متعدد الأنماط.
النتائج
الأداء الدلالي
على اختبار مرجعي مكون من 100 استعلام حقيقي من الدردشة المباشرة:
- الضبط الدقيق للمولد: أدى الضبط الدقيق للمولد الصوتي-البصي المشترك (MOVA) على InteracVid إلى مكاسب جوهرية في جميع الأبعاد الدلالية (الصلة، الملاءمة، التعبيرية). على سبيل المثال، باستخدام Qwen3.5-9B كمخطط، زادت الدرجة الإجمالية (OVRL) بمقدار +1.41.
- الضبط الدقيق للمخطط: وفر الضبط الدقيق لمخطط التفاعل أيضاً تحسينات ثابتة، وإن كانت أصغر من الضبط الدقيق للمولد (مثلاً +0.44 لـ OVRL لـ Qwen3.5-9B). وهذا يشير إلى أن تعلم تخطيط استجابة تفاعلية يمثل عقبة كبيرة.
- المقارنة مع النموذج المثالي (Oracle): حتى مع استخدام الأوصاف الحقيقية (Oracle)، لم يشهد المولد سوى مكاسب طفيفة (+0.09 OVRL) عند ضبطه، مما يشير إلى أن القيد الأساسي يكمن في التخطيط للاستجابة الصحيحة وليس في تخليقها (rendering). ومع ذلك، لا يزال النموذج المثالي (Oracle) يتفوق على أفضل مخطط متعلم بـ 0.71 OVRL، مما يسلط الض الضوء على الفجوة في قدرات التخطيط الحالية.
التقييم البشري
أكد تقييم بشري مستقل من 10 مقيمين للفيديوهات المولدة نتائج النظام التلقائي (VLM judge) (مع معامل ارتباط بيرسون r≈0.96).
- أكد المقيمون البشر أن الضبط الدقيق للمولد كان العامل المهيمن للتحسين (+1.68 OVRL مع مخطط InternVL).
- أثبتت النتائج أن النموذج يستجيب لـ الاستعلام بدلاً من مجرد المشهد، وهو ما تم تأكيده عبر اختبارات مضادة للواقع (counterfactual tests) حيث أدى تبديل الاستعلام إلى الحفاظ على درجة الصلة فقط عندما كان النموذج مدركاً للاستعلام.
الجودة الصوتية-البصرية
أدى الضبط الدقيق على InteracVid إلى تحسين مقاييس التوليد منخفضة المستوى:
- الفيديو: تحسينات في اتساق الموضوع (+1.3%)، واتساق الخلفية (+1.2%)، وسلاسة الحركة (تقليل الخطأ بنسبة +39.2%).
- الصوت: مكاسب في الاستمتاع بالمحتوى (+3.4%)، وفائدة المحتوى (+5.7%)، وجودة الإنتاج (+5.6%).
- المزامنة: تحسنت مسافة مزامنة الشفاه بنسبة 4.1%، وزاد مقياس AV-Align بنسبة 16.3%.
- الصوت السياقي: أظهرت التجارب أن التكييف بناءً على الصوت السابق (بالإضافة إلى الإطار الأول) حسن بشكل كبير من تشابه المتحدث والحالة الصوتية، مما استعاد جزءاً كبيراً من الفجوة مع التسجيلات الحقيقية.
الأهمية والادعاءات
يزعم البحث أن البيانات المهيكلة تفاعلياً هي الأساس المفقود للجيل القادم من الوكلاء متعدد الأنماط. وبينما تتفوق النماذج الحالية في التوليد الوصفي، فإنها تعاني في التوليد التفاعلي — أي إنتاج استجابات ناتجة سببياً عن محفزات خارجية.
ويرى المؤلفون ما يلي:
- البيانات هي العقبة: إن نقص مجموعات البيانات التي تربط المحفزات الخارجية باستجابات صوتية بصرية مترابطة قد أعاق التقدم في الوكلاء التفاعليين. InteracVid يسد هذه الفجوة.
- التخطيط هو التحدي الرئيسي: تشير التجارب إلى أن تعلم تخطيط استجابة تفاعلية منطقية (مرحلة "المفكر") لا يزال يمثل عقبة أكبر من تخليق (rendering) تلك الاستجابة (مرحلة "الممثل").
- القدرة على التعميم: تتيح التغطية المتنوعة لمجموعة البيانات (من التلاعب بالأشياء إلى الإجراءات القائمة على الشاشة) دراسة التفاعل الصوتي-البصري في حالات عامة، متجاوزة قيود مجموعات بيانات "الرؤوس المتحدثة".
يخلص العمل إلى أن InteracVid يسهل البحث في المساعدين متعدد الأنماط القادرين على تقديم استجابات صوتية بصرية مترابطة، وتعبيرية، ومدركة للتفاعل، مما يوفر الإشراف اللازم للانتقال من روبوتات الدردشة النصية إلى وكلاء حقيقيين متجسدين أو صور رمزية (avatars).