ملخص تقني: Vorch-Streamer
بيان المشكلة
تواجه عملية توليد الصوت والفيديو للصور الرمزية (avatars) طويلة المدى في الوقت الفعلي، والناتجة عن نماذج الانتشار ثنائية الاتجاه (bidirectional diffusion models) سابقة التدريب، معضلتين أساسيتين عند التكيف مع بيئة البث (streaming):
- التحيز للتعرض والانجراف البصري (Exposure Bias and Visual-Drift): يتطلب البث طويل المدى توليداً ذاتي التكرار (autoregressive) حيث تعمل تنبؤات النموذج نفسه كـ "سياق" للكتل اللاحقة. تتراكم الأخطاء الصغيرة في المظهر أو الحركة أو التزامن بمرور الوقت، مما يخلق فجوة بين بيانات التدريب (النظيفة) وتاريخ الاستدلال (المتولد ذاتياً). يؤدي هذا إلى تراكم العيوب والانسياق الزمني، مما يزعزع استقرار التوليد طويل الأمد.
- عدم التطابق بين الكلام العالمي والسياق السببي (Global Speech vs. Causal Context Mismatch): في مهام تحويل النص إلى صوت وفيديو (T2AV)، يصف النص المدخل جملة كاملة. ومع ذلك، فإن المولد السببي الذي يعمل ضمن نافذة بث لا يمكنه إلا الانتباه إلى تاريخ محلي محدود. وبدون تخطيط صريح، يواجه النموذج صعوبة في تحديد الجزء الذي يجب التحدث به من النص العالمي، مما يؤدي غالباً إلى بدء الصوت في منتصف الجملة، أو الخروج عن التزامن الزمني، أو توليد محتوى كلامي غير صحيح.
النماذج الحالية مصممة عادةً لمقاطع قصيرة غير متصلة (offline) باستخدام الانتباه ثنائي الاتجاه، مما يجعلها غير متوافقة مع أنظمة البث التي يجب أن تولد الجزء التالي قبل ملاحظة المحتوى المستقبلي. علاوة على ذلك، تعتمد العديد من النماذج الحالية على صوت خارجي أو إطارات مرجعية، وتفشل في توليد الكلام والفيديو معاً من النص بطريقة سببية حقيقية.
المنهجية
Vorch-టرح-Streamer هو إطار عمل لما بعد التدريب (post-training) مصمم لتوسيع نموذج الأساس (LTX2.3) ثنائي الاتجاه لإنتاج صوت وفيديو وتحويله إلى مولد بث سببي، في الوقت الفعلي، وطويل المدى. يتكون النهج من ثلاث مراحل رئيسية:
1. بناء المجموعة الاصطناعية (Synthetic Corpus Construction)
قام المؤلفون ببناء مجموعة اصطناعية تضم 80,000 مقطع فيديو وصوت عالي الجودة للصور الرمزية (بمدة تتراوح بين 12-21 ثانية) باستخدام نموذج LTX2.3 ثنائي الاتجاه. يضمن ذلك اتساق بيانات التدريب مع تهيئة النموذج، مما يوفر إشرافاً متسقاً مع النموذج لعملية التدريب السببي اللاحقة.
2. بث الصوت والفيديو السببي (المرحلة الثانية)
لتحويل النموذج ثنائي الاتجاه إلى مولد بث ذاتي التكرار (block-autoregressive)، استخدم المؤلفون استراتيجية تدريب مختلطة:
- الدمج بين الإجبار بالمعلم (Teacher Forcing) والإجبار بالانتشار (Diffusion Forcing): يتم تدريب النموذج باستخدام عينة مختلطة حيث تستخدم 10% من العينات تاريخاً حقيقياً نظيفاً (Teacher Forcing) و90% تستخدم تاريخاً تالفاً (Diffusion Forcing). يقلل هذا من الفجوة بين التدريب والاختبار عبر تعريض النموذج لسياقات غير مثالية ولدت ذاتياً أثناء التدريب.
- قناع الانتباه السببي (Causal Attention Masking): يحافظ النموذج على الانتباه ثنائي الاتجاه داخل كل كتلة متزامنة (حوالي ثانية واحدة) لنمذجة التفاعلات الدقيقة، ولكنه يفرض انتباهاً سببياً عبر الكتل.
- السياق المحدود (Bounded Context): للحفاظ على استهلاك ثابت للذاكرة، ينتبه النموذج إلى نافذة محدودة تتكون من الكتل الثلاث الأولى (بادئة مستمرة) والكتلة السابقة الأخيرة مباشرة.
3. الإجبار الذاتي طويل المدى (المرحلة الثالثة)
لمعالجة تراكم الأخطاء عبر التسلسلات الطويلة، يطبق الإطار تقنية الإجبار الذاتي (Self Forcing) مع تقطير مطابقة التوزيع (DMD):
- يقوم نموذج الطالب السببي بتوليد تسلسلات كاملة (12-21 ثانية) كتلة تلو الأخرى من تنبؤاته الخاصة.
- يعمل نموذج LTX2.3 ثنائي الاتجاه (المجمد) كـ "معلم" يمثل التوزيع المستهدف.
- يقوم نموذج "درجة زائفة" (fake-score) قابل للتدريب بتقدير التوزيع المتطور للطالب.
- يتم تحسين الطالب لتقليل الفرق بين توزيعه وتوزيع المعلم، مما ينقل جودة نموذج LTX2.3 الأصلي إلى المسارات السببية الطويلة مع تعريض النموذج لتوزيع التوليد الخاص به أثناء الاستدلال.
4. تخطيط الكلام القائم على النماذج اللغوية الكبيرة (LLM-Based Speech Planning)
لحل عدم التطابق بين النصوص العالمية والتوليد المحلي السببي، يقدم Vorch-Streamer مساراً صريحاً لـ تخطيط الكلام:
- يتنبأ نموذج لغوي كبير خارجي (Fun-CosyVoice) بتوكنات تخطيط الكلام المنفصلة بتردد 25 هرتز (وحدات 40 مللي ثانية).
- يتم تحويل هذه التوكنات إلى ميزات مستمرة وحقنها في فرع انتشار الصوت عبر وحدة انتباه متقاطع مخصمة.
- يقوم عامل دمج بوابي (gated fusion operator) بدمج ميزات التخطيط هذه مع ميزات الصوت المشروطة بالنص الأصلي بشكل تكيفي.
- يعزل هذا العملية بين تخطيط الكلام (ماذا يقال ومتى) وبين توليد الصوت (كيفية التوليد)، مما يسمح بالمقاطعة، والتبديل، وتضمين توكن صمت قابل للتعلم للاستماع التفاعلي.
المساهمات الرئيسية
- إطار العمل: تقديم Vorch-Streamer، وهو إطار عمل لما بعد التدريب يكيّف نموذج انتشار صوت وفيديو ثنائي الاتجاه ليكون مولداً سببياً، في الوقت الفعلي، وطويل المدى.
- استراتيجية التدريب: بناء مجموعة اصطناعية مكونة من 80 ألف مقطع، وخط تدريب مبتكر يجمع بين الإجبار المختلط (Teacher/Diffusion Forcing) مع الإجبار الذاتي طويل المدى وتقطير المعلم لمواءمة التدريب السببي مع الاستدلال في وضع البث.
- تخطيط الكلام: اقتراح مسار تخطيط كلام يعتمد على النماذج اللغوية الكبيرة، ويوفر ميزات تخطيط مستمرة لفرع الصوت، مما يتيح التحكم الصريح في تقدم الكلام، والمقاطعة، والاستماع الصامت دون الحاجة لتثبيت الجملة المستقبلية كاملة عند بداية البث.
- الأداء: إثبات القدرة على توليد (T2AV) طويل المدى في الوقت الفعلي بسرعة 27.12 إطاراً في الثانية (FPS) (متجاوزاً عتبة الوقت الفعلي البالغة 24 إطاراً)، مع الحفاظ على تزامن ودقة كلام تنافسية.
النتائج التجريبية
قيم المؤلفون Vorch-Streamer على عمليات تشغيل مستمرة طويلة المدى (حوالي دقيقتين) مقابل نماذج T2AV الأصلية (LTX2.3, JoyAI-Echo, OmniForcing, Hallo-Live) ومراجع TIA2V مشروطة (LiveAvatar, SoulX-FlashTalk).
- السرعة: يحقق Vorch-Streamer سرعة 27.12 إطاراً في الثانية على وحدة معالجة رسومات واحدة من نوع NVIDIA H200، مما يجعله الطريقة الوحيدة التي تم تقييمها من نوع T2AV والتي تجاوزت سرعة التشغيل الفعلي. وهو أسرع بكثير من LTX2.3 ثنائي الاتجاه (1.83 إطاراً في الثانية) والأساسات الأخرى للبث.
- دقة الكلام: يحقق النموذج معدل خطأ في الكلمات (WER) بنسبة 7.92%، وهو قريب جداً من نموذج LTX2.3 ثنائي الاتجاه (7.59%). في المقابل، تعاني النماذج التي تفتقر لتخطيط الكلام الصريح (OmniForcing, Hallo-Live) من معدلات خطأ كارثية (>90%) عند التوسع لفترات طويلة.
- التزامن: يحافظ النموذج على تزامن قوي بين الصوت وحركة الشفاه (Sync-C: 6.62, Sync-D: 8.95)، وهو ما يضاهي نموذج LTX2.3 الأبطأ بكثير.
- الاستقرار طويل المدى: خلال تشغيل لمدة دقيقتين، يظهر Vorch-Streamer تدهوراً ضئيلاً في الحفاظ على الهوية (تظل تشابه ArcFace مستقرة حول 0.73–0.77) واتساق المشهد (تشابه CLIP حول 0.92–0.94). بينما تظهر طرق T2AV الأخرى انجرافاً كبيراً وفقداناً للهوية خلال فترات مماثلة.
- دراسات الاستئصال (Ablation Studies):
- إزالة مخطط الكلام (LLM) تؤدي إلى معدل خطأ في الكلمات (WER) بنسبة 184%، مما يؤكد ضرورة التخطيط الصريح لـ Causal T2AV.
- إزالة المرحلة الثانية (التهيئة السببية) تؤدي إلى انهيار الحركة (ينخفض مستوى الديناميكية من 0.2706 إلى 0.0824).
- إزالة المرحلة الثالثة (الإجبار الذاتي طويل المدى) تؤدي إلى ارتفاع معدل الخطأ (9.17%) وزيادة الانجراف.
- تبين أن نافذة السياق 3+1 (3 كتل بادئة مستمرة + 1 كتلة حديثة) هي الأمثل للموازنة بين الحفاظ على الهوية وتراكم الأخطاء.
الأهمية
يزعم البحث أن Vorch-Streamer يضع مساراً عملياً لتكييف النماذج الأساسية القوية ثنائية الاتجاه لإنتاج صور رمزية تفاعلية في الوقت الفعلي. ومن خلال حل مشكلة "التحيز للتعرض" عبر الإجبار الذاتي طويل المدى، ومشكلة "تقدم الكلام" عبر التخطيط الصريح القائم على النماذج اللغوية الكبيرة، يتيح الإطار توليد (T2AV) أصلي (Native) يكون سببياً وطويل المدى في آن واحد. وبخلاف الأنابيب الشرطية التي تعتمد على أصوات خارجية أو إطارات مرجعية، يقوم Vorch-Streamer بتوليد كلا النمطين من الصفر، محافظاً على الاستقرار والتزامن عبر فترات ممتدة دون الحاجة لزيادة الذاكرة بما يتناسب مع طول التسلسل.