← أحدث الأبحاث
💻 computer science

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

يُعد Vorch-Streamer إطار عمل لما بعد التدريب يتيح البث المباشر للنصوص إلى الصوت والفيديو طويل التنسيق، وذلك عبر الجمع بين مولد سببي تم تدريبه باستراتيجيات إجبار مختلطة، وتقطير DMD لتحقيق الاستقرار طويل الأمد، ونموذج لغوي خارجي لتخطيط الكلام، بهدف تحقيق توليد سريع ومتزامن ومتسق للأفاتار.

المؤلفون الأصليون: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

نُشر 2026-08-07
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كيف يروي قصة. تريد منه أن يتحدث، ويحرك شفتيه، ويغير تعبيرات وجهه في آن واحد، تماماً مثل البشر الحقيقيين. لفترة طويلة، كانت أفضل الروبوتات قادرة على فعل ذلك فقط لمقاطع قصيرة جداً، مثل تحية مدتها 5 ثوانٍ. كانت تعمل مثل مخرج يشاهد السيناريو بأكمله قبل تصوير المشهد، ليرى ما سيحدث لاحقاً. لكن في العالم الحقيقي، ليس لدينا وقت لانتظار كتابة القصة بأكملها قبل البدء في التحدث. نحن بحاجة لأن يتحدث الروبوت "الآن"، بناءً فقط على ما قاله حتى الآن، مع الحفاظ على تزامن مثالي بين وجهه وصوته. هذا هو تحدي "البث في الوقت الفعلي". تكمن المشكلة في أنه إذا ارتكب الروبوت خطأً طفيفاً في الثانية الأولى، فقد تتراكم هذه الأخطاء بمرور الوقت، مما يجعل وجه الروبوت يبدو غريباً أو يجعل صوته ينحرف عن الموضوع بنهاية المحادثة. لقد حاول العلماء جاهدين معرفة كيفية جعل هذه الشخصيات الرقمية (avatars) تتحدث لدقائق في كل مرة دون أن تفقد تركيزها أو إيقاعها.

هنا يأتي دور Vorch-Streamer، وهو نظام جديد يعمل كحكواتي منظم للغاية في الوقت الفعلي. بدلاً من محاولة حفظ السيناريو كاملاً قبل التحدث، يستخدم Vorch-Streamer استراتيجية ذكية مكونة من جزأين للحفاظ على استمرار العرض لأكثر من دقيقتين دون توقف. فكر في الأمر كفرقة موسيقية تعزف جلسة ارتجال طويلة. عادةً، إذا عزف الموسيقي نوتة خاطئة، فقد تصبح بقية الأغنية فوضوية. لكن Vorch-Streamer لديه "وضع بروفة" خاص. أولاً، يتدرب على عزف مقاطع قصيرة مع تلقي تصحيح لطيف من معلم (نموذج مدرب مسبقاً يعرف كيف يفعل ذلك بشكل مثالي). بعد ذلك، يتدرب على عزف الأغنية كاملة من البداية إلى النهاية، ولكن هذه المرة، يستمع إلى أخطائه السابقة ويتعلم كيفية إصلاحها فورياً، بينما يقوم "مايسترو" (مخطط ذكاء اصطناعي) بإخباره بالضبط بالكلمات التي يجب أن يقولها تالياً.

والنتيجة هي شخصية رقمية يمكنها توليد الفيديو والصوت في وقت واحد بسرعة 27.12 إطاراً في الثانية (FPS). ولوضع ذلك في الاعتبار، فإن الفيديو القياسي يعمل بسرعة 24 إطاراً في الثانية، مما يعني أن هذا الروبوت أسرع من الوقت الفعلي! يمكنه الحفاظ على وجهه ليبدو كأنه نفس الشخص، وشفتيه تتحركان بتوقيت مثالي مع كلماته، وصوته واضح ودقيق لمدة تقارب الدقيقتين المتتاليتين. وجد الباحثون أنه بدون خطوة "تخطيط" محددة لتقرير ماذا سيقول تالياً، سيصاب الروبوت بالارتباك ويبدأ في التحدث بهراء أو تكرار نفسه. ومن خلال إضافة هذا المخطط، نجح النظام في حل لغز كيفية جعل المحادثة الطويلة تتدفق بسلاسة دون الحاجة لرؤية المستقبل. إنه يثبت أنه يمكنك تحويل روبوت قوي وبطيء يعرف كل شيء عن القصة إلى مؤدٍ سريع ومباشر يعرف فقط ما يكفي لإبقاء العرض مستمراً، ثانية بثانية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →