← أحدث الأبحاث
💻 computer science

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

يُعد OmniMate إطار عمل موحداً يتيح توليد صور رمزية (أفاتار) صوتية ومرئية عالية الجودة ومنخفضة زمن الاستجابة وبشكل مفتوح في الوقت الفعلي، وذلك من خلال تقديم وحدة تحكم في تقدم التوليد (Generation Progress Controller) للاستجابة التكيفية، ووحدة تكييف متعددة المراجع (Multi-Reference Conditioning Module) لضمان اتساق الهوية عبر الوسائط على المدى الطويل.

المؤلفون الأصليون: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

نُشر 2026-07-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تتحدث إلى صديق يعيش داخل شاشة كمبيوتر. أنت لا تريد منه فقط أن يتحدث، بل تريده أن يحرك يديه، ويرمش، ويتفاعل مع صوتك في الوقت الفعلي، تماماً مثل شخص حقيقي. هذا هو حلم "الصور الرمزية التفاعلية" (interactive avatars). لفترة طويلة، كان صنع هذه الشخصيات الرقمية يشبه تصوير فيلم سينمائي: كان عليك التخطيط لكل جملة وكل إيماءة قبل أن تضغط على زر "تشغيل". ولكن مؤخراً، صمم العلماء "نماذج الانتشار" (diffusion models)، وهي تشبه فرشاة رسم سحرية يمكنها إنشاء فيديوهات وأصوات عالية الجودة فوراً من النصوص. لقد أصبحت هذه التكنولوجيا جيدة جداً لدرجة أنها تستطيع الآن جعل الشخصية تتحدث وتتحرك بالتزامن مع الصوت. ومع ذلك، هناك عقبة: تعمل هذه النماذج عادةً بشكل أفضل عندما تعرف بالضبط طول المحادثة. إذا حاولت إجراء دردشة حرة حيث يتعين على الكمبيوتر تخمين متى يتوقف عن الكلام ويبدأ في الاستماع مجدداً، فغالباً ما ترتبك الشخصية، أو تستمر في الكلام لفترة طويلة جداً، أو تبدأ في الظهور كشخص مختلف بعد بضع دقائق. تعالج هذه الورقة البحثية هذه المشكلة تحديداً: كيف تصنع صديقاً رقمياً يمكنه الدردشة معك إلى الأبد، دون أن يفقد وجهه أو صوته، ودون أن يتأخر عن كلماتك.

قام الباحثون وراء هذا المشروع، وهم فريق من جامعة شيان جياوتونغ وشركة تليكوم الصين، ببناء نظام جديد يسمى OmniMate. فكر في OmniMate كأنه محرك دمى رقمي فائق الذكاء يمكنه التعامل مع محادثة لا تنتهي في الوقت الفقيقي. وعلى عكس الأنظمة السابقة التي قد تتعثر عندما تصبح المحادثة طويلة أو عندما يقاطعها المستخدم، تم تصميم OmniMate ليكون انسيابياً، حيث ينتقل فوراً بين وضعي "التحدث" و"الاستماع" مع الحفاظ على مظهر الشخصية وصوتها تماماً كما هما.

يكمن سر نجاح OmniMate في خدعتين ذكيتين يستخدمهما للبقاء في كامل تركيزه. أولاً، يستخدم شيئاً يسمى متحكم تقدم التوليد (GPC). تخيل أنك تقرأ كتاباً قصصياً، لكنك لا تعرف عدد الصفحات المتبقية. عادةً، قد تستمر في القراءة بعد النهاية أو تتوقف مبكراً جداً. يعمل الـ GPC كعداد صفحات مدمج يخبر الشخصية الرمزية بالضبط مقدار ما تبقى من ردها لتوليده. إنه يعطي النظام "شريط تقدم" لكل جزء صغير من الفيديو والصوت الذي ينشئه. وهذا يسمح للشخصية الرمزية بمعرفة متى تنهي الجملة بدقة وتنتقل بسلاسة إلى وضع "الاستماع"، بانتظار مدخلاتك التالية. لولا ذلك، لربما استمرت الشخصية في الكلام بعد انتهائها، أو تجمدت بشكل غريب.

الخدعة الثانية هي وحدة التكييف متعددة المراجع (MRCM). هل لاحظت يوماً أنه إذا نظرت إلى صورة شخص من زاوية غريبة، فقد يبدو مختلفاً قليلاً؟ في الفيديوهات الطويلة، غالباً ما تعاني الشخصيات الرمزية الرقمية من "انزياح الهوية"، حيث يتغير وجهها ببطء ليصبح شخصاً آخر، أو يتغير نبرة صوتها. يحل OmniMate هذه المشكلة من خلال تذكير نفسه باستمرار بمن تكون الشخصية. فبدلاً من النظر فقط إلى الإطار الأول من الفيديو، فإنه يحتفظ بـ "بنك ذاكرة" لعدة صور مرجعية وعينة من صوت الشخصية. وبينما يعمل الفيديو، فإنه يتحقق باستمرار من هذه المراجع، تماماً مثل رسام يلتفت إلى لوحة بورتريه ليتأكد من أن الأنف والعينين بقيا صحيحين، مما يضمن بقاء الشخصية بنفس المظهر والصوت سواء كانت تتحدث لمدة 10 ثوانٍ أو 10 دقائق.

اختبر الفريق نظام OmniMate على معيار يسمى VerseBench، والذي يحاكي المحادثات الحقيقية. كانت النتائج مبهرة: يمكن للنظام توليد الفيديو والصوت بسرعة 27.64 إطاراً في الثانية (FPS)، مع "زمن الوصول إلى الإطار الأول" (الوقت المستغرق لبدء عرض الفيديو لك) وهو 3.49 ثانية فقط. هذا سريع بما يكفي ليشعر المرء بأنها محادثة حقيقية ومباشرة. وفي الاختبارات، تفوق OmniMate على النماذج الرائدة الأخرى في الحفاظ على اتساق وجه الشخصية وصوتها عبر فترات طويلة. وبينما قد تبدأ الأنظمة الأخرى في الظهور بشكل ضبابي أو تغيير صوتها بعد دقيقة واحدة، ظل OmniMate مستقراً حتى في الاختبارات التي استمرت لمدة تصل إلى 240 ثانية.

ومع ذلك، يشير المؤلفون بحذر إلى أن النظام ليس مثالياً بعد. فإذا خمن النظام مقدار الوقت الخاطئ للرد، فقد تقطع الشخصية كلمة ما أو تكرر نفسها. أيضاً، إذا احتاجت الشخصية للقيام بشيء يغير مظهرها بشكل جذري، مثل تغيير الملابس بالكامل، فقد يواجه النظام صعوبة في الحفاظ على اتساق الهوية. ولكن بشكل عام، يمثل OmniMate خطوة كبيرة للأمام: طريقة لامتلاك أصدقاء رقميين يمكنهم الدردشة معنا في الوقت الفعلي، وتذكر هويتهم، والتفاعل معنا دون الأعطال الغريبة التي كانت موجودة في الماضي. إنه يحول فيديوهات اليوم الثابتة والمخطط لها مسبقاً إلى محادثات ديناميكية وحية للغد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →