← أحدث الأبحاث
💻 computer science

CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation

يُعد CapTalk إطار عمل مبتكرًا موجهًا بالنصوص يتيح تحريك الرأس ثلاثي الأبعاد بشكل متزامن وفي الوقت الفعلي، مع تحكم منفصل وديناميكي في أسلوب التحدث والتعبير العاطفي، وذلك من خلال الاستفادة من مجموعة بيانات واسعة النطاق من الأوصاف النصية إلى جانب الصوت المحرك.

المؤلفون الأصليون: Xuangeng Chu, Yuan Gan, Ziteng Cui, Shuhong Liu, Jian Wang, Bing Zhou, Tatsuya Harada

نُشر 2026-05-29
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xuangeng Chu, Yuan Gan, Ziteng Cui, Shuhong Liu, Jian Wang, Bing Zhou, Tatsuya Harada

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك دمية رقمية، رأساً ثلاثي الأبعاد يمكنه التحدث. عادةً، عندما تغذيها بالصوت (مثل تسجيل لشخص يتحدث)، تكتفي الدمية بمحاكاة حركات الفم فقط. الأمر يشبه دمية "المتحدث البارع" (ventriloquist) التي تحرك شفتيها فحسب. إذا أردت أن تبدو الدمية سعيدة، أو غاضبة، أو أن تهز رأسها بطريقة معينة، فعادةً ما يتعين عليك برمجة هذه الحركات يدوياً أو تغذيتها بفيديو لشخص حقيقي يقوم بتلك الحركات أولاً.

نظام CapTalk هو نظام جديد يغير قواعد اللعبة. فبدلاً من مجرد الاستماع إلى الصوت، فإنه يستمع أيضاً إلى التعليمات النصية التي تكتبها. فكر في الأمر كمخرج يعطي ملاحظات لممثل؛ يمكنك أن تقول للرأس الرقمي: "قل هذه الجملة، ولكن بأسلوب سريع ومتوتر وتعبير سعيد"، أو "قلها ببطء، بنبرة جادة وإيماءات كبيرة بالرأس".

إليك تفصيل لكيفية عمله، باستخدام تشبيهات بسيطة:

1. المشكلة: الدمية "ذات النموذج الموحد"

كانت الطرق السابقة تشبه صندوق الموسيقى؛ تضع فيه أغنية (الصوت)، فيعزف نفس اللحن تماماً (حركات الوجه) في كل مرة. إذا أردت الحصول على "أسلوب" مختلف، كان عليك استبدال آلية صندوق الموسيقى بالكامل أو العثور على تسجيل محدد لشخص يتحرك بتلك الطريقة بالفعل. هذا جعل من الصعب إنشاء شخصيات فريدة أو تغيير مزاج المحادثة أثناء حدوثها.

2. الحل: "نص" جديد و"مكتبة" جديدة

بنى الباحثون شيئين رئيسيين لحل هذه المشكلة:

  • المكتبة الجديدة (مجموعة البيانات): أنشأوا مجموعة ضخمة تضم 200 ساعة من مقاطع الفيديو من موقع يوتيوب. لكنهم لم يحفظوا الفيديو فحسب؛ بل استخدموا أدوات ذكاء اصطناعي ذكية لكتابة "نص" لكل مقطع.

    • ذكاء اصطناعي واحد استمع إلى الصوت لتخمين العاطفة (مثلاً: "هل هذا الشخص غاضب أم سعيد؟").
    • ذكاء اصطناعي آخر شاهد الفيديو لوصف الأسلوب الجسدي (مثلاً: "هل يفتح الفم بشكل واسع؟ هل يهز الرأس كثيراً؟").
    • خلق هذا مكتبة ضخمة حيث يتم تصنيف كل حركة بالعاطفة والوصف الأسلوبي معاً.
  • المخرج الجديد (النموذج): بنوا نموذجاً يسمى CapTalk يعمل كمترجم. يأخذ ثلاثة أشياء:

    1. الصوت: ما يتم قوله.
    2. وصف الأسلوب: وصف نصي لكيفية قول الكلام (مثلاً: "حركات رأس طفيفة"، "فتحة فم واسعة").
    3. وصف العاطفة: وصف نصي للشعور (مثلاً: "محايد"، "متحمس").

3. كيف يعمل: لغز "النافذة الزمنية"

تخيل أنك تحاول رسم رسوم متحركة كرتونية طويلة ومستمرة. إذا حاولت رسم العمل بأكمله دفعة واحدة، فسيصبح الأمر فوضوياً. يقوم CapTalk بتقسيم الرسوم المتحركة إلى "نوافذ زمنية" صغيرة (مثل مقاطع قصيرة مدتها 4 ثوانٍ).

  • الترميز/الـ Codec (آلة التصغير): أولاً، يأخذ النظام الحركات المعقدة ثلاثية الأبعاد للوجه ويضغطها في رمز بسيط، مثل تحويل فيلم عالي الدقة إلى مجموعة من التعليمات الرقمية (أصفار وآحاد).
  • المولد ذاتي التراجع/Autoregressive Generator (الحكواتي): يتنبأ النموذج بعد ذلك بمجموعة التعليمات التالية بناءً على التعليمات السابقة، والصوت، وملاحظاتك النصية. إنه يشبه الحكواتي الذي يعرف الحبكة (الصوت) وشخصية الشخصية (ملاحظاتك النصية)، لذا يمكنه ارتجال الجمل القليلة التالية (حركة الوجه) بشكل مثالي.
  • سحر النص: إذا غيرت الملاحظة النصية من "متوتر" إلى "واثق" مع الإبقاء على نفس الصوت، فإن النموذج يغير فوراً حركات الرأس وأشكال الفم لتناسب التعليمات الجديدة، حتى في منتصف الجملة.

4. النتائج: أداء أفضل

اختبر الباحثون CapTalk مقابل طرق أخرى ووجدوا ما يلي:

  • تزامن شفاه أفضل: تتحرك الشفاه بدقة مع الكلمات.
  • تحكم أفضل في الأسلوب: إذا طلبت "حركات رأس كبيرة"، فإن الرأس يتحرك كثيراً. وإذا طلبت "حركات طفيفة"، فإنه يظل ثابتاً.
  • الواقعية: في الاختبارات التي شاهد فيها البشر الفيديوهات، فضلوا CapTalk على الطرق الأخرى لأن الحركات بدت أكثر طبيعية وطابقت التعليمات بشكل أفضل.

باخت ملخص

CapTalk يشبه إعطاء ممثل رقمي نصاً يتضمن ليس فقط الحوار، بل أيضاً التوجيهات المسرحية. يمكنك كتابة "تحدث بأسلوب درامي وعيون واسعة"، وسيقوم الرأس ثلاثي الأبعاد فوراً بأداء هذا الأسلوب المحدد، متزامناً بدقة مع الصوت. إنه ينتقل من الرسوم المتحركة الجامدة والمبرمجة مسبقاً إلى الأداء المرن الموجه بالنص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →