Realistic Lip Motion Generation Based on 3D Dynamic Viseme and Coarticulation Modeling for Human-Robot Interaction
تقدم هذه الورقة إطار عمل خفيف الوزن وفعال لتوليد حركات شفاه واقعية في الروبوتات البشرية من خلال بناء مكتبة ثلاثية الأبعاد للرموز الصوتية الديناميكية استناداً إلى نظرية النطق الصينية وتوظيف آلية التآزر مع فك الارتباط بين البداية والنهاية لضمان التزامن الطبيعي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل روبوتًا يحاول إجراء محادثة معك. إذا كانت حركة فم الروبوت تشبه دمية خشبية صلبة —تنتقل من شكل إلى آخر بحركات مفاجئة دون أي انسيابية— فسيشعر المرء بالرهبة وعدم الارتياح. هذا هو تأثير "الوادي غير المألوف" (Uncanny Valley): فكلما اقترب الروبوت في شكله من البشر، زاد تركيزنا على العيوب عندما لا يتحرك مثله تمامًا.
هذه الورقة البحثية تدور حول تعليم الروبوت كيفية التحدث باستخدام شفتيه بطريقة تبدو بشرية حقًا، وتحديدًا للغة الصينية. إليك تفصيل حلهم، باستخدام بعض التشبيهات اليومية.
المشكلة: الروبوت بنظام "التوقف والانطلاق"
معظم الروبوتات اليوم تتعامل مع الكلام كأنه عرض شرائح. لديها قائمة من أشكال الفم (مثل شكل "O" لصوت "Oh" أو "M" لصوت "Mom"). عندما يسمع الروبوت صوتًا، فإنه يقفز ببساطة إلى تلك الصورة.
- العيب: البشر الحقيقيون لا يقفزون هكذا؛ نحن ننزلق. عندما نقول "Moo"، لا تقفز شفاهنا فجًا إلى شكل "O"؛ بل تتقوس وتستدير بينما لا نزال نصدر صوت الـ "M". هذا ما يسمى بـ التداخل النطقي (coarticulation) (اندماج الأصوات معًا).
- النتيجة: بدون هذا الاندماج، يبدو كلام الروبوت متقطعًا، وتبدو الشفاه وكأنها تهتز أو تعاني من خلل تقني.
الحل: وصفة من ثلاث خطوات لشفاه تشبه البشر
بنى المؤلفون نظامًا يتكون من ثلاثة مكونات رئيسية لإصلاح ذلك:
1. مكتبة "سيناريو الفيلم" (الرموز البصرية ثلاثية الأبعاد الديناميكية)
بدلاً من صورة ثابتة للفم، أنشأ الباحثون مكتبة فيديو ثلاثية الأبعاد لكل صوت في اللغة الصينية.
- التشبيه: تخيل أن القاموس التقليدي يحتوي على صورة لابتسامة. هذه المكتبة الجديدة تشبه مقطع فيديو عالي الدقة لابتسامة تحدث بالفعل. إنها لا تسجل البداية والنهاية فحسب، بل تسجل المسار الدقيق الذي تسلكه الشفاه للوصول إلى هناك.
- لماذا يهم ذلك: لقد ربطوا هذه الحركات بمعيار ARKit (نفس التقنية التي تستخدمها شركة Apple في خاصية Face ID)، حيث حولوا حركات العضلات المعقدة إلى 27 "مقبضًا" رقميًا يتحكم في الوجه. ثم قاموا بتبسيط مئات الأصوات الصينية إلى 14 "شخصية شفاه" أساسية (visemes) تغطي جميع الحركات الضرورية.
2. "الخلاط السلس" (نمذجة التداخل النطقي)
هذا هو المكون السري. عندما تنطق كلمة مثل "Gua" (بطيخ)، فإنها في الواقع عبارة عن ثلاثة أصوات ممتزجة معًا: G-u-a.
- التشبيه: إذا قمت بخلط المكونات في الخلاط واحدًا تلو الآخر، فستحصل على قطع منفصلة. أنت بحاجة لخلطها بينما هي تدور.
- كيف يعمل: يستخدم النظام معادلة رياضية خاصة لعمل "تلاشٍ متقاطع" (cross-fade) بين الأصوات. فهو يعرف أنه عندما تنهي صوت الـ "G"، يجب أن تبدأ شفاهك بالفعل في الاستدارة لصوت الـ "u". كما يقوم بتعديل السرعة بناءً على قوة الصوت (تعديل الطاقة). إذا صرخت، تتحرك الشفاه بشكل أسرع وأوسع؛ وإذا همست، تتحرك بلطف. هذا يمنع شفاه الروبوت من التعثر أو الاهتزاز.
3. "المترجم" (رسم خرائط الحركة)
هذا هو الجزء الصعب: رأس الروبوت ليس لديه 27 عضلة مستقلة مثل الإنسان. بل لديه هيكل ميكانيكي يحتوي على 14 جزءًا متحركًا فقط (محركات وكابلات).
- التشبيه: تخيل أنك قائد أوركسترا تحاول قيادة أوركسترا مكونة من 27 عازفًا، لكن ليس لديك سوى 14 عصا للقيادة. عليك أن تخبر العصوات كيف تتحرك لكي تحاكي صوت الأوركسترا بأكملها.
- كيف يعمل: يعمل النظام كمترجم. يأخذ الأمر الرقمي المعقد المكون من 27 مقبضًا، ويحدد كيفية دمجها لتحريك المحركات الـ 14 الفيزيائية للروبوت. لقد استخدموا مزيجًا من البيانات الحاسوبية والخبراء البشريين لـ "معايرة" هذا، مما يضمن تمدد الجلد السيليكوني للروبوت بشكل طبيعي دون تمزق أو تيبس.
هل نجح الأمر؟ (النتائج)
اختبر الفريق الروبوت الخاص بهم مقابل أربع طرق أخرى وممثلين بشريين حقيقيين.
- السلاسة: قاموا بقياس "الارتجاج" (مدى مفاجأة الحركات). كان روبوتهم سلسًا تقريبًا مثل الإنسان الحقيقي، بينما بدت الطرق الأخرى وكأنها تعاني من نوبات تشنج.
- الدقة: قاموا بقياس مدى مطابقة فم الروبوت للصوت. كانت طريقتهم أفضل بكثير في مطابقة إيقونة وشكل الكلام البشري.
الصورة الكبيرة
هذا البحث يمنح الروبوتات "صوتًا" لا يقتصر فقط على الصوت المسموع، بل يشمل الأداء البصري أيضًا. من خلال جعل الشفاه تتحرك بانسيابية البشر، يساعد ذلك الناس على فهم الروبوت بشكل أفضل (خاصة في الغرف المزدحمة بالضجيج) ويجعل التفاعل يبدو أقل رعبًا وأكثر ودية.
باخت-اختصار: لقد توقفوا عن جعل فم الروبوت "يقفز" وتعلموا جعله "ينزلق" بشفتيه، مما يجعله شريكًا أفضل في المحادثة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.