VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation
يُعد VoiceDesigner إطار عمل موحداً يستفيد من خط معالجة بيانات هجين ومحول انتشار مُحسّن للتغلب على القيود الحالية في توليد أصوات متنوعة واقعية وخيالية، مع تمكين تحرير صوتي قوي وقابل للتحكم.
المؤلفون الأصليون:Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin
تخيل عالماً لا يكون فيه صوتك مجرد صدفة بيولوجية، بل آلة موسيقية قابلة للتخصيص يمكنك ضبطها مثل الغيتار. لعقود من الزمن، كانت الحواسيب بارعة في قراءة النصوص بصوت عالٍ، لكنها عادة ما تبدو كإنسان آلي واحد متصلب، ما لم تغذّها بتسجيل لشخص حقيقي لتقليده. هذا المجال، المعروف باسم تحويل النص إلى صوت (TTV)، يحاول تغيير ذلك. فبدلاً من مجرد نسخ شخص معين، يعلم العلماء الحواسيب فهم أوصاف مثل "ساحر عجوز غاضب" أو "فضائي متحمس" وإنشاء صوت من الصفر. الأمر يشبه إعطاء طاهٍ وصفة مكتوبة بالكلمات بدلاً من صورة للطبق؛ الهدف هو استحضار النكهة والقوام والرائحة بدقة بمجرد قراءة التعليمات. ولكن حتى الآن، واجه هؤلاء الطهاة الرقميون مشكلتين كبيرتين: معظمهم يعرف فقط كيفية طهي الأطباق "البشرية"، وإذا طلبت منهم تعديل نكهة ما (مثل جعل الصوت يبدو أكثر سعادة)، فإنهم غالباً ما يفسدون الوجبة بأكملها.
إليك VoiceDesigner، وهو نظام جديد يعمل كمهندس معماري بارع للأصوات. أدرك الباحثون وراء هذا المشروع أن الأنظمة الحالية كانت عالقة في روتين، حيث تولد في الغالب أصواتاً بشرية قياسية وتفشل عندما يُطلب منها إنشاء شخصيات خيالية مثل التنانين أو الشياطين، أو عند محاولة تعديل مزاج الصوت دون إفساده. ولحل هذه المشكلة، بنوا إطار عمل موحداً يعامل إنشاء الصوت وتحرير الصوت كوجهين لعملة واحدة. فكر في الأمر كأنه استوديو واحد ذكي للغاية حيث يمكنك إما بناء صوت من الصفر باستخدام وصف نصي، أو أخذ صوت موجود وإعادة تشكيله بتعليمات بسيطة مثل "اجعله يبدو أكثر غموضاً".
السر الكامن وراء VoiceDesigner هو مزيج ذكي من شيئين. أولاً، لم يعتمدوا فقط على تسجيل أشخاص حقيقيين؛ بل بنوا "مصنع أصوات" يستخدم معالجة الإشارات الرقمية (مثل تدوير مقابض لوحة التحكم في الصوت) والذكاء الاصطناعي التوليدي لإنشاء آلاف الأصوات المزيفة ولكن الواقعية. سمح هذا لنظامهم بالتدرب على كل شيء، من همسات البشر إلى الزمجرة العميقة لوحش، مما ملأ الفجوات التي تركتها التسجيلات الواقعية فارغة. ثانياً، قاموا بترقية عقل النظام — وهو نوع من الذكاء الاصطناعي يسمى "Diffusion Transformer". لقد منحوه طريقة جديدة للاستماع إلى التعليمات، والنصوص المكتوبة، والمراجع الصوتية جميعها في وقت واحد دون ارتباك، باستخدام نظام تحديد مواقع ثلاثي الأبعاد خاص يحافظ على تنظيم أنواع المعلومات المختلفة، مثل أمين مكتبة لا يخلط أبداً بين الكتب والأفلام والموسيقى.
تشير النتائج إلى أن هذا النهج يعمل بشكل جيد للغاية. ففي الاختبارات، كان VoiceDesigner أفضل في اتباع التعليمات المعقدة من النماذج مفتوحة المصدر الأخرى، حيث نجح في توليد أصوات لشخصيات مثل القراصنة والروبوتات بدت تماماً كما وُصفت. كما أثبت أنه محرر بارع، حيث استطاع تغيير عاطفة المتحدث أو نبرته دون فقدان هويته الأصلية. وبينما لا تزال هناك فجوة صغيرة يغلقها مع الأنظمة التجارية رفيعة المستوى، توضح الورقة البحثية أنه من خلال الجمع بين محاكاة البيانات الإبداعية ونموذج موحد أكثر ذكاءً، فإننا نقترب كثيراً من مستقبل يمكنك فيه تصميم أي صوت تتخيله، مباشرة من لوحة مفاتيحك.
ملخص تقني: VoiceDesigner
بيان المشكلة
يهدف توليد النص إلى الصوت (TTV) إلى تخليق الكلام من نص مكتوب ووصف باللغة الطبيعية لصوت المتحدث. وبينما مكنت التطورات الحديثة في التعلم العميق الأنظمة التي توجه فيها سمات الصوت عملية التوليد، تواجه النماذج الحالية عقبتين رئيسيتين:
تنوع صوتي محدود: تعاني الأنظمة الحالية في توليد طيف واسع من الأصوات، لا سيما الشخصيات الخيالية أو غير البشرية (مثل الوحوش، الروبوتات، الشياطين) وأساليب الكلام الأقل شيوعاً (مثل الهمس، أو الكلام العصبي). تتكون معظم بيانات التدريب من الكلام البشري الطبيعي المستمد من الكتب الصوتية والبودكاست، مما يفتقر إلى التنوع المطلوب للتطبيقات الإبداعية مثل الأفلام والألعاب.
ضعف التحرير وإعادة الاستخدام: غالباً ما تُصمم أنظمة استنساخ الصوت والتحرير القائمة على التعليمات الحالية للأصوات البشرية التقليدية، وتظهر ضعفاً في المتانة عند التعامل مع الأصوات ذات الأنماط المميزة أو غير التقليدية. علاوة على ذلك، يتم تنفيذ توليد الصوت وتحريره كأنظمة منفصلة، مما يزيد من تكاليف النشر ويحد من إمكانية التطبيق في البيئات ذات الموارد المنخفضة.
المنهجية
يقترح المؤلفون VoiceDesigner، وهو إطار عمل موحد لتوليد وتحرير النص إلى صوت، يعالج هذه التحديات من خلال خط أنابيب بيانات هجين وبنية محول انتشار (Diffusion Transformer) محسنة.
1. خط أناقة محاكاة البيانات الهجين
للتغلب على ندرة البيانات، وخاصة للأصوات غير البشرية أو شخصيات معينة، يستخدم المؤلفون خطي أنابيب محاكاة متكاملين:
المحاكاة القائمة على معالجة الإشارات الرقمية (DSP): يقوم خط أنابيب معالجة الإشارات الرقمية بتحويل الكلام البشني القياسي إلى أصوات شخصيات غير بشرية (مثل التنانين، الأشباح، الروبوتات) باستخدام تأثيرات مثل تغيير طبقة الصوت (Pitch Shifting)، وتغيين الصيغة (Formant Shifting)، والتردد (Reverberation)، وضغط النطاق الديناميكي، مما يوسع توزيع الأصوات ليشمل الخصائص الصوتية غير البشرية دون الحاجة إلى تسجيلات مخصصة لكل شخصية.
المحاكاة التوليدية: يقوم خط أنابيب يستفيد من نماذج تحويل النص إلى صوت (استنساخ الصوت) بنموذج الصفر (Zero-shot) ونماذج تحويل الصوت بتعزيز البيانات الأسلوبية عالية الجودة. يقوم هذا الخط بتوليد محتوى لغوي متنوع مع الحفاظ على سمات صوتية محددة (الجرس، العاطفة، اللكنة) أو خصائص أسلوبية (منحنيات الطبقة)، مما يوفر إشرافاً لمهام تحرير الصوت.
تصفية البيانات: تضمن عملية تصفية متعددة المراحل الجودة، باستخدام معدل الخطأ في الكلمات (WER) للدقة اللغوية ومقاييس تشابه التضمين لاتساق المتحدث والعاطفة.
2. بنية النموذج: MM-DiT الموحد
بُني VoiceDesigner على محول انتشار متعدد الوسائط (MM-DiT) يعمل في فضاء كامن صوتي (باستخدام DAC-VAE). وهو يوحد ثلاثة أنماط توليد ضمن إطار عمل واحد:
توليد الصوت: يخلق الكلام من نص وصفي للصوت. تعداد
استنساخ الصوت: يحافظ على هوية المتحدث من خلال صوت مرجعي ونص.
تحرير الصوت: يعدل سمات الصوت (العاطفة، الأسلوب، الطبقة) لصوت مرجعي بناءً على تعليمات مع الحفاظ على المحتوى اللغوي.
الابتكارات الهيكلية الرئيسية:
التطبيع الطبقي التكيفي على مستوى الرمز (AdaLN): على عكس خطوات الانتشار العالمية المستخدمة في أطر عمل TTS السابقة، يقوم VoiceDesigner بتعيين تضمينات زمنية مستمرة لكل رمز. تتلقى أهداف التوليد ضجيجاً (الخطوات الزمنية t∈[0,1])، بينما تظل المدخلات الشرطية (التعليمات، النصوص، الصوت المرجعي) خالية من الضجيج (t=1). هذا التمييز الصريح يسمح للنموذج بتنسيق الإشارات غير المتجانسة بشكل أفضل ويحسن التقارب.
التضمينات الموضعية الدوارة ثلاثية الأبعاد (3D-RoPE): للتعامل مع ثلاثة أنماط شرطية متميزة (التعليمات، النص، الصوت)، قام المؤلفون بتوسيع RoPE إلى مساحة ثلاثية الأبعاد. يتم ترميز رموز التعليمات، ورموز النص، ورموز الصوت على محاور منفصلة (x,y,z). هذا يحافظ على الانحيازات الاستقرائية الخاصة بكل نمط والمحاذاة الزمنية مع تمكين الانتباه الذاتي الموحد عبر جميع الرموز.
المساهمات الرئيسية
خط أنابيب بيانات هجين: نهج مبتكر يجمع بين تقنيات DSP والنماذج التوليدية لبناء مجموعة بيانات متنوعة تغطي الأصوات البشرية الواقعية، والشخصيات الخيالية، وأزواج التحرير، مما يعالج ندرة بيانات الأصوات غير البشرية.
بنية MM-DiT الموحدة: محول انتشار محسن مع AdaLN و3D-RoPE يعمل على نمذجة توليد النص إلى صوت، والاستنساخ، والتحرير الموجه بالتعليمات بشكل مشترك، مما يتيح توليداً عالي الدقة وتحكماً دقيقاً ضمن نموذج واحد.
تقييم شامل: تجارب ذاتية وموضوعية واسعة النطاق تثبت توافقاً فائقاً مع المطالبات (Prompt Alignment) وجودة إدراكية تنافسية مقارنة بالنماذج الأساسية مفتوحة المصدر والتجارية.
النتائج التجريبية
قام المؤلفون بتقييم VoiceDesigner مقابل أنظمة تشمل CapSpeech، وQwen3-TTS، وElevenLabs (API)، وIndexTTS-2.
توليد الصوت: حقق VoiceDesigner أعلى دقة أسلوب (Style-Accuracy: 0.66) وأقل معدل خطأ في الكلمات (WER: 1.22%) بين النماذج مفتوحة المصدر. وفي اختبارات الاستماع الذاتية (MOS)، أظهر توافقاً فائقاً بين المطالبة والصوت (MOS-C) وقابلية استخدام تنافسية (MOS-U) وجودة (MOS-Q)، مقلصاً الفجوة مع الأنظمة التجارية، خاصة عند تطبيق التحسينات بعد المعالجة.
استنساخ الصوت: في اختبار Seed-TTS، حقق VoiceDesigner معدل خطأ في الكلمات (WER) قدره 1.70% وتشابهاً في المتحدث (SIM-o) قدره 0.757، متفوقاً على معظم نماذج zero-shot TTS مفتوحة المصدر ومقترباً من أداء الأنظمة مغلقة المصدر. وفي الاختبارات الذاتية لأصوات الشخصيات الصعبة، تفوق على CosyVoice-3 وIndexTTS-2 في كل من الجرس والتشابه الأسلوبي.
تحرير الصوت: تفوق VoiceDesigner على Step-Audio-EditX وIndexTTS-2 في كل من تشابه الصوت (SIM-t: 0.884) ودقة اتباع التعليمات (MOS-E: 4.129)، مما أظهر قدرة قوية على التحرير الأسلوبي الدقيق دون إدخال عيوب كبيرة.
الكفاءة: يعمل النموذج بمعامل وقت حقيقي (RTF) قدره 0.36 للتوليد و0.42 للتحرير على بطاقة RTX 4090 واحدة، وهو أسرع بكثير من Qwen3-TTS وIndexTTS-2.
الأهمية والادعاءات
يزعم البحث أن VoiceDesigner يمثل خطوة كبيرة للأمام في توحيد توليد الصوت وتحريره، متجاوزاً حدود المطالبات القائمة على السمات لدعم تصميم الشخصيات الحدسي (مثل "تنين ذكر ضخم"). ومن خلال الاستفيد من خط أنابيب بيانات هجين، نجح إطار العمل في نمذجة الأصوات التي يصعب الحصول عليها من مجموعات الكلام الطبيعي، بما في ذلك الكيانات غير البشرية. تتيح الابتكارات الهيكلية (Token-level AdaLN و3D-RoPE) تنسيقاً فعالاً للإشارات الشرطية غير المتجانسة، مما يسمح لنموذج واحد بالتعامل مع مهام التوليد والاستنساخ والتحرير بدقة عالية.
يشير المؤلفون إلى أنه رغم بقاء فجوة في الأداء مقارنة بالأنظمة التجارية الرائدة (مثل ElevenLabs)، إلا أن النتائج تشير إلى أن اتباع نماذج محاكاة البيانات والنمذجة المماثلة، جنباً إلى جنب مع المزيد من بيانات التدريب الواقعية، يمكن أن يقلص هذه الفجوة بشكل أكبر. ويؤكد العمل على إمكانات مثل هذه الأطر الموحدة في صناعة المحتوى اليومي، والألعاب، وإنتاج الأفلام، حيث يعد تصميم الصوت المتنوع والقابل للتحكم أمراً بالغ الأهمية.