← أحدث الأبحاث
⚡ electrical engineering

VoiceDesigner: Text-to-Voice Generation and Editing via Unified Diffusion Modeling and Data Augmentation

يُعد VoiceDesigner إطار عمل موحداً يستفيد من خط معالجة بيانات هجين ومحول انتشار مُحسّن للتغلب على القيود الحالية في توليد أصوات متنوعة واقعية وخيالية، مع تمكين تحرير صوتي قوي وقابل للتحكم.

المؤلفون الأصليون: Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin

نُشر 2026-08-17
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiarui Hai, Karan Thakkar, Ke Chen, Yunyun Wang, Jiaqi Su, Rithesh Kumar, Mounya Elhilali, Zeyu Jin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً لا يكون فيه صوتك مجرد صدفة بيولوجية، بل آلة موسيقية قابلة للتخصيص يمكنك ضبطها مثل الغيتار. لعقود من الزمن، كانت الحواسيب بارعة في قراءة النصوص بصوت عالٍ، لكنها عادة ما تبدو كإنسان آلي واحد متصلب، ما لم تغذّها بتسجيل لشخص حقيقي لتقليده. هذا المجال، المعروف باسم تحويل النص إلى صوت (TTV)، يحاول تغيير ذلك. فبدلاً من مجرد نسخ شخص معين، يعلم العلماء الحواسيب فهم أوصاف مثل "ساحر عجوز غاضب" أو "فضائي متحمس" وإنشاء صوت من الصفر. الأمر يشبه إعطاء طاهٍ وصفة مكتوبة بالكلمات بدلاً من صورة للطبق؛ الهدف هو استحضار النكهة والقوام والرائحة بدقة بمجرد قراءة التعليمات. ولكن حتى الآن، واجه هؤلاء الطهاة الرقميون مشكلتين كبيرتين: معظمهم يعرف فقط كيفية طهي الأطباق "البشرية"، وإذا طلبت منهم تعديل نكهة ما (مثل جعل الصوت يبدو أكثر سعادة)، فإنهم غالباً ما يفسدون الوجبة بأكملها.

إليك VoiceDesigner، وهو نظام جديد يعمل كمهندس معماري بارع للأصوات. أدرك الباحثون وراء هذا المشروع أن الأنظمة الحالية كانت عالقة في روتين، حيث تولد في الغالب أصواتاً بشرية قياسية وتفشل عندما يُطلب منها إنشاء شخصيات خيالية مثل التنانين أو الشياطين، أو عند محاولة تعديل مزاج الصوت دون إفساده. ولحل هذه المشكلة، بنوا إطار عمل موحداً يعامل إنشاء الصوت وتحرير الصوت كوجهين لعملة واحدة. فكر في الأمر كأنه استوديو واحد ذكي للغاية حيث يمكنك إما بناء صوت من الصفر باستخدام وصف نصي، أو أخذ صوت موجود وإعادة تشكيله بتعليمات بسيطة مثل "اجعله يبدو أكثر غموضاً".

السر الكامن وراء VoiceDesigner هو مزيج ذكي من شيئين. أولاً، لم يعتمدوا فقط على تسجيل أشخاص حقيقيين؛ بل بنوا "مصنع أصوات" يستخدم معالجة الإشارات الرقمية (مثل تدوير مقابض لوحة التحكم في الصوت) والذكاء الاصطناعي التوليدي لإنشاء آلاف الأصوات المزيفة ولكن الواقعية. سمح هذا لنظامهم بالتدرب على كل شيء، من همسات البشر إلى الزمجرة العميقة لوحش، مما ملأ الفجوات التي تركتها التسجيلات الواقعية فارغة. ثانياً، قاموا بترقية عقل النظام — وهو نوع من الذكاء الاصطناعي يسمى "Diffusion Transformer". لقد منحوه طريقة جديدة للاستماع إلى التعليمات، والنصوص المكتوبة، والمراجع الصوتية جميعها في وقت واحد دون ارتباك، باستخدام نظام تحديد مواقع ثلاثي الأبعاد خاص يحافظ على تنظيم أنواع المعلومات المختلفة، مثل أمين مكتبة لا يخلط أبداً بين الكتب والأفلام والموسيقى.

تشير النتائج إلى أن هذا النهج يعمل بشكل جيد للغاية. ففي الاختبارات، كان VoiceDesigner أفضل في اتباع التعليمات المعقدة من النماذج مفتوحة المصدر الأخرى، حيث نجح في توليد أصوات لشخصيات مثل القراصنة والروبوتات بدت تماماً كما وُصفت. كما أثبت أنه محرر بارع، حيث استطاع تغيير عاطفة المتحدث أو نبرته دون فقدان هويته الأصلية. وبينما لا تزال هناك فجوة صغيرة يغلقها مع الأنظمة التجارية رفيعة المستوى، توضح الورقة البحثية أنه من خلال الجمع بين محاكاة البيانات الإبداعية ونموذج موحد أكثر ذكاءً، فإننا نقترب كثيراً من مستقبل يمكنك فيه تصميم أي صوت تتخيله، مباشرة من لوحة مفاتيحك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →