← أحدث الأبحاث
🤖 AI

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

يُعد PilotTTS نظاماً خفيف الوزن ومفتوح المصدر لتحويل النص إلى كلام يعتمد على النماذج ذاتية الانحدار، ويحقق أداءً رائداً في استنساخ الأصوات وتوليف المشاعر واللهجات باستخدام بنية هندسية تبسيطية ومسار بيانات قابل لإعادة الإنتاج تم تدريبه على 200 ألف ساعة فقط من البيانات، متفوقاً بذلك على النماذج التي تدرّبت على مجموعات بيانات أكبر بكثير.

المؤلفون الأصليون: Bowen Li, Shaotong Guo, Zhen Wang, Yang Xiang, Mingli Jin, Yihang Lin, Jiahui Zhao, Weibo Xiong, Dongrui Li, Keming Chen, Yunze Gao, Yuze Zhou, Zeyang Lin, Yue Liu

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bowen Li, Shaotong Guo, Zhen Wang, Yang Xiang, Mingli Jin, Yihang Lin, Jiahui Zhao, Weibo Xiong, Dongrui Li, Keming Chen, Yunze Gao, Yuze Zhou, Zeyang Lin, Yue Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد بناء ممثل صوتي عالمي المستوى. عادةً، للقيام بذلك، تحتاج إلى استوديو ضخم ومكلف، وملايين الساعات من النصوص المسجلة، وفريق من المهندسين لبناء آلة معقدة للغاية. الأمر يشبه محاولة خبز كعكة حائزة على نجمة ميشلان باستخدام مصنع مليء بالأفران الصناعية والمكونات النادرة والخاصة.

PilotTTS هي وصفة جديدة من فريق Amap التابع لشركة Alibaba تقول: "لا تحتاج إلى المصنع. أنت فقط بحاجة إلى مطبخ جيد ومنضبط وطريقة ذكية لاستخدام ما تملكه."

إليك كيف فعلوا ذلك، مشروحاً ببساة:

1. "المطبخ النظيف" (معالجة البيانات)

تعتمد معظم نماذج الصوت بالذكاء الاصطناعي على بيانات فوضوية تم جمعها من الإنترنت — مثل محاولة الخبز بدقيق يحتوي على حشرات.

  • الطريقة القديمة: غالباً ما تستخدم الفرق أدوات سرية ومكلفة لتنظيف بياناتها، مما يبقي الباحثين الآخرين خارج اللعبة.
  • طريقة PilotTTS: قاموا ببناء "خط معالجة للتنظيف" باستخدام أدوات مفتوحة المصدر ومجانية فقط. فكر في هذا كحزام ناقل يغسل، ويفرز، ويفحص كل مقطع صوتي.
    • يتحقق مما إذا كان الصوت واضحاً (بدون تشويش أو ضوضاء في الخلفية).
    • يقص الأجزاء التي يتحدث فيها الناس في وقت واحد.
    • يصنف كل شيء بدقة (من المتحدث، وماذا يقولون، وكيف يقولونه).
    • النتيجة: لقد حولوا كومة ضخمة من الصوتيات الفوضوية من الإنترنت إلى مكتبة نقية مكونة من 200,000 ساعة من البيانات عالية الجودة. إنه يشبه تحويل ساحة خردة إلى مكتبة منظمة تماماً.

2. "الطاهي الذكي" (بنية النموذج)

بدلاً من بناء روبوت عملاق ومعقد بألف قطعة متحركة، استخدموا نهجاً "نموذجياً" (Modular). لقد أخذوا أدوات موجودة ومثبتة وربطوها بطريقة ذكية جديدة.

  • العقل: استخدموا نموذج لغة قوياً (Qwen3) ليكون العقل الذي يفهم النص.
  • خدعة "الفصل": هذه هي وصفتهم السرية. عادةً، عندما يحاول الذكاء الاصطناعي تقليد صوت ما، فإنه يرتبك بين هوية الشخص (بصمته الصوتية الفريدة) وبين كيفية حديثه (عاطفته أو سرعته).
    • يستخدم PilotTTS "مجسّين" منفصلين (Q-Former و CAMPPlus encoder). يركز أحد المجسّين فقط على الهوية (الصوت نفسه)، بينما يركز الآخر على الأسلوب (العاطفة، السرعة، واللهجة).
    • التشبيه: تخيل رساماً. فرشاة واحدة ترسم وجه الشخص (الهوية)، وفرشاة أخرى ترسم مزاج المشهد (الأسلوب). من خلال إبقاء الفرش منفصلة، يمكن للرسام تغيير المزاج (جعل الشخص حزيناً أو سعيداً) دون تغيير وجه الشخص عن طريق الخطأ.

3. ماذا يمكنه أن يفعل؟

بسبب فصلهم بين "الصوت" و"الأسلوب"، فإن النظام مرن للغاية:

  • الاستنساخ بلقطة واحدة (Zero-Shot Cloning): يمكنك إعطاؤه 5 ثوانٍ فقط من صوت شخص غريب، ويمكنه التحدث بأي نص بهذا الصوت. وقد تفوق على أنظمة أخرى تم تدريبها على مجموعات بيانات أكبر بكثير.
  • التحكم في العاطفة: يمكنك أن تطلب منه التحدث "بحزن"، أو "بغضب"، أو "بشعور من القلق". يمكنه القيام بذلك لـ 11 عاطفة مختلفة.
  • السمات شبه اللغوية (Paralinguistics): يمكنه إضافة أصوات بشرية مثل الضحك، أو البكاء، أو السعال، أو التنفس. يمكنه حتى القيام بـ "الضحك المدمج"، حيث يضحك الشخص أثناء التحدث، بدلاً من مجرد الضحك قبل أو بعد الكلام.
  • اللهجات: يمكنه التحدث بـ 14 لهجة صينية مختلفة. حتى لو أعطيته أمراً بلغة الماندارين، يمكنه التحول في المخرجات إلى لهجة محددة مع الحفاظ على هوية المتحدث الأصلية.

4. النتائج

لقد اختبروا هذا النظام مقابل نماذج صوتية رفيعة المستوى أخرى.

  • الدقة: ارتكب أخطاء قليلة جداً فيما يقوله (معدلات خطأ منخفضة).
  • مطابقة الصوت: كان صوته يشبه المتحدث الأصلي أكثر من أي نظام آخر تم اختباره، على الرغم من أنه تم تدريبه على بيانات أقل بكثير (200 ألف ساعة مقابل ملايين الساعات التي استخدمها المنافسون).
  • الكفاءة: حقق هذه النتائج دون الحاجة إلى بيانات مملوكة لجهات خاصة أو بنية تحتية معقدة وضخمة.

الخلاصة

يثبت PilotTTS أنك لست بحاجة لأن تكون شركة تقنية عملاقة ذات موارد غير محدية لبناء صوت ذكاء اصطناعي رفيع المستوى. من خلال الانضباط في جودة البيانات واستخدام تصميم نموذجي ذكي (فصل "من هو" عن "كيف يتحدث")، أنشأوا نظاماً قادراً على منافسة أكبر اللاعبين في هذا المجال.

لقد أطلقوا "وصفتهم" (الشيفرة البرمجية ومسار معالجة البيانات) للجمهور، بحيث يمكن لأي شخص بناء نسخته الخاصة من هذا "المطبخ النظيف" و"الطاهي الذكي".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →