يُعد JaiTTS-v1.0 نموذجاً متطوراً لتحويل النص إلى كلام واستنساخ الأصوات باللغة التايلاندية يعتمد على بنية VoxCPM، حيث يحقق معدلات خطأ في الحروف فائقة الدقة ويتفوق على النماذج التجارية الرائدة في التقييمات البشرية من خلال التعامل بفعالية مع التبديل بين اللغات والأرقام دون الحاجة إلى تطبيع نصي صريح.
تخيل أن لديك طاهياً ماهراً يمكنه طهي أي طبق، لكنه لا يعرف حقاً سوى إتقان الأطباق الإنجليزية فقط. إذا طلبت منه طهي طبق تايلاندي، فقد يخطئ في التوابل، وإذا طلبت منه طبقاً يمزج بين المكونات التايلاندية والإنجليزية، فقد يصاب بالارتباك.
JaiTTS يشبه طاهياً تايلاندياً جديداً ومتخصصاً، تم تدريبه خصيصاً على مكتبة ضخمة من الأصوات والقصص التايلاندية. إليك تفصيل بسيط لما يقوله هذا البحث حول ابتكارهم الجديد:
1. المشكلة: الطاهي الذي يتقن الإنجليزية فقط
معظم أدوات استنساخ الصوت الأفضل المتاحة حالياً تشبه ذلك الطاهي الذي يتقن الإنجليزية فقط؛ فهي تعمل بشكل رائع للغة الإنجليزية ولكنها تعاني مع اللغة التايلاندية.
مشكلة اللكنة: عندما يحاولون التحدث بالتايلاندية، يخطئون أحياناً في النغمات (الارتفاع والانخفاض الموسيقي في اللغة).
صعوبة "التبديل بين اللغات": في الحياة الواقعية، غالباً ما يمزج التايلانديون الكلمات الإنجليزية في الجمل التايلاندية (مثل قول "أحتاج إلى التحقق من الـ schedule الخاص بي"). الأدوات التايلاندية الحالية غالباً ما تتعثر في هذا المزيج أو تتطلب من البشر تنظيف النص أولاً.
مشكلة القصص الطويلة: بعض الأدوات التايلاندية جيدة في الجمل القصيرة، لكنها تبدو آلية أو تنهار عندما يُطلب منها سرد قصة طويلة.
2. الحل: JaiTTS-v1.0
قام الفريق ببناء JaiTTS-v1.0، وهو نموذج صوتي جديد مصمم خصيصاً للغة التايلاندية. فكر فيه كـ "طاهٍ خارق" تعلم مباشرة من 10,000 ساعة من الصوت التايلاندي.
كيف يعمل (تشبيه المطبخ): بدلاً من استخدام كتاب وصفات جاهز (وهو ما يشبه استخدام "المجزئ - tokenizer" الذي يكسر الكلمات إلى قطع)، يتعلم JaiTTS الطهي من خلال الاستماع والمحاكاة مباشرة.
المخطط (TSLM): يقرأ هذا الجزء النص ويقرر ماذا سيقول وكيف سيقوله (العاطفة والإيقاع).
الهيكل العظمي (FSQ): ينشئ مخططاً أولياً للصوت، مثل مسودة لوحة فنية.
المُحسّن (RALM): يضيف هذا الجزء التفاصيل الدقيقة، مثل ملمس الصوت المحدد وشخصية المتحدث الفريدة.
الرسام (LocDiT): أخيراً، يقوم هذا الجزء بتحويل المسودة والتفاصيل إلى موجة صوتية مستمرة وسلسة.
3. المهارات الخاصة
لا حاجة لـ "التنظيف المسبق": إذا قمت بتغذيته بجملة غير منظمة تحتوي على أرقام (مثل "لدي 500 باهت") أو لغة مختلطة (إنجليزية/تايلاندية)، فإنه لا يحتاج إلى بشر لإعادة كتابتها أولاً؛ فهو يفهم النص الخام فوراً.
القصص القصيرة والطويلة: تم اختباره على كل من العبارات القصيرة (مثل رسالة نصية) والقصص الطويلة (مثل مقطع من بودكاست). وهو يتعامل مع كليهما بشكل جيد، بينما تفشل الأدوات التايلاندية الأخرى غالباً في القصص الطويلة.
4. اختبار التذوق (النتائج)
وضع الفريق JaiTTS تحت الاختبار مقابل نماذج مفتوحة المصدر شهيرة أخرى وحتى أفضل مولدات الصوت التجارية (مثل ElevenLabs و MiniMax).
الدقة: في "اختبار استماع" حيث تحاول حاسوب كتابة ما قيل، ارتكب JaiTTS أخطاء أقل (معدل خطأ 1.94%) حتى من المتحدثين البشر الذين كان يقلدهم (1.98%). لقد كان دقيقاً إلى هذا الحد!
تشابه الصوت: عندما طُلب منه محاكاة شخص معين، فقد قام بعمل رائع، حيث طابق الصوت الأصلي عن كثب.
السرعة: إنه سريع للغاية. يمكنه توليد الكلام بسرعة تقارب 9 مرات من الوقت الفعلي. تخيل كاتبًا يمكنه طباعة كتاب كامل في الوقت الذي تستغرقه أنت لقراءة صفحة واحدة.
حكم البشر: عندما استمع 20 متحدثاً تايلاندياً حقيقياً إلى JaiTTS مقارنة بالمنافسين التجاريين الكبار، فضلوا JaiTTS بنسبة 70% من المرات. وفي تصويت وجهاً لوجه من 400 مقارنة، فاز JaiTTS في 283 مرة وخسر في 58 مرة فقط.
الملخص
JaiTTS هو أداة استنساخ صوت تايلاندية عالية الكفاءة، لا تحتاج إلى مساعدة لفهم اللغات المختلطة أو الأرقام. يبدو أكثر طبيعية ودقة من الخيارات مفتوحة المصدر الأخرى، بل ويتفوق على بعض الأنظمة التجارية المكلفة في كيفية محاكاة الأصوات البشرية الحقيقية، كل ذلك مع العمل بسرعة البرق.
إليك ملخص تقني مفصل لورقة البحث بعنوان "JaiTTS: نموذج استنساخ الصوت للغة التايلاندية".
1. بيان المشكلة
تعالج الورقة ثلاث فجوات حرجة في تكنولوجيا تحويل النص إلى كلام (TTS) الحالية، وتحديداً فيما يتعلق باللغة التايلاندية:
التحيز المتمحور حول الإنجليزية: معظم نماذج تحويل النص إلى كلام مفتوحة المصدر والتجارية المتطورة مُحسّنة بشكل مكثف للغة الإنجليزية. ورغم وجود نماذج متعددة اللغات (مثل Qwen3-TTS)، إلا أنها غالباً ما تعاني من أخطاء في النطق والخصائص النبرية (prosody) في اللغة التايلاندية بسبب ندرة البيانات التايلاندية في مجموعات بيانات التدريب الخاصة بها.
قصور النماذج التايلاندية الحالية: الأنظمة التايلاندية المخصصة (مثل ThonburianTTS) غالباً ما تكون محدودة في قدرات استنساخ المتحدث من نوع (zero-shot)، وتواجه صعوبة في توليد الكلام طويل المدة لأنها تدربت على مجموعات بيانات تهيمن عليها العبارات القصيرة.
متطلبات المعالجة المسبقة المعقدة: تعتمد مسارات تحويل النص إلى كلام التايلاندية التقليدية بشكل كبير على تطبيع نصي (text normalization) معقد للتعامل مع الأرقام والتبديل المتكرر بين الكود (Code-switching) للغتين التايلاندية والإنجليزية (وهو أمر شائع في الاستخدام الواقعي). وهذا يزيد من تعقيد النشر ونقاط الفشل المحتملة.
قصور برامج الترميز (Codec Limitations): تفتقر النماذج التكرارية (autoregressive) الحديثة التي تستخدم برامج ترميز صوتية منفصلة (مثل x-codec2) إلى القدرة المثبتة على إعادة بناء التباينات الصوتية الخاصة بالتايلاندية، مثل النغمات المعجمية وتجمعات الحروف الساكنة، حيث تشير التقارير إلى أن بيانات تدريبها تستبعد اللغة التايلاندية.
2. المنهجية
يقدم المؤلفون JaiTTS-v1.0، وهو نموذج استنساخ صوت متطور مقتبس من VoxCPM. تم تصميم النظام ليكون خالياً من الرموز (tokenizer-free)، متجاوزاً برامج ترميز الكلام الخارجية تماماً.
نظرة عامة على البنية
يعمل النموذج عبر مسار هرمي يتكون من أربعة مكونات أساسية (كما هو موضح في الشكل 1 من الورقة):
نموذج اللغة الدلالي-النصي (TSLM): وهو محول (Transformer) يعمل بنظام فك التشفيد فقط (decoder-only) ومبني على (MiniCPM-4)، يعتمد على النص المرمز والسياق الصوتي التاريخي. يقوم بتوليد تمثيل دلالي-نبري مستمر، يلتقط المحتوى وأسلوب الإلقاء معاً.
الكمية القياسية المحدودة (FSQ): تعمل هذه الطبقة على ضغط المخرجات المستمرة لنموذج (TSLM) إلى "هيكل شبه منفصل". وهي تعمل كمنظم (regularizer)، مما يحافظ على استقرار إشارة التخطيط مع ضمان قابلية الاشتقاق عبر (straight-through estimator).
نموذج اللغة الصوتي المتبقي (RALM): وهو محول (decoder-only Transformer) يعمل على تحسين الهيكل شبه المنفصل. يتخصص هذا النموذج في التعبير الصوتي وخصائص المتحدث، حيث يضيف التفاصيل التي لا يستطيع الاختناق المنفصل (discrete bottleneck) تمثيلها.
محول الانتشار المحلي (LocDiT): وهو محول ثنائي الاتجاه يقوم بفك تشفير رقع (patches) الكلام المستمرة النهائية. يستخدم تقنية (flow-matching denoising)، مشروطاً بالإشارة المدمجة من هيكل (FSQ) ومتبقيات (RALM)، بالإضافة إلى رقعة الصوت السابقة لضمان الاستمرارية بين الرقع.
متنبئ التوقف (Stop Predictor): رأس خفيف يتنبأ بنهاية التسلسل لإنهاء عملية التوليد.
استراتيجية التدريب
البيانات: تم التدريب على مجموعة بيانات مركزة على اللغة التايلاندية بحجم ~10,000 ساعة، تجمع بين الكلام العام (الحواري/الرسمي) والمحتوى المتخصص في مجالات (التمويل، الرعاية الصحية، التعليم، والقانون).
المعالجة المباشرة: تم تدريب النموذج لمعالجة النص الخام مباشرة، مما يسمح بالتعامل مع التبديل بين التايلاندية والإنجليزية والأرقام دون الحاجة لتطبيع نصي صريح.
الهدف: تم تحسين النظام من الطرف إلى الطرف (end-to-end) باستخدام دالة خسارة مشتركة من مطابقة التدفق (Flow Matching) (لعملية الانتشار) والتقاطع الثنائي المتشعب (Binary Cross-Entropy) (لمتنبئ التوقف).
3. المساهمات الرئيسية
أول مستنسخ صوت عالي الأداء للغة التايلاندية: يعد JaiTTS-v1.0 أول نموذج يحقق أداءً رائداً (SOTA) في استنساخ الصوت للغة التايلاندية، متفوقاً على الحقيقة البشرية (human ground truth) في المهام قصيرة المدة، ومطابئاً لها في المهام طويلة المدة.
بنية خالية من الرموز (Tokenizer-Free): من خلال تكييف VoxCPM، يتجنب النموذج قيود إعادة بناء الأصوات الموجودة في برامج ترميز الصوت المنفصلة، مما يسمح بنمذجة أكثر دقة للنغمات التايلاندية وتجمعات الحروف.
القوة في التعامل مع المدخلات الواقعية: يلغي النموذج الحاجة إلى مسارات معقدة لتطبيع النص، حيث يقوم بتخليق الكلام مباشرة من النص الخام الذي يحتوي على لغات مختلطة وأرقام.
معيار تقييم جديد: قدم المؤلفون إطار تقييم جديد يقسم المهام إلى قصيرة المدة (1-15 ثانية) وطويلة المدة (16-30 ثانية) ليعكس حالات الاستخدام الواقعي بشكل أفضل ويختبر الاستقرار بمرور الوقت.
4. النتائج التجريبية
المقاييس الموضوعية
المهام قصيرة المدة: حقق JaiTTS-v1.0 معدل خطأ في الحروف (CER) بنسبة 1.94%، متفوقاً على الحقيقة البشرية (1.98%) ومتفوقاً على جميع النماذج المرجعية (Qwen3-TTS-1.7B: 2.56%؛ ThonburianTTS: 6.26%).
المهام طويلة المدة: حافظ النموذج على معدل CER بنسبة 2.55%، وهو قريب جداً من أداء البشر (2.47%). وفي المقابل، تراجع Qwen3-TTS-1.7B إلى 3.64%، بينما فشل ThonburianTTS في توليد مخرجات منطقية.
تشابه المتحدث (SIM): حقق درجة تنافسية بلغت 0.62 للمهام القصيرة و0.76 للمهام الطويلة.
الكفاءة
عامل الوقت الحقيقي (RTF): حقق JaiTTS-v1.0 عاملاً قدره 0.1136، مما يعني أنه يولد الكلام بسرعة تقارب 9 أضعاف الوقت الحقيقي. وهذا أسرع بحوالي 13 ضعفاً من نماذج Qwen3-TTS التكرارية (RTF > 1.5) وأسرع قليلاً من نموذج ThonburianTTS غير التكراري (0.1150).
التقييم عبر الحكم البشري
المقارنة: تمت التجربة مقابل نماذج تجارية رائدة مثل ElevenLabs (eleven_v3) و MiniMax (speech-2.8-hd).
النتيجة: في 400 مقارنة ثنائية، فاز JaiTTS-v1.0 في 283 مرة، وتعادل في 59 مرة، وخسر في 58 مرة فقط.
التفضيل: فضل الحكام البشريون JaiTTS-v1.0 بنسبة تقارب 70% من الوقت، مشيرين إلى تفوقه في الطبيعية، ووضوح النطق (خاصة مع التبديل اللغوي والأرقام)، وتشابه المتحدث.
5. الأهمية
يمثل JaiTTS-v1.0 قفزة نوعية في مجال تحويل النص إلى كلام للغات ذات الموارد المحدودة. فهو يثبت أن البنى التكرارية الخالية من الرموز يمكن أن تتفوق على كل من النماذج متعددة اللغات التقليدية والنماذج الصغيرة المخصدة للغات، عندما يتم تدريبها على بيانات عالية الجودة ومتنوعة المجالات.
إن قدرته على التعامل مع النص الخام الذي يحتوي على تبديل لغوي وأرقام دون الحاجة لتطبيع النص تبسط مسارات النشر بشكل كبير. علاوة على ذلك، فإن أداءه المتفوق في التوليد طويل المدة يعالج نقطة فشل حرجة في النماذج الحالية، مما يجعله قابلاً للتطبيق في تطبيقات مثل الكتب الصوتية، وصناعة المحتوى طويل المدة، وأنظمة الحوار المعقدة. يضع هذا النموذج معياراً جديداً لتخليق الكلام التايلاندي، مثبتاً أن البيانات المتخصصة وعالية الجودة يمكنها التغلب على قيود النماذج العامة متعددة اللغات.