DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis
يقدم البحث إطار عمل DLLM-TTS، وهو نموذج بـ 0.6 مليار معلمة يصيغ عملية تحويل النص إلى كلام كعملية انتشار كتلي شرطي منفصل فوق رموز الترميز الصوتي العصبي، محققاً أداءً تنافسياً مع وضوح عالٍ وعامل زمن حقيقي قدره 0.15 من خلال التنبؤ المتوازي للرموز ضمن كتل متتالية.