Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech
यह शोध पत्र सैद्धांतिक और अनुभवजन्य रूप से यह प्रदर्शित करता है कि फाईनाइट स्केलर क्वांटाइजेशन (FSQ) टोकेनाइजेशन स्कीम निरंतर डिफ्यूजन मॉडल्स के लिए इष्टतम है जो श्रेणीगत डेटा उत्पन्न करते हैं, जैसा कि टेक्स्ट-टू-स्पीच कार्यों में इसके उत्कृष्ट प्रदर्शन से सिद्ध होता है जहाँ यह ऑटोरेग्रेसिव लार्ज लैंग्वेज मॉडल्स से बेहतर प्रदर्शन करता है और साथ ही काफी छोटा और तेज़ भी है।