Fish Audio S2 Technical Report
यह शोध पत्र Fish Audio S2 को प्रस्तुत करता है, जो एक ओपन-सोर्स टेक्स्ट-टू-स्पीच सिस्टम है जो नेचुरल-लैंग्वेज इंस्ट्रक्शन फॉलोइंग के साथ मल्टी-स्पीकर, मल्टी-टर्न जनरेशन को सक्षम करने के लिए एक मल्टी-स्टेज ट्रेनिंग पाइपलाइन का लाभ उठाता है, जबकि प्रोडक्शन-रेडी वेट्स और एक कुशल SGLang-आधारित इन्फरेंस इंजन प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक डिजिटल वॉयस एक्टर है जो अविश्वसनीय रूप से प्रतिभाशाली है, लेकिन अब तक, वह थोड़ा "एक ही काम में माहिर" (one-trick pony) रहा है। वह स्क्रिप्ट को पूरी तरह से पढ़ सकता था, लेकिन यदि आप उसे फुसफुसाकर कोई रहस्य बताने, गुस्सा होने, या वाक्य के बीच में चरित्र बदलने के लिए कहते, तो वह अक्सर भ्रमित हो जाता या रोबोटिक लगने लगता।
Fish Audio S2 वह अपग्रेड है जो इस डिजिटल अभिनेता को एक सच्चा 'मेथड एक्टर' में बदल देता है जो आपकी हर इच्छा का पालन कर सकता है, और वह भी केवल साधारण अंग्रेजी में उससे बात करके।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. "दो-मस्तिष्क" प्रणाली (आर्किटेक्चर)
अधिकांश वॉयस एआई सिस्टम सब कुछ एक साथ करने की कोशिश करते हैं: यह समझना कि क्या कहना है और कैसे कहना है। यह एक शेफ से एक ही सेकंड में रेसिपी लिखने, सब्जियां काटने और भोजन पकाने के लिए कहने जैसा है। यह अस्त-व्यस्त और धीमा है।
Fish Audio S2 इस काम को दो विशिष्ट भूमिकाओं में विभाजित करता है:
- धीमा मस्तिष्क (निर्देशक): यह हिस्सा एक फिल्म निर्देशक की तरह है। यह स्क्रिप्ट पढ़ता है और बड़ी तस्वीर तय करता है: "ठीक है, इस वाक्य को फुसफुसाकर बोलना है," या "अब पात्र एक विलेन में बदल रहा है।" यह अर्थ और प्रवाह को संभालता है।
- तेज मस्तिष्क (साउंड इंजीनियर): यह हिस्सा एक बिजली की गति से काम करने वाला तकनीशियन है। यह निर्देशक के निर्देशों को सुनता है और तुरंत वास्तविक ध्वनि तरंगें उत्पन्न करता है, जिसमें सांस लेने की आवाज, आवाज का फटना और पिच में बदलाव जैसे सूक्ष्म विवरण जोड़ता है।
इन कामों को अलग करके, सिस्टम कहानी के बारे में गहराई से सोच सकता है और साथ ही अविश्वसनीय गति से उच्च गुणवत्ता वाली ध्वनि भी उत्पन्न कर सकता है।
2. "स्मार्ट फिल्टर" फैक्ट्री (डेटा पाइपलाइन)
एआई को अच्छी तरह से बोलना सिखाने के लिए, आपको लाखों घंटों के ऑडियो की आवश्यकता होती है। लेकिन इंटरनेट खराब ऑडियो से भरा है: बैकग्राउंड शोर, ओवरलैपिंग आवाजें और लोगों का बुदबुदाना।
हर क्लिप को सुनने के लिए हजारों मनुष्यों को काम पर रखने के बजाय, Fish Audio ने एक स्व-सफाई करने वाली फैक्ट्री बनाई:
- क्वालिटी इंस्पेक्टर: एक स्मार्ट रोबोट जो ऑडियो सुनता है और तुरंत किसी भी ऐसी चीज़ को खारिज कर देता है जो खराब लगती है (जैसे क्लब के बाउंसर)।
- अनुवादक: एक अन्य रोबोट जो न केवल यह नहीं लिखता कि क्या कहा गया, बल्कि यह भी बताता है कि इसे कैसे कहा गया। यदि कोई व्यक्ति घबराहट में हंसता है, तो रोबोट टेक्स्ट के ठीक बगल में लिखता है:
[घबराहट भरी हंसी]।
जादुई ट्रिक: आमतौर पर, डेटा को साफ करने वाले रोबोट और एआई का होमवर्क ग्रेड करने वाले रोबोट अलग होते हैं। Fish Audio ने दोनों के लिए एक ही रोबोट का उपयोग किया। इसका मतलब है कि एआई को ठीक उन्हीं मानकों पर ग्रेड किया जाता है जिस पर उसे सिखाया गया था, ताकि वह "डिस्ट्रीब्यूशन शिफ्ट" (एक फैंसी तरीका जिसका अर्थ है सीखने और परीक्षण के बीच नियमों का बदलना) से भ्रमित न हो।
3. "कठोर कोच" (रीइन्फोर्समेंट लर्निंग)
एक बार जब एआई बुनियादी बातें सीख जाता है, तो इसे जटिल निर्देशों का पालन करना सीखना होता है। यहीं पर रीइन्फोर्समेंट लर्निंग आता है। इसे एक कठोर कोच के रूप में सोचें जो केवल "अच्छा काम किया" या "बुरा काम किया" नहीं कहता।
कोच एक बहु-आयामी स्कोरकार्ड का उपयोग करता है:
- क्या आपने सही शब्द कहे? (सिमेंटिक शुद्धता)
- क्या आप स्वाभाविक लगे? (ध्वनिक गुणवत्ता)
- क्या आप सही व्यक्ति की तरह लगे? (स्पीकर समानता)
यदि एआई कोई शब्द छोड़ देता है या "धीरे बोलें" जैसे निर्देश को अनदेखा करता है, तो कोच तुरंत अंक काट लेता है। एआई परीक्षण और त्रुटि के माध्यम से सीखता है, हजारों विविधताओं को तब तक आजमाता है जब तक कि उसे परफेक्ट स्कोर न मिल जाए।
4. "सुपर-एक्सप्रेसिव" परिणाम
इन अपग्रेड्स के कारण, Fish Audio S2 वह चीजें कर सकता है जो पहले ओपन-सोर्स मॉडल्स के लिए असंभव थीं:
- "गिरगिट" प्रभाव (Chameleon Effect): आप इसे कई पात्रों वाली स्क्रिप्ट दे सकते हैं, और यह बिना दोबारा जनरेशन शुरू किए वाक्य के बीच में स्वाभाविक रूप से आवाज बदल देगा।
- "डायरेक्टर्स कट": आप निर्देश टाइप कर सकते हैं जैसे "यह हिस्सा रोते हुए कहें, फिर फुसफुसाहट में बदल जाएं" और यह बिल्कुल वैसा ही करेगा। यह प्राकृतिक भाषा को समझता है, न कि केवल कोड को।
- "मैराथन रनर": यह पूरी किताब का अध्याय पढ़ सकता है बिना अपनी आवाज खोए या थके, शुरुआत से अंत तक एक ही टोन और गुणवत्ता बनाए रखते हुए।
5. "बिजली की तरह तेज" इंजन
अंत में, उन्होंने केवल एक स्मार्ट मस्तिष्क ही नहीं बनाया; उन्होंने इसे चलाने के लिए एक तेज कार भी बनाई। उन्होंने एक विशेष इंजन (SGLang) का उपयोग किया जो आमतौर पर टेक्स्ट चैटबॉट्स के लिए आरक्षित होता है।
- परिणाम: यह ऑडियो को इतनी तेजी से उत्पन्न करता है कि यह जादू जैसा लगता है। आप 100 मिलीसेकंड से भी कम समय में (मानव पलक झपकने से भी तेज) आवाज सुनना शुरू कर सकते हैं, और यह रियल-टाइम से 5 गुना तेजी से ऑडियो जेनरेट कर सकता है। यह एक ऐसे वॉयस एक्टर की तरह है जो चाय बनाने के समय में पूरी ऑडियोबुक रिकॉर्ड कर सकता है।
निचोड़ (The Bottom Line)
Fish Audio S2 एक बड़ी छलांग है क्योंकि यह वॉयस जनरेशन को केवल "टेक्स्ट को जोर से पढ़ने" के रूप में नहीं, बल्कि अभिनय के रूप में देखता है। एक स्मार्ट दो-भाग वाले मस्तिष्क, एक स्व-सफाई करने वाली डेटा फैक्ट्री और एक कठोर कोचिंग सिस्टम को मिलाकर, उन्होंने एक ऐसा ओपन-सोर्स वॉयस एआई बनाया है जो तेज, अभिव्यंजक है और आज उपलब्ध लगभग किसी भी अन्य चीज़ की तुलना में मानवीय निर्देशों को बेहतर समझता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।