← नवीनतम पेपर
💻 computer science

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech

AgentSteerTTS एक मल्टी-एजेंट क्लोज्ड-लूप फ्रेमवर्क है जो टेक्स्ट-टू-स्पीच में कंपोजिट निर्देशों पर सूक्ष्म और इरादा-सत्य नियंत्रण प्राप्त करने के लिए एडवरसेरियल डिसेंटैंगलमेंट, प्रोटोटाइप लाइब्रेरी के साथ ड्यूल-स्ट्रीम एंकरिंग, और फास्ट-स्लो फीडबैक तंत्रों का उपयोग करता है ताकि टेक्स्टुअल इंटेंट्स और एकोस्टिक रियलाइजेशन के बीच संरचनात्मक बेमेल को दूर किया जा सके।

मूल लेखक: Bin Kang, Shaoguo Wen, Yang Fan, Shunlong Wu, Junjie Wang, Yulin Li, Junzhi Zhao, Junle Wang, Zhuotao Tian

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bin Kang, Shaoguo Wen, Yang Fan, Shunlong Wu, Junjie Wang, Yulin Li, Junzhi Zhao, Junle Wang, Zhuotao Tian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ AgentSteerTTS पेपर का विवरण दिया गया है, जिसे रोजमर्रा की भाषा में उपमाओं (analogies) का उपयोग करके अनुवादित किया गया है।

बड़ी समस्या: "समझौतावादी" आवाज़

कल्पना कीजिए कि आपने एक मानव अभिनेता से एक बहुत ही विशिष्ट, जटिल भावना के साथ एक पंक्ति पढ़ने के लिए कहा: "खुश, लेकिन थोड़ा अहंकारी (Arrogant)।"

अतीत में, कंप्यूटर की आवाज़ें (टेक्स्ट-टू-स्पीच या TTS) या तो खुश होने या या क्रोधित होने में बहुत अच्छी रही हैं। लेकिन जब आप एक मिश्रण मांगते हैं, तो वे अक्सर भ्रमित हो जाती हैं। आपको वह सटीक मिश्रण देने के बजाय, वे अक्सर:

  1. भावना को हल्का कर देती हैं: वे बस "ठीक-ठाक" या "तटस्थ (neutral)" सुनाई देती हैं, जिससे वह विशिष्ट "अहंकार" वाला तीखापन गायब हो जाता है जो आप चाहते थे।
  2. गलत वाइब लीक कर देती हैं: वे गलती से "दुखी" या "डरी हुई" भी सुनाई दे सकती हैं क्योंकि कंप्यूटर ने निर्देशों को गलत समझ लिया।
  3. आवाज़ बदल देती हैं: "अहंकारी" दिखने की कोशिश में, कंप्यूटर अनजाने में बोलने वाले की आवाज़ को इतना बदल सकता है कि वह पूरी तरह से एक अलग व्यक्ति लगने लगता है।

पेपर इसे "सिमेंटिक-अकॉस्टिक मिसमैच (Semantic-Acoustic Mismatch)" कहता है। सरल शब्दों में: कंप्यूटर आपके द्वारा टाइप किए गए शब्दों को समझता है, लेकिन वह उन्हें उस सटीक ध्वनि में अनुवादित नहीं कर पाता जो आपके दिमाग में है।

समाधान: विशेषज्ञ एजेंटों की एक टीम

लेखकों ने AgentSteerTTS नामक एक नया सिस्टम बनाया है। एक बड़े कंप्यूटर मस्तिष्क के बजाय, जो सब कुछ एक साथ करने की कोशिश करता है, उन्होंने विशेषज्ञ एजेंटों की एक टीम (एक प्रोडक्शन क्रू की तरह) बनाई है जो गलतियों को सुधारने के लिए एक लूप में मिलकर काम करती है।

यहाँ उनका "क्रू" कैसे काम करता है:

1. "पहचान और भावना" का बॉडीगार्ड (Adversarial Disentanglement)

समस्या: सामान्य भाषण में, एक व्यक्ति की आवाज़ (उसका "टिम्बर" या पहचान) और उसकी भावना आपस में उलझी होती है। यदि आप किसी को "क्रोधित" दिखाने की कोशिश करते हैं, तो कंप्यूटर अक्सर उनकी आवाज़ भी बदल देता है, जिससे वे एक अलग व्यक्ति लगने लगते हैं।
एजेंट का काम: यह एजेंट एक सख्त बॉडीगर्ड की तरह काम करता है। यह कंप्यूटर को मजबूर करता है कि वह "कौन बोल रहा है" (पहचान) को "कैसे महसूस कर रहा है" (भावना) से अलग रखे।

  • उपमा: एक ऐसे शेफ की कल्पना करें जो आमतौर पर नमक और काली मिर्च को एक ही शेकर में मिला देता है। यह एजेंट उन्हें नमक (आवाज़) और काली मिर्च (भावना) को अलग-अलग शेकर में रखने के लिए मजबूर करता है। अब, आप नमक (आवाज़) की मात्रा बदले बिना बहुत सारी काली मिर्च (क्रोध) डाल सकते हैं।

2. "रेफरेंस लाइब्रेरियन" और "मिक्सिंग इंजीनियर" (Dual-Stream Anchoring)

समस्या: जब आप "खुश लेकिन अहंकारी" टाइप करते हैं, तो कंप्यूटर को ठीक से पता नहीं होता कि यह कैसा सुनाई देता है। वह अनुमान लगा सकता है, लेकिन वह अनुमान अक्सर कमजोर होता है।
एजेंट का काम:

  • रिट्रीवल एजेंट (लाइब्रेरियन): अनुमान लगाने के बजाय, यह एजेंट वास्तविक मानव रिकॉर्डिंग के एक विशाल पुस्तकालय में जाता है। यह एक क्लिप ढूंढता है जो "खुश" जैसी लगती है और दूसरी क्लिप जो "अहंकारी" जैसी लगती है।
  • सिंथेसिस एजेंट (मिक्सिंग इंजीनियर): यह एजेंट उन वास्तविक क्लिप्स को लेता है और उन्हें मिलाता है। यह केवल उन्हें औसत नहीं निकालता; यह यह तय करने के लिए एक स्मार्ट "गेट" का उपयोग करता है कि कितना "खुश" और कितना "अहंकारी" मिलाना है, जिससे एक सटीक कंट्रोल सिग्नल बनता है।
  • उपमा: याददाश्त से एक "सूर्यास्त" की तस्वीर बनाने की कोशिश करने के बजाय (जो शायद एक साधारण नारंगी धब्बे जैसा दिखेगा), कलाकार एक वास्तविक सूर्यास्त की फोटो देखता है, फिर अपनी विशिष्ट मांग के अनुसार रंगों को समायोजित करने के लिए एक फिल्टर का उपयोग करता है।

3. "फास्ट और स्लो" एडिटर्स (Fast-Slow Feedback)

समस्या: सबसे अच्छे मिश्रण के बावजूद, कंप्यूटर अभी भी तीव्रता (intensity) को गलत कर सकता है। शायद "अहंकार" बहुत कम है, या "खुशी" बहुत तेज़ है।
एजेंट का काम: यह इंसानों के सोचने के तरीके से प्रेरित एक दो-चरणीय सुधार प्रक्रिया है:

  • फास्ट एजेंट (त्वरित जाँच): अंतिम ध्वनि बनने से पहले, यह एजेंट एक बिजली जैसी तेज़ गणितीय जाँच करता है। यह पूछता है, "क्या भावना का वॉल्यूम सही है?" यदि नहीं, तो यह पूरे काम को दोबारा किए बिना तुरंत सेटिंग्स को बदल देता है।
  • स्लो एजेंट (मानव आलोचक): यह अंतिम परिणाम को सुनता है और एक सख्त फिल्म निर्देशक की तरह काम करता है। यह कहता है, "आवाज़ बहुत कांप रही है," या "यह बहुत दुखी लग रहा है, पर्याप्त अहंकारी नहीं है।" यदि परिणाम खराब है, तो यह निर्देशों को लाइब्रेरियन और मिक्सिंग इंजीनियर के पास वापस भेज देता है ताकि वे फिर से प्रयास कर सकें।
  • उपमा: एक फोटोग्राफर की कल्पना करें जो फोटो खींच रहा है। फास्ट एजेंट कैमरे का ऑटो-फोकस है (जल्दी से धुंधलेपन को ठीक करना)। स्लो एजेंट फोटोग्राफर है जो स्क्रीन पर फोटो देखता है, कहता है, "लाइटिंग सही नहीं है," और टीम को फिर से शूट करने के लिए कहता है।

परिणाम: यह क्यों मायने रखता है

पेपर ने इस सिस्टम का परीक्षण अन्य शीर्ष वॉयस मॉडल्स के मुकाबले किया।

  • बेहतर सटीकता: "दुखी लेकिन आशा की एक झलक के साथ" जैसे जटिल कार्यों को करने के लिए कहा जाने पर, AgentSteerTTS अन्य मॉडल्स की तुलना में बहुत अधिक बार सफल रहा।
  • कम "लीकेज": जब आपने "क्रोध" मांगा, तो इसने अनजाने में "डर" नहीं जोड़ा।
  • आवाज़ की स्थिरता: भावनाओं के बदलने के बावजूद, बोलने वाला व्यक्ति एक ही बना रहा।

सारांश

AgentSteerTTS को एक स्क्रिप्ट निभाने की कोशिश करने वाले एक अकेले, भ्रमित रोबोट से बदलकर एक प्रोफेशनल फिल्म क्रू के रूप में देखें।

  • एक व्यक्ति अभिनेता की पहचान को सुरक्षित रखता है।
  • एक व्यक्ति सही रेफरेंस क्लिप ढूंढता है।
  • एक व्यक्ति भावनाओं को पूरी तरह से मिक्स करता है।
  • दो संपादक तुरंत काम की जाँच करते हैं और फिर अंतिम आलोचना देते हैं।

परिणामस्वरूप, एक ऐसी कंप्यूटर आवाज़ मिलती है जो अंततः आपके जटिल, सूक्ष्म निर्देशों का पालन कर सकती है बिना अपना मानसिक संतुलन खोए या अपनी आवाज़ बदले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →