STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
STITCH स्पोकन लैंग्वेज मॉडल्स के लिए एक नवीन जनरेशन विधि है जो अनस्पोकन रीजनिंग चंक्स (unspoken reasoning chunks) को स्पोकन रिस्पांस चंक्स (spoken response chunks) के साथ इंटरलीव करके लेटेंसी को कम करती है, जिससे मॉडल उपयोगकर्ता को ऑडियो प्ले करते समय ही साथ-साथ "सोच" सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने एक बहुत ही बुद्धिमान मित्र के साथ बातचीत कर रहे हैं। आमतौर पर, जब आप उनसे कोई कठिन गणित का प्रश्न पूछते हैं, तो वे या तो:
- "बड़बड़ाने वाले" (The Mutterer): वे तुरंत बोलना शुरू कर देते हैं, लेकिन वे लड़खड़ाते हैं, खुद को सुधारते हैं, और अंततः उत्तर तक पहुँच जाते हैं। (वर्तमान के अधिकांश AI वॉयस मॉडल इसी तरह काम करते)।
- "मौन विचारक" (The Silent Thinker): वे 30 सेकंड तक पूरी तरह से मौन रहकर आपको देखते रहते हैं जबकि वे आपके सामने मन ही मन गणित हल कर रहे होते हैं, और फिर वे आखिरकार बोलना शुरू करते हैं। (यह "चेन-ऑफ-थॉट" AI का तरीका है—यह बुद्धिमान तो है, लेकिन यह सन्नाटा अजीब लगता है और ऐसा महसूस होता है जैसे मशीन खराब हो गई हो)।
माइक्रोसॉफ्ट और नेशनल ताइवान यूनिवर्सिटी के शोधकर्ताओं ने एक तीसरा तरीका बनाया है, जिसे वे STITCH कहते हैं।
उपमा: "मुख्य शेफ और सहायक शेफ" (The Chef and the Sous-Chef)
AI को एक पेशेवर रसोई टीम की तरह समझें।
पुराने तरीके में (मौन विचारक), मुख्य शेफ (तर्क करने वाला हिस्सा) को पूरी रेसिपी पूरी करनी होती है, पूरा भोजन बनाना होता है, और उसे पूरी तरह से सजाना होता है, इससे पहले कि वेटर (बोलने वाला हिस्सा) को डाइनिंग रूम में प्रवेश करने की अनुमति दी जाए। ग्राहक खाली मेज को देखते हुए वहां बैठा रहता है, जो और भी अधिक भूखा और अधीर होता जाता है।
STITCH एक मुख्य शेफ और एक सहायक शेफ के बीच एक उच्च-गति, समन्वित नृत्य की तरह काम करता है:
- सहायक शेफ (आवाज़): वे तुरंत एक छोटा सा ऐपेटाइज़र (प्रतिक्रिया के पहले कुछ शब्द) लेकर आते हैं ताकि ग्राहक को पता चल सके, "चिंता न करें, खाना आ रहा है!" यह उस अजीब "डेड एयर" वाले सन्नाटे को खत्म कर देता है।
- मुख्य शेफ (सोचना): जब सहायक शेफ वह ऐपेटाइज़र परोसने में व्यस्त होता है, तब मुख्य शेफ पीछे की तरफ सब्जियां काट रहा होता है और मुख्य व्यंजन तैयार कर रहा होता है (जटिल तर्क प्रक्रिया)।
चूंकि "परोसने" (बोलने) में "काटने" (सोचने) की तुलना में बहुत अधिक समय लगता है, इसलिए शेफ वास्तव में अगले भोजन के हिस्से को तैयार कर सकता है जबकि ग्राहक अभी पहला निवाला खा ही रहा होता है। वे सोचने और बोलने को इतनी सहजता से "स्टिच" (सीवन/जोड़ना) कर रहे हैं कि ग्राहक को सेवा में कभी भी अंतराल महसूस नहीं होता।
यह वास्तव में कैसे काम करता है? ("चंकिंग" का रहस्य)
तर्क के एक विशाल, लंबे पैराग्राफ के बजाय, STITCH सब कुछ छोटे "चंक्स" (टुकड़ों) में तोड़ देता है।
- चंक 1: AI थोड़ा सा "मौन चिंतन" करता है (शुरू करने के लिए पर्याप्त)।
- चंक 2: यह तुरंत कुछ शब्द ज़ोर से बोलता है।
- जादुई ट्रिक: जब वे शब्द आपके स्पीकर के माध्यम से बजाए जा रहे होते हैं, तब AI उस "खाली समय" का उपयोग वाक्य के अगले हिस्से के लिए एक बड़ा "मौन चिंतन" करने के लिए करता है।
यह एक बड़ी बात क्यों है?
- यह स्मार्ट है: क्योंकि AI बात करते समय भी "सोच" रहा होता है, इसलिए यह गणित जैसे कठिन कार्यों पर बहुत बेहतर प्रदर्शन करता है। यह केवल अनुमान नहीं लगाता; यह गणना करता है।
- यह तेज़ है: इसमें शुरुआत में वह लंबा, अजीब ठहराव नहीं होता। यह एक वास्तविक, उत्तरदायी मानवीय बातचीत जैसा महसूस होता है।
- यह स्वाभाविक है: यह एक "मutterer" (बड़बड़ाने वाले) की गति के साथ एक "silent thinker" (मौन विचारक) की बुद्धिमत्ता प्राप्त करता है।
संक्षेप में: STITCH AI को "अपने पैरों पर खड़े होकर सोचने" की अनुमति देता है—शाब्दिक रूप से बोलने के दौरान बिताए गए समय का उपयोग भारी मानसिक कार्य करने के लिए करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।