← नवीनतम पेपर
💻 computer science

AgenticASR: Refining Speech Recognition in Real-World Scenarios via an Agentic Approach

यह शोध पत्र AgenticASR प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो वक्ता के अंतिम इरादे को सुरक्षित रखते हुए विसंयोजकों (disfluencies) को हटाने और आत्म-सुधारों को हल करने के लिए ट्रांसक्रिप्ट को पुनरावृत्ति से परिष्कृत करके रीयल-टाइम स्पीच रिकग्निशन को परिष्कृत करता है, जिसे एक नए द्विभाषी बेंचमार्क और कई ASR फ्रंट एंड्स में बेहतर प्रदर्शन द्वारा प्रमाणित किया गया है।

मूल लेखक: Zixuan Jiang, Binghao Qiang, Jiaying Chi, Yanqiao Zhu, Kai Yu, Xie Chen

प्रकाशित 2026-07-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zixuan Jiang, Binghao Qiang, Jiaying Chi, Yanqiao Zhu, Kai Yu, Xie Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त की कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका दोस्त बिल्कुल एक इंसान की तरह बात करता है: वह शब्दों पर लड़खड़ाता है, "अम" और "अह" कहता है, एक वाक्य शुरू करता है, एहसास करता है कि उसने गलती कर दी, और फिर बीच में ही उसे सुधारता है। यदि आप उसके द्वारा की गई हर आवाज़ को लिख देते हैं, तो आपको एक अव्यवस्थित, भ्रमित करने वाला ट्रांसक्रिप्ट मिलेगा जो गलत शुरुआत और दोहराव से भरा होगा। यह पारंपरिक स्पीच-टू-टेक्स्ट तकनीक करता है; यह एक बहुत ही शाब्दिक लेखक है जो भाषण की ध्वनि को तो पकड़ता है लेकिन संदेश के इरादे को नहीं। दूसरी ओर, कुछ नए उपकरण टेक्स्ट को साफ करने की कोशिश करते हैं, लेकिन वे आमतौर पर व्यक्ति के पूरी तरह से बोलने के बाद ही संपादन करना शुरू करते हैं। यह एक समस्या पैदा करता है: यदि आपका दोस्त कहता है, "मैरी के घर मिलो... नहीं, रुको, मैरी के घर," तो एक टूल जो अंत तक प्रतीक्षा करता है वह शायद पहले ही "मैरी" लिख चुका होगा और बिना दोबारा शुरू किए उसे ठीक नहीं कर पाएगा। इस शोध का लक्ष्य एक ऐसा सिस्टम बनाना है जो एक सुपर-फास्ट, चौकस संपादक की तरह काम करे जो वास्तविक समय (real-time) में सुनता है, गलतियों को होते ही पकड़ता है, और टेक्स्ट को साफ और पठनीय बनाने के लिए तुरंत इसे फिर से लिख देता है, और यह सब तब भी करता है जब व्यक्ति अभी भी बोल रहा होता है।

यह पेपर एक नया दृष्टिकोण पेश करता है जिसे AgenticASR (एजेंटिक स्पीच रिकग्निशन) कहा जाता है। इसे एक लाइव ब्रॉडकास्ट पर काम करने वाली दो-सदस्यीय टीम के रूप में समझें। पहला व्यक्ति "लेखक" (ASR फ्रंट एंड) है, जो जो कुछ भी सुनता है, जिसमें सभी हकलाहट और "अम" शामिल हैं, उसे जल्दी से टाइप करता है। दूसरा व्यक्ति "रिफाइनर" (एजेंटिक भाग) है, एक स्मार्ट संपादक जो लगातार लेखक के पिछले कुछ वाक्यों पर नज़र रखता है। जैसे ही लेखक टेक्स्ट का एक हिस्सा टाइप करता है, रिफाइनर उसे देखता है, उस गड़बड़ी को ठीक करता है, और अव्यवस्थित संस्करण को एक साफ संस्करण के साथ बदल देता है।

यही असली जादू है: रिफाइनर केवल वर्तमान वाक्य को नहीं देखता; यह अपने दिमाग में पिछले कुछ टेक्स्ट चंक्स (chunks) की एक छोटी "विंडो" रखता है। यदि लेखक "Meet Mary" टाइप करता है, और फिर अगला हिस्सा "Wait, Marie" के रूप में आता है, तो रिफाइनर तुरंत संबंध देख लेता है। वह समझ जाता है कि पहला हिस्सा एक गलती थी, "Mary" को हटा देता है, और अगले विचार को पूरा करने से पहले ही पूरे वाक्य को "Meet Marie" में अपडेट कर देता है। यह सिस्टम को सुधारों और स्पष्टीकरणों को अंत तक प्रतीक्षा किए बिना, चलते-फिरते संभालने की अनुमति देता है।

यह वास्तव में काम करता है या नहीं, इसे परखने के लिए, लेखकों ने एक विशेष खेल का मैदान बनाया जिसे AASR-Bench कहा जाता है। एक विशाल बाधा दौड़ (obstacle course) की कल्पना करें जिसमें 917 अलग-अलग परिदृश्य हैं, जिनमें अनौपचारिक बातचीत और ग्राहक सेवा कॉल से लेकर तकनीकी कोडिंग सत्र और वॉयस सर्च तक शामिल हैं। उन्होंने परिणामों को ग्रेड करने के लिए 6,637 छोटे, विशिष्ट प्रश्न (रुब्रिक्स) बनाए, जो यह जाँचते थे कि: "क्या उन्होंने 'अम' को हटाया?", "क्या उन्होंने नाम की स्पेलिंग ठीक की?", और "क्या उन्होंने अंतिम अर्थ को सही रखा?" उन्होंने केवल यह नहीं देखा कि कितने शब्द सही थे; उन्होंने यह भी देखा कि टेक्स्ट कितना पठनीय और उपयोगी था।

परिणाम बताते हैं कि यह "एजेंटिक" दृष्टिकोण एक महत्वपूर्ण प्रगति है। जब उन्होंने AgenticASR का अन्य प्रणालियों के विरुद्ध परीक्षण किया, तो इसने लगातार अधिक साफ और सटीक टेक्स्ट तैयार किया। उदाहरण के लिए, एक विशिष्ट सेटअप (Qwen3-ASR-1.7B उनके रिफाइनर के साथ) का उपयोग करते हुए, सिस्टम ने उनके समग्र बेंचमार्क पर 79.95 स्कोर किया, जो अगले सर्वश्रेष्ठ तरीकों को एक सहज अंतर से पीछे छोड़ देता है। अध्ययन में पाया गया कि सिस्टम सबसे अच्छा काम करता है जब यह एक बार में लगभग तीन स्पीच चंक्स की "विंडो" को देखता है। यह विंडो का आकार एकदम सही (sweet spot) था: यह इतने बड़े आकार का था कि कुछ सेकंड पहले हुए सुधारों (जैसे "Mary" से "Marie" का बदलाव) को पकड़ सके, लेकिन इतना छोटा भी था कि सिस्टम को तेज़ बनाए रखे।

लेखकों ने यह भी पता लगाया कि "रिफाइनर" का आकार मायने रखता है। एक बड़ा, अधिक स्मार्ट संपादक (एक 4-बिलियन पैरामीटर मॉडल) जटिल वाक्यों को ठीक करने में थोड़ा बेहतर काम करता है, लेकिन उसे सोचने में थोड़ा अधिक समय लगता है। हालांकि, यहाँ तक कि छोटे, तेज़ मॉडल भी उन सिस्टमों की तुलना में बहुत बेहतर थे जो केवल अंत तक प्रतीक्षा करके संपादन करते हैं। पेपर इस बात पर जोर देता है कि यह सिस्टम पूर्ण नहीं है; यदि प्रारंभिक लेखक (Scribe) किसी शब्द को पूरी तरह से मिस कर देता है, तो रिफाइनर उसे जादुई रूप से वापस नहीं ला सकता। लेकिन हमारे वास्तविक, अव्यवस्थित दुनिया के बोलने के तरीके के लिए—फिलर्स, हकलाहट और वाक्य के बीच सुधारों के लिए—AgenticASR तुरंत एक साफ, पठनीय टेक्स्ट प्राप्त करने का एक व्यावहारिक तरीका सुझाता है, जो मानव भाषण के अराजक प्रवाह को चलते-चलते एक पॉलिश की हुई कहानी में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →