← नवीनतम पेपर
💬 NLP

FormalASR: End-to-End Spoken Chinese to Formal Text

यह शोधपत्र FormalASR को प्रस्तुत करता है, जो दो कॉम्पैक्ट एंड-टू-एंड मॉडल्स (0.6B और 1.7B) का एक जोड़ा है, जिन्हें नए निर्मित बड़े पैमाने के डेटासेट्स पर सीधे बोले गए चीनी भाषा को औपचारिक लिखित पाठ में ट्रांसक्राइब करने के लिए प्रशिक्षित किया गया है, जिससे त्रुटि दर में काफी कमी आती है और विलंब उत्पन्न करने वाले पोस्ट-प्रोसेसिंग LLMs की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Wanyi Ning, Yinshang Guo, Haitao Qian, Jiyuan Cheng, Weiyuan Feng, Yufei Zhang

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wanyi Ning, Yinshang Guo, Haitao Qian, Jiyuan Cheng, Weiyuan Feng, Yufei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त के लिए एक वॉयस मेमो रिकॉर्ड कर रहे हैं। आप स्वाभाविक रूप से बोल रहे हैं, जिसमें "अम्म," "अह," दोहराए गए शब्द, और ऐसे वाक्य हैं जो बीच में ही टूट जाते हैं या फिर से शुरू होते हैं। यदि आप इस रिकॉर्डिंग को किसी मानक स्पीच-टू-टेक्स्ट ऐप से गुजारते हैं, तो यह आपको एक वैरबेटिम ट्रांसक्रिप्ट (शब्दशः प्रतिलेख) देता है: आपकी बिखरी हुई बातों की एक अव्यवस्थित, शब्द-दर-शब्द नकल। यह इस बात के लिए सटीक है कि आपने क्या कहा, लेकिन यदि आप उस टेक्स्ट को किसी औपचारिक ईमेल या पेशेवर रिपोर्ट में डालना चाहते हैं, तो यह बहुत उपयोगी नहीं है।

वर्तमान में, इस गड़बड़ी को ठीक करने के लिए, लोग एक "दो-चरणीय" प्रक्रिया का उपयोग करते हैं: पहले कंप्यूटर ठीक वही लिखता है जो आपने कहा है; दूसरा, एक विशाल, महंगा AI (जैसे कि एक बहुत ही स्मार्ट संपादक) उस अव्यवस्थित टेक्स्ट को पढ़ता है और उसे साफ, पेशेवर भाषा में फिर से लिखता है। यह धीमा है, इसके लिए बहुत अधिक कंप्यूटर शक्ति की आवश्यकता होती है, और आमतौर पर इसके लिए एक बड़े क्लाउड सर्वर के साथ इंटरनेट कनेक्शन की आवश्यकता होती है।

FormalASR एक नया आविष्कार है जो दूसरे चरण को पूरी तरह से छोड़ देता है। यह एक एकल, संक्षिप्त AI मॉडल है जो आपकी अव्यवस्थित आवाज़ को सुनता है और तुरंत साफ, औपचारिक टेक्स्ट निकाल देता है, जैसे कि एक पेशेवर संपादक ने इसे पहले ही पॉलिश कर दिया हो।

यहाँ बताया गया है कि यह शोध पत्र इस समाधान को कैसे समझाता है:

1. समस्या: "अव्यवस्थित कमरा" बनाम "साफ कार्यालय"

बोली जाने वाली भाषा को एक अव्यवस्थित बेडरूम के रूप में सोचें। इसमें फर्श पर कपड़े पड़े हैं (फिलर शब्द), अधूरे प्रोजेक्ट्स (गलत शुरुआत), और चीजें इधर-उधर बिखरी हुई हैं (अनौपचारिक व्याकरण)।

  • मानक ASR एक कैमरे की तरह है जो अव्यवस्थित कमरे की फोटो लेता है। यह सब कुछ बिल्कुल वैसा ही कैप्चर करता है जैसा वह है।
  • पुराना समाधान यह था कि वह फोटो ली जाए, उसे एक पेशेवर इंटीरियर डिजाइनर (एक बड़े AI मॉडल) के पास भेजा जाए, और उनसे उस कमरे को डिजिटल रूप से साफ करने के लिए कहा जाए। इसमें समय और पैसा लगता है।
  • FormalASR एक नए प्रकार का कैमरा है जो केवल फोटो नहीं लेता; इसमें एक इन-बिल्ट क्लीनिंग क्रू (सफाई दल) भी है। यह अव्यवस्थित ऑडियो को देखता है और तुरंत एक व्यवस्थित, संगठित कार्यालय की तस्वीर आउटपुट के रूप में देता है।

2. प्रशिक्षण: AI को "साफ करना" सिखाना

इस नए कैमरे को कैसे साफ करना सिखाया जाए, इसके लिए शोधकर्ताओं ने "पहले और बाद के" उदाहरणों के दो विशाल पुस्तकालय बनाए:

  • स्रोत (The Source): उन्होंने वास्तविक, अव्यवस्थित वॉयस रिकॉर्डिंग्स (ऑडियोबुक्स, मीटिंग्स और पॉडकास्ट से) के हजारों घंटों को लिया।
  • रूपांतरण (The Transformation): उन्होंने उन अव्यवस्थित ट्रांसक्रिप्ट्स को सटीक, औपचारिक चीनी टेक्स्ट में फिर से लिखने के लिए एक शक्तिशाली AI (DeepSeek-V3.2) का उपयोग किया।
  • फ़िल्टर (The Filter): उन्होंने यह जांचने के लिए काम की समीक्षा की कि "साफ" संस्करण का अर्थ वही था जो "अव्यवस्थित" संस्करण का था, और किसी भी खराब उदाहरण को हटा दिया।

इससे दो नए डेटासेट (WenstSpeech-Formal और Speechio-Formal) बने जो AI के लिए एक प्रशिक्षण नियमावली (training manual) के रूप में कार्य करते हैं, जो उसे दिखाते हैं कि कैसे बोली जाने वाली बिखरी हुई बातों को लिखित गद्य (prose) में बदला जाता है।

3. परिणाम: एक संक्षिप्त, ऑल-इन-वन टूल

शोधकर्ताओं ने दो मौजूदा AI मॉडलों (0.6 बिलियन और 1.7 बिलियन पैरामीटर्स के आकार के) को लिया और उनके नए प्रशिक्षण डेटा का उपयोग करके उन्हें "फाइन-ट्यून" किया।

  • प्रदर्शन (The Performance): परीक्षण के दौरान, ये नए मॉडल (FormalASR) मानक मॉडलों की तुलना में औपचारिक टेक्स्ट बनाने में बहुत बेहतर थे। उन्होंने पुराने "वैरबेटिम" स्टाइल की तुलना में त्रुटियों को 37% तक कम कर दिया। वे मूल अर्थ को बनाए रखने के मामले में भी उच्च स्कोर प्राप्त कर रहे थे।
  • गति (The Speed): क्योंकि AI सुनते समय ही फिलर शब्दों और दोहराव को हटा देता है, इसलिए अंतिम टेक्स्ट छोटा होता है। इसका मतलब है कि कंप्यूटर को उत्तर जेनरेट करने के लिए कम काम करना पड़ता है, जिससे यह तेज़ हो जाता है।
  • आकार (The Size): सबसे अच्छी बात यह है कि यह मॉडल इतना छोटा है कि इसे बिना किसी बड़े क्लाउड सर्वर की आवश्यकता के फोन या लैपटॉप (ऑन-डिवाइस) पर चलाया जा सकता है।

4. "छोटा" संस्करण (क्वांटाइजेशन)

शोधपत्र ने मॉडल को और भी छोटा करने (जैसे कि एक हाई-रेजोल्यूशन फोटो को छोटी फाइल में कंप्रेस करना) का भी परीक्षण किया ताकि यह और भी छोटे उपकरणों पर फिट हो सके।

  • उन्होंने पाया कि जब उन्होंने मॉडल को 4-बिट प्रिसिजन तक सिकोड़ दिया (इसे 1GB से भी कम आकार का बना दिया), तब भी यह अविश्वसनीय रूप से अच्छा काम करता रहा।
  • यह एक उच्च श्रेणी के शेफ नाइफ को पॉकेट नाइफ के आकार में तेज करने जैसा है; यह अभी भी काम को पूरी तरह से काटने के लिए पर्याप्त तेज है, बस छोटा और ले जाने में आसान है।

सारांश

FormalASR एक बड़ी उपलब्धि है क्योंकि यह "सुनने" और "संपादन करने" के काम को एक छोटे, तेज़ पैकेज में जोड़ देता है। अपनी आवाज़ रिकॉर्ड करने, एक अव्यवस्थित ट्रांसक्रिप्ट प्राप्त करने और फिर एक डिजिटल संपादक को उसे ठीक करने के लिए काम पर रखनेने के बजाय, आप बस बोलते हैं, और आपका डिवाइस तुरंत एक पॉलिश किया हुआ, पेशेवर दस्तावेज़ दे देता है। यह ऑफलाइन काम करता है, यह तेज़ है, और यह आश्चर्यजनक रूप से सटीक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →