← नवीनतम पेपर
💬 NLP

Learning to Hear Hesitation: Continual Learning for Disfluency-Aware ASR

यह शोध पत्र ऑटोमैटिक स्पीच रिकग्निशन के लिए एक निरंतर सीखने (continual learning) वाले ढांचे का प्रस्ताव करता है जो सीमित डेटासेट पर विस्कंदित भाषण (disfluent speech) को प्रभावी ढंग से संभालने के लिए स्पष्ट विस्कंदन टोकन (disfluency tokens) को एकीकृत करता है और कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करता है तथा प्रशिक्षण विधियों के बीच एक साझा क्रॉस-अटेंशन मैकेनिज्म को प्रकट करता है।

मूल लेखक: Henri-Leon Kordt, Theresa Pekarek Rosin, Jae Hee Lee, Stefan Wermter

प्रकाशित 2026-06-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Henri-Leon Kordt, Theresa Pekarek Rosin, Jae Hee Lee, Stefan Wermter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, अच्छी तरह से प्रशिक्षित रोबोट सहायक है जो लोगों को बोलते हुए सुन सकता है और वे जो कहते हैं उसे बिल्कुल वैसा ही टाइप कर सकता है। यह रोबोट अपने काम में बहुत अच्छा है, लेकिन इसकी एक आदत है: जब लोग लड़खड़ाते हैं, "अम" (um) कहते हैं, या खुद को दोहराते हैं, तो रोबोट टेक्स्ट को साफ दिखाने के लिए उन हिस्सों को हटा देता है। हालांकि यह मददगार लग सकता है, लेकिन वास्तव में इससे रोबोट "भ्रमित" (hallucinate) हो जाता है—यह खाली जगहों को भरने के लिए शब्द गढ़ सकता है या व्यक्ति की भावनाओं या विचारों के बारे में महत्वपूर्ण विवरण खो सकता है।

इस शोध पत्र के शोधकर्ताओं चाहते थे कि यह रोबोट उन हिचकिचाहटों (जिन्हें "डिसफ्लुएंसी" कहा जाता है) को ट्रांसक्रिप्ट में रखना सीखे, जैसे कि एक कोर्ट स्टैनोग्राफर हर "अह" और "अम" को ठीक वैसे ही लिखता है जैसे वे घटित होते हैं। हालांकि, इसमें एक पेंच है: यदि आप केवल थोड़े से नए डेटा का उपयोग करके रोबot को यह नया कौशल सिखाने की कोशिश करते हैं, तो यह वह सब कुछ "भूलने" लगता है जो इसने पहले स्पष्ट रूप से बोलना सीखा था। यह एक ऐसे छात्र की तरह है जो इतिहास की परीक्षा के लिए इतनी मेहनत से पढ़ता है कि वह बुनियादी गणित करना भूल जाता है।

यहाँ इस शोध पत्र द्वारा इस समस्या का समाधान सरल तरीके से समझाया गया है:

1. समस्या: "साफ" बनाम "असली" दुविधा

अधिकांश स्पीच रोबोट आपको बोलने का एक "साफ" संस्करण देने के लिए प्रशिक्षित होते हैं। लेकिन कभी-कभी, आपको "असली" संस्करण की आवश्यकता होती है।

  • लक्ष्य: रोबोट को फिलर वर्ड्स (जैसे "अम"), पुनरावृत्ति ("I-I-I"), खाँसी और ठहराव जैसे विशिष्ट मार्करों को पहचानने और लिखने के लिए प्रशिक्षित करना।
  • जोखिम: यदि आप रोबोट को केवल अव्यवस्थित, हकलाने वाली बातचीत पर फिर से प्रशिक्षित करते हैं, तो यह इतना भ्रमित हो सकता है कि यह सामान्य, साफ बातचीत पर ठीक से काम करना बंद कर दे। इसे "कैटैस्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) कहा जाता है।

2. समाधान: "कंटीन्यूअल लर्निंग" (स्मार्ट ट्यूटर)

रोबोट को शुरू से फिर से प्रशिक्षित करने के बजाय, लेखकों ने कंटीन्यूअल लर्निंग (CL) नामक तकनीक का उपयोग किया। इसे एक स्मार्ट ट्यूटर की तरह समझें जो एक छात्र को उसके पुराने विषयों को भूले बिना नया विषय सीखने में मदद करता है। उन्होंने चार अलग-अलग "ट्यूटरिंग शैलियों" (तरीकों) का परीक्षण किया कि कौन सा सबसे अच्छा काम करता है:

  • "मेमोरी बफर" (एक्सपीरियंस रिप्ले): रोबोट पुरानी, साफ बातचीत की एक छोटी नोटबुक रखता है और नई, अव्यवस्थित बातचीत सीखते समय उनकी समीक्षा करता है।
  • "जेंटल नज़" (EWC): रोबोट को बताया जाता है, "उन हिस्सों पर अपना दिमाग बहुत अधिक मत बदलो जिन्हें तुम पहले से अच्छी तरह जानते हो।"
  • "वेटेड एवरेज" (WA): रोबोट नई चीजें सीखता है, और फिर शिक्षक "पुराने दिमाग" और "नए दिमाग" को मिलाकर एक आदर्श संतुलन पाते हैं।
  • "ग्रेडिएंट गार्ड" (A-GEM): रोबोट पुराने पाठों के विरुद्ध अपने नए पाठों की जाँच करता है ताकि यह सुनिश्चित हो सके कि वह पीछे की ओर कदम नहीं बढ़ा रहा है।

3. खोज: "विशेष टीम"

शोधकर्ताओं ने केवल यह नहीं देखा कि रोबोट ने कितने अच्छे से प्रदर्शन किया; उन्होंने रोबोट के मस्तिष्क के अंदर (विशेष रूप से इसके अटेंशन मैकेनिज्म) देखा कि यह कैसे सीखता है।

उन्होंने पाया कि कुछ दिलचस्प था: जब रोबोट ने "अम" और "पुनरावृत्ति" लिखना सफलतापूर्वक सीखा, तो उसने अपने पूरे मस्तिष्क का उपयोग नहीं किया। इसके बजाय, एक छोटा, विशिष्ट टीम के प्रोसेसर (जिन्हें अटेंशन हेड्स कहा जाता है) ने उस काम को संभाल लिया।

  • उपमा: एक बड़े कार्यालय की कल्पना करें जहाँ हर कोई आमतौर पर सब कुछ करता है। लेकिन जब काम "हकलाहट लिखना" होता है, तो कर्मचारियों का एक विशिष्ट समूह सामने आता है, एक विशेष डेस्क पर बैठता है, और विशेष रूप से इसे संभालता है।
  • प्रमाण: जब शोधकर्ताओं ने अस्थायी रूप से इस विशिष्ट टीम को "निकाल" (मास्क) दिया, तो रोबोट ने हकलाहट लिखना बंद कर दिया, लेकिन वह सामान्य भाषण को पूरी तरह से समझने में सक्षम था। इसने साबित कर दिया कि रोबोट ने डिसफ्लुएंसी को संभालने के लिए एक समर्पित, स्थिर तंत्र बना लिया था।

4. परिणाम: कौन जीता?

शोधकर्ताओं ने विश्वविद्यालय के छात्रों, डिमेंशिया वाले बुजुर्गों और हल्के संज्ञानात्मक दोष वाले लोगों सहित विभिन्न समूहों के वक्ताओं पर इन तरीकों का परीक्षण किया।

  • ट्रेड-ऑफ (समझौता): यहाँ एक खींचतान है। वे तरीके जो रोबोट के मूल "साफ भाषण" कौशल को बनाए रखने में बहुत अच्छे थे (जैसे कि वेटेड एवरेज विधि), वे कभी-कभी हकलाहट के मार्करों को सीखने में संघर्ष करते थे। इसके विपरीत, जो तरीके मार्करों को सीखने में बेहतरीन थे, उन्होंने रोबोट को साफ भाषण के मामले में थोड़ा कमजोर बना दिया।
  • विजेता:
    • पुरानी चीजों को याद रखने के लिए (साफ भाषण): वेटेड एवरेज (WA) विधि सबसे स्थिर थी। इसने रोबोट के मूल कौशल को बरकरार रखते हुए नए कौशल भी जोड़े।
    • नई चीजों को याद रखने के लिए (हकलाहट): एक्सपीरियंस रिप्ले (ER) विधि (वह तरीका जिसमें नोटबुक है) अलग-अलग प्रकार की हिचकिचाहटों को याद रखने और पहचानने में सबसे अच्छी थी, विशेष रूप से कठिन मामलों जैसे कि ठहराव (pauses) के लिए।

5. निष्कर्ष

यह शोध पत्र दिखाता है कि हम स्पीच रोबोट को सामान्य भाषण समझने की अपनी क्षमता को तोड़े बिना अधिक ईमानदार और विस्तृत (वर्बेटिम) होने के लिए कैसे सिखा सकते हैं।

  • मुख्य बात: आपको पूरे रोबोट को शुरू से फिर से प्रशिक्षित करने की आवश्यकता नहीं है। सही "कंटीन्यूअल लर्निंग" रणनीति का उपयोग करके, आप रोबोट के मस्तिष्क के अंदर एक विशेष "हकलाहट-पहचानने वाली टीम" जोड़ सकते हैं।
  • अंतर्दृष्टि: सफल सीखना पूरे रोबोट को बदलने के बारे में नहीं है; यह एक छोटे, विशिष्ट हिस्से को खोजने और सक्रिय करने के बारे में है जो बाकी मस्तिष्क को अकेला छोड़ते हुए नए, अव्यवस्थित विवरणों को संभाल सके।

लेखक निष्कर्ष निकालते हैं कि जबकि कोई भी एक विधि हर चीज़ में पूर्ण नहीं थी, एक्सपीरियंस रिप्ले अव्यवस्थित विवरणों को याद रखने के लिए सबसे अच्छा था, और वेटेड एवरेज रोबोट के मुख्य कौशल को तेज रखने के लिए सबसे अच्छा था। यह इंजीनियरों को बेहतर, अधिक मानवीय स्पीच रिकग्निशन सिस्टम बनाने के लिए एक रोडमैप प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →