HK-LegiCoST: Leveraging Non-Verbatim Transcripts for Speech Translation
यह शोध पत्र HK-LegiCoST को प्रस्तुत करता है, जो कैंटोनीज़ ऑडियो, गैर-मौखिक पारंपरिक चीनी लिप्यंतरण और अंग्रेजी अनुवादों का एक बड़े पैमाने पर तीन-तरफा समानांतर संग्रह है, जिसे उन भाषाओं के लिए स्पीच ट्रांसलेशन अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है जहाँ मौखिक और लिखित रूपों में महत्वपूर्ण अंतर होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को बातचीत का एक बहुत ही विशिष्ट प्रकार समझने के लिए सिखाने की कोशिश कर रहे हैं: हांगकांग विधान परिषद (Legislative Council) की औपचारिक बहस। लेकिन इसमें एक पेच है, वह यह कि बोलने वाले लोग कैंटोनीज़ (Cantonese) का उपयोग कर रहे हैं, जो अपनी अनूठी शब्दावली और वाक्य संरचनाओं के साथ एक समृद्ध, बोली जाने वाली बोली है। हालाँकि, उनकी बैठकों के आधिकारिक लिखित रिकॉर्ड "शुद्ध" कैंटोनीज़ में नहीं लिखे गए हैं। इसके बजाय, उन्हें मानक चीनी (Standard Chinese) में अनुवादित किया गया है, जो एक औपचारिक लिखित भाषा है और अक्सर पूरी तरह से एक अलग बोली की तरह लगती है।
यह कुछ ऐसा है जैसे किसी दोस्त को एक भारी, स्थानीय लहजे में कहानी सुनाते हुए सुनना, लेकिन आपके पास जो आधिकारिक ट्रांसक्रिप्ट है, उसे एक सख्त, औपचारिक शैली में लिखा गया है जिसे शब्दों को पुनर्व्यवस्थित करता है और साधारण शब्दावली को विनम्र शब्दावली से बदल देता है।
यही वह चुनौती है जिसका सामना जॉन्स हॉपकिन्स यूनिवर्सिटी के शोधकर्ताओं ने किया, जिन्होंने एक विशाल नया डेटासेट पेश करते हुए HK-LegiCoST का परिचय दिया।
समस्या: "शोर वाला" ट्रांसक्रिप्ट
आमतौर पर, जब हम कंप्यूटर को भाषण अनुवाद करने के लिए प्रशिक्षित करते हैं, तो हम मान लेते हैं कि लिखित पाठ बोले गए शब्दों से पूरी तरह मेल खाता है। लेकिन कैंटोनीज़ के मामले में, लिखित रिकॉर्ड अक्सर बोले गए शब्दों का एक "साफ-सुथरा" संस्करण होता है।
- बोला गया: "तुम पहले जाओ!" (कैंटोनीज़ शैली में)
- लिखित: "तुम पहले जाओ।" (मानक चीनी शैली में)
यह बेमेल होना एक जैज़ इम्प्रोवाइजेशन (jazz improvisation) को शास्त्रीय संगीत के शीट म्यूजिक से मिलाने जैसा है। स्वर समान हैं, लेकिन लय और क्रम अलग हैं। यह कंप्यूटर के लिए भाषण का सीधे अनुवाद करना सीखना बहुत कठिन बना देता है।
समाधान: एक विशाल पहेली बनाना
शोधकर्ताओं ने हांगकांग सरकार की बैठकों के 600 घंटों से अधिक के वीडियो रिकॉर्डिंग ली। उन्होंने केवल फाइलों को कॉपी-पेस्ट नहीं किया; उन्होंने इस बिखरे हुए कच्चे डेटा को एक साफ, उपयोगी प्रशिक्षण सेट में बदलने के लिए एक जटिल "पाइपलाइन" (एक चरण-दर-चरण असेंबली लाइन) बनाई।
उनकी प्रक्रिया को एक उच्च-तकनीकी लाइब्रेरियन द्वारा एक अराजक पुस्तकालय को व्यवस्थित करने के समान समझें:
- टेप काटना: उन्होंने लंबी बैठक के वीडियो को छोटे ऑडियो क्लिप्स में काट दिया।
- अनुवादक का मिलान: उन्होंने ऑडियो को लिखित पाठ से मिलाने के लिए उन्नत AI का उपयोग किया। क्योंकि पाठ एक सटीक शब्द-दर-शब्द मिलान नहीं था, इसलिए उन्हें AI को लचीला होना सिखाना पड़ा। यह एक अनुवादक को यह सिखाने जैसा है कि वह इस बात को अनदेखा करे कि वक्ता ने "y'all" कहा और टेक्स्ट में "you all" लिखा है, और इसके बजाय अर्थ पर ध्यान केंद्रित करे।
- "स्किप" बटन: कभी-कभी, लिखित ट्रांसक्रिप्ट में ऐसी टिप्पणियाँ या औपचारिकताएँ शामिल होती थीं जो वास्तव में कभी बोली ही नहीं गईं। शोधकर्ताओं ने एक विशेष एल्गोरिदम बनाया जो एक "स्किप बटन" की तरह कार्य करता है, जिससे कंप्यूटर उन अतिरिक्त लिखित शब्दों को अनदेखा कर सकता है और केवल उन्हीं हिस्सों पर ध्यान केंद्रित कर सकता है जो वास्तव में बोले गए थे।
परिणाम: एक नया प्रशिक्षण मैदान
अंतिम उत्पाद, HK-LegiCoST, 600+ घंटों का कैंटोनीज़ ऑडियो है जो इसके "अपूर्ण" लिखित ट्रांसक्रिप्ट और एक अंग्रेजी अनुवाद के साथ जुड़ा हुआ है।
शोधकर्ताओं ने अपने कंप्यूटर मॉडल का परीक्षण इस नए डेटा पर किया और पाया कि कुछ रोमांचक चीजें हुई हैं:
- यह काम करता है: भले ही ट्रांसक्रिप्ट "शोर वाले" (एक सटीक मिलान नहीं) थे, कंप्यूटर मॉडल ने भाषण का अनुवाद बहुत अच्छी तरह से करना सीख लिया।
- यह मजबूत है: जब उन्होंने अपने मॉडल का परीक्षण कैंटोनीज़ भाषण के एक अलग, छोटे डेटासेट (गूगल के FLEURS प्रोजेक्ट से) पर किया, तो इसने बहुत बड़े, अधिक महंगे डेटा पर प्रशिक्षित मॉडलों के समान ही प्रदर्शन किया।
- "ज़ीरो-शॉट" जादू: केवल इस नए हांगकांग डेटा पर प्रशिक्षित एक मॉडल बिना किसी अतिरिक्त प्रशिक्षण के गूगल डेटासेट को संभालने में सक्षम था, जो यह साबित करता है कि डेटा उच्च गुणवत्ता वाला और सामान्यीकरण योग्य (generalizable) है।
यह क्यों महत्वपूर्ण है
यह पेपर हमें केवल एक नया डेटासेट ही नहीं देता है; यह यह भी सिद्ध करता है कि हम शक्तिशाली स्पीच टूल्स बना सकते हैं भले ही लिखित रिकॉर्ड बोले गए शब्दों से पूरी तरह मेल न खाते हों। यह उन भाषाओं को संभालने के लिए एक ब्लूप्रिंट है जहाँ "बोली जाने वाली" और "लिखित" संस्करण अक्सर एक-दूसरे के विपरीत होते हैं, जो दुनिया भर के कई बोलियों और स्थानीय भाषाओं में आम है।
संक्षेप में, शोधकर्ताओं ने एक बिखरी हुई, वास्तविक दुनिया की समस्या (सरकारी बैठकें जहाँ स्क्रिप्ट भाषण से मेल नहीं खाती) को एक साफ, शक्तिशाली उपकरण में बदल दिया जो कंप्यूटर को केवल पृष्ठ पर लिखे औपचारिक शब्दों को ही नहीं, बल्कि लोगों की वास्तविक आवाज़ को समझने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।