Ebisu: Benchmarking Large Language Models in Japanese Finance
यह शोध पत्र एबिसु (Ebisu) को प्रस्तुत करता है, जो दो विशेषज्ञ-एनोटेटेड कार्यों वाला एक नवीन बेंचमार्क है जिसे जापानी वित्त की जटिल भाषाई और सांस्कृतिक बारीकियों को समझने में बड़े भाषा मॉडल (large language models) के सामने आने वाली चुनौतियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि पैमाने या अनुकूलन के बावजूद अत्याधुनिक मॉडल भी निहित प्रतिबद्धताओं (implicit commitments) और पदानुक्रमित शब्दावली निष्कर्षण (hierarchical terminology extraction) के मामले में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक जापानी कंपनी और उसके निवेशकों के बीच एक बहुत ही विनम्र, अत्यधिक जटिल बातचीत को समझने की कोशिश करें। इस बातचीत में, कंपनी शायद ही कभी सीधे तौर पर "नहीं" कहती है। इसके बजाय, वे कह सकते हैं, "हम संभावनाओं पर विचार करेंगे," या "अभी कोई निश्चित उत्तर देना कठिन है।" एक मूल वक्ता (native speaker) के लिए, ये वाक्यांश स्पष्ट रूप से इनकार के संकेत हैं। लेकिन अंग्रेजी पर प्रशिक्षित एक AI के लिए, जहाँ लोग अधिक स्पष्ट होने की प्रवृत्ति रखते हैं, ये वाक्यांश एक "शायद" या यहाँ तक कि एक "हाँ" की तरह दिखते हैं।
यह शोध पत्र, जिसका शीर्षक EBISUS है, एक नया "परीक्षा" (exam) पेश करता है जो यह परीक्षण करने के लिए डिज़ाइन किया गया है कि आर्टिफिशियल इंटेलिजेंस (AI) जापान में इन सूक्ष्म, सांस्कृतिक रूप से विशिष्ट वित्तीय बातचीत को कितनी अच्छी तरह समझ सकता है।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इस शोध पत्र का विवरण दिया गया है:
1. समस्या: "अनुवाद में खो जाने" का जाल (The "Lost in Translation" Trap)
लेखकों का तर्क है कि वर्तमान AI मॉडल उन पर्यटकों की तरह हैं जिन्होंने जापानी पाठ्यपुस्तक तो पढ़ ली है लेकिन वास्तव में उस देश की यात्रा कभी नहीं की है।
- भाषाई बाधा: जापानी एक "हेड-फाइनल" (head-final) भाषा है (वाक्य के अंत में क्रिया आती है) और इसमें तीन अलग-अलग लेखन प्रणालियों का मिश्रण होता है। यह एक ऐसे वाक्य को पढ़ने की कोशिश करने जैसा है जहाँ सबसे महत्वपूर्ण शब्द वाक्य के बिल्कुल अंत में छिपा हुआ है, और शब्द तीन अलग-अलग फोंट में लिखे गए हैं।
- सांस्कृतिक बाधा: जापानी व्यावसायिक संस्कृति में, बहुत अधिक सीधा होना अक्सर अशिष्ट माना जाता है। कंपनियाँ "उच्च-संदर्भ" (high-context) संचार का उपयोग करती हैं, जिसका अर्थ है कि वास्तविक अर्थ शब्दों में नहीं, बल्कि लहजे, चुप्पी, या वाक्य के समाप्त होने के विशिष्ट तरीके में छिपा होता है।
- परिणाम: यहाँ तक कि सबसे स्मार्ट AI मॉडल भी इन वित्तीय दस्तावेजों में "खो" जाते हैं। वे सूक्ष्म "ना" और जटिल वित्तीय शब्दों को मिस कर देते हैं क्योंकि वे सीधे अंग्रेजी-शैली के उत्तरों की तलाश कर रहे होते हैं।
2. समाधान: EBISU बेंचमार्क (The EBISU Benchmark)
इसे ठीक करने के लिए, शोधकर्ताओं ने EBISU बनाया है, जो दो विशिष्ट चुनौतियों (टास्क) वाला एक विशेष परीक्षण है। इसे AI के लिए दो-चरणीय ड्राइविंग टेस्ट की तरह समझें।
टास्क 1: "पंक्तियों के बीच पढ़ने" का परीक्षण (JF-ICR)
- परिदृश्य: एक निवेशक एक कठिन प्रश्न पूछता है, और कंपनी एक विनम्र, अस्पष्ट उत्तर देती है।
- चुनौती: AI को तय करना होगा: क्या कंपनी कह रही है "हाँ, हम इसे करेंगे," "शायद, लेकिन यह जोखिम भरा है," या "नहीं, बिल्कुल नहीं"?
- जाल: AI अक्सर एक विनम्र "ना" को "शायद" समझकर गलती कर देता है क्योंकि वह अप्रत्यक्ष इनकार के सांस्कृतिक नियमों को नहीं समझता।
- डेटा: उन्होंने 3 वर्षों के दौरान 4 प्रमुख जापानी कंपनियों के वास्तविक ट्रांसक्रिप्ट का उपयोग किया है, जिन्हें मानव विशेषज्ञों द्वारा सावधानीपूर्वक लेबल किया गया है जो एक विनम्र हिचकिचाहट (hedge) और एक सख्त इनकार के बीच के अंतर को जानते हैं।
टास्क 2: "भूसे के ढेर में सुई खोजने" का परीक्षण (JF-TE)
- परिदृश्य: जापानी वित्तीय रिपोर्ट टेक्स्ट के घने जंगलों की तरह होती हैं। महत्वपूर्ण वित्तीय शब्द अक्सर लंबे, नेस्टेड (nested) वाक्यांशों में दबे होते हैं और समय के साथ अर्थ बदल चुके अंग्रेजी और चीनी के ऋणशब्दों (loanwords) के साथ मिश्रित होते हैं।
- चुनौती: AI को विशिष्ट वित्तीय शब्दों को खोजना और उन्हें महत्व के आधार पर रैंक करना होता है।
- जाल: क्योंकि शब्द मिश्रित (Kanji, Hiragana, Katakana) हैं और एक-दूसरे के भीतर समाए हुए हैं, AI अक्सर भ्रमित हो जाता है कि एक शब्द कहाँ समाप्त होता है और दूसरा कहाँ शुरू होता है। यह एक ऐसे सूप में विशिष्ट सामग्री खोजने की कोशिश करने जैसा है जहाँ लेबल तीन अलग-अलग भाषाओं में लिखे गए हैं और सामग्रियां आपस में चिपकी हुई हैं।
3. परिणाम: AI संघर्ष करता है (The AI Struggles)
शोधकर्ताओं ने 22 अलग-अलग AI मॉडल का परीक्षण किया, जिसमें अमेरिका के सबसे प्रसिद्ध मॉडल (जैसे GPT-4 और Claude) और जापानी या वित्तीय डेटा पर विशेष रूप से प्रशिक्षित मॉडल शामिल थे।
- स्कोरकार्ड: परिणाम आश्चर्यजनक रूप से खराब थे। सबसे "स्मार्ट" AI मॉडल भी केवल 40% उत्तर सही दे पाए।
- बड़ा होना बेहतर नहीं है: AI को "बड़ा" बनाने (अधिक डेटा और पैरामीटर जोड़ने) से थोड़ी मदद मिली, लेकिन समस्या को हल करने के लिए पर्याप्त नहीं।
- विशेषज्ञता ने मदद नहीं की: आश्चर्यजनक रूप से, जो मॉडल विशेष रूप से जापानी वित्तीय डेटा पर प्रशिक्षित थे, वे कुछ मामलों में सामान्य मॉडल की तुलना में बदतर प्रदर्शन करते थे। यह ऐसा है जैसे किसी विशिष्ट पाठ्यपुस्तक को पढ़ने से छात्र अति-आत्मविश्वासी और कम लचीला हो गया हो।
- पूर्वाग्रह (Bias): अंग्रेजी डेटा पर प्रशिक्षित AI मॉडल बहुत आशावादी होते हैं। जब एक जापानी कंपनी अस्पष्ट होती है, तो अंग्रेजी-प्रशिक्षित AI मान लेता है कि वे सहमत हैं, जबकि वास्तव में वे इनकार कर रहे होते हैं।
4. निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हम केवल AI को "स्केल अप" नहीं कर सकते या अंग्रेजी के वित्तीय नियमों को जापानी में अनुवादित नहीं कर सकते। जापानी वित्त को वास्तव में समझने के लिए, AI को केवल शब्दावली ही नहीं, बल्कि भाषा के सांस्कृतिक बारीकियों और भाषाई विचित्रताओं को सीखने की आवश्यकता है।
संक्षेप में: EBISU बेंचमार्क एक वास्तविकता की जाँच है। यह दिखाता है कि हालांकि AI कई चीजों में महान है, लेकिन यह वर्तमान में जापानी कंपनियां पैसे के बारे में बात करने के लिए जिस विनम्र, अप्रत्यक्ष और जटिल तरीके का उपयोग करती हैं, उसे समझने में बहुत खराब है। लेखकों ने अपने परीक्षण डेटा और उपकरण जारी कर दिए हैं ताकि अन्य शोधकर्ता बेहतर "सांस्कृतिक अनुवादक" बनाने की कोशिश कर सकें।
नोट: लेखक स्पष्ट रूप से कहते हैं कि ये मॉडल केवल अनुसंधान और मूल्यांकन के लिए हैं। वे चेतावनी देते हैं कि भले ही कोई AI इस परीक्षण पर अच्छा स्कोर करे, इसका उपयोग मानव विशेषज्ञों द्वारा सब कुछ दोबारा जांचे बिना वास्तविक निवेश निर्णय लेने या कानूनी अनुपालन के लिए नहीं किया जाना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।