← नवीनतम पेपर
💬 NLP

Ebisu: Benchmarking Large Language Models in Japanese Finance

यह शोध पत्र एबिसु (Ebisu) को प्रस्तुत करता है, जो दो विशेषज्ञ-एनोटेटेड कार्यों वाला एक नवीन बेंचमार्क है जिसे जापानी वित्त की जटिल भाषाई और सांस्कृतिक बारीकियों को समझने में बड़े भाषा मॉडल (large language models) के सामने आने वाली चुनौतियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि पैमाने या अनुकूलन के बावजूद अत्याधुनिक मॉडल भी निहित प्रतिबद्धताओं (implicit commitments) और पदानुक्रमित शब्दावली निष्कर्षण (hierarchical terminology extraction) के मामले में संघर्ष करते हैं।

मूल लेखक: Xueqing Peng, Ruoyu Xiang, Fan Zhang, Mingzi Song, Mingyang Jiang, Yan Wang, Lingfei Qian, Taiki Hara, Yuqing Guo, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xueqing Peng, Ruoyu Xiang, Fan Zhang, Mingzi Song, Mingyang Jiang, Yan Wang, Lingfei Qian, Taiki Hara, Yuqing Guo, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक जापानी कंपनी और उसके निवेशकों के बीच एक बहुत ही विनम्र, अत्यधिक जटिल बातचीत को समझने की कोशिश करें। इस बातचीत में, कंपनी शायद ही कभी सीधे तौर पर "नहीं" कहती है। इसके बजाय, वे कह सकते हैं, "हम संभावनाओं पर विचार करेंगे," या "अभी कोई निश्चित उत्तर देना कठिन है।" एक मूल वक्ता (native speaker) के लिए, ये वाक्यांश स्पष्ट रूप से इनकार के संकेत हैं। लेकिन अंग्रेजी पर प्रशिक्षित एक AI के लिए, जहाँ लोग अधिक स्पष्ट होने की प्रवृत्ति रखते हैं, ये वाक्यांश एक "शायद" या यहाँ तक कि एक "हाँ" की तरह दिखते हैं।

यह शोध पत्र, जिसका शीर्षक EBISUS है, एक नया "परीक्षा" (exam) पेश करता है जो यह परीक्षण करने के लिए डिज़ाइन किया गया है कि आर्टिफिशियल इंटेलिजेंस (AI) जापान में इन सूक्ष्म, सांस्कृतिक रूप से विशिष्ट वित्तीय बातचीत को कितनी अच्छी तरह समझ सकता है।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस शोध पत्र का विवरण दिया गया है:

1. समस्या: "अनुवाद में खो जाने" का जाल (The "Lost in Translation" Trap)

लेखकों का तर्क है कि वर्तमान AI मॉडल उन पर्यटकों की तरह हैं जिन्होंने जापानी पाठ्यपुस्तक तो पढ़ ली है लेकिन वास्तव में उस देश की यात्रा कभी नहीं की है।

  • भाषाई बाधा: जापानी एक "हेड-फाइनल" (head-final) भाषा है (वाक्य के अंत में क्रिया आती है) और इसमें तीन अलग-अलग लेखन प्रणालियों का मिश्रण होता है। यह एक ऐसे वाक्य को पढ़ने की कोशिश करने जैसा है जहाँ सबसे महत्वपूर्ण शब्द वाक्य के बिल्कुल अंत में छिपा हुआ है, और शब्द तीन अलग-अलग फोंट में लिखे गए हैं।
  • सांस्कृतिक बाधा: जापानी व्यावसायिक संस्कृति में, बहुत अधिक सीधा होना अक्सर अशिष्ट माना जाता है। कंपनियाँ "उच्च-संदर्भ" (high-context) संचार का उपयोग करती हैं, जिसका अर्थ है कि वास्तविक अर्थ शब्दों में नहीं, बल्कि लहजे, चुप्पी, या वाक्य के समाप्त होने के विशिष्ट तरीके में छिपा होता है।
  • परिणाम: यहाँ तक कि सबसे स्मार्ट AI मॉडल भी इन वित्तीय दस्तावेजों में "खो" जाते हैं। वे सूक्ष्म "ना" और जटिल वित्तीय शब्दों को मिस कर देते हैं क्योंकि वे सीधे अंग्रेजी-शैली के उत्तरों की तलाश कर रहे होते हैं।

2. समाधान: EBISU बेंचमार्क (The EBISU Benchmark)

इसे ठीक करने के लिए, शोधकर्ताओं ने EBISU बनाया है, जो दो विशिष्ट चुनौतियों (टास्क) वाला एक विशेष परीक्षण है। इसे AI के लिए दो-चरणीय ड्राइविंग टेस्ट की तरह समझें।

  • टास्क 1: "पंक्तियों के बीच पढ़ने" का परीक्षण (JF-ICR)

    • परिदृश्य: एक निवेशक एक कठिन प्रश्न पूछता है, और कंपनी एक विनम्र, अस्पष्ट उत्तर देती है।
    • चुनौती: AI को तय करना होगा: क्या कंपनी कह रही है "हाँ, हम इसे करेंगे," "शायद, लेकिन यह जोखिम भरा है," या "नहीं, बिल्कुल नहीं"?
    • जाल: AI अक्सर एक विनम्र "ना" को "शायद" समझकर गलती कर देता है क्योंकि वह अप्रत्यक्ष इनकार के सांस्कृतिक नियमों को नहीं समझता।
    • डेटा: उन्होंने 3 वर्षों के दौरान 4 प्रमुख जापानी कंपनियों के वास्तविक ट्रांसक्रिप्ट का उपयोग किया है, जिन्हें मानव विशेषज्ञों द्वारा सावधानीपूर्वक लेबल किया गया है जो एक विनम्र हिचकिचाहट (hedge) और एक सख्त इनकार के बीच के अंतर को जानते हैं।
  • टास्क 2: "भूसे के ढेर में सुई खोजने" का परीक्षण (JF-TE)

    • परिदृश्य: जापानी वित्तीय रिपोर्ट टेक्स्ट के घने जंगलों की तरह होती हैं। महत्वपूर्ण वित्तीय शब्द अक्सर लंबे, नेस्टेड (nested) वाक्यांशों में दबे होते हैं और समय के साथ अर्थ बदल चुके अंग्रेजी और चीनी के ऋणशब्दों (loanwords) के साथ मिश्रित होते हैं।
    • चुनौती: AI को विशिष्ट वित्तीय शब्दों को खोजना और उन्हें महत्व के आधार पर रैंक करना होता है।
    • जाल: क्योंकि शब्द मिश्रित (Kanji, Hiragana, Katakana) हैं और एक-दूसरे के भीतर समाए हुए हैं, AI अक्सर भ्रमित हो जाता है कि एक शब्द कहाँ समाप्त होता है और दूसरा कहाँ शुरू होता है। यह एक ऐसे सूप में विशिष्ट सामग्री खोजने की कोशिश करने जैसा है जहाँ लेबल तीन अलग-अलग भाषाओं में लिखे गए हैं और सामग्रियां आपस में चिपकी हुई हैं।

3. परिणाम: AI संघर्ष करता है (The AI Struggles)

शोधकर्ताओं ने 22 अलग-अलग AI मॉडल का परीक्षण किया, जिसमें अमेरिका के सबसे प्रसिद्ध मॉडल (जैसे GPT-4 और Claude) और जापानी या वित्तीय डेटा पर विशेष रूप से प्रशिक्षित मॉडल शामिल थे।

  • स्कोरकार्ड: परिणाम आश्चर्यजनक रूप से खराब थे। सबसे "स्मार्ट" AI मॉडल भी केवल 40% उत्तर सही दे पाए।
  • बड़ा होना बेहतर नहीं है: AI को "बड़ा" बनाने (अधिक डेटा और पैरामीटर जोड़ने) से थोड़ी मदद मिली, लेकिन समस्या को हल करने के लिए पर्याप्त नहीं।
  • विशेषज्ञता ने मदद नहीं की: आश्चर्यजनक रूप से, जो मॉडल विशेष रूप से जापानी वित्तीय डेटा पर प्रशिक्षित थे, वे कुछ मामलों में सामान्य मॉडल की तुलना में बदतर प्रदर्शन करते थे। यह ऐसा है जैसे किसी विशिष्ट पाठ्यपुस्तक को पढ़ने से छात्र अति-आत्मविश्वासी और कम लचीला हो गया हो।
  • पूर्वाग्रह (Bias): अंग्रेजी डेटा पर प्रशिक्षित AI मॉडल बहुत आशावादी होते हैं। जब एक जापानी कंपनी अस्पष्ट होती है, तो अंग्रेजी-प्रशिक्षित AI मान लेता है कि वे सहमत हैं, जबकि वास्तव में वे इनकार कर रहे होते हैं।

4. निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हम केवल AI को "स्केल अप" नहीं कर सकते या अंग्रेजी के वित्तीय नियमों को जापानी में अनुवादित नहीं कर सकते। जापानी वित्त को वास्तव में समझने के लिए, AI को केवल शब्दावली ही नहीं, बल्कि भाषा के सांस्कृतिक बारीकियों और भाषाई विचित्रताओं को सीखने की आवश्यकता है।

संक्षेप में: EBISU बेंचमार्क एक वास्तविकता की जाँच है। यह दिखाता है कि हालांकि AI कई चीजों में महान है, लेकिन यह वर्तमान में जापानी कंपनियां पैसे के बारे में बात करने के लिए जिस विनम्र, अप्रत्यक्ष और जटिल तरीके का उपयोग करती हैं, उसे समझने में बहुत खराब है। लेखकों ने अपने परीक्षण डेटा और उपकरण जारी कर दिए हैं ताकि अन्य शोधकर्ता बेहतर "सांस्कृतिक अनुवादक" बनाने की कोशिश कर सकें।

नोट: लेखक स्पष्ट रूप से कहते हैं कि ये मॉडल केवल अनुसंधान और मूल्यांकन के लिए हैं। वे चेतावनी देते हैं कि भले ही कोई AI इस परीक्षण पर अच्छा स्कोर करे, इसका उपयोग मानव विशेषज्ञों द्वारा सब कुछ दोबारा जांचे बिना वास्तविक निवेश निर्णय लेने या कानूनी अनुपालन के लिए नहीं किया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →