← नवीनतम पेपर
💻 computer science

EDINET-Bench: Evaluating LLMs on Complex Financial Tasks using Japanese Financial Statements

यह शोध पत्र EDINET-Bench प्रस्तुत करता है, जो दस वर्षों की जापानी वित्तीय रिपोर्टों से प्राप्त एक चुनौतीपूर्ण ओपन-सोर्स बेंचमार्क है, जिसका उद्देश्य धोखाधड़ी का पता लगाने और आय के पूर्वानुमान जैसे जटिल कार्यों पर LLMs का मूल्यांकन करना है, जो यह प्रकट करता है कि वर्तमान मॉडल विशेष स्कैफोल्डिंग के बिना काफी संघर्ष करते हैं और अधिक यथार्थवादी मूल्यांकन ढांचे की आवश्यकता पर प्रकाश डालता है।

मूल लेखक: Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Issa Sugiura, Takashi Ishida, Taro Makino, Chieko Tazuke, Takanori Nakagawa, Kosuke Nakago, David Ha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुपर-स्मार्ट रोबोट को वित्तीय जासूस (financial detective) बनना सिखाने की कोशिश कर रहे हैं। आप यह देखना चाहते हैं कि क्या यह रोबोट किसी कंपनी की वार्षिक रिपोर्ट पढ़ सकता है, छिपे हुए झूठ पकड़ सकता है, यह अनुमान लगा सकता है कि क्या कंपनी अगले साल अधिक पैसा कमाएगी, या केवल आंकड़ों को देखकर यह अंदाजा लगा सकता है कि वह किस प्रकार का व्यवसाय कर रही है।

यह शोध पत्र, EDINET-Bench, मूल रूप से इन कठिन कार्यों के लिए इन रोबोटों (Large Language Models, या LLMs) का परीक्षण करने के लिए बनाया गया एक "फाइनल एग्जाम" है।

इस पेपर का विवरण सरल शब्दों में यहाँ दिया गया है:

1. समस्या: रोबोट गणित में अच्छा है, लेकिन फाइनेंस में नहीं

हमने देखा है कि AI गणित की समस्याओं और कोड लिखने में बहुत अच्छा होता जा रहा है। लेकिन फाइनेंस अलग है। यह सुडोकू पहेली हल करने और किसी दुर्लभ बीमारी वाले मरीज का निदान करने के बीच के अंतर जैसा है। फाइनेंस के लिए लाइनों के बीच पढ़ना, सैकड़ों पन्नों में फैले सूक्ष्म सुरागों को जोड़ना और मानवीय व्यवहार एवं जटिल नियमों को समझना आवश्यक है।

अब तक, AI के लिए बहुत कम "कठिन" परीक्षण उपलब्ध थे। अधिकांश मौजूदा परीक्षण ऐसे हैं जैसे पूछना, "कंपनी X का लाभ क्या है?" (एक साधारण खोज)। यह पेपर पूछना चाहता था, "क्या कंपनी X अपने मुनाफे के बारे में झूठ बोल रही है?" (एक जटिल जांच)।

2. समाधान: EDINET-Bench (द "फाइनेंशियल जिम")

शोधकर्ताओं ने EDINET-Bench नामक एक नया प्रशिक्षण मैदान बनाया।

  • स्रोत: उन्होंने जापान के "EDINET" से वास्तविक दस्तावेजों का उपयोग किया, जो जापान की कंपनियों द्वारा पिछले 10 वर्षों में जमा की गई वार्षिक रिपोर्ट का एक विशाल पुस्तकालय है (यह अमेरिका के SEC के EDGAR सिस्टम जैसा ही है)।
  • टूल्स: उन्होंने इन रिपोर्टों में से डेटा निकालने के लिए एक विशेष टूल (जिसे edinet2dataset कहा जाता है) बनाया, जो अव्यवस्थित PDF और तालिकाओं को साफ डेटा में बदल देता है जिसे AI पढ़ सके।
  • तीन चुनौतियाँ (परीक्षा के प्रश्न):
    1. धोखाधड़ी का पता लगाना (Fraud Detection): क्या AI उस कंपनी का पता लगा सकता है जो अपने खातों में हेरफेर कर रही है? (जैसे संख्याओं के ढेर में सुई ढूंढना)।
    2. कमाई का पूर्वानुमान (Earnings Forecasting): क्या AI इस साल की रिपोर्ट देखकर यह अनुमान लगा सकता है कि कंपनी अगले साल अधिक या कम पैसा कमाएगी?
    3. उद्योग का अनुमान (Industry Prediction): क्या AI कंपनी के बैलेंस शीट को देखकर यह अंदाजा लगा सकता है कि वह एक बैंक है, कार निर्माता है, या खाद्य कंपनी है?

3. परिणाम: रोबोट संघर्ष करते रहे

शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट AI मॉडलों (जैसे GPT-4o, Claude 3.7, और अन्य) का इस परीक्षा पर परीक्षण किया।

फैसला: AI अच्छा प्रदर्शन नहीं कर सका।

  • उपमा: कल्पना कीजिए कि एक छात्र जिसने पूरी डिक्शनरी रट ली है, लेकिन एक बुनियादी गणित के टेस्ट में फेल हो जाता है क्योंकि उसे समझ नहीं आता कि संख्याओं को लागू कैसे किया जाए।
  • वास्तविकता: AI मॉडल एक बहुत ही पुराने और सरल सांख्यिकीय तरीके, जिसे "लॉजिस्टिक्स रिग्रेशन" (Logistic Regression) कहा जाता है, से केवल थोड़ा बेहतर प्रदर्शन कर पाए। कुछ मामलों में, वे सिक्का उछालकर अनुमान लगाने से भी मुश्किल से बेहतर थे।
  • क्यों? AI को पूरी रिपोर्ट दी गई थी और इसे "बस पढ़ने" के लिए कहा गया था। लेकिन वित्तीय धोखाधड़ी सूक्ष्म होती है। यह आमतौर पर कोई बड़ा रेड फ्लैग नहीं होता; बल्कि यह एक छोटा सा विरोधाभास होता है जो तीन पन्ने दूर स्थित एक तालिका के विपरीत होता है। AI, अपने वर्तमान "केवल पढ़ने" वाले मोड में, इन कनेक्शनों को पकड़ने में विफल रहा।

4. बड़ा सबक: केवल पढ़ना काफी नहीं है

पेपर निष्कर्ष निकालता है कि केवल एक AI को दस्तावेज़ थमा देना उसे वित्तीय विशेषज्ञ बनाने के लिए पर्याप्त नहीं है।

  • रूपक: एक AI को वार्षिक रिपोर्टों का ढेर देना एक जासूस को 500 पन्नों का रहस्यमयी उपन्यास देने जैसा है और यह कहना कि, "अपराध सुलझाओ।" जासूस को एक आवर्धक लेंस (magnifying glass), सुरागों को जोड़ने के लिए एक व्हाइटबोर्ड और शायद विशेषज्ञों की एक टीम की आवश्यकता होती है।
  • भविष्य: AI को वित्त के लिए उपयोगी बनाने के लिए, हमें "स्कैफोल्डिंग" (scaffolding) बनानी होगी। इसका अर्थ है AI को वास्तविक दुनिया के परिदृश्यों का अनुकरण करने के लिए उपकरण देना, उसे प्रश्न पूछने देना, उसे डेटा को क्रॉस-रेफरेंस करने देना और उसकी तर्क प्रक्रिया का समर्थन करना। हमें "पैसिव रीडर" (निष्क्रिय पाठक) से "एक्टिव एनालिस्ट" (सक्रिय विश्लेषक) बनने की आवश्यकता है।

सारांश

EDINET-Bench एक चेतावनी है। यह दिखाता है कि हालांकि AI कई चीजों में अद्भुत है, लेकिन यह उच्च-दांव वाले, सूक्ष्म वित्तीय विश्लेषण की दुनिया में अभी भी बहुत अनाड़ी है। शोधकर्ता अपना डेटा और टूल्स जनता के लिए जारी कर रहे हैं ताकि अन्य वैज्ञानिक भविष्य के लिए बेहतर, अधिक "वित्तीय रूप से साक्षर" AI बनाने में मदद कर सकें।

संक्षेप में: AI स्मार्ट है, लेकिन यह अभी वॉल स्ट्रीट विश्लेषक बनने के लिए तैयार नहीं है। इसे संख्याओं के पीछे की छिपी कहानियों को समझने के लिए अधिक प्रशिक्षण और बेहतर उपकरणों की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →