← नवीनतम पेपर
💻 computer science

FinDocMRE: A Benchmark for Document-Level Financial Multimodal Reasoning Evaluation

यह शोध पत्र FinDocMRE को प्रस्तुत करता है, जो वित्तीय रिपोर्टों से 12,000 से अधिक नमूनों वाला एक व्यापक मल्टी-इमेज डॉक्यूमेंट-लेवल बेंचमार्क है, जो जटिल वित्तीय तर्क के लिए टेक्स्ट, टेबल और इमेजेस को एकीकृत करने में वर्तमान लार्ज मल्टीमॉडल मॉडल्स की सीमाओं का कठोरता से मूल्यांकन करने और उन्हें उजागर करने के लिए बनाया गया है।

मूल लेखक: Jiayong Zhu, Jiangtong Li, Jinru Ding, Dawei Cheng, Jie Xu, Feng Yu

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayong Zhu, Jiangtong Li, Jinru Ding, Dawei Cheng, Jie Xu, Feng Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए वित्तीय विश्लेषक (financial analyst) को काम पर रख रहे हैं। आपके पास एक विशाल, 100 पन्नों की रिपोर्ट है जो टेक्स्ट, जटिल स्प्रेडशीट्स और अलग-अलग पन्नों पर बिखरे हुए रंगीन चार्टों से भरी हुई है। आप यह देखना चाहते हैं कि क्या आपका नया कर्मचारी पूरी तस्वीर को देख सकता है, पेज 5 के चार्ट और पेज 40 की टेबल के बीच संबंध जोड़ सकता है, और सटीक उत्तर देने के लिए गणित सही ढंग से कर सकता है।

यह पेपर, FinDocMRE, बिल्कुल इसी बारे में है। यह एक विशाल "फाइनल एग्जाम" है जिसे यह परीक्षण करने के लिए बनाया गया है कि आर्टिफिशियल इंटेलिजेंस (AI) इन अव्यवस्थित, वास्तविक दुनिया के वित्तीय दस्तावेजों को कितनी अच्छी तरह संभाल सकता है।

यहाँ शोधकर्ताओं ने क्या किया और उन्हें क्या पता चला, इसका विवरण सरल उपमाओं (analogies) का उपयोग करते हुए दिया गया है:

1. समस्या: "सिंगल-चार्ट" का जाल

अब तक, अधिकांश AI टेस्ट एक छात्र को कागज के एक टुकड़े पर एक अलग, आइसोलेटेड गणित के सवाल दिखाने जैसे थे। AI उसे आसानी से हल कर सकता था। लेकिन वास्तविक वित्तीय दुनिया में, जानकारी अलग-थलग नहीं होती है। यह एक जिग्सॉ पहेली (jigsaw puzzle) की तरह है जहाँ टुकड़े एक पूरी किताब में बिखरे हुए हैं।

  • समस्या: मौजूदा AI मॉडल एक चार्ट को देखने और यह कहने में बहुत अच्छे हैं कि "ओह, यह रेखा ऊपर जा रही है।" लेकिन जब उनसे यह पूछने को कहा जाता है कि "पेज 10 के चार्ट से संख्या लें, उसे पेज 30 की टेबल में दिए गए प्रतिशत से गुणा करें, और मुझे कुल लागत बताएं," तो वे संघर्ष करते हैं।
  • कमी: ऐसा कोई बड़ा, कठिन परीक्षण नहीं था जिसने AI को इस "डॉक्यूमेंट-लेवल" तर्क (reasoning) करने के लिए मजबूर किया हो।

2. समाधान: "FinDocMRE" परीक्षा का निर्माण

टीम ने एक विशाल नया बेंचमार्क (एक टेस्ट सेट) बनाया जिसे FinDocMRE कहा जाता है। इसे AI के लिए भारी वजन उठाने के अभ्यास के लिए एक जिम बनाने के रूप में समझें।

  • डेटासेट: उन्होंने 2,878 वास्तविक वित्तीय रिपोर्ट (जैसे बड़ी कंपनियों की वार्षिक रिपोर्ट) एकत्र कीं और उनमें से 12,207 विशिष्ट प्रश्न निकाले।
  • गुणवत्ता का "नुस्खा" (Recipe): उन्होंने केवल कंप्यूटर को प्रश्न लिखने के लिए नहीं कहा, क्योंकि कंप्यूटर कभी-कभी तथ्य बना लेते हैं (जिसे "hallucination" कहा जाता है)। इसके बजाय, उन्होंने एक तीन-चरणीय नुस्खा का उपयोग किया:
    1. रोबोट शेफ: एक AI ने केवल छवियों और चार्टों के आधार पर प्रश्न उत्पन्न किए, आसपास के टेक्स्ट को अनदेखा करते हुए ताकि वह डेटा को "देखने" के लिए मजबूर हो सके।
    2. मानवीय स्वाद-परीक्षक (Human Taste-Testers): तीन वास्तविक वित्तीय विशेषज्ञों (जैसे वरिष्ठ विश्लेषकों) ने प्रत्येक प्रश्न की समीक्षा की। यदि प्रश्न भ्रमित करने वाला था, गणित गलत था, या चार्ट का संदर्भ गलत था, तो उन्होंने उसे कचरे में डाल दिया।
    3. अंतिम चयन: केवल लगभग 55% जनरेट किए गए प्रश्नों को ही चुना गया। इसने यह सुनिश्चित किया कि अंतिम परीक्षा अविश्वसनीय रूप से उच्च गुणवत्ता वाली और कठिन हो।

3. परिणाम: "एनालिस्ट बनाम कैलकुलेटर" का विभाजन

शोधकर्ताओं ने उपलब्ध 11 सबसे स्मार्ट AI मॉडलों (GPT-5, Gemini और Qwen जैसे बड़े नामों सहित) का इस परीक्षा के विरुद्ध परीक्षण किया। उन्होंने AI की तुलना करने के लिए वास्तविक मानव वित्तीय विशेषज्ञों को भी बुलाया।

यहाँ उन्होंने क्या खोजा:

  • स्कोरबोर्ड: सबसे अच्छा AI मॉडल केवल 100 में से लगभग 64 अंक प्राप्त कर सका। मानव विशेषज्ञों ने लगभग 79 अंक प्राप्त किए। अभी भी एक बड़ा अंतर है।
  • "स्टोरीटेलर" बनाम "मैथ व्हिज" (Math Whiz):
    • कहानियों में अच्छे: AI मॉडल आश्चर्यजनक रूप से लंबे, सुसंगत सारांश लिखने में अच्छे हैं। यदि आपसे पूछा जाए, "इस कंपनी का सामान्य रुझान क्या है?" तो वे एक बेहतरीन पैराग्राफ लिख सकते हैं।
    • गणित और नेविगेशन में खराब: जब सटीक गणना करने या पेज 5 के चार्ट को देखते हुए पेज 45 पर छिपी किसी विशिष्ट संख्या को खोजने के लिए कहा गया, तो वे अक्सर विफल रहे। वे या तो गलत नंबर दे देते थे या यह मिला देते थे कि कौन सा चार्ट किस वर्ष का है।
  • "बीच में खो जाने" का प्रभाव (Lost in the Middle Effect): जैसे-जैसे दस्तावेज़ लंबे होते गए और AI को अधिक छवियों (जैसे एक साथ 3 या 4 अलग-अलग चार्ट) को देखना पड़ा, AI का प्रदर्शन गिर गया। यह एक साथ तीन अलग-अलग फोन नंबर याद रखने की कोशिश करने जैसा है; आप जितने अधिक जोड़ते जाएंगे, उनके आपस में मिलने की संभावना उतनी ही बढ़ जाएगी।

4. मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि AI "देखने" और "बोलने" में बेहतर हो रहा है, लेकिन यह एक पेशेवर वित्तीय विश्लेषक की तरह कार्य करने के लिए अभी भी संघर्ष कर रहा है।

  • रुकावट (Bottleneck): मुख्य समस्या यह नहीं है कि AI शब्दों को नहीं पढ़ सकता; बल्कि यह है कि वह जटिल दस्तावेज़ों में बिखरे हुए विशिष्ट दृश्य साक्ष्यों (visual evidence) के आधार पर अपने तर्क को विश्वसनीय रूप से स्थापित (ground) नहीं कर सकता। यह एक ऐसे छात्र की तरह है जो लेखांकन (accounting) का सिद्धांत जानता है, लेकिन गणित करते समय स्प्रेडशीट की गलत लाइन को देखता रहता है।

संक्षेप में: FinDocMRE एक कठोर स्ट्रेस टेस्ट है जो दिखाता है कि वर्तमान AI एक बेहतरीन "निबंध लेखक" है लेकिन जटिल, बहु-पृष्ठीय वित्तीय रिपोर्टों के मामले में एक कमजोर "कैलकुलेटर" है। पेपर सुझाव देता है कि AI को वास्तव में मानव विश्लेषकों को बदलने के लिए, इसे इन विजुअल पहेलियों को सुलझाने में बहुत बेहतर होना होगा ताकि वह भटक न जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →