← नवीनतम पेपर
💰 quantitative finance

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

यह शोध पत्र UniFinEval को प्रस्तुत करता है, जो पांच मुख्य वित्तीय परिदृश्यों में टेक्स्ट, इमेज और वीडियो को कवर करने वाला पहला एकीकृत मल्टीमॉडल बेंचमार्क है, जो यह प्रकट करता है कि हालांकि Gemini-3-pro-preview जैसे वर्तमान मॉडल प्रदर्शन में अग्रणी हैं, फिर भी वे उच्च-घनत्व वाली जानकारी और जटिल तर्क को संभालने में वित्तीय विशेषज्ञों से काफी पीछे हैं।

मूल लेखक: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin
प्रकाशित 2026-02-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाले निवेश फर्म (investment firm) को चलाने में मदद करने के लिए एक नया सहायक नियुक्त कर रहे हैं। इस सहायक को एक "सुपर-एनालिस्ट" होना चाहिए जो घने वित्तीय रिपोर्ट पढ़ सके, जटिल चार्टों की व्याख्या कर सके, घंटों के मार्केट एनालिसिस वीडियो देख सके, और फिर यह निर्णय ले सके कि पैसा कहाँ लगाना है।

लंबे समय से, हम इन AI सहायकों का सरल क्विज़ के साथ परीक्षण कर रहे हैं—जैसे कि उन्हें एक पैराग्राफ पढ़ने या एक साधारण ग्राफ को पहचानने के लिए कहना। लेकिन वास्तविक दुनिया में, वित्त (finance) बहुत अव्यवस्थित होता है। यह एक नक्शा पढ़ते हुए, रेडियो प्रसारण सुनते हुए और एक लाइव वीडियो फीड देखते हुए, एक तूफानी समुद्र में नेविगेट करने जैसा है। पुराने परीक्षण बहुत आसान थे और वे वास्तविक काम के अराजक वातावरण को नहीं दर्शाते थे।

एंट्री "UniFinEval": द अल्टीमेट फाइनेंशियल बूटकैंप

इस शोध पत्र के लेखकों ने एक नया, अत्यंत चुनौतीपूर्ण परीक्षण बनाया जिसे UniFinEval कहा जाता है। इसे एक "सर्वाइवल कोर्स" के रूप में सोचें, जिसे विशेष रूप से AI मॉडल्स के लिए डिज़ाइन किया गया है ताकि यह देखा जा सके कि क्या वे वास्तविक वित्त के उच्च-दबाव और सूचना-अतिभार (information-overload) वाले वातावरण को संभाल सकते हैं।

उन्होंने इस बूटकैंप को इस प्रकार बनाया है:

1. बूटकैंप के पांच स्तर

केवल एक प्रकार का प्रश्न पूछने के बजाय, इस परीक्षण को पांच वास्तविक परिदृश्यों में विभाजित किया गया है, जो आगे बढ़ते हुए कठिन होते जाते हैं:

  • स्तर 1: द डिटेक्टिव (वित्तीय विवरण ऑडिटिंग): कल्पना कीजिए कि एक जासूस एक बिखरे हुए अपराध स्थल को देख रहा है। AI को एक ऐसी वित्तीय रिपोर्ट में छोटी विसंगतियों को खोजना होगा जो टेक्स्ट, चार्ट और भ्रमित करने वाले लेआउट से भरी हुई है। यह एक 100 पन्नों के दस्तावेज़ में एक एकल टाइपो खोजने जैसा है, जबकि कोई आपके कान में चिल्लाकर आपका ध्यान भटका रहा हो।
  • स्तर 2: द इन्वेस्टिगेटर (कंपनी फंडामेंटल रीजनिंग): अब AI को यह समझना है कि क्या कोई कंपनी वास्तव में स्वस्थ है। इसे विभिन्न रिपोर्टों से आंकड़े निकालने, जटिल गणित करने और एक टेक्स्ट विवरण तथा एक ग्राफ के बीच संबंध जोड़ने की आवश्यकता है। यह एक ऐसी पहेली को सुलझाने जैसा है जिसके टुकड़े अलग-अलग भाषाओं में हैं।
  • स्तर 3: द ट्रेंड स्पॉटर (इंडस्ट्री ट्रेंड इनसाइट्स): AI अब ज़ूम आउट करता है। अब वह केवल एक कंपनी को नहीं देख रहा है, बल्कि पूरे उद्योग को देख रहा है। उसे बड़े पैटर्न को पहचानने के लिए समय के साथ दर्जनों कंपनियों की तुलना करनी होगी। यह एक फुटबॉल मैच देखने और केवल स्टार क्वार्टरबैक के प्रदर्शन के आधार पर नहीं, बल्कि मैदान पर मौजूद हर एक खिलाड़ी के प्रदर्शन के आधार पर विजेता का अनुमान लगाने जैसा है।
  • स्तर 4: द रडार (फाइनेंशियल रिस्क सेंसिंग): यह डरावना हिस्सा है। AI को एक मार्केट एनालिस्ट की बात करते हुए वीडियो देखना होगा, साथ ही एक रिपोर्ट पढ़नी होगी और एक चार्ट देखना होगा। उसे शोर के बीच दबे हुए छिपे खतरों (जोखिमों) को पहचानना होगा। यह तूफान के बीच एक फुसफुसाहट सुनने की कोशिश करने जैसा है।
  • स्तर 5: द जनरल (एसेट एलोकेशन एनालिसिस): अंतिम बॉस लेवल। AI को पिछले चार स्तरों से सीखी गई सभी चीजों को लेना होगा और निवेश करने के बारे में अंतिम निर्णय लेना होगा, जिसमें सभी जोखिमों और नियमों को संतुलित करना होगा। यह वह क्षण है जब जनरल को यह तय करना होता है कि सैनिकों को कहाँ भेजना है।

2. खेल के नियम

  • कोई धोखाधड़ी नहीं: परीक्षण के प्रश्न अन्य AI द्वारा नहीं लिखे गए थे (जो गलतियाँ कर सकते हैं या झूठ बोल सकते हैं)। उन्हें वास्तविक मानव विशेषज्ञों द्वारा लिखा गया था—ऐसे लोग जिनके पास उन्नत डिग्रियाँ और वित्त में वर्षों का अनुभव है।
  • मिश्रण: यह परीक्षण टेक्स्ट, इमेज और वीडियो को एक साथ उपयोग करता है। आप केवल उत्तर पढ़ नहीं सकते; आपको संदर्भ समझने के लिए चार्ट को "देखना" और वीडियो को "देखना" होगा।
  • आकार: उन्होंने अंग्रेजी और चीनी दोनों भाषाओं में लगभग 4,000 ऐसे कठिन प्रश्न तैयार किए हैं।

3. परिणाम: कौन पास हुआ?

शोधकर्ताओं ने 10 सबसे स्मार्ट AI मॉडल्स ("छात्रों") को इस बूटकैंप के माध्यम से भेजा। यहाँ क्या हुआ:

  • शीर्ष प्रदर्शन करने वाला: एक मॉडल, Gemini-3-pro-preview, शीर्ष पर आया। उसने लगभग 74% उत्तर सही दिए। यह अच्छा लगता है, लेकिन याद रखें, यह एक बहुत कठिन परीक्षण है।
  • अंतराल: यहाँ तक कि सर्वश्रेष्ठ AI भी एक मानव विशेषज्ञ की तुलना में बहुत सारी गलतियाँ करता है, जिसने लगभग 90-95% सही उत्तर दिए। AI टेक्स्ट पढ़ने में अच्छा है, लेकिन जब उसे वीडियो, चार्ट और रिपोर्ट के बीच संबंध जोड़ने की आवश्यकता होती है, तो वह संघर्ष करता है।
  • संघर्ष:
    • गणित की समस्या: कई मॉडल्स सरल गणित में गलत हो गए।
    • हैलुसिनेशन (Hallucinations): कुछ मॉडल्स ने ऐसे तथ्य बना दिए जो वहां थे ही नहीं (जैसे कि एक छात्र उत्तर का अनुमान लगाता है क्योंकि वह यह कहने से डरता है कि "मुझे नहीं पता")।
    • "वीडियो" की समस्या: जब वीडियो शामिल थे, तो अधिकांश मॉडल्स भटक गए। वे समय के साथ कहानी का ट्रैक नहीं रख सके।
    • अंतिम बॉस: सबसे कठिन स्तर (एसेट एलोकेशन) में, AI का प्रदर्शन काफी गिर गया। वे जानकारी तो जुटा सकते थे, लेकिन वे भ्रमित हुए बिना अंतिम, जटिल निर्णय नहीं ले सके।

4. मुख्य निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि हालांकि AI सरल वित्तीय डेटा को पढ़ने और समझने में बहुत अच्छा हो रहा है, लेकिन यह जटिल, वास्तविक दुनिया की स्थितियों में मानव वित्तीय विशेषज्ञों को बदलने के लिए अभी तैयार नहीं है।

इसे इस तरह सोचें: AI एक ऐसे प्रतिभाशाली छात्र की तरह है जो पूरी लाइब्रेरी की किताबों को याद कर सकता है। लेकिन जब आप उन्हें एक लाइव वीडियो फीड, एक हिलते हुए हाथ और टिक-टिक करती घड़ी के साथ एक वास्तविक वॉर रूम में रखते हैं, तो वे घबराने लगते हैं और गलतियाँ करने लगते हैं।

लेखकों ने UniFinEval को यह दिखाने के लिए बनाया है कि AI कहाँ विफल होता है, ताकि डेवलपर्स इन विशिष्ट कमजोरियों को ठीक कर सकें, इससे पहले कि वे इन मॉडल्स पर वास्तविक पैसा भरोसे के साथ लगाएं। उन्होंने यह नहीं कहा कि AI जल्द ही शेयर बाजार चलाएगा; उन्होंने कहा, "यहाँ चट्टानों का एक नक्शा है, ताकि हमें पता चल सके कि AI के गिरने की संभावना कहाँ है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →