← नवीनतम पेपर
💰 quantitative finance

FinTradeBench: A Financial Reasoning Benchmark for LLMs

यह शोध पत्र FinTradeBench प्रस्तुत करता है, जो एक व्यापक वित्तीय तर्क बेंचमार्क है जिसमें 1,400 प्रश्न शामिल हैं जो कंपनी के बुनियादी सिद्धांतों (fundamentals) और ट्रेडिंग संकेतों को एकीकृत करते हैं ताकि जटिल, बहु-आयामी (multi-modal) वित्तीय निर्णय लेने वाले कार्यों को संभालने में बड़े भाषा मॉडल (LLMs) की वर्तमान सीमाओं का मूल्यांकन और खुलासा किया जा सके।

मूल लेखक: Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan, Santu Karmaker, Aritra Dutta

प्रकाशित 2026-03-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan, Santu Karmaker, Aritra Dutta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह तय करने की कोशिश कर रहे हैं कि क्या आपको एक घर खरीदना चाहिए। आपके पास देखने के लिए दो बहुत अलग प्रकार की जानकारी है:

  1. घर का निरीक्षण रिपोर्ट (बुनियादी बातें): यह उबाऊ, कानूनी कागजी कार्रवाई है। यह आपको बताता है कि घर में कितने कमरे हैं, छत कितनी पुरानी है, या मालिक पर कितना होम लोन बकाया है। यह तथ्यात्मक है, टेक्स्ट में लिखा गया है, और आधिकारिक रिकॉर्ड से आता है।
  2. पड़ोस का माहौल (ट्रेडिंग सिग्नल): यह बाहर की ऊर्जा है। क्या सड़क लोगों से भरी हुई है? क्या "बिक्री के लिए" (For Sale) के बोर्ड लग रहे हैं या कम हो रहे हैं? क्या घर की कीमत रोलरकोस्टर की तरह ऊपर-नीचे बहुत तेजी से उछल रही है? यह गति, रफ्तार और एहसास के बारे में है।

लंबे समय से, AI मॉडल ("स्मार्ट कंप्यूटर") घर की निरीक्षण रिपोर्ट को पढ़ने में बहुत अच्छे रहे हैं। वे कागजी कार्रवाई का सटीक सारांश निकाल सकते हैं। लेकिन वे पड़ोस के माहौल को समझने में बहुत खराब रहे हैं। जब आप उनसे पूछते हैं, "कागज पर तो घर बहुत अच्छा दिख रहा है, लेकिन इसकी कीमत हर दिन क्यों गिर रही है? क्या मुझे इसे खरीदना चाहिए?" तो वे भ्रमित हो जाते हैं।

पेश है FinTradeBench

सेंट्रल फ्लोरिडा यूनिवर्सिटी के शोधकर्ताओं ने एक नया "टेस्ट" बनाया है जिसे FinTradeBench कहा जाता है। इसे एक विशाल, 1,400-प्रश्नों वाली पॉप क्विज़ की तरह समझें, जो विशेष रूप से AI के लिए बनाई गई है, ताकि यह देखा जा सके कि क्या वे कागजी कार्रवाई और पड़ोस के माहौल दोनों को एक साथ संभाल सकते हैं।

यहाँ उनका सरल विवरण दिया गया है कि उन्हें क्या मिला:

1. टेस्ट: तीन प्रकार के प्रश्न

क्विज़ में तीन खंड थे:

  • अकाउंटेंट (लेखाकार): "कंपनी का लाभ क्या है?" (शुद्ध कागजी कार्रवाई)।
  • ट्रेडर (व्यापारी): "स्टॉक की कीमत ऊपर जा रही है या नीचे?" (शुद्ध गति)।
  • हाइब्रिड (मिश्रित): "कंपनी लाभदायक है, लेकिन स्टॉक की कीमत गिर रही है। क्या यह खरीदने का सही समय है?" (इसके लिए दोनों को मिलाने की आवश्यकता है)।

2. "जादुई चश्मे" (RAG)

AI की मदद करने के लिए, शोधकर्ताओं ने उन्हें RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक "जादुई चश्मे" दिए। यह AI को एक लाइब्रेरी कार्ड देने जैसा है ताकि वह याददाश्त से अनुमान लगाने के बजाय सटीक तथ्यों को देख सके।

  • अच्छी खबर: जब सवाल अकाउंटेंट (कागजी कार्रवाई) के बारे में थे, तो जादुई चश्मों ने कमाल कर दिया। AI का स्कोर लगभग 37% बढ़ गया। वह बिना कुछ मनगढ़ंत कहे बारीक विवरण को आखिरकार पढ़ सका।
  • बुरी खबर: जब सवाल ट्रेडर (कीमतों की हलचल) के बारे में थे, तो जादुमी चश्मों ने वास्तव में AI को नुकसान पहुँचाया। स्कोर गिर गया। क्यों? क्योंकि AI अभिभूत (overwhelmed) हो गया। वह कच्चे नंबरों (जैसे स्टॉक कीमतों का स्प्रेडशीट) की दीवार को घूर रहा था और उसे नहीं पता था कि उन नंबरों को एक कहानी में कैसे बदला जाए। वह शोर (noise) से विचलित हो गया।

3. "सबसे स्मार्ट" AI बनाम "सबसे तेज़" AI

शोधकर्ताओं ने 14 अलग-अलग AI मॉडल का परीक्षण किया।

  • "रीज़नर" (जैसे DeepSeek-R1): ये मॉडल जासूसों की तरह हैं जो कदम-दर-कदम सोचते हैं। वे हाइब्रिड सवालों के लिए सबसे अच्छे थे। वे लाभ और कीमत में गिरावट दोनों को देख सकते थे और कह सकते थे, "आह, बाजार डरा हुआ है, लेकिन कंपनी वास्तव में स्वस्थ है। यह खरीदने का एक अवसर है।"
  • "समराइज़र" (जैसे LLaMA): ये मॉडल तेज पाठकों की तरह हैं जो टेक्स्ट का सारांश देते हैं। जादुई चश्मे मिलने पर वे भ्रमित हो गए। उन्होंने पूरा दस्तावेज़ पढ़ा लेकिन मुख्य बात चूक गए। वे अतिरिक्त जानकारी से "विचलित" हो गए और बिना चश्मे के दिए गए जवाबों से भी खराब उत्तर दिए।

4. "बड़ी सीख: संदर्भ राजा है, लेकिन संरचना रानी है"

सबसे आश्चर्यजनक खोज यह थी कि जानकारी कैसे प्रस्तुत की गई थी।

  • जब AI को कच्चा डेटा (स्टॉक की कीमतों की एक अव्यवस्थित सूची) दिया गया, तो वह विफल रहा।
  • जब AI को पूर्व-गणना की गई अंतर्दृष्टि (जैसे, "स्टॉक अपने औसत से 15% ऊपर है") दी गई, तो वह सफल रहा।

उपमा (Analogy): एक शेफ को सूप बनाने के लिए पूछने की कल्पना करें।

  • No-RAG: आप उन्हें एक रेसिपी बुक देते हैं, लेकिन सामग्री नहीं देते। वे अनुमान लगाते हैं।
  • Standard RAG: आप उन्हें रेसिपी बुक देते हैं और कच्चे, बिना छिले और बिना कटे सब्जियों का एक बड़ा थैला देते हैं। वे रेसिपी पढ़ते हुए सब कुछ काटने की कोशिश में अभिभूत हो जाते हैं।
  • Ideal RAG: आप उन्हें रेसिपी बुक देते हैं और पूरी तरह से कटे हुए, पहले से मापे गए मसालों और सामग्रियों का एक कटोरा देते हैं। वे एक बेहतरीन सूप बनाते हैं।

यह क्यों मायने रखता है?

वर्तमान में, यदि आप AI से पूछते हैं, "क्या मुझे टेस्ला का स्टॉक खरीदना चाहिए?" तो यह अर्निंग रिपोर्ट (अच्छा) देख सकता है और स्टॉक चार्ट (खराब) को देखकर भ्रमित हो सकता है, जिससे आपको गलत उत्तर मिल सकता है।

यह पेपर साबित करता है कि:

  1. AI को गणित और नंबरों के साथ मदद की जरूरत है। उन्हें सिर्फ अधिक टेक्स्ट देना काफी नहीं है; उन्हें गणना करने के लिए उपकरणों की आवश्यकता है।
  2. डेटा को खिलाने का तरीका मायने रखता है। यदि हम चाहते हैं कि AI एक वित्तीय सलाहकार बने, तो हम केवल कच्चा डेटा उन पर नहीं डाल सकते। हमें डेटा को इस तरह व्यवस्थित करना होगा कि वे उसके बारे में "सोच" सकें, न कि केवल उसे "पढ़" सकें।

संक्षेप में: हमने एक बेहतर टेस्ट बनाया है यह दिखाने के लिए कि हालांकि AI वित्तीय रिपोर्ट पढ़ने में स्मार्ट हो रहा है, फिर भी वह शेयर बाजार की अराजक, चलती-फिरती दुनिया को समझने में संघर्ष करता है। इसे ठीक करने के लिए, हमें AI को केवल पढ़ना ही नहीं, बल्कि गणित करना भी सिखाना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →