FinTradeBench: A Financial Reasoning Benchmark for LLMs
यह शोध पत्र FinTradeBench प्रस्तुत करता है, जो एक व्यापक वित्तीय तर्क बेंचमार्क है जिसमें 1,400 प्रश्न शामिल हैं जो कंपनी के बुनियादी सिद्धांतों (fundamentals) और ट्रेडिंग संकेतों को एकीकृत करते हैं ताकि जटिल, बहु-आयामी (multi-modal) वित्तीय निर्णय लेने वाले कार्यों को संभालने में बड़े भाषा मॉडल (LLMs) की वर्तमान सीमाओं का मूल्यांकन और खुलासा किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह तय करने की कोशिश कर रहे हैं कि क्या आपको एक घर खरीदना चाहिए। आपके पास देखने के लिए दो बहुत अलग प्रकार की जानकारी है:
- घर का निरीक्षण रिपोर्ट (बुनियादी बातें): यह उबाऊ, कानूनी कागजी कार्रवाई है। यह आपको बताता है कि घर में कितने कमरे हैं, छत कितनी पुरानी है, या मालिक पर कितना होम लोन बकाया है। यह तथ्यात्मक है, टेक्स्ट में लिखा गया है, और आधिकारिक रिकॉर्ड से आता है।
- पड़ोस का माहौल (ट्रेडिंग सिग्नल): यह बाहर की ऊर्जा है। क्या सड़क लोगों से भरी हुई है? क्या "बिक्री के लिए" (For Sale) के बोर्ड लग रहे हैं या कम हो रहे हैं? क्या घर की कीमत रोलरकोस्टर की तरह ऊपर-नीचे बहुत तेजी से उछल रही है? यह गति, रफ्तार और एहसास के बारे में है।
लंबे समय से, AI मॉडल ("स्मार्ट कंप्यूटर") घर की निरीक्षण रिपोर्ट को पढ़ने में बहुत अच्छे रहे हैं। वे कागजी कार्रवाई का सटीक सारांश निकाल सकते हैं। लेकिन वे पड़ोस के माहौल को समझने में बहुत खराब रहे हैं। जब आप उनसे पूछते हैं, "कागज पर तो घर बहुत अच्छा दिख रहा है, लेकिन इसकी कीमत हर दिन क्यों गिर रही है? क्या मुझे इसे खरीदना चाहिए?" तो वे भ्रमित हो जाते हैं।
पेश है FinTradeBench
सेंट्रल फ्लोरिडा यूनिवर्सिटी के शोधकर्ताओं ने एक नया "टेस्ट" बनाया है जिसे FinTradeBench कहा जाता है। इसे एक विशाल, 1,400-प्रश्नों वाली पॉप क्विज़ की तरह समझें, जो विशेष रूप से AI के लिए बनाई गई है, ताकि यह देखा जा सके कि क्या वे कागजी कार्रवाई और पड़ोस के माहौल दोनों को एक साथ संभाल सकते हैं।
यहाँ उनका सरल विवरण दिया गया है कि उन्हें क्या मिला:
1. टेस्ट: तीन प्रकार के प्रश्न
क्विज़ में तीन खंड थे:
- अकाउंटेंट (लेखाकार): "कंपनी का लाभ क्या है?" (शुद्ध कागजी कार्रवाई)।
- ट्रेडर (व्यापारी): "स्टॉक की कीमत ऊपर जा रही है या नीचे?" (शुद्ध गति)।
- हाइब्रिड (मिश्रित): "कंपनी लाभदायक है, लेकिन स्टॉक की कीमत गिर रही है। क्या यह खरीदने का सही समय है?" (इसके लिए दोनों को मिलाने की आवश्यकता है)।
2. "जादुई चश्मे" (RAG)
AI की मदद करने के लिए, शोधकर्ताओं ने उन्हें RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) नामक "जादुई चश्मे" दिए। यह AI को एक लाइब्रेरी कार्ड देने जैसा है ताकि वह याददाश्त से अनुमान लगाने के बजाय सटीक तथ्यों को देख सके।
- अच्छी खबर: जब सवाल अकाउंटेंट (कागजी कार्रवाई) के बारे में थे, तो जादुई चश्मों ने कमाल कर दिया। AI का स्कोर लगभग 37% बढ़ गया। वह बिना कुछ मनगढ़ंत कहे बारीक विवरण को आखिरकार पढ़ सका।
- बुरी खबर: जब सवाल ट्रेडर (कीमतों की हलचल) के बारे में थे, तो जादुमी चश्मों ने वास्तव में AI को नुकसान पहुँचाया। स्कोर गिर गया। क्यों? क्योंकि AI अभिभूत (overwhelmed) हो गया। वह कच्चे नंबरों (जैसे स्टॉक कीमतों का स्प्रेडशीट) की दीवार को घूर रहा था और उसे नहीं पता था कि उन नंबरों को एक कहानी में कैसे बदला जाए। वह शोर (noise) से विचलित हो गया।
3. "सबसे स्मार्ट" AI बनाम "सबसे तेज़" AI
शोधकर्ताओं ने 14 अलग-अलग AI मॉडल का परीक्षण किया।
- "रीज़नर" (जैसे DeepSeek-R1): ये मॉडल जासूसों की तरह हैं जो कदम-दर-कदम सोचते हैं। वे हाइब्रिड सवालों के लिए सबसे अच्छे थे। वे लाभ और कीमत में गिरावट दोनों को देख सकते थे और कह सकते थे, "आह, बाजार डरा हुआ है, लेकिन कंपनी वास्तव में स्वस्थ है। यह खरीदने का एक अवसर है।"
- "समराइज़र" (जैसे LLaMA): ये मॉडल तेज पाठकों की तरह हैं जो टेक्स्ट का सारांश देते हैं। जादुई चश्मे मिलने पर वे भ्रमित हो गए। उन्होंने पूरा दस्तावेज़ पढ़ा लेकिन मुख्य बात चूक गए। वे अतिरिक्त जानकारी से "विचलित" हो गए और बिना चश्मे के दिए गए जवाबों से भी खराब उत्तर दिए।
4. "बड़ी सीख: संदर्भ राजा है, लेकिन संरचना रानी है"
सबसे आश्चर्यजनक खोज यह थी कि जानकारी कैसे प्रस्तुत की गई थी।
- जब AI को कच्चा डेटा (स्टॉक की कीमतों की एक अव्यवस्थित सूची) दिया गया, तो वह विफल रहा।
- जब AI को पूर्व-गणना की गई अंतर्दृष्टि (जैसे, "स्टॉक अपने औसत से 15% ऊपर है") दी गई, तो वह सफल रहा।
उपमा (Analogy): एक शेफ को सूप बनाने के लिए पूछने की कल्पना करें।
- No-RAG: आप उन्हें एक रेसिपी बुक देते हैं, लेकिन सामग्री नहीं देते। वे अनुमान लगाते हैं।
- Standard RAG: आप उन्हें रेसिपी बुक देते हैं और कच्चे, बिना छिले और बिना कटे सब्जियों का एक बड़ा थैला देते हैं। वे रेसिपी पढ़ते हुए सब कुछ काटने की कोशिश में अभिभूत हो जाते हैं।
- Ideal RAG: आप उन्हें रेसिपी बुक देते हैं और पूरी तरह से कटे हुए, पहले से मापे गए मसालों और सामग्रियों का एक कटोरा देते हैं। वे एक बेहतरीन सूप बनाते हैं।
यह क्यों मायने रखता है?
वर्तमान में, यदि आप AI से पूछते हैं, "क्या मुझे टेस्ला का स्टॉक खरीदना चाहिए?" तो यह अर्निंग रिपोर्ट (अच्छा) देख सकता है और स्टॉक चार्ट (खराब) को देखकर भ्रमित हो सकता है, जिससे आपको गलत उत्तर मिल सकता है।
यह पेपर साबित करता है कि:
- AI को गणित और नंबरों के साथ मदद की जरूरत है। उन्हें सिर्फ अधिक टेक्स्ट देना काफी नहीं है; उन्हें गणना करने के लिए उपकरणों की आवश्यकता है।
- डेटा को खिलाने का तरीका मायने रखता है। यदि हम चाहते हैं कि AI एक वित्तीय सलाहकार बने, तो हम केवल कच्चा डेटा उन पर नहीं डाल सकते। हमें डेटा को इस तरह व्यवस्थित करना होगा कि वे उसके बारे में "सोच" सकें, न कि केवल उसे "पढ़" सकें।
संक्षेप में: हमने एक बेहतर टेस्ट बनाया है यह दिखाने के लिए कि हालांकि AI वित्तीय रिपोर्ट पढ़ने में स्मार्ट हो रहा है, फिर भी वह शेयर बाजार की अराजक, चलती-फिरती दुनिया को समझने में संघर्ष करता है। इसे ठीक करने के लिए, हमें AI को केवल पढ़ना ही नहीं, बल्कि गणित करना भी सिखाना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।