← नवीनतम पेपर
💬 NLP

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

यह शोध पत्र FinChain को प्रस्तुत करता है, जो मशीन-निष्पादन योग्य प्रतीकात्मक टेम्पलेट्स और CHAINEVAL मेट्रिक वाली सत्यापन योग्य चेन-ऑफ-थॉट (Chain-of-Thought) वित्तीय तर्क प्रक्रिया के लिए पहला बेंचमार्क है, जो वर्तमान LLMs की बहु-चरणीय वित्तीय विश्लेषण क्षमताओं में महत्वपूर्ण सीमाओं को प्रकट करता है और साथ ही डोमेन-अनुकूलित मॉडलों की क्षमता को भी उजागर करता है।

मूल लेखक: Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xi
प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप भविष्य में आपके पास कितने पैसे होंगे, इसकी गणना करने में मदद करने के लिए एक वित्तीय सलाहकार (financial advisor) को काम पर रख रहे हैं। आप नहीं चाहते कि वे बस आपको एक अंतिम संख्या थमा दें; आप चाहते हैं कि वे अपना काम दिखाएं। आप जानना चाहते हैं: क्या उन्होंने सही फॉर्मूला इस्तेमाल किया? क्या उन्होंने संख्याओं को सही ढंग से जोड़ा? क्या वे गणना के बीच में ही रास्ता भटक गए?

यह शोध पत्र FINCHAIN पेश करता है, जो एक नया "टेस्ट" है जिसे विशेष रूप से यह जांचने के लिए डिज़ाइन किया गया है कि क्या AI मॉडल अंत में केवल सही उत्तर का अनुमान लगाने के बजाय, इस तरह की चरण-दर-चरण वित्तीय गणित को सही ढंग से कर सकते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके शोध पत्र के विचारों का विवरण दिया गया है:

1. समस्या: वित्तीय AI का "ब्लैक बॉक्स" (The Black Box of Financial AI)

वर्तमान में, अधिकांश वित्तीय AI परीक्षण एक ऐसे शिक्षक की तरह हैं जो केवल गणित के टेस्ट में अंतिम उत्तर को ग्रेड देते हैं। यदि कोई छात्र उत्तर में "100" लिखता है, तो उन्हें एक स्टार मिल जाता है, भले ही उन्होंने अपने काम में "2 + 2 = 5" और फिर "5 + 95 = 100" लिखा हो।

लेखकों का कहना है कि वित्त में यह खतरनाक है। यदि कोई AI गलती से या किसी पुराने पैटर्न को कॉपी करके सही नंबर प्राप्त कर लेता है, तो वह बाद में आपको गलत सलाह दे सकता है। मौजूदा परीक्षण (जैसे FinQA) अंतिम संख्या पर बहुत अधिक ध्यान केंद्रित करते हैं और उन बीच के जटिल चरणों को अनदेखा कर देते हैं जहाँ AI वास्तव में झूठ बोल रहा हो सकता है या गलतियाँ कर रहा हो सकता है।

2. समाधान: FINCHAIN (द ट्रांसपेरेंट किचन)

इसे ठीक करने के लिए, टीम ने FINCHAIN बनाया है। इसे वित्तीय गणित के लिए एक "पारदर्शी रसोई" (transparent kitchen) के रूप में समझें।

  • यह कैसे काम करता है: मानव प्रश्न लिखने के बजाय, उन्होंने हजारों वित्तीय समस्याओं को स्वचालित रूप से उत्पन्न करने के लिए कंप्यूटर कोड (Python) का उपयोग किया।
  • "रेसिपी" (The Recipe): प्रत्येक समस्या के साथ एक पूर्ण, पूर्व-लिखित "रेसिपी" (सही विचार श्रृंखला/chain of thought) आती है जिसे कंप्यूटर उत्तर को सत्यापित करने के लिए चला सकता है।
  • "मेन्यू" (The Menu): उन्होंने 58 विभिन्न विषयों (जैसे चक्रवृद्धि ब्याज, टैक्स, क्रिप्टो और जोखिम प्रबंधन) को कवर करने वाला एक विशाल मेन्यू बनाया है जो 12 वित्तीय डोमेन में फैला हुआ है।
  • "लेवल" (The Levels): बिल्कुल एक वीडियो गेम की तरह, समस्याएं "आसान" (साधारण ब्याज) से लेकर "उन्नत" (जटिल बहु-चरणीय निवेश परिदृश्य) तक के स्तरों में विभाजित हैं।

चूंकि "गोल्ड स्टैंडर्ड" उत्तर कोड द्वारा उत्पन्न किए जाते हैं, इसलिए टेस्ट तुरंत जान सकता है कि AI का तर्क गणितीय रूप से सटीक है या वह केवल कल्पना (hallucinating) कर रहा है।

3. स्कोरकार्ड: CHAINEVAL (द डबल-चेक)

लेखकों ने महसूस किया कि केवल यह जांचना कि अंतिम संख्या सही है या नहीं, पर्याप्त नहीं है। उन्होंने CHAINEVAL नामक एक नया स्कोरिंग सिस्टम बनाया।

एक जिम्नास्टिक्स प्रतियोगिता में जज की कल्पना करें।

  • पुराने जज: केवल इस बात को देखते थे कि जिम्नास्ट अपने पैरों पर लैंड हुआ या नहीं (अंतिम उत्तर)।
  • CHAINEVAL: लैंडिंग के साथ-साथ उस तक पहुँचने के लिए किए गए हर फ्लिप, ट्विस्ट और बैलेंस बीम मूव को भी देखता है।

यह स्कोर दो चीजों को एक साथ जांचता है:

  1. क्या चरण तर्कसंगत थे? (Semantic alignment: क्या AI ने सही अवधारणाओं के बारे में बात की?)
  2. क्या संख्याएँ मेल खाती थीं? (Numerical consistency: क्या चरणों में की गई गणित वास्तव में आपस में जुड़ रही थी?)

यदि AI अंतिम उत्तर सही पाता है लेकिन चरण निरर्थक हैं, तो CHAINEVAL उसे कम स्कोर देता है।

4. परिणाम: "स्मार्ट" AI अभी भी संघर्ष कर रहा है

टीम ने 26 अलग-अलग AI मॉडलों का परीक्षण किया (OpenAI, Google और Anthropic जैसे सबसे बड़े, प्रसिद्ध मॉडलों और छोटे, विशिष्ट वित्त मॉडलों सहित)।

यहाँ उनके निष्कर्ष दिए गए हैं:

  • "फ्रंटियर" मॉडल (The Frontier Models): सबसे बड़े, सबसे उन्नत AI (जैसे GPT-5 और Gemini) समग्र रूप से सबसे अच्छा प्रदर्शन करते हैं, लेकिन वे अभी भी सबसे कठिन, बहु-चरणीय समस्याओं पर महत्वपूर्ण गलतियाँ करते हैं। वे उन प्रतिभाशाली छात्रों की तरह हैं जो कभी-कभी लंबे वर्ड प्रॉब्लम्स में रास्ता भटक जाते हैं।
  • "विशेषज्ञ" मॉडल (The Specialized Models): कुछ मॉडल विशेष रूप रूप से वित्त या गणित पर प्रशिक्षित किए गए थे। वे बेहतर हुए, लेकिन वे दिग्गजों के अंतर को पूरी तरह से नहीं भर सके।
  • "गणित" मॉडल (The Math Models): गणित पर भारी प्रशिक्षण प्राप्त मॉडलों ने सरल संख्याओं पर अच्छा प्रदर्शन किया, लेकिन वे अक्सर तब विफल रहे जब समस्या के लिए वित्तीय अवधारणाओं (जैसे नियम या विशिष्ट व्यावसायिक नियम) को समझने की आवश्यकता थी।
  • बड़ा निष्कर्ष: आज का सबसे स्मार्ट AI भी विश्वसनीय रूप से लंबी, जटिल वित्तीय तर्क श्रृंखलाओं को करने के लिए संघर्ष करता है। वे अक्सर भाग्य या पैटर्न मिलान के माध्यम से अंतिम नंबर सही पाते हैं, लेकिन उनकी "सोचने की प्रक्रिया" अस्थिर होती है।

5. यह क्यों महत्वपूर्ण है

शोध पत्र का तर्क है कि यदि हमें AI पर वास्तविक धन के लिए भरोसा करना है, तो हमें उसके सोचने की प्रक्रिया का ऑडिट (audit) करने में सक्षम होना चाहिए। FINCHAIN हमें यह करने के लिए पहला उपकरण प्रदान करता है। यह हमें स्पष्ट रूप से दिखाता है कि AI कहाँ विफल होता है—चाहे वह गणित की त्रुटि हो, किसी वित्तीय नियम की गलत समझ हो, या केवल मनगढ़ंत बातें बनाना (hallucination) हो।

संक्षेप में: शोध पत्र कहता है, "हमने एक कठोर, पारदर्शी परीक्षण बनाया है यह देखने के लिए कि क्या AI वास्तव में चरण-दर-चरण वित्तीय गणित कर सकता है। हमने पाया कि भले ही सबसे स्मार्ट AI भी जटिल होने पर तर्क करने में त्रुटियों के प्रति संवेदनशील होते हैं, और हमें अपने पैसे के साथ उन पर भरोसा करने से पहले उनके काम की जांच करने के बेहतर तरीकों की आवश्यकता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →