← नवीनतम पेपर
💰 quantitative finance

RealFin: How Well Do LLMs Reason About Finance When Users Leave Things Unsaid?

यह शोध पत्र REALFIN को प्रस्तुत करता है, जो एक द्विभाषी बेंचमार्क है जो प्रश्नों से आवश्यक आधारों को हटाकर वित्तीय तर्क का मूल्यांकन करता है, जिससे यह पता चलता है कि सामान्य और वित्त-विशेषज्ञ दोनों प्रकार के LLMs लुप्त जानकारी को पहचानने में संघर्ष करते हैं और अक्सर अनुचित उत्तरों के प्रति अत्यधिक प्रतिबद्ध रहते हैं।

मूल लेखक: Yuyang Dai, Yan Lin, Zhuohan Xie, Yuxia Wang

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuyang Dai, Yan Lin, Zhuohan Xie, Yuxia Wang

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वित्तीय सलाहकार (financial advisor) को काम पर रख रहे हैं। आप उनसे एक सवाल पूछते हैं जैसे, "क्या मुझे यह बॉन्ड खरीदना चाहिए?" एक वास्तव में भरोसेमंद सलाहकार केवल अंदाज़ा लगाकर जवाब नहीं देगा; वह पहले यह जांच करेगा कि क्या आपने उसे पर्याप्त जानकारी दी है। यदि आप अपनी जोखिम सहने की क्षमता (risk tolerance) या वर्तमान मुद्रास्फीति दर (inflation rate) का उल्लेख करना भूल गए हैं, तो एक अच्छा सलाहकार कहेगा, "मैं अभी इसका उत्तर नहीं दे सकता; मुझे और विवरणों की आवश्यकता है।"

यह शोध पत्र, RealFin, एक कठोर "ट्रैप टेस्ट" (trap test) की तरह है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या AI वित्तीय सलाहकार (Large Language Models) में भी वही सावधानी है।

यहाँ शोधकर्ताओं द्वारा किए गए कार्यों और उनकी खोजों का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. द ट्रैप (The Trap): "गायब सामग्री" वाली रेसिपी

अधिकांश AI परीक्षण एक आदर्श रेसिपी के साथ खाना पकाने जैसे होते हैं: "2 कप मैदा मिलाएं, 1 अंडा डालें और 30 मिनट तक बेक करें।" AI बस चरणों का पालन करता है और कहता है, "केक!"

RealFin टीम ने खेल बदल दिया। उन्होंने वास्तविक वित्तीय परीक्षा के प्रश्नों को लिया और गुप्त रूप से उनमें से एक प्रमुख सामग्री (जैसे तापमान या आटे का प्रकार) को निकाल दिया, लेकिन वाक्य को सामान्य दिखने के लिए बरकरार रखा।

  • पुराना तरीका: AI एक गायब चरण देखता है लेकिन फिर भी अंदाज़ा लगाने की कोशिश करता है, जैसे, "मैं मान लेता हूँ कि यह 350 डिग्री है!" और एक आत्मविश्वासी उत्तर देता है।
  • RealFin का तरीका: AI को यह एहसास होना चाहिए, "रुको, मैं तापमान जाने बिना यह केक नहीं बना सकता। मुझे उस जानकारी के लिए पूछना होगा।"

2. प्रयोग: कौन पकड़ा गया?

शोधकर्ताओं ने 15 अलग-अलग AI मॉडल का परीक्षण किया, जिनमें सामान्य "स्मार्ट" AI से लेकर विशेष "वित्त विशेषज्ञ" AI तक शामिल थे। उन्होंने उन्हें तीन प्रकार की चुनौतियाँ दीं:

  1. पूर्ण रेसिपी: सभी जानकारी वाले प्रश्न (आसान टेस्ट)।
  2. गायब सामग्री: छिपी हुई कमी वाले प्रश्न (द ट्रैप)।
  3. "इनमें से कोई भी नहीं" टेस्ट: प्रश्न जहाँ कोई भी उत्तर सही नहीं है क्योंकि जानकारी गायब है।

परिणाम:

  • "अति-आत्मविश्वासी" जनरललिस्ट्स (The "Over-Confident" Generalists): बड़े, सामान्य उद्देश्य वाले AI (जैसे वे जिनसे आप रोज़ चैट करते हैं) यह स्वीकार करने में सबसे खराब थे कि वे नहीं जानते। वे एक ऐसे छात्र की तरह व्यवहार करते थे जो अंक पाने के लिए परीक्षा में उत्तर का अनुमान लगाता है, भले ही प्रश्न असंभव हो। वे आत्मविश्वास से कहते थे, "उत्तर B है!" भले ही प्रश्न ही गलत था।
  • "विशेषज्ञ" विफलताएं (The "Specialist" Failures): आश्चर्यजनक रूप से, विशेष रूप से वित्त डेटा पर प्रशिक्षित मॉडल अक्सर गायब जानकारी को पहचानने में और भी खराब थे। क्योंकि उन्होंने "टैक्स" या "ऑडिट" जैसे शब्दों को याद कर लिया था, वे इन शब्दों से तुरंत सक्रिय हो जाते थे और गणना शुरू कर देते थे, इस तथ्य को अनदेखा करते हुए कि प्रश्न अधूरा था। यह एक मैकेनिक की तरह है जो "इंजन की आवाज़" सुनता है और तुरंत कार्बोरेटर ठीक करने में लग जाता है बिना यह देखे कि कार में इंजन है भी या नहीं।
  • "रीज़निंग" हीरो (The "Reasoning" Heroes): कुछ नए मॉडल जो "चरण-दर-चरण सोचने" (Reasoning-enhanced models) के लिए डिज़ाइन किए गए हैं, उन्होंने बेहतर काम किया। उनके द्वारा रुकने, गायब हिस्से को देखने और कहने की अधिक संभावना थी, "मैं इसका उत्तर नहीं दे सकता।" हालाँकि, वे कभी-कभी बहुत उत्साहित हो जाते थे और फिर भी अंदाज़ा लगाने लगते थे।

3. भाषा का मोड़: अंग्रेजी बनाम चीनी

शोध पत्र ने भाषाओं के बीच एक दिलचस्प अंतर पाया:

  • अंग्रेजी में: जब एक मुख्य शब्द गायब होता था, तो वाक्य अक्सर "अजीब" या अधूरा लगता था, इसलिए AI के लिए यह नोटिस करना आसान था कि कुछ गलत है।
  • चीनी में: यह भाषा बहुत लचीली है। आप एक महत्वपूर्ण शर्त को हटा सकते हैं, और वाक्य अभी भी पूरी तरह से स्वाभाविक और व्याकरणिक रूप से सही लगता है। AI को यह सोचने के धोखे में आसानी से फंसाया जा सका कि प्रश्न ठीक है, जिससे वे बेतहाशा अंदाज़ा लगाने लगे। यह एक ऐसे वाक्य की तरह है जो एक पूरी कहानी जैसा लगता है, लेकिन मुख्य पात्र गायब है।

4. बड़ा निष्कर्ष (The Big Takeaway)

शोध पत्र निष्कर्ष निकालता है कि प्रश्नों के उत्तर देने में स्मार्ट होना ही काफी नहीं है।

वास्तविक वित्तीय दुनिया में, सबसे खतरनाक गलती गणित गलत करना नहीं है; बल्कि एक ऐसे प्रश्न का उत्तर देना है जिसका उत्तर अभी नहीं दिया जाना चाहिए

  • वर्तमान AI एक आत्मविश्वासी लेकिन लापरवाह ड्राइवर की तरह हैं जो रेड लाइट पार कर जाते हैं क्योंकि उन्हें लगता है कि वे इसे पार कर लेंगे।
  • भरोसेमंद AI को एक सतर्क ड्राइवर की तरह होना चाहिए जो रेड लाइट पर रुकता है, भले ही कोई देख न रहा हो, क्योंकि वह नियमों को जानता है।

लेखकों का तर्क है कि वित्त में AI के सुरक्षित होने के लिए, इसे "ना कहना" सीखना होगा। इसे यह जानना होगा कि कब तर्क करना बंद करना है और पूछना है, "हे, आप मुझे कुछ महत्वपूर्ण बताना भूल गए।"

संक्षेप में: शोध पत्र दिखाता है कि वर्तमान AI मॉडल खुश करने के लिए बहुत उत्सुक हैं। वे उत्तर देंगे भी तब भी जब प्रश्न ही गलत हो। वास्तव में विश्वसनीय होने के लिए, उन्हें यह सीखना होगा कि कभी-कभी, सही उत्तर यह होता है कि "मेरे पास पर्याप्त जानकारी नहीं है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →