← नवीनतम पेपर
🤖 AI

Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation

Conv-FinRe स्टॉक अनुशंसा के लिए एक संवादात्मक और अनुदैर्ध्य बेंचमार्क पेश करता है जो शोर वाले उपयोगकर्ता व्यवहार की नकल करने और दीर्घकालिक निवेशक लक्ष्यों के अनुरूप उपयोगिता-आधारित रैंकिंग उत्पन्न करने के बीच अंतर करके बड़े भाषा मॉडल (LLMs) का मूल्यांकन करता है, जिससे तर्कसंगत निर्णय की गुणवत्ता और व्यवहार संबंधी संरेखण के बीच एक निरंतर तनाव का पता चलता है।

मूल लेखक: Yan Wang, Yi Han, Lingfei Qian, Yueru He, Xueqing Peng, Dongji Feng, Zhuohan Xie, Vincent Jim Zhang, Rosie Guo, Fengran Mo, Jimin Huang, Yankai Chen, Xue Liu, Jian-Yun Nie

प्रकाशित 2026-02-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Wang, Yi Han, Lingfei Qian, Yueru He, Xueqing Peng, Dongji Feng, Zhuohan Xie, Vincent Jim Zhang, Rosie Guo, Fengran Mo, Jimin Huang, Yankai Chen, Xue Liu, Jian-Yun Nie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वित्तीय सलाहकार (financial advisor) को काम पर रख रहे हैं। उनके अच्छे होने को परखने के दो तरीके हैं:

  1. "कॉपीकैट" टेस्ट (The "Copycat" Test): क्या उन्होंने आपको वही खरीदने को कहा जो आपने पिछली बार खरीदा था?
  2. "विजडम" टेस्ट (The "Wisdom" Test): क्या उन्होंने आपको ऐसी सलाह दी जिससे आप लंबे समय में वास्तव में समृद्ध और सुरक्षित हो सकें, भले ही इसके लिए उन्हें आपको वह करने से रोकना पड़ा हो जो आप करना चाहते थे?

वर्तमान में अधिकांश AI परीक्षण केवल "कॉपीकैट टेस्ट" का उपयोग करते हैं। वे पूछते हैं, "क्या AI ने उस चीज़ का अनुमान लगाया जिसे यूजर ने क्लिक किया था?" समस्या यह है कि इंसान बहुत उलझे हुए (messy) होते हैं। कभी-कभी हम घबराकर शेयर बेच देते हैं जब बाजार गिरता है, या लालच में आकर कोई जोखिम भरा स्टॉक खरीद लेते हैं क्योंकि वह ट्रेंड में है। यदि कोई AI आपके इन भावनात्मक और अव्यवस्थित फैसलों की नकल करता है, तो वह एक अच्छा सलाहकार नहीं बन रहा है; वह बस एक बुरा आईना बन रहा है।

Conv-FinRe एक नया, अधिक स्मार्ट टेस्ट है जिसे इसे ठीक करने के लिए बनाया गया है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के साथ दिया गया है:

1. सेटअप: एक दीर्घकालिक संबंध, न कि एक बार की बातचीत

कल्पना कीजिए कि आप एक पर्सनल ट्रेनर को काम पर रख रहे हैं।

  • पुराने टेस्ट: आप ट्रेनर से पूछते हैं, "आपने कल कौन सा वर्कआउट किया था?" और वे बस आपकी सटीक दिनचर्या को दोहरा देते हैं।
  • Conv-FinRe: यह बेंचमार्क एक 30-दिवसीय संबंध का अनुकरण (simulate) करता है। यह एक इंटरव्यू (ऑनबोर्डिंग) के साथ शुरू होता है जहाँ AI आपके लक्ष्यों, आपके डर और आपके बजट के बारे में सीखता है। फिर, दिन-प्रतिदिन, जैसे-जैसे बाजार बदलता है, AI आपसे बात करता है, सलाह देता है और देखता है कि आप कैसी प्रतिक्रिया देते हैं। यह केवल एक बार का सवाल नहीं है; यह एक लंबी बातचीत है।

2. निर्णय के "चार नेत्र" (The "Four Eyes" of Judgment)

यह सबसे रचनात्मक हिस्सा है। जब AI कोई सिफारिश देता है, तो यह टेस्ट केवल एक 'उत्तर कुंजी' (answer key) की जाँच नहीं करता। यह AI की सलाह को चार अलग-अलग "विशेषज्ञ नेत्रों" के विरुद्ध जाँचता है ताकि यह देखा जा सके कि AI वास्तव में क्या सोच रहा है:

  • 👁️ "यूजर आई" (User Eye - जो आपने वास्तव में किया): क्या AI ने आपके पिछले अव्यवस्थित विकल्पों की नकल की? (यह "कॉपीकैट" स्कोर है)।
  • 🧠 "रेशनल आई" (Rational Eye - जो गणितीय रूप से सबसे अच्छा है): आपके जोखिम सहने की क्षमता के आधार पर, एक आदर्श और शांत निवेशक को क्या करना चाहिए? (यह "विजडम" स्कोर है)।
  • 📈 "हाइप आई" (Hype Eye - जो बाजार अभी कर रहा है): क्या AI ने बस भीड़ का पीछा किया और इस सप्ताह के सबसे चर्चित स्टॉक को खरीद लिया?
  • 🛡️ "सेफ्टी आई" (Safety Eye - जो आपको सुरक्षित रखता है): क्या AI ने बड़े मुनाफे के पीछे भागने के बजाय बड़े नुकसान से बचने को प्राथमिकता दी?

उपमा: कल्पना कीजिए कि एक छात्र परीक्षा दे रहा है।

  • यदि वह केवल अपने दोस्त के उत्तरों की नकल करता है, तो वह "यूजर आई" पास कर लेता है।
  • यदि वह पूर्ण तर्क का उपयोग करके समस्या को हल करता है, तो वह "रेशनल आई" पास कर लेता है।
  • यदि वह केवल उस उत्तर का अनुमान लगाता है जो सोशल मीडिया पर ट्रेंड कर रहा है, तो वह "हाइप आई" पास कर लेता है।
    Conv-FinRe जानना चाहता है: क्या AI एक बुद्धिमान तर्कशास्त्री है, एक बिना सोचे-समझे नकल करने वाला है, या केवल ट्रेंड का पीछा करने वाला है?

3. गुप्त मंत्र: आपके दिमाग को "रिवर्स इंजीनियर" करना

अगर यूजर ने कोई "अव्यवस्थित" (messy) चुनाव किया है, तो टेस्ट को कैसे पता चलता है कि "तार्किक" (rational) उत्तर क्या है?

शोधकर्ताओं ने इनवर्स ऑप्टिमाइजेशन (Inverse Optimization) नामक एक चतुर तकनीक का उपयोग किया।

  • इसे ऐसे समझें: आप एक शतरंज खिलाड़ी को एक अजीब चाल चलते हुए देखते हैं। आप उनकी रणनीति नहीं जानते। लेकिन उनके कई चालों को समय के साथ देखकर, आप गणितीय रूप से उनके दिमाग को "रिवर्स इंजीनियर" कर सकते हैं और पता लगा सकते हैं कि: "आह, यह खिलाड़ी वास्तव में जोखिम से बचने वाला है; वे जीतने वाले मोहरों के बजाय नुकसान से बचने को प्राथमिकता देते हैं।"
  • यह बेंचमार्क यूजर के डेटा के साथ यही करता है। यह यूजर के वास्तविक छिपे हुए व्यक्तित्व (जैसे, "मुझे पैसा कमाने से ज्यादा पैसा खोने से डर लगता है") का पता लगाता है और उसी का उपयोग "गोल्ड स्टैंडर्ड" के रूप में करता है कि अच्छी सलाह कैसी दिखती है।

4. बड़ी खोज: "रस्साकशी" (The "Tug-of-War")

जब उन्होंने इस नए बेंचमार्क पर शीर्ष AI मॉडल्स (जैसे GPT-4, Llama, आदि) का परीक्षण किया, तो उन्हें एक दिलचस्प और महत्वपूर्ण तनाव (tension) मिला:

  • "स्मार्ट" AI: कुछ मॉडल "रेशनल आई" में बहुत अच्छे थे। उन्होंने गणितीय रूप से सटीक सलाह दी जो यूजर के दीर्घकालिक लक्ष्यों के अनुरूप थी। हालांकि, वे अक्सर "यूजर आई" में विफल रहे। उन्होंने यूजर को वह करने को कहा जो यूजर नहीं करना चाहता था, जिससे यूजर को लगा कि उसे समझा नहीं गया।
  • "एम्पैथेटिक" (सहानुभूतिपूर्ण) AI: अन्य मॉडल (विशेष रूप से जो विशेष रूप से वित्त पर प्रशिक्षित थे) "यूजर आई" में बहुत अच्छे थे। उन्होंने यूजर के अव्यवस्थित और भावनात्मक विकल्पों की पूरी तरह से नकल की। हालांकि, वे "रेशनल आई" में विफल रहे। वे यूजर की बुरी आदतों की नकल करने में इतने व्यस्त थे कि उन्होंने खराब वित्तीय सलाह दी।

निष्कर्ष

Conv-FinRe हमें सिखाता है कि एक वास्तव में महान वित्तीय AI को न केवल एक "जी-हुज़ूरी" (yes-man) होना चाहिए जो आपकी गलतियों की नकल करे, और न ही एक "रोबोट" जो आपकी भावनाओं को अनदेखा करे।

उसे एक "बुद्धिमान मार्गदर्शक" (wise guide) होना चाहिए: कोई ऐसा जो आपके व्यक्तित्व को समझता हो, आपके डर का सम्मान करता हो, लेकिन धीरे से आपको उन भावनात्मक जाल से दूर ले जाए जो आपकी जेब को नुकसान पहुँचाते हैं। यह नया बेंचमार्क पहला ऐसा उपकरण है जो वास्तव में यह माप सकता है कि क्या AI इस संतुलन को बना पा रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →