← नवीनतम पेपर
🤖 machine learning

Hindsight Preference Optimization for Financial Time Series Advisory

यह शोध पत्र "हाइंडसाइट प्रेफरेंस ऑप्टिमाइज़ेशन" का प्रस्ताव करता है, जो एक ऐसी विधि है जो देखे गए वित्तीय परिणामों का उपयोग करती है ताकि एक भाषा मॉडल को डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) के माध्यम से पूर्वव्यापी रूप से भविष्य कहने वाली सलाहों को रैंक और संरेखित करने की अनुमति मिल सके, जिससे एक छोटा 4B मॉडल एक बहुत बड़े 235B शिक्षक मॉडल की तुलना में सटीकता और सलाहकार गुणवत्ता दोनों में बेहतर प्रदर्शन कर पाता है।

मूल लेखक: Yanwei Cui, Guanghui Wang, Xing Zhang, Peiyang He, Ziyuan Li, Bing Zhu, Wei Qiu, Xusheng Wang, Zheng Yu, Anqi Xin

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yanwei Cui, Guanghui Wang, Xing Zhang, Peiyang He, Ziyuan Li, Bing Zhu, Wei Qiu, Xusheng Wang, Zheng Yu, Anqi Xin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जूनियर स्टॉक मार्केट एनालिस्ट को प्रशिक्षित कर रहे हैं। आप उन्हें एक चार्ट देते हैं और पूछते हैं, "आपको क्या लगता है कि अगले सप्ताह क्या होगा, और मुझे इसके बारे में क्या करना चाहिए?"

जूनियर एनालिस्ट एक विस्तृत रिपोर्ट देता है: "मुझे लगता है कि इस पैटर्न के कारण कीमत बढ़ेगी, लेकिन सावधान रहें क्योंकि अस्थिरता (volatility) अधिक है।"

अब, समस्या यह है: आप उन्हें ग्रेड कैसे देंगे?

यदि आप केवल यह देखते हैं कि उन्होंने कीमत सही बताई या नहीं, तो आप शायद एक "किस्मत वाले अनुमान लगाने वाले" (lucky guesser) को पुरस्कृत कर रहे होंगे। एक छात्र कह सकता है, "कल आसमान से चंद्रमा गिरेगा," और यदि किसी चमत्कार से बाजार गिर जाता है, तो वह एक जीनियस की तरह दिखेगा, भले ही उसका तर्क निरर्थक हो। वास्तविक दुनिया में, एक पेशेवर को केवल एक "सही" संख्या की आवश्यकता नहीं होती; उन्हें ठोस तर्क, वास्तविक जोखिम और एक समझदारी भरी योजना की आवश्यकता होती है।

यह शोध पत्र, "हिंडसाइट प्रिफरेंस ऑप्टिमाइजेशन" (Hindsight Preference Optimization), AI को उस पेशेवर एनालिस्ट की तरह प्रशिक्षित करने का एक नया तरीका पेश करता है।

मुख्य विचार: "टाइम मशीन" शिक्षक

शोधकर्ताओं ने महसूस किया कि हालांकि एक AI टेस्ट के दौरान भविष्य नहीं देख सकता, लेकिन हम (प्रशिक्षक) देख सकते हैं।

वे "हिंडसाइट" (Hindsight) की अवधारणा का उपयोग करते हैं। इसे फुटबॉल के खेल के रीप्ले देखने की तरह समझें। खेल के दौरान, खिलाड़ियों को नहीं पता होता कि कोई चाल काम करेगी या नहीं। लेकिन एक बार खेल समाप्त हो जाने के बाद, आप रीप्ले देख सकते हैं और कह सकते हैं, "उस क्वार्टरबैक ने शानदार निर्णय लिया क्योंकि उसने डिफेंडर को बाईं ओर बढ़ते हुए देखा था," या "उस खिलाड़ी की सिर्फ किस्मत अच्छी थी; उसका पैर फिसल गया, लेकिन गेंद फिर भी अंदर चली गई।"

शोधकर्ता इस "रीप्ले" (वास्तविक बाजार परिणाम) का उपयोग AI को प्रशिक्षित करने के लिए करते हैं। यहाँ उनकी तीन-चरणीय प्रक्रिया दी गई है:

  1. ब्रेनस्टॉर्मिंग (SFT): वे एक विशाल, "स्मार्ट" AI (शिक्षक) लेते हैं और उससे एक स्टॉक चार्ट के बारे में कई अलग-अलग रिपोर्ट लिखवाते हैं। वे एक छोटे, तेज़ AI (छात्र) को ये रिपोर्ट दिखाते हैं ताकि वह वित्तीय सलाह की बुनियादी "भाषा" सीख सके।
  2. रीप्ले और जज (हिंडसाइट): यही असली सफलता का सूत्र है। वे सप्ताह समाप्त होने तक प्रतीक्षा करते हैं और देखते हैं कि स्टॉक के साथ वास्तव में क्या हुआ। फिर, वे एक "जज" (एक अन्य शक्तिशाली AI) को बुलाते हैं। जज छात्र की विभिन्न रिपोर्टों और वास्तविक परिणाम को देखता है और कहता है: "रिपोर्ट A बहुत अच्छी थी क्योंकि इसने गिरावट की भविष्यवाणी की और जोखिम के बारे में चेतावनी दी। रिपोर्ट B केवल एक भाग्यशाली अनुमान था। इसलिए, रिपोर्ट A बहुत बेहतर है।"
  3. परिष्करण (DPO): छात्र को केवल यह बताने के बजाय कि "यह सही है" या "यह गलत है," वे छात्र को वे दो रिपोर्ट दिखाते हैं और कहते हैं, "सीखें कि जज ने A को B के ऊपर क्यों चुना।" यह AI को अनुमान लगाना बंद करने और तर्क करना शुरू करने के लिए मजबूर करता है।

यह क्यों महत्वपूर्ण है: छोटा लेकिन शक्तिशाली

इस शोध पत्र का सबसे प्रभावशाली हिस्सा इसका परिणाम है। आमतौर पर, एक छोटा AI एक विशाल AI की तुलना में बहुत कम समझदार होता है। लेकिन इस "हिंडसाइट" पद्धति का उपयोग करके, शोधकर्ताओं ने एक नन्हा 4B मॉडल (छात्र) प्रशिक्षित किया जो वास्तव में अपने विशाल 235B शिक्षक (विशालकाय AI) से बेहतर प्रदर्शन करता है।

यह केवल कीमत का अनुमान लगाने में बेहतर नहीं था; यह समझाने में और जोखिमों को प्रबंधित करने में बेहतर था।

रूपक सारांश

  • पारंपरिक AI प्रशिक्षण: किताब के पीछे दिए गए उत्तर से मिलान करके छात्र को पढ़ाने जैसा। (गणित के लिए अच्छा, रणनीति के लिए बुरा)।
  • इस शोध पत्र की विधि: छात्र के प्रदर्शन का वीडियो देखकर एक मास्टर कोच द्वारा यह समझाने जैसा कि, "आपने केवल सही उत्तर नहीं दिया; आपने सही रणनीति के साथ खेल खेला और अप्रत्याशित के लिए तैयारी की।"

संक्षेप में: उन्होंने AI को न केवल भविष्य की भविष्यवाणी करना सिखाया, बल्कि अतीत से सीखने वाला एक रणनीतिकार बनना सिखाया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →