← नवीनतम पेपर
💻 computer science

Online KL-Regularized Reinforcement Learning with Function Approximation under Misspecification

यह शोध पत्र सामान्य फंक्शन एप्रोक्सिमेशन और मॉडल मिसस्पेसिफिकेशन के तहत कॉन्टेक्स्टुअल बैंडिट्स और एपिसोडिक रिइन्फोर्समेंट लर्निंग के लिए KL-रेगुलराइज्ड फॉर्मुलेशन पेश करता है, जो उन रिग्रेशन-आधारित एल्गोरिदम के लिए उच्च-संभाव्यता वाले रिग्रेट गारंटी स्थापित करता है जो स्पष्ट रूप से एप्रोक्सिमेशन त्रुटियों को ध्यान में रखते हैं।

मूल लेखक: Haoyang Hong, Zichen Wang, Quanquan Gu, Huazheng Wang

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyang Hong, Zichen Wang, Quanquan Gu, Huazheng Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना सिखा रहे हैं। लक्ष्य यह है कि रोबोट जीतने के लिए सबसे अच्छे मूव्स (चालें) सीखना सीख जाए। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे रीइन्फोर्समेंट लर्निंग (RL) कहा जाता है।

आमतौर पर, वैज्ञानिक यह मान लेते हैं कि रोबोट के पास गेम की दुनिया का एक "परफेक्ट मैप" (सटीक मानचित्र) है। वे मानते हैं कि रोबोट एक ऐसा मॉडल सीख सकता है जो वास्तविकता से बिल्कुल मेल खाता हो। लेकिन वास्तविक दुनिया में, यह धारणा अक्सर विफल हो जाती है। गेम बहुत जटिल हो सकता है, या रोबोट का "दिमाग" (उसका गणितीय मॉडल) हर बारीकी को समझने के लिए बहुत सरल हो सकता है। इसे मॉडल मिसस्पेसिफिकेशन (Model Misspecification) कहा जाता है। यह एक 3D परिदृश्य (landscape) को केवल एक 2D ड्राइंग के माध्यम से वर्णित करने जैसा है; आप कितनी भी कोशिश कर लें, आप हमेशा कुछ विवरणों को छोड़ देंगे।

यह शोध पत्र इस समस्या के एक विशिष्ट, आधुनिक संस्करण को संबोधित करता है: रोबोट को उसके मौजूदा ज्ञान के प्रति "कोमल" रहते हुए सीखने के लिए प्रशिक्षित करना।

"कोमल धक्का" (KL-Regularization)

आधुनिक AI (जैसे वे सिस्टम जो चैटबॉट्स को संचालित करते हैं) में, हम केवल यह नहीं चाहते कि रोबलेट नई चीजें सीखे; हम चाहते हैं कि वह अपने मूल व्यक्तित्व को भूले बिना या पटरी से उतरे बिना सीखे। इसे करने के लिए, हम एक "कोमल धक्के" का उपयोग करते हैं जिसे KL-Regularization कहा जाता है।

इसे एक छात्र के नया विषय सीखने के रूप में सोचें।

  • रेफरेंस पॉलिसी (Reference Policy): यह छात्र के सोचने का मूल, सुरक्षित तरीका है।
  • नई पॉलिसी (New Policy): यह छात्र का नया, अनुकूलित (optimized) सोचने का तरीका है जो पढ़ाई के बाद प्राप्त हुआ है।
  • KL पेनल्टी (KL Penalty): यह एक नियम है जो कहता है, "आप नई चीजें सीख सकते हैं, लेकिन अपने मूल, सुरक्षित तरीके से बहुत दूर न भटकें।" यदि छात्र बहुत अधिक बदलाव करता है, तो उसे "जुर्माना" (पेनल्टी) लगाया जाता है। यह सीखने की प्रक्रिया को स्थिर रखता है और रोबोट को जंगली या खतरनाक अनुमान लगाने से रोकता है।

समस्या: "खुरदरा नक्शा" (The Rough Map)

लेखक पूछते हैं: क्या होगा यदि रोबोट का नक्शा मौलिक रूप से त्रुटिपूर्ण (misspecified) है और हम उसे एक कोमल पथ पर रखने की कोशिश कर रहे हैं?

पिछले सिद्धांतों ने कहा था: "यदि आपका नक्शा गलत है, तो रोबोट कुशलतापूर्वक सीखने में विफल रहेगा।"
यह शोध पत्र कहता है: "जरूरी नहीं। हम अभी भी यह सिद्ध कर सकते हैं कि रोबोट अच्छी तरह से सीखेगा, भले ही उसका नक्शा खुरदरा हो, जब तक कि हम इस बात का हिसाब रखें कि वह नक्शा कितना खुरदरा है।"

समाधान: "सुरक्षा मार्जिन" (The Safety Margin)

लेखकों ने नए एल्गोरिदम (MR-KL-UCB और MR-KL-LSVI) डिजाइन किए हैं जो एक सुरक्षा मार्जिन वाले सतर्क खोजकर्ता (cautious explorer) की तरह कार्य करते हैं।

  1. खोजकर्ता की रणनीति: रोबोट सबसे अच्छा मूव अनुमान लगाने की कोशिश करता है। लेकिन क्योंकि वह जानता है कि उसका नक्शा थोड़ा गलत हो सकता है, इसलिए वह अपने अनुमानों में एक "सुरक्षा मार्जिन" (एक बोनस) जोड़ता है।
  2. "मिसस्पेसिफिकेशन" शब्द: मुख्य नवाचार यह है कि इस सुरक्षा मार्जिन में स्पष्ट रूप से नक्शे की "खुरदराहट" के लिए एक शब्द शामिल है।
    • उपमा: कल्पना कीजिए कि आप कोहरे में चल रहे हैं। यदि आप जानते हैं कि कोहरा घना है (उच्च मिसस्पेसिफिकेशन), तो आप छोटे कदम उठाते हैं और रास्ते के करीब रहते हैं। यदि कोहरा पतला है, तो आप तेजी से चल सकते हैं। एल्गोरिदम स्वचालित रूप से यह तय करता है कि उसे कितना "सतर्क" रहना है।
  3. गिब्स पॉलिसी (The Gibbs Policy): केवल एक एकल "सर्वश्रेष्ठ" मूव चुनने के बजाय (जो कि एक इत्तेफाक हो सकता है), रोबोट एक संभाव्यता वितरण (probability distribution - "गिब्स पॉलिसी") के आधार पर मूव चुनता है। यह एक भारित पासे (weighted die) को फेंकने जैसा है जहाँ सबसे अच्छे मूव्स के चुने जाने की संभावना अधिक होती है, लेकिन रोबोट अन्य विकल्पों की भी खोज करता रहता है। यह यादृच्छिकता (randomness) उसे एक खराब नक्शे के कारण बुरी आदतों में फंसने से बचने में मदद करती है।

परिणाम: "पर्याप्त अच्छा" सिद्ध है

शोध पत्र गणितीय प्रमाण (regret bounds) प्रदान करता है जो दर्शाता है कि:

  • भले ही रोबोट का मॉडल अपूर्ण हो, फिर भी वह गेम को अच्छी तरह से खेलना सीख जाएगा।
  • अपूर्ण मॉडल की "लागत" गणित में स्पष्ट रूप से दिखाई देती है। यह दिखाता है कि एक खराब नक्शे के कारण रोबलेट के सीखने की गति कितनी धीमी हो जाती है।
  • यदि नक्शा परफेक्ट होता (पुराना, आदर्श परिदृश्य), तो गणित मानक, ज्ञात परिणामों में सरल हो जाता। यह सिद्ध करता है कि यह नया तरीका एक वास्तविक अपग्रेड है जो परफेक्ट और अपूर्ण दोनों दुनियाओं को कवर करता है।

संक्षेप में

यह शोध पत्र एक ऐसी AI बनाने के बारे में है जो मजबूत (robust) है। यह स्वीकार करता है कि AI मॉडल अक्सर वास्तविकता के अपूर्ण अनुमान होते हैं। मॉडलों को पूर्ण मानने के बजाय, लेखकों ने एक ऐसा सिस्टम बनाया है जो यह स्वीकार करता है, "मेरा नक्शा थोड़ा धुंधला है," और तदनुसार अपनी सीखने की रणनीति को समायोजित करता है। यह सुनिश्चित करता है कि एक धुंधले नक्शे और "कोमल" रहने के नियम के साथ भी, AI प्रभावी ढंग से और सुरक्षित रूप से सीखेगा।

मुख्य निष्कर्ष: आपको नेविगेट करने के लिए एक परफेक्ट मैप की आवश्यकता नहीं है; आपको बस एक ऐसी रणनीति की आवश्यकता है जो कोहरे को संभालना जानती हो। यह शोध पत्र AI के लिए वही रणनीति प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →