← नवीनतम पेपर
🤖 machine learning

Value Functions as Supermartingale Certificates

यह शोध पत्र एक सैद्धांतिक संबंध स्थापित करता है जो यह दर्शाता है कि ω\omega-रेगुलर गुणों को संतुष्ट करने वाली नीतियों के लिए वैल्यू फंक्शन (value functions), स्ट्रीट सुपरमार्टिंगेल प्रमाणपत्रों (Streett supermartingale certificates) को एनकोड करते हैं, जिससे औपचारिक सत्यापन (formal verification) और सुदृढीकरण लर्निंग (reinforcement learning) के बीच एक सेतु बनता है ताकि परिमित (finite), गणनीय अनंत (countably infinite) और निरंतर (continuous) अवस्था स्थानों में सिद्धांत-आधारित प्रमाण-संश्लेषण (principled certificate synthesis) को सक्षम किया जा सके।

मूल लेखक: Alessandro Abate, Daniel Contro, Mirco Giacobbe, Agustín Martínez-Suñé, Diptarko Roy

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alessandro Abate, Daniel Contro, Mirco Giacobbe, Agustín Martínez-Suñé, Diptarko Roy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में रास्ता खोजने के लिए सिखा रहे हैं। आप चाहते हैं कि रोबोट नियमों का एक जटिल सेट पालन करे, जैसे "तब तक चलते रहो जब तक तुम्हें खजाना न मिल जाए, फिर हमेशा के लिए सुरक्षित क्षेत्र (safe zone) में रहो, और कभी भी लावा पर कदम न रखो।" कंप्यूटर विज्ञान की दुनिया में, इसे "ओमेगा-रेगुलर" (omega-regular) प्रॉपर्टी को संतुष्ट करना कहा जाता है (एक फैंसी तरीका यह कहने का कि यह एक नियम है जो एक अनंत यात्रा पर लागू होता है)।

लंबे समय से, इसे संभालने के दो अलग-अलग तरीके थे:

  1. "गणितीय प्रमाण" का तरीका (वेरिफिकेशन): गणितज्ञ एक सुपरमार्टिंगेल सर्टिफिकेट (Supermartingale Certificate) का उपयोग करते हैं। इसे एक "सुरक्षा स्कोरकार्ड" के रूप में सोचें। यदि आप एक ऐसा नक्शा बना सकते हैं जहाँ रोबोट के चलने पर स्कोर हमेशा कम होता है (या समान रहता है) और यह शून्य पर तभी पहुँचता है जब रोबोट सुरक्षित हो, तो आपके पास एक गणितीय प्रमाण है कि रोबोट कभी विफल नहीं होगा, चाहे परिस्थितियाँ कैसी भी हों (stochasticity)। समस्या यह है कि जटिल भूलभुलैया के लिए इस तरह का नक्शा हाथ से बनाना अविश्वसनीय रूप से कठिन है और यह बड़े स्तर पर काम नहीं कर पाता।

  2. "गलती और सुधार" का तरीका (रीइन्फोर्समेंट लर्निंग): यहाँ रोबोट करके सीखता है। वह क्रियाएं करता है, अच्छे कदमों के लिए पुरस्कार प्राप्त करता है, और एक वैल्यू फंक्शन (Value Function) बनाता है। वैल्यू फंक्शन को एक "खुशी के नक्शे" (happiness map) के रूप में समझें जो रोबोट को बताता है कि वह किसी स्थान से भविष्य में कितनी खुशी या इनाम की उम्मीद कर सकता है। हालांकि यह एक अच्छा रास्ता खोजने में बहुत अच्छा काम करता है, लेकिन इसमें आमतौर पर इस बात की औपचारिक गारंटी नहीं होती कि रोबोट वास्तव में सफल होगा, विशेष रूप से जटिल, अनंत या निरंतर (continuous) दुनियाओं में।

बड़ी सफलता
यह शोध पत्र इन दोनों दुनियाओं के बीच के अंतर को पाटता है। लेखकों ने एक आश्चर्यजनक रहस्य खोजा है: यदि रोबोट का "खुशी का नक्शा" (Value Function) एक बहुत ही विशिष्ट प्रकार के रिवॉर्ड सिस्टम का उपयोग करके बनाया गया है, तो वह नक्शा ही एक "सुरक्षा स्कोरकार्ड" (Supermartingale Certificate) बन जाता है।

उन्होंने इसे कैसे किया, इसके लिए सरल उपमाओं का उपयोग किया है:

दो रिवॉर्ड रेसिपी (पुरस्कार बनाने के तरीके)

लेखक दो अलग-अलग तरीके प्रस्तावित करते हैं जिनसे आप रोबोट को पुरस्कार दे सकते हैं ताकि उसका परिणामी "खुशी का नक्शा" अपने आप एक वैध सुरक्षा प्रमाण बन जाए।

रेसिपी 1: "सुरक्षित क्षेत्र" वाला पुरस्कार

  • यह कैसे काम करता है: आप रोबोट को बताते हैं: "आपको हर बार एक अंक मिलता है जब आप 'सुरक्षित क्षेत्र' में कदम रखते हैं (या ऐसे क्षेत्र में जहाँ आप हमेशा सुरक्षित रहने की गारंटी के साथ रहेंगे)।"
  • जादू: यदि रोबिमोट वास्तव में नियमों का पालन कर रहा है, तो उसका "खुशी का नक्शा" सुरक्षित क्षेत्र के बाहर स्वाभाविक रूप से ऊंचा होगा और सुरक्षा के करीब आने पर नीचे गिर जाएगा। एक बार जब वह सुरक्षित क्षेत्र में पहुँच जाता है, तो नक्शा स्थिर रहता है।
  • चुनौती: इसका उपयोग करने के लिए, आपको ठीक से पता होना चाहिए कि कौन से क्षेत्र "सुरक्षित क्षेत्र" हैं जहाँ रोबोट हमेशा के लिए फंस जाएगा। जटिल प्रणालियों के लिए इसे पहले से जानना कठिन है।

रेसिपी 2: "दंड और पुरस्कार" वाला पुरस्कार

  • यह कैसे काम करता है: आप रोबोट को बताते हैं: "जब आप 'खतरे के क्षेत्र' (लक्ष्य की प्रतीक्षा करते समय) में होते हैं तो आपको एक छोटा दंड (नकारात्मक अंक) मिलता है, और जब आप अंततः 'लक्ष्य' तक पहुँचते हैं तो एक बड़ा पुरस्कार मिलता है।"
  • जादू: जैसे-जैसे रोबोट खतरे के क्षेत्र से गुजरता है, उसकी "खुशी का नक्शा" बढ़ता है क्योंकि वह बड़े पुरस्कार के करीब पहुँच रहा है और दंड से बच रहा है। एक बार जब वह लक्ष्य तक पहुँच जाता है, तो नक्शा स्थिर हो जाता है।
  • चुनौती: इसके लिए पहले से "सुरक्षित क्षेत्रों" को जानने की आवश्यकता नहीं है; इसे केवल नियमों (specification) को जानने की आवश्यकता है। हालांकि, गणित को सही बनाने के लिए इसमें थोड़ा अधिक जटिल सेटअप (एक विशेष डिस्काउंट फैक्टर) की आवश्यकता होती है।

उन्होंने क्या सिद्ध किया

लेखकों ने गणितीय रूप से सिद्ध किया कि यदि आप इनमें से किसी भी रिवॉर्ड रेसिपी का उपयोग करते हैं, और रोबोट वास्तव में नियमों का पालन करने में सफल होता है, तो उसका "खुशी का नक्शा" वास्तव में एक वैध सुपरमार्टिंगेल सर्टिफिकेट है

इसका अर्थ है:

  • आपको मैन्युअल रूप से सुरक्षा मानचित्र बनाने की आवश्यकता नहीं है।
  • आप मानक रीइन्फोर्समेंट लर्निंग टूल्स का उपयोग करके रोबोट को प्रशिक्षित कर सकते हैं।
  • एक बार प्रशिक्षित होने के बाद, आप उसके "खुशी के नक्शे" को देख सकते हैं, उसे गणितीय रूप से उल्टा कर सकते हैं, और तुरंत आपके पास एक औपचारिक, गणितीय प्रमाण होगा कि रोबोट लगभग 100% समय सफल होगा।

प्रयोग

उन्होंने परीक्षण के लिए एक "फिसलन भरी भूलभुलैया" (जहाँ रोबोट गलती से गलत दिशा में फिसल सकता है) के कंप्यूटर सिमुलेशन का उपयोग किया।

  • उन्होंने रोबोटों को विभिन्न जटिल नियमों का पालन करने के लिए प्रशिक्षित किया (जैसे "'b' को ढूँढो और कभी 'h' को मत छुओ")।
  • उन्होंने सफल रोबोटों के लिए "खुशी के नक्शे" की गणना की।
  • उन्होंने नक्शे की सुरक्षा नियमों के विरुद्ध जाँच की।
  • परिणाम: नक्शों ने परीक्षण को पूरी तरह से पास किया। सफल रोबोटों के पास वैध सर्टिफिकेट थे; विफल रोबोटों के पास नहीं थे।

यह क्यों मायने रखता है (पेपर के अनुसार)

यह सर्टिफाइड रीइन्फोर्समेंट लर्निंग (Certified Reinforcement Learning) के लिए एक नया, सिद्धांत आधारित मार्ग बनाता है। केवल यह उम्मीद करने के बजाय कि सीखा हुआ नीति (policy) काम करेगी, या हाथ से जटिल प्रमाण लिखने के संघर्ष के बजाय, अब हम:

  1. मानक AI विधियों का उपयोग करके एक पॉलिसी को प्रशिक्षित कर सकते हैं।
  2. उसके वैल्यू फंक्शन का मूल्यांकन कर सकते हैं।
  3. यह जाँच सकते हैं कि क्या वह फंक्शन "सुरक्षा स्कोरकार्ड" के नियमों को संतुष्ट करता है।

यदि यह करता है, तो हमारे पास एक औपचारिक गारंटी है कि पॉलिसी काम करेगी, यहाँ तक कि जटिल, निरंतर या अनंत वातावरण में भी। यह पेपर सुझाव देता है कि यह अंततः हमें उन प्रणालियों के लिए सुरक्षा प्रमाण बनाने के लिए डेटा-संचालित तरीकों (जैसे न्यूरल नेटवर्क) का उपयोग करने की अनुमति दे सकता है जो इंसानों द्वारा मैन्युअल रूप से विश्लेषण करने के लिए बहुत बड़े हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →