← नवीनतम पेपर
🤖 machine learning

Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

यह शोध पत्र युग्मवार प्राथमिकताओं (pairwise preferences) वाले सुदृढीकरण अधिगम (reinforcement learning) के लिए एक नए ढांचे के रूप में मार्कोव निर्णय प्रतियोगिता (Markov decision contest) को प्रस्तुत करता है, जो यह सिद्ध करता है कि स्थिर मार्कोव नीतियां (stationary Markov policies) इष्टतम हैं और यह प्रदर्शित करता है कि एक सरल पुनरावृत्ति एल्गोरिदम पूर्व विधियों की तुलना में दीर्घ-क्षितिज (long-horizon), उच्च-आयामी समस्याओं में बेहतर शिक्षण दक्षता प्राप्त करता है।

मूल लेखक: Jonathan Colaço Carr, Prakash Panangaden, Doina Precup, Benjamin Van Roy

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jonathan Colaço Carr, Prakash Panangaden, Doina Precup, Benjamin Van Roy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखाने की कोशिश कर रहे हैं, या उसे कोई वीडियो गेम खेलना सिखा रहे हैं। पुराने तरीके में (जिसे रीइन्फोर्समेंट लर्निंग कहा जाता है), आप एक सख्त शिक्षक की तरह व्यवहार करते हैं जिसके पास एक स्कोरकार्ड है। आप रोबोट से कहते हैं, "अगर तुम यह कदम उठाते हो, तो तुम्हें +10 अंक मिलेंगे। अगर तुम गिरते हो, तो तुम्हें -5 अंक मिलेंगे।" रोबोट का एकमात्र लक्ष्य उन अंकों को अधिकतम करना है।

लेकिन कभी-कभी, रोबोट को एक विशिष्ट स्कोर देना कठिन होता है। यह कहना अधिक आसान है कि "मैं चलने के इस तरीके को उस तरीके से बेहतर मानता हूँ।" शायद आप ठीक से नहीं जानते कि एक तरीका दूसरे से क्यों बेहतर है, आप बस इतना जानते हैं कि आप उसे अधिक पसंद करते हैं। इसे पेयरवाइज प्रेफरेंस (pairwise preference) कहा जाता है।

समस्या यह है कि रोब "इस चीज़ को उस चीज़ से बेहतर" वाले तुलनात्मक तरीकों का उपयोग करके रोबोट को सिखाने के लिए केवल छोटे खेलों के लिए ही अच्छा काम करते हैं। यदि खेल लंबे समय तक चलता है (जैसे कि एक रोबोट घंटों तक चलना सीख रहा है), तो पुराने तरीके भ्रमित, धीमे और अक्षम हो जाते हैं। वे यह भी गारंटी नहीं दे सकते कि एक सरल, "उसी क्षण में" लिया गया निर्णय नियम, उस जटिल नियम जितना अच्छा होगा जो अतीत में हुई हर एक चीज़ को याद रखता है।

यह शोध पत्र इस समस्या को हल करने का एक नया तरीका पेश करता है, जिसे मार्कोव डिसीजन कॉन्टेस्ट (Markov Decision Contest) कहा जाता है। यह कैसे काम करता है, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:

1. नया खेल: एक "स्कोरकार्ड" के बजाय एक "प्रतियोगिता"

एक स्कोरकार्ड देने के बजाय, कल्पना करें कि रोबोट अपने ही एक दर्पण प्रतिबिंब (mirror image) के खिलाफ एक खेल खेल रहा है।

  • सेटअप: रोबोट एक राउंड खेलता है। फिर, रोबोट का एक "क्लोन" एक अलग रणनीति का उपयोग करके एक राउंड खेलता है।
  • जज (न्यायाधीश): एक जज दोनों राउंडों को देखता है और कहता है, "मैं पहले वाले को पसंद करता हूँ," या "मैं दूसरे वाले को पसंद करता हूँ," या "दोनों बराबर हैं।"
  • लक्ष्य: रोबोट को एक ऐसी रणनीति ढूंढनी है जो इतनी अच्छी हो कि, चाहे उसका क्लोन क्या भी रणनीति अपनाए, जज लगातार क्लोन की रणनीति को रोबोट की रणनीति से बेहतर न माने।

इसे लेखक मार्कोव डिसीजन कॉन्टेस्ट कहते हैं। यह "वरीयताओं (preferences) से सीखने" की समस्या को दो खिलाड़ियों के बीच एक निष्पक्ष खेल में बदल देता है।

2. बड़ा आश्चर्य: सादगी की जीत

कई जटिल खेलों में, आप सोच सकते हैं कि जीतने के लिए आपको अपने द्वारा किए गए हर पिछले कदम को याद रखने की आवश्यकता है (एक "हिस्ट्री-डिपेंडेंट" रणनीति)। लेकिन लेखकों ने कुछ आश्चर्यजनक सिद्ध किया: आपको याददाश्त (memory) की आवश्यकता नहीं है।

उन्होंने सिद्ध किया कि एक "स्टेशनरी" रणनीति—जो केवल वर्तमान स्थिति को देखती है और अतीत की चिंता किए बिना अभी निर्णय लेती है—वास्तव में किसी भी जटिल रणनीति जितनी ही अच्छी है जो पूरे इतिहास को याद रखती है।

  • उपमा: शतरंज खेलने की कल्पना करें। आपको लग सकता है कि सबसे अच्छा कदम उठाने के लिए आपको पिछले 50 चालों को याद रखने की आवश्यकता है। लेखकों ने सिद्ध किया कि इस विशिष्ट प्रकार के खेल के लिए, आपको केवल बोर्ड को अभी देखने की आवश्यकता है ताकि आप सही चाल चल सकें। यह समस्या को हल करने के लिए बहुत आसान बना देता है।

3. पहेली को कुशलतापूर्वक हल करना

लेखकों ने दिखाया कि इस "कॉन्टेस्ट" को हल करना गणितीय रूप से प्रबंधनीय है।

  • सटीक समाधान (Exact Solution): यदि समस्या बहुत बड़ी नहीं है, तो आप मानक गणितीय उपकरणों का उपयोग करके इसे पूरी तरह से हल कर सकते हैं, और इसमें बहुत समय नहीं लगेगा। यह उन्हीं "डिफिकल्टी क्लास" में है जिन्हें हम पहले से जानते हैं।
  • अनुमानित समाधान (HPI एल्गोरिदम): बहुत बड़ी, जटिल समस्याओं (जैसे उच्च-आयामी रोबोट नियंत्रण) के लिए, उन्होंने हेज्ड पॉलिसी इटरेशन (Hedged Policy Iteration - HPI) नामक एक सरल, पुनरावृत्ति एल्गोरिदम बनाया है।
    • यह कैसे काम करता है: रोबोट एक रणनीति आज़माता है, देखता है कि वह अपने क्लोन के साथ कैसे तुलना करता है, और अगली बार बेहतर करने के लिए अपनी रणनीति में थोड़ा बदलाव करता है। वह इसे बार-बार करता है।
    • परिणाम: रोबोट बेहतर और बेहतर होता जाता है, और एक अनुमानित गति से सबसे अच्छी संभव रणनीति की ओर बढ़ता है।

4. क्या यह काम आया? (प्रयोग)

लेखकों ने अपने नए तरीके का परीक्षण मौजूदा सर्वोत्तम तरीकों के विरुद्ध किया। उन्होंने कठिन, दीर्घकालिक रोबोट नियंत्रण कार्यों (सिम्युलेटेड वातावरण जहाँ रोबोट को हजारों कदमों तक चलना, पहुँचना या दौड़ना पड़ता है) का एक सेट उपयोग किया।

  • परिणाम: उनका नया तरीका (HPI) पुराने तरीकों की तुलना में बहुत तेज़ी से और अधिक कुशलता से सीखा।
  • "नॉन-ट्रांजिटिव" मोड़: उन्होंने उन परिदृश्यों का भी परीक्षण किया जहाँ प्राथमिकताएँ अजीब होती हैं। उदाहरण के लिए: "मैं A को B से बेहतर मानता हूँ, B को C से बेहतर, लेकिन C को A से बेहतर" (जैसे रॉक-पेपर-सिज़र्स)। पुराने तरीके इसमें संघर्ष करते हैं, लेकिन नया "कॉन्टेस्ट" मॉडल इसे स्वाभाविक रूप से संभाल लेता है।

सारांश

शोध पत्र कहता है: "रोबोटों को एक जटिल स्कोरकार्ड को अधिकतम करने के लिए मजबूर करना बंद करें जब आपके पास केवल प्राथमिकताएँ हों। इसके बजाय, उन्हें अपने ही खिलाफ एक 'कॉन्टेस्ट' खेलने दें। हमने सिद्ध किया है कि इस प्रतियोगिता को जीतने के लिए सरल, 'उसी क्षण में' लिए गए निर्णय पर्याप्त हैं, और हमने उन्हें यह सिखाने के लिए एक तेज़, विश्वसनीय एल्गोरिदम बनाया है, जो बहुत लंबे और जटिल कार्यों के लिए भी काम करता है।"

यह विशेष रूप से लार्ज लैंग्वेज मॉडल्स (जैसे कि वह मॉडल जिससे आप अभी बात कर रहे हैं) को प्रशिक्षित करने के लिए उपयोगी है, जहाँ "खेल" (एक बातचीत या कार्य) लंबे समय तक चल सकता है, और किसी चीज़ को एक विशिष्ट संख्या देने के बजाय यह कहना अधिक आसान होता है कि "मुझे यह उत्तर बेहतर लगता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →