← नवीनतम पेपर
📊 statistics

Similarity as Reward Alignment: Robust and Versatile Preference-based Reinforcement Learning

यह शोध पत्र सिमिलैरिटी एज़ रिवॉर्ड अलाइनमेंट (SARA) को प्रस्तुत करता है, जो प्राथमिकता-आधारित सुदृढीकरण शिक्षण (preference-based reinforcement learning) के लिए एक सुदृढ़ कंट्रास्टिव फ्रेमवर्क है जो रिवॉर्ड्स की गणना समानता के रूप में करने के लिए लेटेंट रिप्रेजेंटेशन सीखता है, और निरंतर नियंत्रण बेंचमार्क (continuous control benchmarks) पर बेसलाइन्स की तुलना में बेहतर स्थिरता और शोर प्रतिरोध (noise resilience) प्रदर्शित करता है।

मूल लेखक: Sara Rajaram, R. James Cotton, Fabian H. Sinz

प्रकाशित 2026-07-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sara Rajaram, R. James Cotton, Fabian H. Sinz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना, नाचना या खाना बनाना सिखाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) कहा जाता है। आमतौर पर, रोबोट चीज़ों को आजमाकर और एक स्कोर, या "रिवॉर्ड" (ईनाम) प्राप्त करके सीखता है, जो एक मानव प्रोग्रामर द्वारा दिया जाता है। यदि रोबोट कुछ अच्छा करता है, तो उसे एक अंक मिलता है; यदि वह गिर जाता है, तो वह एक अंक खो देता है। लेकिन यहाँ एक पेंच है: एक आदर्श स्कोरिंग सिस्टम लिखना अविश्वसनीय रूप से कठिन है। यह एक शेफ द्वारा की जाने वाली हर संभावित गलती को कवर करने के लिए "अच्छे खाना पकाने" का नियम पुस्तिका लिखने जैसा है, बिना अनजाने में उसे घर जलाने के लिए कहने के।

इस समस्या को हल करने के लिए, वैज्ञानिकों ने एक चतुर शॉर्टकट विकसित किया जिसे 'पसेंडेंस-बेस्ड रीइन्फोर्समेंट लर्निंग' (Preference-based Reinforcement Learning - PbRL) कहा जाता है। नियम पुस्तिका लिखने के बजाय, वे बस इंसानों से दो अलग-अलग रोबोट प्रयासों को देखने के लिए कहते हैं और पूछते हैं कि "मुझे यह वाला उस वाले से बेहतर लगता है।" रोबोट फिर उन छिपे हुए नियमों को समझने की कोशिश करता है कि क्या चीज़ एक "अच्छे" प्रदर्शन को बेहतर बनाती है। यह कहना बहुत आसान है कि "मुझे यह पिज्जा अधिक पसंद है" बजाय इसके कि मैं ठीक से बता सकूँ कि पनीर की कितनी मात्रा एकदम सही है। हालाँकि, एक बड़ी समस्या है: इंसान पूर्ण नहीं होते। हम थक जाते हैं, भ्रमित हो जाते हैं, और कभी-कभी गलतियाँ भी करते हैं। यदि रोबोट एक ऐसे शिक्षक से सीखता है जो अक्सर गलत होता है, तो रोबोट अनाड़ी या खतरनाक होना सीख सकता है। यह शोध पत्र मानव शिक्षकों की इस उलझी हुई वास्तविकता को संबोधित करता है जो कभी-कभी गलत होते हैं।

इस अध्ययन के पीछे के शोधकर्ताओं, सारा राजाराम, आर. जेम्स कॉटन और फैबियन एच. सिंज ने देखा कि रोबतों को मानव प्राथमिकताओं से सिखाने के लिए वर्तमान में उपयोग किए जाने वाले अधिकांश तरीके 'ब्रैडली-टेरी मॉडल' (Bradley-Terry model) नामक एक विशिष्ट गणितीय ट्रिक पर निर्भर करते हैं। इस मॉडल को एक सख्त रेफरी की तरह समझें जो केवल आमने-सामने के मुकाबलों पर ध्यान देता है। यदि आप रेफरी को बताते हैं, "रोबोट A, रोबोट B से बेहतर है," तो रेफरी यह मान लेता है कि यह एक परम सत्य है और रोबोट के मस्तिष्क को उसी के अनुसार ढाल देता है। लेकिन क्या होगा अगर आप सिर्फ अनुमान लगा रहे थे? या क्या होगा अगर आप थके हुए थे और आपने गलत चुनाव कर लिया? पुराना मॉडल हर गलती को एक तथ्य के रूप में मानता है, जो रोबोट को भ्रमित कर सकता है और उसे बहुत खराब प्रदर्शन करने पर मजबूर कर सकता है जब मानव शिक्षक चूक जाता है।

इसे ठीक करने के लिए, टीम ने एक नया तरीका पेश किया जिसे SARA (सिमिलैरिटी एज रिवॉर्ड अलाइनमेंट - Similarity as Reward Alignment) कहा जाता है। एक सख्त रेफरी की तरह काम करने के बजाय जो केवल जोड़ों (pairs) को देखता है, SARA एक बुद्धिमान कला समीक्षक की तरह काम करता है जो पेंटिंग्स की एक पूरी गैलरी को देखता है। SARA केवल एक समय में दो रोबोटों की तुलना नहीं करता है; यह उन सभी "अच्छे" उदाहरणों को देखता है जिन्हें इंसान पसंद करता है और उन सामान्य पैटर्न को खोजता है जो उन्हें खास बनाते हैं। यह एक "फिंगरप्रिंट" बनाता है कि एक आदर्श प्रदर्शन कैसा दिखता है। फिर, जब रोबोट कुछ नया करने की कोशिश करता है, तो SARA पूछता है, "यह हमारे फिंगरप्रिंट जैसा कितना है?" यदि यह समान दिखता है, तो रोबोट को रिवॉर्ड मिलता है। यदि यह अलग दिखता है, तो उसे कम स्कोर मिलता है।

SARA की खूबसूरती यह है कि यह शोर (noise) को अनदेखा कर देता है। यदि किसी इंसान ने गलती से एक खराब प्रदर्शन को "अच्छा" कह दिया, तो SARA घबराता नहीं है। क्योंकि इसने कई अन्य "अच्छे" उदाहरणों को देखा है, यह महसूस करता है कि यह एक बुरा उदाहरण बाकी पैटर्न में फिट नहीं बैठता है। यह एक संगीत शिक्षक की तरह है जिसने हजारों बेहतरीन पियानो पीस सुने हैं; यदि एक छात्र एक गलत नोट के साथ गाना बजाता है और शिक्षक गलती से ताली बजा देता है, तो शिक्षक का दिमाग जानता है, "रुको, यह अन्य महान गीतों जैसा नहीं था," और वह छात्र को यह सोचने नहीं देता कि उसने कमाल कर दिया।

टीम ने इस विचार का परीक्षण विभिन्न रोबोट कार्यों पर किया, जैसे कि एक वर्चुअल हॉपर को कूदने या एक वॉकर को आगे बढ़ने के लिए प्रेरित करना। उन्होंने जानबूझकर मानव फीडबैक में गड़बड़ी की, रोबोटों को बताया कि खराब चालें वास्तव में अच्छी थीं, जिसमें त्रुटि दर 0% से लेकर 40% तक थी। इन परीक्षणों में, पुराने तरीके (सख्त रेफरी) जैसे ही त्रुटियां बढ़ीं, बिखरने लगे, जिससे कुछ कार्यों पर उनका प्रदर्शन 73% तक गिर गया। हालाँकि, SARA स्थिर रहा। भले ही मानव फीडबैक शोर भरा था, SARA के रोबोट अच्छा प्रदर्शन करते रहे, जो पुराने तरीकों की तुलना में सांख्यिकीय रूप से महत्वपूर्ण सुधार दिखाते हैं।

शोधकर्ताओं ने यह भी जांचा कि SARA कार्य के वास्तविक लक्ष्य को कितनी अच्छी तरह समझता है, न कि केवल वह जो इंसान ने कहा। उन्होंने पाया कि SARA द्वारा गणना किए गए रिवॉर्ड्स, पुराने तरीकों द्वारा गणना किए गए रिवॉर्ड्स की तुलना में वातावरण के वास्तविक भौतिकी (physics) के साथ बहुत अधिक संरेखित (aligned) थे। यह सुझाव देता है कि SARA, मानव के भ्रम को छानने और उसके नीचे छिपे वास्तविक "अच्छे" व्यवहार को खोजने में बेहतर है।

संक्षेप में, यह शोध पत्र सुझाव देता है कि रोबोटों को मानव फीडबैक से सिखाते समय, प्रत्येक तुलना पर अत्यधिक ध्यान देने के बजाय कई उदाहरणों के माध्यम से एक अच्छे प्रदर्शन के "वाइब" (vibe) को देखना बेहतर है। "अच्छे" उदाहरणों के समूह की सामूहिक बुद्धिमत्ता का उपयोग करके, SARA एक जोड़ी मुकाबले (pairwise fight) के बजाय, मानव की गलतियों के प्रति रोबोट को बहुत अधिक मजबूत बनाता है। इसका मतलब यह नहीं है कि मानव शिक्षक को पूर्ण होना चाहिए; इसका मतलब सिर्फ यह है कि रोबोट इतना स्मार्ट है कि वह जान सके कि शिक्षक का दिन खराब चल रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →