← नवीनतम पेपर
🤖 machine learning

Corruption Robust Offline Reinforcement Learning with Human Feedback

यह शोध पत्र पहले प्रमाणित रूप से सुदृढ़ ऑफलाइन सुदृढीकरण शिक्षण (RLHF) एल्गोरिदम प्रस्तुत करता है जो कॉन्फिडेंस सेट्स के साथ रिवॉर्ड मॉडल सीखकर और करप्शन-रोबस्ट आरएल ओरेकल्स के माध्यम से पेसिमिस्टिक ऑप्टिमाइज़ेशन का लाभ उठाकर, ε\varepsilon-हिस्से वाले दूषित ट्राजेक्टरी-फीडबैक पेयर्स वाले डेटासेट से निकट-इष्टतम नीतियों की पहचान कर सकते हैं।

मूल लेखक: Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

प्रकाशित 2026-07-01
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आप रोबोट को खेलने देंगे, उसके कार्यों को देखेंगे, और उसके प्रदर्शन के आधार पर उसे कहेंगे, "अच्छा काम किया!" या "बुरा काम किया!" यह रिनफोर्समेंट लर्निंग फ्रॉम ह्यूमन फीडबैक (RLHF) है।

हालाँकि, वास्तविक दुनिया में, जो डेटा आप एकत्र करते हैं वह आदर्श नहीं होता है। कभी-कभी, फीडबैक देने वाला व्यक्ति थका हुआ होता है और गलतियाँ करता है (शोर/noise)। कभी-कभी, कोई दुर्भावनापूर्ण हैकर रोबोट को धोखा देने के लिए जानबूझकर "अच्छा" और "बुरा" लेबल बदल देता है (भ्रष्टाचार/corruption)।

यह शोध पत्र एक विशिष्ट, कठिन समस्या पर काम करता है: आप एक ऐसे डेटासेट का उपयोग करके रोबोट को अच्छी तरह से खेलना कैसे सिखा सकते हैं जो आंशिक रूप से दूषित या भ्रष्ट है, बिना रोबोट को दोबारा गेम खेलने दिए (ऑफलाइन)?

यहाँ उनके समाधान का एक सरल विवरण दिया गया, जिसमें कुछ रचनात्मक उपमाओं का उपयोग किया गया है।

मुख्य समस्या: "जहरीली रेसिपी बुक"

कल्पना कीजिए कि आप एक आदर्श केक बनाना सीखना चाहते हैं। आपके पास एक रेसिपी बुक (डेटासेट) है जिसमें 1,000 रेसिपी हैं। लेकिन, एक विरोधी ने चुपके से 10% रेसिपी बदल दी हैं। कुछ में लिखा है "नमक डालें" जबकि वहाँ "चीनी डालें" होना चाहिए था, और कुछ सामग्री गलत तरीके से सूचीबद्ध की गई है।

यदि आप केवल किताब का आँख बंद करके पालन करेंगे, तो आप एक बहुत ही खराब केक बनाएंगे। यदि आप बनाने और चखने (ऑनलाइन RL) द्वारा सीखने की कोशिश करते हैं, तो आप बीमार पड़ सकते हैं या बहुत सारी सामग्री बर्बाद कर सकते हैं। लेखक एक ऐसा तरीका चाहते हैं जो इस जहरीली किताब को देख सके, यह पता लगा सके कि कौन सी रेसिपी वास्तविक होने की संभावना है, और रोबोट को बिना कभी भी रसोई में कदम रखे सबसे अच्छा केक बनाना सिखा सके।

तीन-चरणीय रणनीति

लेखक इस समस्या को हल करने के लिए एक तीन-चरणीय "जासूसी" प्रक्रिया प्रस्तावित करते हैं:

1. "सत्य डिटेक्टर" (रोबस्ट रिवॉर्ड लर्निंग)

सबसे पहले, रोबोट को समझने की आवश्यकता है कि "अच्छा" क्या दिखता है। शोध पत्र में, इसे रिवॉर्ड मॉडल सीखना कहा गया है।

  • उपमा: कल्पना कीजिए कि आप घर की बिक्री की एक सूची के आधार पर घर की वास्तविक कीमत का अनुमान लगाने की कोशिश कर रहे हैं। कुछ प्रविष्टियाँ फर्जी हैं (जैसे, एक हवेली जिसे $50 में सूचीबद्ध किया गया है)।
  • विधि: सभी कीमतों का औसत निकालने के बजाय (जो फर्जी प्रविष्टियों से प्रभावित होगा), लेखक ट्रिम्ड मैक्सिमम लाइकलीहुड (Trimmed Maximum Likelihood) नामक तकनीक का उपयोग करते हैं। इसे एक स्मार्ट फिल्टर के रूप में सोचें जो कहता है, "मैं सबसे अजीब, सबसे संदिग्ध शीर्ष 10% नंबरों को अनदेखा कर दूँगा और केवल बीच के 90% पर भरोसा करूँगा।" यह उन्हें एक "साफ" अनुमान देता है कि मनुष्य वास्तव में क्या पसंद करते हैं, भले ही कुछ डेटा झूठ बोल रहा हो।

2. "सुरक्षा जाल" (कॉन्फिडेंस सेट्स)

एक बार जब उनके पास वास्तविक रिवॉर्ड का एक "सर्वश्रेष्ठ अनुमान" आ जाता है, तो वे उस पर आँख बंद करके भरोसा नहीं करते हैं। वे एक कॉन्फिडेंस सेट (Confidence Set) बनाते हैं।

  • उपमा: कल्पना कीजिए कि जासूस कहता है, "मुझे 95% यकीन है कि हत्यारा इसी विशिष्ट पड़ोस में है।" वे उस पड़ोस के चारों ओर एक घेरा खींचते हैं। वे जानते हैं कि हत्यारा उस घेरे के भीतर कहीं भी हो सकता है, लेकिन वे ठीक-ठीक नहीं जानते कि वह कहाँ है।
  • विधि: वे अपने रिवॉर्ड अनुमान के चारों ओर एक गणितीय "बबल" (बुलबुला) बनाते हैं। वे जानते हैं कि वास्तविक रिवॉर्ड इस बुलबुले के भीतर है, भले ही उन्हें सटीक केंद्र का पता न हो।

3. "सतर्क योजनाकार" (पेसिमिस्टिक पॉलिसी)

अब, रोबोट को यह तय करने की आवश्यकता है कि कौन से कदम उठाने हैं। चूंकि डेटा दूषित है, इसलिए रोबोट को पैसेमिस्टिक (पessimistic - निराशावादी/सतर्क) होना चाहिए।

  • उपमा: कल्पना कीजिए कि आप एक धुंधले जंगल में चल रहे हैं जहाँ कुछ रास्ते "सुरक्षित" चिह्नित हैं लेकिन वास्तव में वे जाल हो सकते हैं। एक सतर्क यात्री केवल उस रास्ते को नहीं चुनेगा जो सबसे अच्छा दिखता है; बल्कि वह उस रास्ते को चुनेगा जो उस धुंधले क्षेत्र के भीतर सबसे खराब स्थिति में भी सबसे सुरक्षित हो।
  • विधि: रोबोट "सुरक्षा जाल" (कॉन्फिडेंस सेट) के भीतर प्रत्येक संभावित रास्ते को देखता है और पूछता है, "यदि मैं यह रास्ता लेता हूँ तो मुझे कितना खराब रिवॉर्ड मिल सकता है?" फिर यह उस पथ को चुनता है जो इस सबसे खराब स्थिति वाले रिवॉर्ड को अधिकतम करता है। यह सुनिश्चित करता है कि भले ही डेटा थोड़ा दूषित हो, रोबोट कोई विनाशकारी गलती नहीं करेगा।

तीन अलग-अलग "टेरेन" (भूभाग) रणनीतियाँ

शोध पत्र को एहसास होता है कि सभी डेटासेट एक जैसे नहीं होते। कुछ बहुत समृद्ध होते हैं (आपके पास हर संभव चाल के लिए डेटा है), जबकि कुछ विरल (sparse) होते हैं (आपके पास केवल कुछ चालों के लिए डेटा है)। उन्होंने डेटा के "टेरेन" के आधार पर तीन अलग-अलग एल्गोरिदम डिजाइन किए हैं:

  1. यूनिफॉर्म कवरेज (एक "समृद्ध मानचित्र"):

    • परिदृश्य: आपके पास गेम की दुनिया के हर कोने को कवर करने वाला डेटा है।
    • परिणाम: रोबोट लगभग पूरी तरह से सीख सकता है, भ्रष्टाचार के साथ भी बहुत कम त्रुटि के साथ। यह एक पूर्ण, उच्च-रिज़ॉल्यूशन वाले मानचित्र की तरह है जहाँ आप आसानी से नकली सड़कों को पहचान सकते हैं।
  2. लो रिलेटिव कंडीशन नंबर (एक "खुरदरा मानचित्र"):

    • परिदृश्य: आपके पास हर कोने के लिए डेटा नहीं है, लेकिन जो डेटा आपके पास है वह पूरी दुनिया का कुछ हद तक प्रतिनिधित्व करता है।
    • परिणाम: रोबक एक "जीरो-ऑर्डर ऑरेकल" का उपयोग करता है। इसे एक अंधे हाइकर के रूप में सोचें जो ढलान का अनुमान लगाने के लिए केवल अपने पैरों के नीचे की जमीन को महसूस कर सकता है। यह धीमा और कम सटीक है, लेकिन फिर भी यह काम करता है। त्रुटि दर थोड़ी अधिक है (यह भ्रष्टाचार के वर्गमूल पर निर्भर करती है), लेकिन यह प्रमाणित रूप से सुरक्षित है।
  3. बाउंडेड जनरलाइज्ड कवरेज (एक "स्मार्ट मानचित्र"):

    • परिदृश्य: डेटा विरल है लेकिन एक विशिष्ट, अनुमानित पैटर्न का पालन करता है।
    • परिणाम: रोबोट एक "फर्स्ट-ऑर्डर ऑरेकल" का उपयोग करता है। यह एक ऐसे हाइकर की तरह है जो न केवल जमीन को महसूस कर सकता है बल्कि आगे के ढलान (ग्रेडिएंट) को देख भी सकता है। यह रोबोट को बहुत अधिक कुशल बनाता है, जिससे कम डेटा बिंदुओं के साथ बेहतर त्रुटि दर (भ्रष्टाचार के वर्गमूल के समानुपाती) प्राप्त होती है।

मुख्य निष्कर्ष

शोध पत्र की मुख्य उपलब्धि यह साबित करना है कि आप गणितीय रूप से गारंटी दे सकते हैं कि एक रोबोट दूषित डेटा से एक अच्छी रणनीति सीख जाएगा, बशर्ते आप इन विशिष्ट "सतर्क" और "फ़िल्टरिंग" तकनीकों का उपयोग करें।

उन्होंने केवल यह नहीं कहा कि "यह शायद काम करेगा।" उन्होंने एक गणितीय ढाल बनाई है जो साबित करती है: "भले ही आपका 10% डेटा आपसे झूठ बोल रहा हो, हमारी विधि एक ऐसी रणनीति खोज लेगी जो लगभग उतनी ही अच्छी है जितना कि आपके पास पूर्ण डेटा होता।"

यह विशेष रूप से ऑफलाइन लर्निंग के लिए मानव फीडबैक के साथ एडवर्सरियल हमलों (adversarial attacks) की उपस्थिति में ऐसी कठोर गारंटी देने का पहला अवसर है। यह एक रोबोट को "सत्य के चश्मे" देने जैसा है जो उसे अपने प्रशिक्षण मैनुअल के झूठ के पार देख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →