← नवीनतम पेपर
🤖 AI

StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning

StepOPSD एक स्टेप-अवेयर ऑनलाइन प्रेफरेंस डिस्टिलेशन फ्रेमवर्क है जो एक्शन-केंद्रित सेगमेंट में ट्रेजेक्टरीज को डीकंपोज करके हिंडसाइट-एनरिच्ड रीस्केलिंग और एडवांटेज शेपिंगिंग के माध्यम से मल्टी-टर्न एजेंट रिइन्फोर्समेंट लर्निंग में क्रेडिट-असाइनमेंट मिसमैच को संबोधित करता है, जिससे ALFWorld और Search-QA जैसे बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

मूल लेखक: Yanfei Zhang, Xu Lin, Chenglin Wu

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanfei Zhang, Xu Lin, Chenglin Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल घर में किसी विशिष्ट वस्तु, जैसे कि "गर्म कॉफी का कप" को खोजने के लिए नेविगेट करना सिखा रहे हैं। रोबोट को दर्जनों मूव्स करने होंगे: रसोई तक जाना, फ्रिज खोलना, माइक्रोवेव चेक करना और अंत में कप उठाना।

समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाली गलती
पारंपरिक प्रशिक्षण (Reinforcement Learning) में, यदि रोबोट कॉफी खोजने में विफल रहता है, तो उसे पूरे सफर के लिए एक ही "खराब ग्रेड" मिलता है। उसे यह नहीं पता चलता कि वह क्यों विफल हुआ। क्या वह गलत कमरे में चला गया? क्या उसने गलत दरवाजा खोला? या उसने बस गलत कप उठा लिया?

यह एक क्रेडिट-असाइनमेंट मिसमैच (credit-assignment mismatch) कहलाता है। रोबोट को पूरे सफर के लिए दंडित किया जाता है, भले ही उसने बीच में केवल एक छोटी सी गलती की हो। यह वैसा ही है जैसे कोई छात्र गणित के टेस्ट में इसलिए फेल हो जाए क्योंकि उसने आखिरी लाइन में गलत नंबर लिख दिया था, और शिक्षक उसके पूरे निबंध के लिए अंक काट देते हैं। रोबोट भ्रमित हो जाता है और उसे समझ नहीं आता कि किस विशिष्ट कदम को ठीक करना है।

समाधान: StepOPSD (एक "कदम-दर-कदम" कोच)
लेखकों ने एक नई विधि बनाई जिसे StepOPSD कहा जाता है। रोबोट की यात्रा को एक लंबे, धुंधले टेक्स्ट स्ट्रिंग की तरह मानने के बजाय, यह विधि यात्रा को व्यक्तिगत कदमों (steps) में विभाजित करती है (जैसे "फ्रिज खोलना," "माइक्रोवेव चेक करना")।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. "दृष्टि-दोष" (Hindsight) कोच: कल्पना कीजिए कि रोबोट एक कार्य करने की कोशिश करता है और विफल हो जाता है। एक "शिक्षक" (रोबोट का एक स्मार्ट वर्जन) विफलता को देखता है और कहता है, "आह, मैं देख सकता हूँ कि क्या हुआ। आपने फ्रिज खोला, लेकिन आपको पहले माइक्रोवेव चेक करना चाहिए था।"
  2. ज़ूम इन करना: रोबोट को यह बताने के बजाय कि "आप पूरा गेम हार गए," StepOPSD कोच केवल उस विशिष्ट क्षण पर ज़ूम करता है (वह कदम जहाँ रोबोट ने फ्रिज खोला था)।
  3. "क्रेडिट" बजट: यह विधि प्रत्येक कदम को काम करने के लिए समान मात्रा में "क्रेडिट" देती है। यह एक लंबी, भटकाव भरी विचार प्रक्रिया को सारा ध्यान चुराने नहीं देती। यह सुनिश्चित करती है कि छोटी, महत्वपूर्ण गलती को सही मात्रा में ध्यान मिले।
  4. सेफ्टी वाल्व (Safety Valve): यह विधि दो "नॉब्स" (knobs) का उपयोग करती है जो यह नियंत्रित करते हैं कि कोच कितना हस्तक्षेप करता है:
    • ग्लोबल नॉब (λmix\lambda_{mix}): कोच की सलाह कुल मिलाकर कितनी महत्वपूर्ण है। इसे अलग-अलग कार्यों (जैसे शारीरिक कार्यों बनाम खोज कार्यों) के लिए अलग-अलग ट्यून करने की आवश्यकता होती है।
    • लोकल नॉब (αclip\alpha_{clip}): यह सबसे महत्वपूर्ण खोज है। यह एक सुरक्षा बेल्ट (safety belt) की तरह कार्य करता है। यह कोच को किसी भी एक कदम पर बहुत ज़ोर से चिल्लाने या रोबोट के निर्णय को बहुत अधिक बदलने से रोकता है। शोध में पाया गया कि इस "सुरक्षा बेल्ट" को कसकर रखने (एक छोटी संख्या) से लगभग हमेशा रोबोट अधिक स्थिरता से सीखता है, चाहे कार्य कोई भी हो।

परिणाम: कमजोर कड़ियों को ठीक करना
शोधकर्ताओं ने दो प्रकार की चुनौतियों पर इसका परीक्षण किया:

  • शारीरिक कार्य (ALFWorld): घर में वस्तुओं को इधर-उधर ले जाना।
  • खोज कार्य (Search-QA): इंटरनेट पर खोज करके उत्तर ढूँढना।

उन्होंने पाया कि StepOPSD ने केवल हर चीज़ में रोबोट को थोड़ा बेहतर नहीं बनाया। इसके बजाय, इसने उन विशिष्ट चरणों को सर्जिकल रूप से ठीक किया जहाँ रोबोट आमतौर पर फंस जाता था।

  • शारीरिक कार्यों में, रोबोट अक्सर इसलिए विफल होता था क्योंकि वह एक सूक्ष्म अवस्था परिवर्तन (state change) को मिस कर देता था (जैसे यह महसूस करने में कि कप वास्तव में "गर्म" था)। StepOPSD ने रोबोट को उन विशिष्ट क्षणों पर ध्यान देने में मदद की।
  • खोज कार्यों में, रोबोट अक्सर इसलिए विफल होता था क्योंकि वह गलत प्रश्न पूछता था। StepOPSD ने उस विशिष्ट खोज क्वेरी (search query) को रिफाइन करने में मदद की।

"दो-नॉब नियम" (Two-Knob Law)
शोधकर्ताओं ने एक सुसंगत नियम की खोज की:

  • कठोर स्थानीय नियंत्रण (Tight Local Control) महत्वपूर्ण है: किसी भी कार्य के लिए, "सुरक्षा बेल्ट" (लोकल क्लिपिंग) को कसकर रखने से रोबोट को पागल होने या जो वह कर रहा था उसे भूल जाने से रोका जा सकता है।
  • ग्लोबल सलाह बदलती रहती है: कोच की समग्र राय कितनी महत्वपूर्ण है, यह इस पर निर्भर करता है कि कौन सा विशिष्ट खेल खेला जा रहा है।

सारांश
StepOPSD एक स्मार्ट कोच की तरह है जो एक लंबी यात्रा को एक एकल इकाई के रूप में मानना बंद कर देता है। इसके बजाय, यह रोबोट को कदम-दर-कदम देखता है, पहचानता है कि रोबोट कहाँ भ्रमित हुआ था, और केवल उस कदम को धीरे से सुधारता है। ऐसा करके, यह रोबोट को बहुत तेज़ी से और अधिक विश्वसनीय रूप से सीखने में मदद करता है, विशेष रूप से जटिल कार्यों में जहाँ एक छोटी सी गलती पूरे परिणाम को बिगाड़ सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →