← नवीनतम पेपर
🤖 AI

ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL

ReSkill एक नवीन एजेंटिक RL फ्रेमवर्क है जो GRPO एल्गोरिदम के भीतर एसर्शन-ड्रिवन स्किल रिवीज़न (assertion-driven skill revision), इन-ग्रुप रोलआउट सैंपलिंग (in-group rollout sampling) और थॉम्पसन सैंपलिंग (Thompson Sampling) को समाहित करके कौशल निर्माण और पॉलिसी ऑप्टिमाइज़ेशन के बीच सामंजस्य स्थापित करता है, जिससे अनदेखे कार्यों पर बेहतर सामान्यीकरण प्राप्त करने के लिए पुन: प्रयोज्य रणनीतियों और पॉलिसियों का स्वचालित सह-विकास संभव होता है।

मूल लेखक: Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew Reimherr

प्रकाशित 2026-06-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew Reimherr

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ RESKILL पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

मुख्य विचार: एक रोबोट को सीखते समय सीखना सिखाना

कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना सिखा रहे हैं।

  • पुराना तरीका: आप रोबोट को नियम सिखाते हैं, उसे खेलने देते हैं, और जब वह विफल होता है, तो आप अगली बार पालन करने के लिए मैन्युअल रूप से एक नया नियम (एक "कौशल" या "skill") लिख देते हैं। लेकिन समस्या यह है: रोबोट बेहतर होते हुए अपनी खेलने की शैली लगातार बदल रहा है। यदि आप एक नया नियम इस आधार पर लिखते हैं कि उसने कल कैसे खेला था, तो वह नियम उसे आज भ्रमित कर सकता है क्योंकि वह पहले ही विकसित हो चुका है। यह एक छोटे बच्चे को जूते के फीते बांधना सिखाने जैसा है—एक ऐसे मैनुअल का उपयोग करके जो एक वयस्क के लिए लिखा गया है; बच्चा उन पुराने निर्देशों से आगे निकल चुका है, लेकिन नए निर्देश अभी तक टेस्ट नहीं किए गए हैं।
  • RESKILL का तरीका: नियमों को एक अलग नोटबुक में लिखने के बजाय, RESKILL नियम बनाने की प्रक्रिया को खेल का ही हिस्सा बना देता है। यह एक "नियम बनाने वाली फैक्ट्री" बनाता है जो ट्रेनिंग लूप के अंदर चलती है। रोबोट सीखते समय ही नए नियमों को आज़माता है, देखता है कि क्या वे मदद करते हैं, अच्छे नियमों को रखता है और खराब नियमों को फेंक देता है, और यह सब रियल-टाइम में होता है।

मूल समस्या: "बेमेल" (The Mismatch)

पेपर का तर्क है कि वर्तमान विधियाँ स्किल-पॉलिसी संघर्ष (Skill-Policy Conflict) से जूझती हैं।

  • पॉलिसी (Policy): यह रोबोट का मस्तिष्क है (खेलने की उसकी रणनीति)। यह सीखते समय लगातार बदलती रहती है।
  • कौशल (Skills): ये दोबारा इस्तेमाल किए जाने वाले नुस्खे या शॉर्टकट हैं (जैसे "हमेशा पहले फ्रिज चेक करो" या "अनुमान लगाने से पहले खोजो")।
  • संघर्ष: मौजूदा विधियाँ मस्तिष्क के प्रशिक्षण से अलग कौशल बनाती हैं। वे एक ऐसा कौशल बना सकती हैं जो "पुराने" मस्तिष्क के लिए काम करता था लेकिन "नए" मस्तिष्क के साथ टकरा जाता है। यह एक कोच की तरह है जो खिलाड़ी को नया प्लेबुक (रणनीति) देता है जबकि खिलाड़ी खेल के बीच में ही है, बिना यह देखे कि क्या खिलाड़ी वास्तव में नए मूव्स को समझता है।

RESKILL कैसे काम करता है: "टेस्टिंग" किचन

RESKILL इसे तीन मुख्य तंत्रों का उपयोग करके कौशल निर्माण को सीधे प्रशिक्षण प्रक्रिया में एकीकृत करके हल करता है, जिसे लेखक "Reconciling Skill Creation with Policy Optimization" कहते हैं।

1. "ग्रुप टेस्ट-टेस्ट" (Within-Group Sampling)

कल्पना कीजिए कि एक कुकिंग प्रतियोगिता है जहाँ एक शेफ (AI) को एक व्यंजन बनाना है।

  • मानक विधि: शेफ एक ही रेसिपी का उपयोग करके 10 व्यंजन बनाता है। फिर एक आलोचक एक नई रेसिपी लिखता है। शेफ बाद में उस नई रेसिपी को आज़माता है।
  • RESKILL विधि: शेफ को 10 ऑर्डर का एक समूह दिया जाता है। 5 ऑर्डर के लिए, वे पुरानी रेसिपी का उपयोग करते हैं। अन्य 5 ऑर्डर के लिए, वे एक नई रेसिपी का उपयोग करते हैं (जो तुरंत बनाई गई है)।
  • यह क्यों काम करता है: क्योंकि शेफ सभी 10 ऑर्डर्स के लिए ठीक उसी मूड और स्थिति में है, एकमात्र अंतर रेसिपी का है। सिस्टम तुरंत देख सकता है: "क्या नई रेसिपी ने शेफ को अभी बेहतर स्कोर दिलाने में मदद की?" यह बिना अतिरिक्त समय या संसाधनों के एक निष्पक्ष, नियंत्रित तुलना की अनुमति देता है।

2. "स्व-सुधार" वाली नियम पुस्तिका (Assertion-Driven Creator)

जब शेफ कोई व्यंजन बनाने में विफल रहता है, तो आमतौर पर एक इंसान को हस्तक्षेप करना पड़ता है और कहना पड़ता है, "तुम सूप में नमक डालना भूल गए।" RESKILL इसे स्वचालित करता है।

  • यह हर उस समय का एक रिजर्वायर (Reservoir/बाल्टी) रखता है जब शेफ सफल हुआ और जब वह विफल हुआ।
  • यह एक "डिटेक्टिव" (LLM) का उपयोग करता है जो बाल्टी को देखता है और पूछता है: "क्या गलत हुआ? क्या हम ओवन चेक करना भूल गए? क्या हमने गलत सामग्री की तलाश की?"
  • इन पैटर्न के आधार पर, सिस्टम स्वचालित रूप से एक नया "कौशल" (एक नियम जैसे: यदि आप बर्तन देखें, तो चलाने से पहले तापमान जांचें) लिखता है।
  • महत्वपूर्ण बात: यह केवल अनुमान नहीं लगाता। यह ऊपर वर्णित "ग्रुप टेस्ट-टेस्ट" का उपयोग करके तुरंत पुरानी रेसिपी के मुकाबले इस नए नियम का परीक्षण करता है।

3. "स्मार्ट जुआरी" (Thompson Sampling)

सिस्टम यह कैसे तय करता है कि कितनी बार नई रेसिपी बनाम पुरानी रेसिपी को आज़माना है?

  • यदि नई रेसिपी आशाजनक दिखती है, तो सिस्टम इसे अधिक बार आज़माता है।
  • यदि नई रेसिपी खराब दिखती है, तो यह इसे कम बार आज़माता है।
  • ट्विस्ट: रोबोट का मस्तिष्क हर सेकंड विकसित हो रहा है। एक नियम जो 10 मिनट पहले काम कर रहा था, वह अब पुराना (stale) हो सकता है। RESKILL "Thompson Sampling with Adaptive Discounting" नामक एक गणितीय ट्रिक का उपयोग करता है।
    • यह एक ऐसे जुआरी की तरह है जो जानता है कि कल के जीतने वाले लॉटरी नंबर आज बेकार हैं।
    • यदि रोबोट ने हाल ही में नई रेसिपी को कई बार आज़माया है, तो सिस्टम नवीनतम डेटा पर भरोसा करता है और पुराने डेटा को भूल जाता है (डिस्काउंटिंग)।
    • यदि रोबोट ने इसे बहुत कम बार आज़माया है, तो यह जल्दबाजी में निर्णय लेने से बचने के लिए पुराने डेटा को सुरक्षित रखता है।
    • यह सुनिश्चित करता है कि सिस्टम हमेशा उस कौशल पर दांव लगाता है जो रोबोट के वर्तमान मस्तिष्क के लिए सबसे अच्छा काम करता है, न कि उसके पिछले मस्तिष्क के लिए।

परिणाम: यह क्यों मायने रखता है

पेपर ने RESKILL का परीक्षण कई "गेम्स" (कार्यों) पर किया:

  1. घरेलू काम (ALFWORLD): एक आभासी घर में वस्तुओं को इधर-उधर ले जाना।
  2. सर्च इंजन: वेब पर खोज करके जटिल प्रश्नों के उत्तर देना।
  3. विज्ञान और कोडिंग: भौतिकी की समस्याओं को हल करना और SQL कोड लिखना।

निष्कर्ष:

  • कठिन कार्यों में बेहतर: RESKILL ने केवल थोड़ा बेहतर प्रदर्शन नहीं किया; इसने अनदेखे कार्यों (unseen tasks) (ऐसे कार्य जो उसने पहले कभी नहीं देखे थे) पर प्रतिस्पर्धा को पछाड़ दिया। ऐसा इसलिए क्योंकि इसके द्वारा सीखे गए कौशल लचीले और सामान्य थे, न कि केवल रटे हुए उत्तर।
  • कोई अतिरिक्त लागत नहीं: इसे रोबोट को दो गुनी देर तक खेलने की आवश्यकता नहीं पड़ी। इसने सामान्य प्रशिक्षण चरणों के दौरान ही कौशल-परीक्षण किया।
  • स्व-सुधार (Self-Correction): सिस्टम ने उन कौशलों को स्वचालित रूप से "प्रून" (हटा दिया) कर दिया जो रोबोट के स्मार्ट होने पर काम करना बंद कर चुके थे। यह कौशलों का एक जीवित पुस्तकालय है जो आवश्यकतानुसार बढ़ता और घटता है।

सारांश उपमा (Summary Analogy)

एक सॉकर टीम (Soccer Team) की कल्पना करें:

  • पुरानी विधि: कोच मैच देखता है, व्हाइटबोर्ड पर एक नया प्ले लिखता है, और टीम को अगले सप्ताह इसे आज़माने के लिए कहता है। इस बीच, खिलाड़ियों ने अपनी फॉर्मेशन बदल ली है, इसलिए नया प्ले फिट नहीं बैठता।
  • RESKILL: कोच मैच के दौरान मैदान पर मौजूद है। हर बार जब टीम हमला करती है, तो आधे खिलाड़ी पुराने प्ले को आज़माते हैं, और आधे खिलाड़ी पिछले गलती के आधार पर तुरंत बनाए गए नए प्ले को आज़माते हैं। कोच तुरंत देखता है कि कौन सा प्ले अभी गोल कर रहा है और टीम को उसी पर टिके रहने के लिए कहता है। टीम अपनी रणनीति और अपनी नियम पुस्तिका दोनों को एक साथ विकसित करती है, पूर्ण सामंजस्य में।

संक्षेप में: RESKILL "खेलना सीखने" और "नियम सीखने" को दो अलग-अलग काम मानना बंद कर देता है। यह उन्हें मिला देता है, जिससे AI एक बेहतर मस्तिष्क और एक बेहतर नियम पुस्तिका दोनों को एक साथ बनाने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →