← नवीनतम पेपर
🤖 machine learning

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1 एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक द्वि-स्तरीय उद्देश्य द्वारा प्रशिक्षित एक हल्के जनरेटर के माध्यम से पुन: प्रयोज्य प्राकृतिक भाषा कौशल को अनुकूलित करता है, जिससे अंतर्निहित फ्रोजन मॉडल को अपडेट किए बिना जटिल कार्यों पर एजेंटिक LLMs के लागत प्रभावी, मॉडल-अज्ञेय सुधार को सक्षम बनाया जा सके।

मूल लेखक: Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन जिद्दी शेफ (Task LLM) है जो खाना बनाने में विशेषज्ञ है लेकिन अपनी रेसिपी बदलने या नई तकनीक सीखने से इनकार करता है। वे अपने तरीकों में "जमे हुए" (frozen) हैं। आप चाहते हैं कि वे एक उत्तम, जटिल भोजन पकाएं, लेकिन वे गलतियाँ करते रहते हैं क्योंकि उनके पास सही निर्देश नहीं होते।

आमतौर पर, इसे ठीक करने के लिए, आप शेफ को शुरू से से फिर से प्रशिक्षित करने की कोशिश कर सकते हैं (जो महंगा और कठिन है) या हर बार जब वे गलती करते हैं तो उन्हें नए प्रॉम्प्ट के साथ चिल्लाकर समझाने की कोशिश कर सकते हैं (जो अक्षम है)।

Skill-R1 इसे हल करने का एक नया तरीका है। मुख्य शेफ को बदलने के बजाय, आप एक हल्का Sous-Chef (Skill Generator) काम पर रखते हैं। इस Sous-Chef का एकमात्र काम उन रेसिपी कार्डों (Skills) को लिखना और फिर से लिखना है जिनका पालन मुख्य शेफ करता है।

यह प्रणाली कैसे काम करती है, इसे सरल चरणों में यहाँ दिया गया है:

1. सेटअप: शेफ और Sous-Chef

  • शेफ (Frozen Task Model): यह बड़ा AI मॉडल है। यही वास्तविक काम (भोजन पकाना/समस्या को हल करना) करता है। इसका दिमाग कभी नहीं बदलता; यह बस निर्देशों का पालन करता है।
  • Sous-Chef (Skill Generator): यह एक छोटा, प्रशिक्षित होने योग्य AI है। यह निर्देश लिखता है। यदि शेफ विफल होता है, तो Sous-Chef देखता है कि क्या गलत हुआ और अगले प्रयास के लिए एक बेहतर रेसिपी लिखता है।

2. प्रक्रिया: एक "कोशिश करो, विफल हो, सुधारो, दोहराओ" लूप

कल्पना कीजिए कि Sous-Chef, शेफ को एक विशिष्ट केक बनाना सिखाने की कोशिश कर रहा है।

  1. पीढ़ी 1 (Generation 1): Sous-Chef एक रेसिपी लिखता है। शेफ उसे पकाने की कोशिश करता है। परिणाम थोड़ा अस्त-व्यस्त होता है।
  2. स्कोरकार्ड: एक "जज" (Verifier) केक चखता है और उसे एक स्कोर देता है।
  3. विकास (The Evolution): Sous-Chef स्कोर और अस्त-व्यस्त केक को देखता है। केवल "फिर से कोशिश करो" कहने के बजाय, Sous-Chef अगले दौर के लिए एक नई, बेहतर रेसिपी लिखता है।
  4. पीढ़ी 2 (Generation 2): शेफ नई रेसिपी का उपयोग करता है। केक बेहतर बनता है।
  5. दोहराना (Repeat): यह बार-बार होता है (कई "पीढ़ियों" तक)। Sous-Chef इस आधार पर बेहतर रेसिपी लिखने में स्मार्ट होता जाता है कि क्या काम किया और क्या नहीं।

3. सीक्रेट सॉस: दो प्रकार का "प्रशंसा" (Praise)

पेपर में Sous-Chef को बेहतर रेसिपी लिखने के लिए सिखाने का एक चतुर तरीका पेश किया गया है। यह फीडबैक के दो प्रकारों का उपयोग करता है, जैसे कोई कोच सलाह दे रहा हो:

  • इंट्रा-जेनरेशन फीडबैक (द "पियर रिव्यू"):
    कल्पना कीजिए कि Sous-Chef शेफ से एक ही रेसिपी का उपयोग करके एक साथ 5 केक बनाने के लिए कहता है। कुछ बेहतरीन बनते हैं, कुछ जल जाते हैं। Sous-Chef सीखता है: "ठीक है, यह विशिष्ट रेसिपी उस दूसरी वाली से बेहतर काम करती है।" यह वर्तमान विचार के सबसे अच्छे संस्करण को चुनने में मदद करता है।
  • इंटर-जेनरेशन फीडबैक (द "प्रोग्रेस रिपोर्ट"):
    यह बड़े चित्र को देखता है। क्या पीढ़ी 5 की रेसिपी ने पीढ़ी 1 की तुलना में बेहतर केक बनाए? यदि नई रेसिपी पुरानी वाली की तुलना में एक सुधार है, तो Sous-Chef को एक बड़ा इनाम मिलता है। यह सुनिश्चित करता है कि सिस्टम वास्तव में विकसित हो रहा है और बेहतर हो रहा है, न कि केवल एक ही जगह घूम रहा है।

4. यह एक बड़ी बात क्यों है

  • यह सस्ता है: आपको विशाल, महंगे शेफ को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप केवल छोटे, सस्ते Sous-Chef को प्रशिक्षित करते हैं।
  • यह बंद दरवाजों पर काम करता है: क्योंकि आप शेफ को नहीं बदल रहे हैं, इसलिए यह तब भी काम करता है जब शेफ एक "क्लोज्ड-सोर्स" मॉडल हो (जैसे कि एक मालिकाना AI जिसे आप छू नहीं सकते)। आप बस उसे दिए जाने वाले निर्देशों को बदलते हैं।
  • यह कठिन समस्याओं को हल करता है: पेपर में पाया गया कि सरल कार्यों के लिए, यह ठीक है। लेकिन जटिल, बहु-चरणीय कार्यों (जैसे वेबसाइट नेविगेट करना या कई चरणों वाली गणित की समस्या को हल करना) के लिए, यह तरीका गेम-चेंजर है। मानक तरीके अक्सर हार मान लेते हैं या अटक जाते हैं, लेकिन Skill-R1 निर्देशों को तब तक परिष्कृत करता रहता है जब तक कि समस्या हल न हो जाए।

परिणाम

शोधकर्ताओं ने दो कठिन चुनौतियों पर इसका परीक्षण किया:

  1. GAIA: वास्तविक दुनिया के कार्य जिनमें PDF, स्प्रेडशीट और वेब पेज पढ़ना शामिल है।
  2. WebWalker: एक गेम जहाँ AI को विशिष्ट जानकारी खोजने के लिए इंटरनेट ब्राउज़ करना होता है।

परिणाम:

  • बिना किसी विशेष निर्देश के, शेफ बहुत कम कार्य सही कर पाता था (GAIA पर लगभग 6%)।
  • मानक ट्रिक्स का उपयोग करने पर, वह बेहतर हुआ (लगभग 30%)।
  • Skill-R1 का उपयोग करने पर, शेफ काफी बेहतर हो गया (GAIA पर लगभग 42% और WebWalker पर 26%)।

पेपर नोट करता है कि सबसे बड़े उछाल शुरुआत में (पीढ़ियों 1 से 3 के बीच) आए, जहाँ Sous-Chef ने प्रमुख त्रुटियों को सुधारा। बाद की पीढ़ियों (4 और 5) ने नई महाशक्तियाँ तो नहीं जोड़ीं, लेकिन उन्होंने शेफ के प्रदर्शन को बहुत अधिक सुसंगत और विश्वसनीय बना दिया, जिससे यह सुनिश्चित हुआ कि शेफ गलती से आसान चरणों पर विफल न हो जाए।

संक्षेप में, Skill-R1 एक "जमे हुए" AI को ट्रैक पर रखने के लिए एक ऐसा सिस्टम है जिसमें एक छोटा, प्रशिक्षित होने योग्य सहायक लगातार निर्देशों को फिर से लिखता है, जिससे बिना खुद के AI को दोबारा बनाए, स्मार्ट और अधिक विश्वसनीय एजेंट प्राप्त होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →