← नवीनतम पेपर
💬 NLP

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

यह शोध पत्र MMG2Skill प्रस्तुत करता है, जो एक क्लोज्ड-लूप फ्रेमवर्क और संबंधित बेंचमार्क (MMG2Skill-Bench) है जो AI एजेंटों को संरचित संकलन (structured compilation) और प्रक्षेपवक्र-संचालित संशोधन (trajectory-driven revision) के माध्यम से शोरयुक्त, मल्टीमॉडल वेब गाइड्स को स्व-विकसित निष्पादन योग्य कौशलों में परिष्कृत करने में सक्षम बनाता है, जो विविध डोमेन में बेसलाइन एजेंटों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinhua Hao, Ming Sun, Han Li, Jiaheng Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन थोड़ा भोला रोबोट सहायक है। आप चाहते हैं कि वह फोटो एडिट करने, वीडियो गेम में घर बनाने या रणनीतिक कार्ड गेम खेलने जैसे जटिल कार्य करे। आपके पास इंटरनेट पर मानव-लिखित गाइड, ट्यूटोरियल और विकी का एक विशाल पुस्तकालय है जो ये चीजें करना समझाते हैं।

समस्या यह है कि ये गाइड इंसानों के लिए लिखी गई हैं, रोबोट के लिए नहीं। वे अव्यवस्थित हैं, यह मान लेती हैं कि आपको वे चीजें पता हैं जो रोबोट को नहीं पता, और यदि रोबोट छोटी सी गलती करता है तो वे भ्रमित हो सकती हैं। यदि आप बस रोबोट को "घर कैसे बनाएं" लेख का एक कच्चा लिंक दे देते हैं, तो वह टेक्स्ट से अभिभूत हो सकता है, महत्वपूर्ण चरणों को छोड़ सकता है, या गलत क्रम में चीजें करने की कोशिश कर सकता है।

यह पेपर MMG2Skill पेश करता है, जो इन अव्यवस्थित मानव गाइडों का उपयोग करके रोबोट को सिखाने का एक नया तरीका है। इसे एक "अनुवादक और कोच" (Translator and Coach) प्रणाली के रूप में समझें जो मानव निर्देशों को रोबोट की व्यक्तिगत खेल पुस्तिका (playbook) में बदल देती है।

यह इस प्रकार काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. अनुवादक (The Translator): "मानव भाषा" को "रोबोट प्लेबुक" में बदलना

पूरे अव्यवस्थित लेख को देने के बजाय, सिस्टम पहले गाइड को पढ़ता है और मुख्य चरणों को निकालता है। यह लेख को एक साफ, संरचित चेकलिस्ट में बदल देता है जिसे स्किल (Skill) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक मानव शेफ एक जटिल रेसिपी ब्लॉग पोस्ट पढ़ रहा है। पूरे ब्लॉग को सहायक शेफ को सौंपने के बजाय, मुख्य शेफ एक संक्षिप्त, बुलेटेड "SOP" (मानक संचालन प्रक्रिया) कार्ड लिखता है: "चरण 1: प्याज काटें। चरण 2: पैन गरम करें। चरण 3: तेल डालें।"
  • परिणाम: अब रोबोट के पास एक भ्रमित करने वाली टेक्स्ट की दीवार के बजाय एक स्पष्ट, संपादन योग्य निर्देश कार्ड (SKILL.md फ़ाइल) है।

2. कोच (The Coach): वास्तविक समय में गलतियों से सीखना

रोबोट इस नई चेकलिस्ट का उपयोग करके कार्य करने का प्रयास करता है। यदि वह विफल होता है, तो सिस्टम केवल यह नहीं कहता कि "फिर से प्रयास करें।" यह एक जासूस की तरह कार्य करता है।

  • जासूस: यह देखता है कि रोबोट ने वास्तव में क्या किया, लक्ष्य के साथ तुलना करता है, और यह पता लगाता है कि वह क्यों विफल हुआ। क्या रोबोट फाइल सेव होने का इंतज़ार करना भूल गया? क्या उसने गलत बटन दबा दिया?
  • सुधार: सिस्टम फिर चेकलिस्ट को संपादित (edit) करता है। यह एक नोट जोड़ता है जैसे, " 'Done' पर क्लिक करने से पहले फाइल सेव होने के लिए 5 सेकंड प्रतीक्षा करें।"
  • उपमा: यह एक ड्राइविंग इंस्ट्रक्टर की तरह है जो छात्र को पैरलल पार्किंग टेस्ट में विफल होते हुए देखता है। केवल यह कहने के बजाय कि "आप विफल रहे," इंस्ट्रक्टर छात्र के अभ्यास पत्र पर एक नोट लिखता है: "रिवर्स करने से पहले रियरव्यू मिरर देखना याद रखें।" अगली बार, छात्र उस अपडेटेड शीट का उपयोग करता है।

3. स्मार्ट स्टॉपर (The Smart Stopper): यह जानना कि कब रुकना है

कभी-कभी, एक रोबोट तब भी प्रयास करता रहता है जब वह सफलतापूर्वक कार्य पूरा कर चुका होता है, या वह एक लूप में विफल होता रहता है। सिस्टम में एक "स्मार्ट स्टॉपर" शामिल है।

  • उपमा: कल्पना कीजिए कि एक GPS यह महसूस करता है कि आप पहले ही अपने गंतव्य पर पहुँच चुके हैं। आपको अपने गंतव्य तक पहुँचने के लिए ब्लॉक के चक्कर लगाने के लिए मजबूर करने के बजाय, यह कहता है, "आप यहाँ हैं। इंजन बंद करें।"
  • लाभ: यह स्पष्ट सफलता के संकेत देखते ही रोबोट को रोकने के लिए समय और पैसा (कंप्यूटिंग पावर) बचाता है, बजाय इसके कि उसे निश्चित संख्या में प्रयासों के लिए मजबूर किया जाए।

उन्होंने क्या पाया?

शोधकर्ताओं ने इसका परीक्षण तीन बहुत अलग दुनियाओं में किया:

  1. डेस्कटॉप कंप्यूटर: Word या Photoshop जैसे सॉफ़्टवेयर को नियंत्रित करना।
  2. वीडियो गेम्स: संसाधन इकट्ठा करने और आइटम बनाने के लिए Minecraft खेलना।
  3. कार्ड गेम्स: Doudizhu या Mahjong जैसे रणनीतिक खेल खेलना।

परिणाम:

  • कच्ची गाइड नुकसानदेह थीं: जब उन्होंने केवल रोबोट को कच्चे, अव्यवस्थित मानव गाइड दिए, तो रोबोट वास्तव में कार्यों में बदतर हो गया। अतिरिक्त शोर ने उसे भ्रमित कर दिया।
  • प्लेबुक की जीत: जब उन्होंने उन गाइडों को साफ, संपादन योग्य स्किल्स में बदलने के लिए "अनुवादक और कोच" सिस्टम (MMG2Skill) का उपयोग किया, तो रोबोटों में उल्लेखनीय सुधार हुआ। उनमें हर क्षेत्र में 12% से 25% का सुधार हुआ।
  • संपादन का जादू: सबसे बड़ी बढ़त अपनी गलतियों के बाद चेकलिस्ट को ठीक करने की प्रणाली की क्षमता से आई। केवल एक बार का अनुवाद पर्याप्त नहीं था; रोबोट को अपनी विफलताओं से सीखने और अपनी खुद की प्लेबुक को अपडेट करने की आवश्यकता थी।

निष्कर्ष

यह पेपर दिखाता है कि हमें हर रोबोट कार्य के लिए एकदम सटीक कोड लिखने की आवश्यकता नहीं है। हम इंटरनेट पर मौजूद लाखों मानव गाइडों का उपयोग कर सकते हैं, लेकिन हमें उन्हें एक ऐसे प्रारूप में अनुवादित करना होगा जिसे रोबोट समझ सके और उन्हें सीखते समय स्वयं संपादित करने देना होगा। यह एक अव्यवस्थित मानव मैनुअल को एक स्व-सुधारने वाली रोबोट प्लेबुक में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →