Toward Scalable Terminal Task Synthesis via Skill Graphs
यह शोध पत्र SkillSynth को प्रस्तुत करता है, जो एक परिदृश्य-मध्यस्थता कौशल ग्राफ (scenario-mediated skill graph) का लाभ उठाकर विविध और नियंत्रणीय टर्मिनल कार्य इंस्टेंस को संश्लेषित करने के लिए एक स्वचालित ढांचा है, जिससे डेटा की कमी को दूर किया जा सके और स्वायत्त टर्मिनल एजेंटों के प्रशिक्षण को बढ़ाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर के कमांड लाइन (वह टेक्स्ट-आधारित स्क्रीन जहाँ आप कमांड टाइप करते हैं) का उपयोग करना सिखाना चाहते हैं ताकि वह जटिल काम कर सके, जैसे फाइलों को व्यवस्थित करना या सॉफ्टवेयर बग्स को ठीक करना। समस्या यह है कि एक रोबोट को सिखाने के लिए आपको उसे इन कामों के हजारों उदाहरण दिखाने की आवश्यकता होती है। लेकिन हाथ से हजारों अच्छे और अलग-अलग उदाहरण ढूंढना या लिखना बेहद धीमा और महंगा काम है।
इस पेपर के लेखक, टेनसेंट की हुनयुआन (Hunyuan) टीम ने इस समस्या को हल करने के लिए SkillSynth नामक एक सिस्टम बनाया है। SkillSynth को एक अत्यधिक कुशल "रेसिपी जनरेटर" के रूप में समझें जो रोबोट ट्रेनिंग के लिए काम आता है।
यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:
1. समस्या: बहुत अधिक समान रेसिपी
पिछले तरीकों ने प्रशिक्षण उदाहरण बनाने के लिए या तो:
- अनुमान लगाया: एक स्मार्ट AI से नए कार्य आविष्कार करने को कहा (जो अक्सर नकली लगते थे या वास्तविक जीवन से मेल नहीं खाते थे)।
- चोरी की: इंटरनेट से वास्तविक कोड लिया और जानबूझकर उसे खराब किया ताकि एक "फिक्स-इट" (ठीक करने वाला) कार्य बनाया जा सके (जिससे रोबोट केवल सॉफ्टवेयर को ठीक करना ही सीख पाया, अन्य चीजें नहीं)।
दोनों तरीकों के परिणामस्वरूप रोबोटों ने एक ही प्रकार की समस्याओं को बार-बार देखा। यह एक शेफ को केवल स्पैगेटी की रेसिपी देकर खाना बनाना सिखाने जैसा है। वे स्पैगेटी बनाने में तो माहिर हो सकते हैं, लेकिन उन्हें सलाद बनाना या केक बेक करना नहीं आएगा।
2. समाधान: "स्किल ग्राफ" (एक मानचित्र)
केवल अनुमान लगाने के बजाय, SkillSynth एक विशाल मानचित्र (Skill Graph) बनाता है।
- स्थान (परिदृश्य/Scenarios): कल्पना करें कि कंप्यूटर की विभिन्न अवस्थाएँ हैं, जैसे "एक फोल्डर खाली है" या "एक वीडियो फ़ाइल तैयार है।" ये मानचित्र पर "स्थान" हैं।
- सड़कें (कौशल/Skills): ये वे क्रियाएं हैं जो एक रोबट एक स्थान से दूसरे स्थान पर जाने के लिए ले सकता है, जैसे "एक फ़ाइल हटाना" या "वीडियो को कन्वर्ट करना।"
टीम ने इन "सड़कों" को वास्तविक स्रोतों (जैसे GitHub और ClawHub नामक डेटाबेस) से एकत्र किया। फिर उन्होंने सड़कों को इस तरह जोड़ा कि यदि आप एक क्रिया पूरी करते हैं, तो आप एक ऐसे स्थान पर पहुँचते हैं जहाँ अगली क्रिया तर्कसंगत लगे।
3. प्रक्रिया: एक रास्ता खींचना
एक बार जब मानचित्र बन जाता है, तो SkillSynth केवल एक सड़क नहीं चुनता। यह मानचित्र पर एक रास्ता (Path) खींचता है।
- यह एक शुरुआती बिंदु चुनता है।
- यह एक सड़क (कौशल) चुनता है।
- यह एक नए स्थान पर पहुँचता है, एक और सड़क चुनता है, और आगे बढ़ता रहता है।
उपमा: कल्पना करें कि आप एक रोड ट्रिप की योजना बना रहे हैं। केवल घर से किराने की दुकान तक जाने (एक कौशल) के बजाय, आप एक यात्रा की योजना बनाते हैं जो: घर → गैस स्टेशन → दर्शनीय मार्ग → बेकरी → किराने की दुकान तक जाती है। यह पथ एक जटिल, बहु-चरणीय कार्य का प्रतिनिधित्व करता है।
यह सिस्टम स्मार्ट है: यह उन लोकप्रिय सड़कों को लेने से बचने की कोशिश करता है जिनका उपयोग इसने पहले किया है। यह सुनिश्चित करता है कि रोबोट नए और अलग रास्ते देखे, जिससे इसकी ट्रेनिंग बहुत समृद्ध हो जाए।
4. असेंबली लाइन: मल्टी-एजेंट हार्नेस
एक बार जब मानचित्र पर एक पथ खींचा जाता है, तो सिस्टम को उस अमूर्त पथ को रोबोट के खेलने योग्य वास्तविक गेम में बदलने की आवश्यकता होती है। इसके लिए वे AI एजेंटों की एक टीम (एक हार्नेस) का उपयोग करते हैं:
- प्लानर (Planner): पथ को देखता है और निर्देशों का एक स्पष्ट सेट लिखता है (उदाहरण के लिए, "इस कच्चे वीडियो को GIF में बदलें")।
- कंस्ट्रक्टर (Constructor): वास्तविक वातावरण (फाइलें, फोल्डर, शुरुआती स्थिति) बनाता है ताकि रोबोट के पास काम करने के लिए कुछ हो।
- रेफरी (Referees): दो अलग-अलग जाँच होती हैं:
- ओरेकल चेक (Oracle Check): क्या वास्तव में एक आदर्श समाधान मौजूद है? (क्या इस कार्य को हल किया जा सकता है?)
- रुब्रिक चेक (Rubric Check): क्या निर्देश स्पष्ट हैं? क्या परीक्षण निष्पक्ष है? (क्या हमने अनजाने में निर्देश बहुत कठिन या बहुत आसान बना दिए हैं?)
यदि कार्य इन जाँचों में विफल रहता है, तो सिस्टम इसे स्वचालित रूप से ठीक करता है और फिर से प्रयास करता है, बिल्कुल एक कारखाने में गुणवत्ता नियंत्रण लाइन की तरह।
5. परिणाम
टीम ने इस सिस्टम को चलाया और एक ही स्वचालित रन में 3,560 सत्यापित, उच्च-गुणवत्ता वाले कार्य बनाए।
- विविधता: कार्यों ने परिदृश्यों और कौशलों की एक विशाल विविधता को कवर किया, जो पिछले तरीकों की तुलना में बहुत अधिक है।
- कठिनाई: कार्य वास्तव में कठिन थे। यहाँ तक कि एक बहुत ही स्मार्ट AI (Claude Opus 4.6) भी कई में संघर्ष कर रहा था, जिसे हल करने के लिए औसतन 37 चरणों की आवश्यकता थी।
- प्रदर्शन: जब उन्होंने अपने स्वयं के रोबोटों (Qwen3 जैसे मॉडल का उपयोग करके) को इन नए कार्यों पर प्रशिक्षित किया, तो वे पुराने, कम विविध डेटा पर प्रशिक्षित रोबोटों की तुलना में टर्मिनल कार्यों को हल करने में काफी बेहतर हो गए।
निचोड़
SkillSynth रोबोटों के अभ्यास के लिए "कंप्यूटर के कामों" की एक विशाल, विविध लाइब्रेरी को स्वचालित रूप से उत्पन्न करने का एक तरीका है। कंप्यूटर कौशल एक-दूसरे से कैसे जुड़ते हैं, इसका मानचित्र बनाकर, वे अनंत नए, यथार्थवादी चुनौतीपूर्ण कार्य बना सकते हैं। यह AI एजेंटों को अधिक बहुमुखी और सक्षम बनाने में मदद करता है, न कि केवल सॉफ्टवेयर को ठीक करने में, बल्कि कंप्यूटर के विविध वास्तविक कार्यों को संभालने में।
नोट: पेपर स्पष्ट रूप से बताता है कि इन सिंथेसाइज्ड कार्यों का उपयोग पहले से ही Hy3 Preview (एक टेनसेंट उत्पाद) को प्रशिक्षित करने के लिए किया गया है, जिससे टर्मिनल सेटिंग्स में एजेंट के रूप में इसकी क्षमता में सुधार हुआ है। लेखक इस सामान्य टर्मिनल ऑटोमेशन में सुधार के अलावा किसी भी चिकित्सा, नैदानिक या अन्य विशिष्ट भविष्य के अनुप्रयोगों का दावा नहीं करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।