SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills
यह शोध पत्र SkillDisCo को प्रस्तुत करता है, जो FSM-परिभाषित परिदृश्यों में सफल एजेंट ट्रेसेस को पुन: प्रयोज्य, पैरामीटराइज्ड कंट्रोल-फ्लो सबग्राफ्स में आसवित (distill) करके निष्पादन योग्य प्रक्रियात्मक कौशल (procedural skills) बनाने का एक ढांचा है, जिससे ALFWorld और WebArena जैसे बेंचमार्क में सफलता दर में सुधार होता है और रीजनिंग लागत कम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोट बटलर (नौकर) को अपना घर साफ करना सिखा रहे हैं।
समस्या: "शून्य से शुरुआत करने" का जाल (The "Start From Scratch" Trap)
अभी, यदि आप उससे कहें "बिस्तर पर रखी किताब ढूँढो और उसे लॉन्ड्री बास्केट में रख दो," तो वह इसे हर बार समझ लेता है। उसे सोचना पड़ता है: ठीक है, पहले मुझे बेडरूम में जाना है। फिर मुझे बिस्तर को देखना है। ओह, वहाँ एक किताब है। मैं इसे उठाता हूँ। अब मैं बास्केट की ओर चलता हूँ।
यदि आप उससे कहें "डेस्क पर रखा मग ढूँढो और उसे किचन में रखो," तो उसे पूरी प्रक्रिया को फिर से से नया बनाना पड़ता है। वह डेस्क तक जाता है, डेस्क को देखता है, मग उठाता है, और किचन की ओर जाता है। यह एक ऐसे छात्र की तरह है जो गणित के सवाल को सही तो हल करता है, लेकिन हर बार नया सवाल देखते ही उसे जोड़ (addition) करना फिर से सीखना पड़ता है। इससे समय बर्बाद होता है, बहुत अधिक दिमागी शक्ति (कंप्यूटिंग पावर) खर्च होती है, और रोबोट धीमा हो जाता है।
समाधान: SKILL-DISCO (द "रेसिपी शेफ")
यह पेपर एक सिस्टम पेश करता है जिसे SKILL-DISCO कहा जाता है। इसे एक मास्टर शेफ की तरह समझें जो रोबोट बटलर को कई बार सफलतापूर्वक खाना बनाते हुए देखता है। केवल खाना बनाने का वीडियो सेव करने के बजाय, शेफ पैटर्न (तरीकों) को पहचानता है।
शेफ ध्यान देता है: "हर बार जब रोबोट सूप बनाता है, तो वह तीन समान कदम उठाता है: 1. बर्तन ढूँढो, 2. उसमें पानी भरो, 3. उसे चूल्हे पर रखो।"
शेफ फिर एक यूनिवर्सल रेसिपी लिखता है जिसे "सूप बनाना" कहा जाता है। यह रेसिपी यह नहीं कहती कि "बाईं ओर रखा नीला बर्तन इस्तेमाल करें।" यह कहती है "एक बर्तन ढूँढो, उसे पानी से भरो, उसे चूल्हे पर रखो।"
यह कैसे काम करता है (दो-चरणीय प्रक्रिया)
डिस्टिलेशन (डिस्टिलेशन - "पैटर्न हंटर"):
सिस्टम सैकड़ों सफल कार्यों (जैसे किताब ढूँढना, मग ढूँढना या रिमोट ढूँढना) को देखता है। यह विशिष्ट विवरणों (जैसे "किताब लाल थी" या "मग दूसरी शेल्फ पर था") को अनदेखा कर देता है और गति के ढांचे (structure) पर ध्यान केंद्रित करता है। यह अव्यवस्थित, लंबी क्रियाओं की सूची को साफ और पुन: उपयोग योग्य "कंट्रोल-फ्लो" मानचित्रों में बदल देता है।
सादृश्य (Analogy): यह किसी को 50 बार भूलभुलैया (maze) में रास्ता खोजते हुए देखने जैसा है। "लाल दीवार के पास बाएं मुड़ें, फिर नीले बॉक्स के पास दाएं मुड़ें" याद रखने के बजाय, वह यह पैटर्न समझ जाता है कि "दीवार के साथ तब तक चलें जब तक कि आप डेड एंड (बंद रास्ते) तक न पहुँच जाएँ, फिर दाएं मुड़ें।"कंपाइलेशन (कंपाइलेशन - "क्वालिटी कंट्रोल"):
केवल रेसिपी लिखना काफी नहीं है; रेसिपी का वास्तव में काम करना भी जरूरी है। सिस्टम इन पैटर्न्स को सख्त, निष्पादित होने योग्य कोड (जैसे पायथन स्क्रिप्ट) में बदल देता है। यह सुनिश्चित करने के लिए इनका परीक्षण करता है कि ये क्रैश न हों।
सादृश्य: यह एक टेस्ट किचन की तरह है। वे "सूप बनाना" रेसिपी लेते हैं, उसे एक बर्तन, एक पैन और एक कटोरे के साथ आजमाते हैं। यदि यह काम करता है, तो वे इस पर "अनुमोदित" (Approved) की मुहर लगाते हैं और इसे रोबोट की आधिकारिक निर्देश पुस्तिका में डाल देते हैं। यदि यह विफल होता है, तो वे इसे फेंक देते हैं।
परिणाम: यह क्यों महत्वपूर्ण है
इस पेपर का परीक्षण दो दुनियाओं पर किया गया:
- ALFWorld: एक टेक्स्ट-आधारित घर जहाँ रोबोट को वस्तुओं को ढूँढना होता है।
- WebArena: एक सिम्युलेटेड इंटरनेट जहाँ रोबोट को वेबसाइटों पर नेविगेट करना होता है।
क्या हुआ?
- तेज़: रोबोट को अब उतना सोचना नहीं पड़ा। किसी वस्तु को खोजने के लिए 19 कदम उठाने के बजाय, वह बस "सर्च" स्किल का उपयोग कर सकता था और 3 स्टेप्स में काम पूरा कर सकता था। यह पैदल चलने के बजाय लिफ्ट लेने जैसा था।
- स्मार्ट: रोबोट ने कम गलतियाँ कीं। क्योंकि "रेसिपियाँ" परीक्षित और सत्यापित थीं, इसलिए वे विश्वसनीय रूप से काम करती थीं।
- ट्रांसफ़रेबल (स्थानांतरणीय): यह सबसे शानदार हिस्सा है। उन्होंने इस सिस्टम को एक बहुत ही शक्तिशाली, महंगे AI मॉडल ( "मास्टर शेफ") का उपयोग करके प्रशिक्षित किया। फिर, उन्होंने परिणामी "रेसिपी" एक बहुत छोटे, सस्ते AI मॉडल को दे दी। छोटा मॉडल, जो आमतौर पर संघर्ष करता है, अचानक बड़े मॉडल के लगभग बराबर हो गया क्योंकि उसके पास मास्टर शेफ की रेसिपी जेब में थी।
निष्कर्ष (The Bottom Line)
SKILL-DISCO AI एजेंटों को हर बार पहिए का पुन: आविष्कार करने से रोकता है। यह सफल अनुभवों को पुन: उपयोग योग्य, सत्यापित "कौशलों" (जैसे ऐप्स की लाइब्रेरी) में बदल देता है जो एजेंट को तेज़, सस्ता और बिना खुद स्मार्ट हुए भी मजबूत मॉडलों से सीखने में सक्षम बनाता है।
यह क्या नहीं करता
पेपर स्पष्ट है: यह केवल उन कार्यों के लिए काम करता है जिनमें एक स्पष्ट "शुरुआत और अंत" वाला रास्ता हो, जैसे कमरा साफ करना या वेब फॉर्म भरना। यह AI को कविता लिखने या उपन्यास की भावनात्मक बारीकियों को समझने में मदद नहीं करेगा, क्योंकि इन कार्यों में पालन करने के लिए कोई निश्चित "रेसिपी" नहीं होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।