← नवीनतम पेपर
🤖 AI

SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills

यह शोध पत्र SkillDisCo को प्रस्तुत करता है, जो FSM-परिभाषित परिदृश्यों में सफल एजेंट ट्रेसेस को पुन: प्रयोज्य, पैरामीटराइज्ड कंट्रोल-फ्लो सबग्राफ्स में आसवित (distill) करके निष्पादन योग्य प्रक्रियात्मक कौशल (procedural skills) बनाने का एक ढांचा है, जिससे ALFWorld और WebArena जैसे बेंचमार्क में सफलता दर में सुधार होता है और रीजनिंग लागत कम होती है।

मूल लेखक: Zhongxin Guo, Danrui Qi, Hanwen Gu, Peng Cheng, Yongqiang Xiong

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhongxin Guo, Danrui Qi, Hanwen Gu, Peng Cheng, Yongqiang Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोट बटलर (नौकर) को अपना घर साफ करना सिखा रहे हैं।

समस्या: "शून्य से शुरुआत करने" का जाल (The "Start From Scratch" Trap)
अभी, यदि आप उससे कहें "बिस्तर पर रखी किताब ढूँढो और उसे लॉन्ड्री बास्केट में रख दो," तो वह इसे हर बार समझ लेता है। उसे सोचना पड़ता है: ठीक है, पहले मुझे बेडरूम में जाना है। फिर मुझे बिस्तर को देखना है। ओह, वहाँ एक किताब है। मैं इसे उठाता हूँ। अब मैं बास्केट की ओर चलता हूँ।

यदि आप उससे कहें "डेस्क पर रखा मग ढूँढो और उसे किचन में रखो," तो उसे पूरी प्रक्रिया को फिर से से नया बनाना पड़ता है। वह डेस्क तक जाता है, डेस्क को देखता है, मग उठाता है, और किचन की ओर जाता है। यह एक ऐसे छात्र की तरह है जो गणित के सवाल को सही तो हल करता है, लेकिन हर बार नया सवाल देखते ही उसे जोड़ (addition) करना फिर से सीखना पड़ता है। इससे समय बर्बाद होता है, बहुत अधिक दिमागी शक्ति (कंप्यूटिंग पावर) खर्च होती है, और रोबोट धीमा हो जाता है।

समाधान: SKILL-DISCO (द "रेसिपी शेफ")
यह पेपर एक सिस्टम पेश करता है जिसे SKILL-DISCO कहा जाता है। इसे एक मास्टर शेफ की तरह समझें जो रोबोट बटलर को कई बार सफलतापूर्वक खाना बनाते हुए देखता है। केवल खाना बनाने का वीडियो सेव करने के बजाय, शेफ पैटर्न (तरीकों) को पहचानता है।

शेफ ध्यान देता है: "हर बार जब रोबोट सूप बनाता है, तो वह तीन समान कदम उठाता है: 1. बर्तन ढूँढो, 2. उसमें पानी भरो, 3. उसे चूल्हे पर रखो।"

शेफ फिर एक यूनिवर्सल रेसिपी लिखता है जिसे "सूप बनाना" कहा जाता है। यह रेसिपी यह नहीं कहती कि "बाईं ओर रखा नीला बर्तन इस्तेमाल करें।" यह कहती है "एक बर्तन ढूँढो, उसे पानी से भरो, उसे चूल्हे पर रखो।"

यह कैसे काम करता है (दो-चरणीय प्रक्रिया)

  1. डिस्टिलेशन (डिस्टिलेशन - "पैटर्न हंटर"):
    सिस्टम सैकड़ों सफल कार्यों (जैसे किताब ढूँढना, मग ढूँढना या रिमोट ढूँढना) को देखता है। यह विशिष्ट विवरणों (जैसे "किताब लाल थी" या "मग दूसरी शेल्फ पर था") को अनदेखा कर देता है और गति के ढांचे (structure) पर ध्यान केंद्रित करता है। यह अव्यवस्थित, लंबी क्रियाओं की सूची को साफ और पुन: उपयोग योग्य "कंट्रोल-फ्लो" मानचित्रों में बदल देता है।
    सादृश्य (Analogy): यह किसी को 50 बार भूलभुलैया (maze) में रास्ता खोजते हुए देखने जैसा है। "लाल दीवार के पास बाएं मुड़ें, फिर नीले बॉक्स के पास दाएं मुड़ें" याद रखने के बजाय, वह यह पैटर्न समझ जाता है कि "दीवार के साथ तब तक चलें जब तक कि आप डेड एंड (बंद रास्ते) तक न पहुँच जाएँ, फिर दाएं मुड़ें।"

  2. कंपाइलेशन (कंपाइलेशन - "क्वालिटी कंट्रोल"):
    केवल रेसिपी लिखना काफी नहीं है; रेसिपी का वास्तव में काम करना भी जरूरी है। सिस्टम इन पैटर्न्स को सख्त, निष्पादित होने योग्य कोड (जैसे पायथन स्क्रिप्ट) में बदल देता है। यह सुनिश्चित करने के लिए इनका परीक्षण करता है कि ये क्रैश न हों।
    सादृश्य: यह एक टेस्ट किचन की तरह है। वे "सूप बनाना" रेसिपी लेते हैं, उसे एक बर्तन, एक पैन और एक कटोरे के साथ आजमाते हैं। यदि यह काम करता है, तो वे इस पर "अनुमोदित" (Approved) की मुहर लगाते हैं और इसे रोबोट की आधिकारिक निर्देश पुस्तिका में डाल देते हैं। यदि यह विफल होता है, तो वे इसे फेंक देते हैं।

परिणाम: यह क्यों महत्वपूर्ण है
इस पेपर का परीक्षण दो दुनियाओं पर किया गया:

  • ALFWorld: एक टेक्स्ट-आधारित घर जहाँ रोबोट को वस्तुओं को ढूँढना होता है।
  • WebArena: एक सिम्युलेटेड इंटरनेट जहाँ रोबोट को वेबसाइटों पर नेविगेट करना होता है।

क्या हुआ?

  • तेज़: रोबोट को अब उतना सोचना नहीं पड़ा। किसी वस्तु को खोजने के लिए 19 कदम उठाने के बजाय, वह बस "सर्च" स्किल का उपयोग कर सकता था और 3 स्टेप्स में काम पूरा कर सकता था। यह पैदल चलने के बजाय लिफ्ट लेने जैसा था।
  • स्मार्ट: रोबोट ने कम गलतियाँ कीं। क्योंकि "रेसिपियाँ" परीक्षित और सत्यापित थीं, इसलिए वे विश्वसनीय रूप से काम करती थीं।
  • ट्रांसफ़रेबल (स्थानांतरणीय): यह सबसे शानदार हिस्सा है। उन्होंने इस सिस्टम को एक बहुत ही शक्तिशाली, महंगे AI मॉडल ( "मास्टर शेफ") का उपयोग करके प्रशिक्षित किया। फिर, उन्होंने परिणामी "रेसिपी" एक बहुत छोटे, सस्ते AI मॉडल को दे दी। छोटा मॉडल, जो आमतौर पर संघर्ष करता है, अचानक बड़े मॉडल के लगभग बराबर हो गया क्योंकि उसके पास मास्टर शेफ की रेसिपी जेब में थी।

निष्कर्ष (The Bottom Line)
SKILL-DISCO AI एजेंटों को हर बार पहिए का पुन: आविष्कार करने से रोकता है। यह सफल अनुभवों को पुन: उपयोग योग्य, सत्यापित "कौशलों" (जैसे ऐप्स की लाइब्रेरी) में बदल देता है जो एजेंट को तेज़, सस्ता और बिना खुद स्मार्ट हुए भी मजबूत मॉडलों से सीखने में सक्षम बनाता है।

यह क्या नहीं करता
पेपर स्पष्ट है: यह केवल उन कार्यों के लिए काम करता है जिनमें एक स्पष्ट "शुरुआत और अंत" वाला रास्ता हो, जैसे कमरा साफ करना या वेब फॉर्म भरना। यह AI को कविता लिखने या उपन्यास की भावनात्मक बारीकियों को समझने में मदद नहीं करेगा, क्योंकि इन कार्यों में पालन करने के लिए कोई निश्चित "रेसिपी" नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →