Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining
यह शोध पत्र एक नैदानिक अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि जबकि इंटरेक्शन ट्रेजेक्टरी माइनिंग कंप्यूटर का उपयोग करने वाले एजेंटों के लिए पठनीय और उच्च-शुद्धता वाली स्किल लाइब्रेरी जेनरेट कर सकती है, वर्तमान दृष्टिकोण सीमा पहचान (बाउंड्री डिटेक्शन), सेगमेंट प्रतिनिधित्व और ऑफलाइन रिवॉर्ड मॉडलिंग की सीमाओं के कारण इन अंतर्दृष्टि को विश्वसनीय क्रॉस-डोमेन पॉलिसी सुधारों में बदलने में विफल रहता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक रोबोट सहायक है जो एक इंसान की तरह कंप्यूटर का उपयोग कर सकता है: क्लिक करना, टाइप करना, स्क्रॉल करना और कॉपी करना। इस रोबोट को अधिक स्मार्ट बनाने के लिए, हम अक्सर इसे एक "चीट शीट" देते हैं जिसे SKILL.md कहा जाता है। इस चीट शीट को एक रेसिपी बुक (नुस्खों की किताब) की तरह समझें। रोबोट को यह बताने के बजाय कि "यहाँ क्लिक करो, फिर वहाँ टाइप करो," यह किताब कहती है: "यहाँ 'ईमेल भेजने' या 'फाइल सेव करने' का तरीका दिया गया है।" ये पहले से तैयार किए गए कौशल (skills) हैं जो रोबोट के काम को समझने और ठीक करने में आसान बनाते हैं।
आमतौर पर, इंसानों को इन रेसिपी बुक्स को हाथ से लिखना पड़ता है। लेकिन क्या होगा अगर हम रोबोट को यह सिखा सकें कि वह लोगों को कंप्यूटर इस्तेमाल करते हुए देखकर अपनी खुद की रेसिपी बुक कैसे लिखे? यह शोध बिल्कुल यही करने की कोशिश कर रहा है।
प्रयोग: एक रोबोट को अपनी खुद की कुकबुक लिखना सिखाना
शोधकर्ताओं ने कंप्यूटर उपयोग के कच्चे डेटा (raw data) को एक रेसिपी बुक में बदलने के लिए एक तीन-चरणीय मशीन बनाई:
- वीडियो को काटना (Cutting the Video): कल्पना कीजिए कि आप किसी को काम करते हुए देखते हुए एक लंबा वीडियो देख रहे हैं। मशीन "सीन बदलावों" (scene changes) को खोजने की कोशिश करती है। यदि व्यक्ति अचानक टाइप करना बंद कर देता है और स्क्रॉल करना शुरू कर देता है, तो मशीन वीडियो को वहीं से काट देती है, यह सोचते हुए, "ठीक है, यह एक कार्य था; अब वे एक नया कार्य शुरू कर रहे हैं।"
- दृश्यों को समूहबद्ध करना (Grouping the Scenes): मशीन इन छोटे वीडियो क्लिप्स को लेती है और समान दिखने वाले क्लिप्स को एक साथ रखने की कोशिश करती है। यदि 50 क्लिप्स "कॉपी और पेस्ट" करने से संबंधित हैं, तो वह उन्हें "डेटा ट्रांसफर" लेबल वाले एक बकेट (bucket) में डाल देती है। इसके बाद, वह प्रत्येक बकेट के लिए एक डिजिटल "फिंगरप्रिंट" बनाती है ताकि रोबोट बाद में उन्हें पहचान सके।
- रोबोट को प्रशिक्षित करना (Training the Robot): अंत में, वे रोबोट को इन बकेट्स का उपयोग करके एक नई पॉलिसी (नियमों का एक सेट) सिखाते हैं। लक्ष्य यह देखना है कि क्या रोबोट एक नए कार्य को देखकर कह सकता है, "सबसे पहले, मुझे 'सर्च' स्किल का उपयोग करना चाहिए, फिर 'कॉपी' स्किल का," और क्या वह वास्तव में पहले से बेहतर तरीके से इसे कर पाता है।
परिणाम: एक मिला-जुला अनुभव
परिणाम थोड़े वैसे ही थे जैसे किसी सुंदर द्वीप की ओर ले जाने वाले खजाने के नक्शे का मिलना, लेकिन आपने जो नाव बनाई है वह बहुत अच्छी तरह से नहीं चलती।
अच्छी खबर: नक्शा पठनीय है
जिस विशिष्ट डेटासेट (जिसे "IW" कहा जाता है) का उपयोग उन्होंने नक्शा बनाने के लिए किया था, उस पर मशीन ने डेटा को व्यवस्थित करने में बहुत अच्छा काम किया। आठ में से पांच "बकेट्स" बहुत शुद्ध थे। उदाहरण के लिए, एक बकेट लगभग पूरी तरह से "दस्तावेज़ संपादन" (Document Editing) कार्यों से बना था, और दूसरा पूरी तरह से "संदेश भेजने" से संबंधित था।
- उपमा: यह ऐसा है जैसे आपने एक रोबट को कपड़ों के मिले-जुले ढेर को छाँटने के लिए कहा, और उसने सफलतापूर्वक सभी मोज़ों को एक टोकरी में और सभी शर्टों को दूसरी टोकरी में डाल दिया। छंटाई स्पष्ट थी और इंसानों के लिए समझना आसान था।
बुरी खबर: नाव नहीं चलती
यहाँ पेचीदा बात यह है: केवल इसलिए कि रोबोट ने कपड़े छाँटने में अच्छा काम किया, इसका मतलब यह नहीं है कि वह उन्हें पहनना भी जानता है।
- ट्रांसफर की समस्या (The Transfer Problem): जब उन्होंने इन सॉर्ट किए गए कौशलों को नए कार्यों (अलग वेबसाइटों या अलग प्रकार के काम) पर आज़माया, तो रोबोट में कोई सुधार नहीं हुआ। वास्तव में, कभी-कभी यह थोड़ा और खराब भी हो गया।
- "फ्रीक्वेंसी" का आश्चर्य: शोधकर्ताओं ने रोबोट का परीक्षण एक बहुत ही सरल, मूर्ख आधार रेखा (baseline) के विरुद्ध किया: एक "फ्रीक्वेंसी प्रायर" (Frequency Prior)। यह बस एक नियम है जो कहता है, "जो कौशल पहले सबसे अधिक बार उपयोग किया गया था, उसे ही फिर से करें।" आश्चर्यजनक रूप से, इस साधारण नियम ने रोबोट के जटिल, सीखे हुए कौशलों को भी पीछे छोड़ दिया।
- उपमा: कल्पना कीजिए कि आप एक नई भाषा सीखने की कोशिश कर रहे हैं। आप एक जटिल व्याकरण की किताब पढ़ते हैं (रोबोट के कौशल), लेकिन आप गलतियाँ करते रहते हैं। वहीं, आपका दोस्त कल सुनी गई सबसे आम बात ("नमस्ते") को दोहराता है, और इस विशिष्ट परीक्षण में वह आपसे बेहतर संवाद कर लेता है।
यह क्यों विफल हुआ?
पेपर कुछ कारणों का सुझाव देता है कि रोबोट की "रेसिपी बुक" उसे बेहतर खाना पकाने में मदद क्यों नहीं कर पाई:
- क्रम को भूल जाना (Missing the Order): मशीन ने कार्यों को उनके प्रकार (क्लिक, टाइप) के आधार पर समूहबद्ध किया, लेकिन वह क्रम को भूल गई। उसे पता था कि "क्लिक" और "पेस्ट" एक ही बकेट में हैं, लेकिन उसे यह याद नहीं रहा कि आपको पेस्ट करने से पहले क्लिक करना होता है। यह केक बनाने के लिए सामग्री के बैग जैसा है, लेकिन यह भूल जाना कि मिश्रण को किस क्रम में मिलाना है।
- गलत कट (Wrong Cuts): मशीन कभी-कभी "वीडियो" को गलत जगहों पर काट देती थी। वह शायद टाइपिंग में लंबे अंतराल को एक नया कौशल समझ लेती थी, जबकि वह उसी कौशल का निरंतर हिस्सा था।
- रिवॉर्ड सिस्टम (The Reward System): रोबोट को प्रशिक्षित करने के लिए उपयोग किया गया सिस्टम (जिसे GR0 कहा जाता है) फीडबैक देने में बहुत अच्छा नहीं था। यह एक ऐसे कोच की तरह था जो विशिष्ट सुधारों के बजाय अस्पष्ट प्रशंसा देता है।
मुख्य निष्कर्ष (The Bottom Line)
यह पेपर एक डायग्नोस्टिक स्टडी (नैदानिक अध्ययन) है, जिसका अर्थ है कि यह किसी बड़ी जीत का दावा करने के बजाय इस बात पर अधिक केंद्रित है कि कोई चीज़ पूरी तरह से क्यों काम नहीं कर पाई।
- क्या काम किया: हम कंप्यूटर उपयोग के डेटा को स्वचालित रूप से निकालकर कौशलों की एक पठनीय, व्यवस्थित सूची बना सकते हैं जिसे इंसान समझ सकते हैं।
- क्या काम नहीं किया: उस सूची को एक ऐसे रोबोट में बदलना जो उन कौशलों का उपयोग करके नई समस्याओं को हल कर सके, बहुत कठिन है। वर्तमान विधि एक साधारण "सबसे सामान्य क्रिया का अनुमान लगाने" वाली रणनीति से बेहतर नहीं रही।
लेखक निष्कर्ष निकालते हैं कि हालांकि हमारे पास यह देखने का एक अच्छा तरीका है कि लोग कैसे काम करते हैं, लेकिन हमने अभी तक यह नहीं सुलझाया है कि उस संरचना को रोबोट के लिए एक विश्वसनीय, हस्तांतरणीय कौशल सेट में कैसे बदला जाए। "रेसिपी बुक" मौजूद है, लेकिन रोबोट को अपने दम पर खाना पकाने में सक्षम होने के लिए अभी और अभ्यास की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।