Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories
Harness-R1 एक नवीन विधि पेश करता है जो एजेंट की विफलता प्रक्षेपवक्र (failure trajectories) से स्वचालित रूप से निष्पादन योग्य रनटाइम पैच उत्पन्न करने के लिए एक समर्पित "हार्नेस इंजीनियर" को प्रशिक्षित करने हेतु ऑनलाइन सुदृढीकरण शिक्षण (online reinforcement learning) का उपयोग करता है, जो लक्षित एजेंट के मॉडल वेट्स में अपडेट की आवश्यकता के बिना कई बेंचमार्क में कार्य सफलता दरों में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान रोबोट सहायक है। आप उसे एक काम देते हैं, जैसे कि "20 डॉलर से कम में एकदम सही लाल शर्ट ढूँढो," और वह काम करना शुरू कर देता है। लेकिन कभी-कभी, रोबोट भ्रमित हो जाता है। शायद वह गलत बटन दबा देता है, भूल जाता है कि वह क्या ढूँढ रहा था, या एक ही चीज़ को बार-बार खरीदने के चक्कर में एक लूप में फंस जाता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस रोबोट को "एजेंट" कहा जाता है, और उसके विचारों, कार्यों और गलतियों के उलझे हुए निशान को "ट्रैजेक्टरी" (trajectory) कहा जाता है।
आमतौर पर, जब कोई रोबोट गलती करता है, तो उसे ठीक करने का एकमात्र तरीका यह होता है कि वापस शुरुआती बिंदु पर जाकर उसके पूरे मस्तिष्क (brain) को फिर से प्रशिक्षित किया जाए। इसमें बहुत समय और ऊर्जा लगती है। लेकिन एक और तरीका है: रोबोट के मस्तिष्क को बदलने के बजाय, आप उसके "हार्नेस" (harness) को बदल सकते हैं। हार्नेस को एक सुरक्षा गियर, उसकी चेकलिस्ट और उसके संचार मार्गदर्शिका के रूप में सोचें जो सब कुछ एक साथ है। यह वह कोड है जो रोबट को बताता है कि दुनिया से कैसे बात करनी है, अपने काम की जाँच कैसे करनी है, और जब वह लड़खड़ा जाए तो खुद को कैसे संभालना है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम एक रोबोट को उसके पिछले विफलताओं के आधार पर अपने स्वयं के हार्नेस को ठीक करना सिखा सकते हैं, बिना हर बार उसके मूल मस्तिष्क को फिर से प्रशिक्षित किए?
यही वह चीज़ है जिसे "हार्नेस-R1" (Harness-R1) एक्सप्लोर करता है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया जहाँ एक विशेष "इंजीनियर" AI, रोबोट के हार्नेस को फिर से लिखने के लिए उसके पिछले विफलताओं का अध्ययन करना सीखता है। यह कैसे काम करता है: सबसे पहले, वे एक मानक रोबोट ("टारगेट") को कार्य हल करने की कोशिश करने और विफल होने देते हैं। फिर, इंजीनियर AI उन विफलताओं की कहानियों को देखता है और हार्नेस को ठीक करने के लिए निर्देशों का एक नया सेट—एक "पैच" (patch)—लिखता है। महत्वपूर्ण बात यह है कि वे केवल यह अनुमान नहीं लगाते कि पैच अच्छा है या नहीं; वे वास्तव में उस पैच को रोबोट पर लगाते हैं और उसे फिर से कार्य करने देते हैं। यदि रोबोट अधिक बार सफल होता है, तो इंजीनियर को इनाम मिलता है और वह बेहतर पैच लिखना सीखता है। यदि पैच चीज़ों को और खराब कर देता है, तो इंजीनियर सीख जाता है कि उसे दोबारा ऐसा नहीं करना है।
परिणाम काफी शानदार हैं। जब उन्होंने तीन अलग-अलग चुनौतीपूर्ण खेलों (ऑनलाइन शॉपिंग, एक टेक्स्ट-आधारित घर में नेविगेट करना, और एक डेटाबेस प्रबंधित करना) पर इसका परीक्षण किया, तो मानक रोबोट केवल 44.3% बार सफल हुआ। जब हार्नेस-R1 इंजीनियर ने उसके हार्नेस को ठीक करना सीखा, तो सफलता दर बढ़कर 53.6% हो गई। यह केवल हार्नेस को बदलकर 9.3 प्रतिशत अंक का सुधार है, मस्तिष्क को बदले बिना। इससे भी बेहतर, उन्होंने इसे एक ऐसे रोबोट पर आज़माया जिसे पहले से ही अधिक स्मार्ट बनने के लिए प्रशिक्षित किया गया था, और इंजीनियर अभी भी इसके प्रदर्शन को 5.0 अंक और बढ़ाने में सफल रहा।
यह पेपर यह भी दिखाता है कि यह किसी एक विशिष्ट रोबोट के लिए केवल एक इत्तेफाक नहीं है। जिस इंजीनियर को उन्होंने प्रशिक्षित किया था, वह एक बिल्कुल नए, अलग रोबोट को देख सकता था जिसे उसने पहले कभी नहीं देखा था, उसकी विफलताओं का अध्ययन कर सकता था, और एक कस्टम सुधार लिख सकता था जिसने उस नए रोबोट को सफल होने में मदद की। यह सुझाव देता है कि "हार्नेस" को संपादित करना सीखने की एक कला है जिसे AI को सिखाया जा सकता है, जिससे वे उन रोबोट्स के साथ सह-विकसित (co-evolve) हो सकते हैं जिनकी वे मदद करते हैं, जिससे उन्हें उनके मूल मस्तिष्क को फिर से प्रशिक्षित किए बिना भी अधिक स्मार्ट और विश्वसनीय बनाया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।