← नवीनतम पेपर
🤖 AI

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1 एक नवीन विधि पेश करता है जो एजेंट की विफलता प्रक्षेपवक्र (failure trajectories) से स्वचालित रूप से निष्पादन योग्य रनटाइम पैच उत्पन्न करने के लिए एक समर्पित "हार्नेस इंजीनियर" को प्रशिक्षित करने हेतु ऑनलाइन सुदृढीकरण शिक्षण (online reinforcement learning) का उपयोग करता है, जो लक्षित एजेंट के मॉडल वेट्स में अपडेट की आवश्यकता के बिना कई बेंचमार्क में कार्य सफलता दरों में महत्वपूर्ण सुधार करता है।

मूल लेखक: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

प्रकाशित 2026-08-04
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान रोबोट सहायक है। आप उसे एक काम देते हैं, जैसे कि "20 डॉलर से कम में एकदम सही लाल शर्ट ढूँढो," और वह काम करना शुरू कर देता है। लेकिन कभी-कभी, रोबोट भ्रमित हो जाता है। शायद वह गलत बटन दबा देता है, भूल जाता है कि वह क्या ढूँढ रहा था, या एक ही चीज़ को बार-बार खरीदने के चक्कर में एक लूप में फंस जाता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस रोबोट को "एजेंट" कहा जाता है, और उसके विचारों, कार्यों और गलतियों के उलझे हुए निशान को "ट्रैजेक्टरी" (trajectory) कहा जाता है।

आमतौर पर, जब कोई रोबोट गलती करता है, तो उसे ठीक करने का एकमात्र तरीका यह होता है कि वापस शुरुआती बिंदु पर जाकर उसके पूरे मस्तिष्क (brain) को फिर से प्रशिक्षित किया जाए। इसमें बहुत समय और ऊर्जा लगती है। लेकिन एक और तरीका है: रोबोट के मस्तिष्क को बदलने के बजाय, आप उसके "हार्नेस" (harness) को बदल सकते हैं। हार्नेस को एक सुरक्षा गियर, उसकी चेकलिस्ट और उसके संचार मार्गदर्शिका के रूप में सोचें जो सब कुछ एक साथ है। यह वह कोड है जो रोबट को बताता है कि दुनिया से कैसे बात करनी है, अपने काम की जाँच कैसे करनी है, और जब वह लड़खड़ा जाए तो खुद को कैसे संभालना है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम एक रोबोट को उसके पिछले विफलताओं के आधार पर अपने स्वयं के हार्नेस को ठीक करना सिखा सकते हैं, बिना हर बार उसके मूल मस्तिष्क को फिर से प्रशिक्षित किए?

यही वह चीज़ है जिसे "हार्नेस-R1" (Harness-R1) एक्सप्लोर करता है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया जहाँ एक विशेष "इंजीनियर" AI, रोबोट के हार्नेस को फिर से लिखने के लिए उसके पिछले विफलताओं का अध्ययन करना सीखता है। यह कैसे काम करता है: सबसे पहले, वे एक मानक रोबोट ("टारगेट") को कार्य हल करने की कोशिश करने और विफल होने देते हैं। फिर, इंजीनियर AI उन विफलताओं की कहानियों को देखता है और हार्नेस को ठीक करने के लिए निर्देशों का एक नया सेट—एक "पैच" (patch)—लिखता है। महत्वपूर्ण बात यह है कि वे केवल यह अनुमान नहीं लगाते कि पैच अच्छा है या नहीं; वे वास्तव में उस पैच को रोबोट पर लगाते हैं और उसे फिर से कार्य करने देते हैं। यदि रोबोट अधिक बार सफल होता है, तो इंजीनियर को इनाम मिलता है और वह बेहतर पैच लिखना सीखता है। यदि पैच चीज़ों को और खराब कर देता है, तो इंजीनियर सीख जाता है कि उसे दोबारा ऐसा नहीं करना है।

परिणाम काफी शानदार हैं। जब उन्होंने तीन अलग-अलग चुनौतीपूर्ण खेलों (ऑनलाइन शॉपिंग, एक टेक्स्ट-आधारित घर में नेविगेट करना, और एक डेटाबेस प्रबंधित करना) पर इसका परीक्षण किया, तो मानक रोबोट केवल 44.3% बार सफल हुआ। जब हार्नेस-R1 इंजीनियर ने उसके हार्नेस को ठीक करना सीखा, तो सफलता दर बढ़कर 53.6% हो गई। यह केवल हार्नेस को बदलकर 9.3 प्रतिशत अंक का सुधार है, मस्तिष्क को बदले बिना। इससे भी बेहतर, उन्होंने इसे एक ऐसे रोबोट पर आज़माया जिसे पहले से ही अधिक स्मार्ट बनने के लिए प्रशिक्षित किया गया था, और इंजीनियर अभी भी इसके प्रदर्शन को 5.0 अंक और बढ़ाने में सफल रहा।

यह पेपर यह भी दिखाता है कि यह किसी एक विशिष्ट रोबोट के लिए केवल एक इत्तेफाक नहीं है। जिस इंजीनियर को उन्होंने प्रशिक्षित किया था, वह एक बिल्कुल नए, अलग रोबोट को देख सकता था जिसे उसने पहले कभी नहीं देखा था, उसकी विफलताओं का अध्ययन कर सकता था, और एक कस्टम सुधार लिख सकता था जिसने उस नए रोबोट को सफल होने में मदद की। यह सुझाव देता है कि "हार्नेस" को संपादित करना सीखने की एक कला है जिसे AI को सिखाया जा सकता है, जिससे वे उन रोबोट्स के साथ सह-विकसित (co-evolve) हो सकते हैं जिनकी वे मदद करते हैं, जिससे उन्हें उनके मूल मस्तिष्क को फिर से प्रशिक्षित किए बिना भी अधिक स्मार्ट और विश्वसनीय बनाया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →