← नवीनतम पेपर
💬 NLP

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

यह शोध पत्र तर्क देता है कि कौशल को निष्पादन योग्य प्रोग्रामों के रूप में प्रस्तुत करना नए डोमेन में LLM एजेंटों को अनुकूलित करने के लिए सबसे लागत प्रभावी रणनीति है, जो प्रस्तावित "SpeedRunner" एजेंट के माध्यम से यह प्रदर्शित करता है कि पिछले प्रक्षेप पथों (trajectories) से इन प्रोग्रामों को क्रमिक रूप से सीखना और उन्हें रिफैक्टर करना विविध वातावरणों में मजबूती बनाए रखते हुए लागत को महत्वपूर्ण रूप से कम करता है।

मूल लेखक: Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

प्रकाशित 2026-08-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, बिखरे हुए खेल के मैदान में रास्ता खोजना सिखा रहे हैं। शुरुआत में, रोबोट एक जिज्ञासु छोटे बच्चे की तरह होता है: वह आगे बढ़ने की कोशिश करता है, दीवार से टकरा जाता है, भ्रमित हो जाता है, फिर से कोशिश करता है, और शायद थोड़ा सा सीखता है। यह आधुनिक AI "एजेंटों" के काम करने का तरीका है। वे शक्तिशाली भाषा मॉडल हैं जो निर्देशों को समझ सकते हैं और कंप्यूटर से बात कर सकते हैं, लेकिन जब वे किसी नए, जटिल कार्य का सामना करते हैं, तो उन्हें अक्सर हर एक कदम को शुरू से "सोचना" पड़ता है। वे शायद एक दरवाजा खोलने की कोशिश करते हैं, विफल होते हैं, फिर दूसरा तरीका आज़माते हैं, फिर विफल होते हैं, और तब तक चलते रहते हैं जब तक कि वे इसे सही नहीं कर लेते। हालांकि यह काम करता है, लेकिन यह धीमा और महंगा है। हर बार जब रोबट "सोचता" है, तो इसमें पैसा और समय खर्च होता है, ठीक वैसे ही जैसे किसी इंसान द्वारा पहेली सुलझाने के लिए बिताए गए हर मिनट के लिए भुगतान करना।

बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह है: हम इन रोबोटों को बेहतर कैसे बना सकते हैं ताकि उन्हें बार-बार एक ही चीज़ दोबारा न सीखनी पड़े? इसका उत्तर आमतौर पर "कौशल" (skills) में निहित होता है। एक कौशल को एक शॉर्टकट या पहले से बने रेसिपी की तरह समझें। हर बार केक बनाने की प्रक्रिया को शून्य से समझने के बजाय, आप बस एक ऐसी रेसिपी का पालन करते हैं जिसे आपने पहले ही लिख लिया है। कुछ समय के लिए, वैज्ञानिकों ने इन रेसिपीज़ को साधारण अंग्रेजी में लिखने की कोशिश की। लेकिन इस पेपर के लेखकों ने सोचा: क्या होगा अगर हम रेसिपीज़ को कोड में लिखें? कोड एक अत्यंत सटीक निर्देश पुस्तिका की तरह है जिसे एक कंप्यूटर बिना भ्रमित हुए या समय बर्बाद किए तुरंत पालन कर सकता है। बड़ा विचार यह है कि यदि हम रोबोट के अव्यवस्थित 'गलती और सुधार' (trial-and-error) के अनुभवों को साफ, पुन: प्रयोज्य (reusable) कोड में बदल सकें, तो रोबोट बहुत तेज़, सस्ता और अधिक स्मार्ट हो सकता है।

यही वह विचार है जिसे "स्पीडरनर" (SpeedRunner) प्रोजेक्ट के पीछे की टीम ने परखने का फैसला किया। वे यह देखना चाहते थे कि क्या एक AI एजेंट काम करते समय अपने स्वयं के कोड-आधारित कौशल लिखना सीख सकता है, बजाय इसके कि उसे केवल बताया जाए कि क्या करना है। उन्होंने एक ऐसा सिस्टम बनाया जहाँ AI एक गेम खेलता है, गलतियाँ करता है, और फिर एक दूसरा, विशेष "कोडिंग एजेंट" रोबोट के इतिहास को देखता है। यह कोडिंग एजेंट एक जासूस और एक प्रोग्रामर दोनों की भूमिका निभाता है। यह रोबोट के पिछले प्रयासों को स्कैन करता है, उन पैटर्न को ढूंढता है जहाँ रोबोट बार-बार विफल हुआ या एक ही लंबे अनुक्रम (sequence) को दोहराता रहा, और फिर इसे ठीक करने के लिए कोड का एक नया टुकड़ा लिखता है। यह किसी को जूते के फीते बांधने की कोशिश करते हुए देखने जैसा है, यह महसूस करना कि वे बार-बार फीते फंसा रहे हैं, और फिर उन्हें सही ढंग से बांधने के लिए एक छोटी, सटीक निर्देश पुस्तिका लिखना ताकि वे फिर कभी न फंसें।

शोधकर्ताओं ने इस विचार का परीक्षण तीन बहुत अलग आभासी दुनियाओं में किया: एक विज्ञान प्रयोगशाला जहाँ आपको रसायनों को मिलाना होता है, एक ग्रिड वर्ल्ड जहाँ आपको वस्तुओं को उठाने के लिए निर्देशों का पालन करना होता है, और एक सर्वाइवल गेम जहाँ आपको संसाधन जुटाने होते हैं और ज़ोंबी से लड़ना होता है। इन सभी जगहों पर, "स्पीडरनर" एजेंट ने चलते-चलते अपने स्वयं के कोड कौशल लिखना सीखा। परिणाम चौंकाने वाले थे। जबकि अन्य तरीके या तो लूप में फंस जाते थे या जैसे-जैसे वे सीखते थे वैसे-वैसे महंगे होते जाते थे, स्पीडरनर वास्तव में जितना अधिक सीखता गया, उतना ही सस्ता और तेज़ होता गया। इसने क्रियाओं के लंबे, जटिल अनुक्रमों को छोटे, पुन: प्रयोज्य कोड फंक्शन में बदल दिया। उदाहरण के लिए, रोबोट को पेड़ खोजने के बारे में सोचने में बहुत पैसा खर्च करने के बजाय, उसने "find_tree" नामक एक सरल कोड कमांड सीखा जिसे वह तुरंत उपयोग करने के लिए बस क्लिक कर सकता था।

यह पेपर सुझाव देता है कि यह दृष्टिकोण लागत के मामले में एक गेम-चेंजर है। एक परीक्षण में, स्पीडरनर एजेंट ने उसी समस्या को हल करने के लिए मानक विधि की तुलना में लगभग एक-आठवें हिस्से के पैसे (कंप्यूटर प्रोसेसिंग पावर के रूप में) का उपयोग किया। इसने केवल पैसे ही नहीं बचाए, बल्कि यह कार्यों में भी बेहतर हुआ। मुख्य बात यह थी कि कोडिंग एजेंट ने केवल यह याद नहीं किया कि क्या हुआ; इसने विश्लेषण किया कि चीजें क्यों विफल हुईं। यदि रोबोट कोई संसाधन खोजने में विफल रहा क्योंकि वह उसे देख नहीं पा रहा था, तो कोडिंग एजेंट ने हार मानने से पहले "क्षेत्र को छानने" (sweep the area) के लिए एक नया फंक्शन लिखा। इसने एजेंट को मजबूत (robust) बनाया, जिसका अर्थ है कि वह पर्यावरण में होने वाले अचानक बदलावों, जैसे कि अचानक ज़ोंबी के प्रकट होने पर भी, बिना घबराए काम कर सका।

हालाँकि, लेखक इस बात पर ध्यान देने में सावधानी बरतते हैं कि यह हर स्थिति के लिए कोई जादुई समाधान नहीं है। उन्होंने पाया कि यदि रोबोट पहले से ही किसी कार्य में बहुत अच्छा है, तो उसे कोड का उपयोग करने के लिए मजबूर करना उसे थोड़ा बहुत कठोर बना सकता है, जैसे कि एक रोबोट जो रेसिपी का इतनी सख्ती से पालन करता है कि यदि ओवन खराब हो जाए तो वह अनुकूलन नहीं कर पाता। लेकिन अधिकांश जटिल, दीर्घकालिक कार्यों के लिए, अपने अव्यवस्थित अनुभवों को साफ कोड में बदलना, AI एजेंटों को स्मार्ट और किफायती दोनों बनाने का सबसे अच्छा तरीका लगता है। यह अध्ययन दिखाता है कि एजेंटों को खेलते समय अपने स्वयं के "स्वचालित शॉर्टकट" लिखने की अनुमति देकर, हम ऐसे सिस्टम बना सकते हैं जो कुशलता से सीखते हैं बिना हर बार नई चुनौती का सामना करने पर शून्य से फिर से प्रशिक्षित होने की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →