← नवीनतम पेपर
🤖 machine learning

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

यह शोध पत्र LLM एजेंट पोस्ट-ट्रेनिंग के लिए एक लागत-कुशल ऑन-पॉलिसी डेटा ऑग्मेंटेशन रणनीति प्रस्तावित करता है जो लर्नर-प्रेरित संदर्भों (learner-induced contexts) में लघु, अनफ़िल्टर्ड शिक्षक निरंतरता (teacher continuations) को पर्यवेक्षण बजट आवंटित करती है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण शुद्ध व्यवहार क्लोनिंग (behavioral cloning) से बेहतर प्रदर्शन करता है और कई बेंचमार्क पर अधिक जटिल फ़िल्टरिंग विधियों के बराबर या उनसे बेहतर परिणाम देता है।

मूल लेखक: Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

प्रकाशित 2026-09-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक छात्र किसी जटिल कौशल को सीख रहा है, जैसे कि किसी रहस्य को सुलझाना या किसी टूटी हुई मशीन को ठीक करना, यह देखते हुए कि एक विशेषज्ञ शुरू से अंत तक उस कार्य को कैसे करता है। छात्र विशेषज्ञ द्वारा किए गए हर कदम की नकल करता है, इस उम्मीद में कि उस सटीक पथ का अनुकरण करके वे अंततः समस्या को अपने दम पर हल करना सीख जाएंगे। यह दृष्टिकोण शुरू में अच्छा काम करता है, लेकिन इसमें एक छिपा हुआ दोष है। वास्तविक दुनिया में, छात्र गलतियाँ करते हैं। जब एक छात्र लड़खड़ाता है, तो स्थिति बदल जाती है। अब वे जिस पथ पर हैं, वह उस पूर्ण पथ से अलग है जिस पर विशेषज्ञ चला था। यदि छात्र केवल विशेषज्ञ के पूर्ण पथ पर ही अभ्यास करता है, तो वह उन अव्यवस्थित और अपूर्ण स्थितियों के लिए तैयार नहीं रहता जिनका सामना उसे वास्तव में करना पड़ेगा। वे मास्टर का अनुसरण करना तो जानते हैं, लेकिन वे यह नहीं जानते कि पटरी से उतर जाने पर वापस कैसे आना है।

यही वह केंद्रीय चुनौती है जिसे स्टैनफोर्ड यूनिवर्सिटी और न्यूयॉर्क यूनिवर्सिटी के शोधकर्ताओं ने आर्टिफिशियल इंटेलिजेंस एजेंटों के लिए हल करने का प्रयास किया है। ये एजेंट बड़े भाषा मॉडल (large language models) हैं जिन्हें दुनिया में कार्य करने के लिए डिज़ाइन किया गया है, चाहे वह उत्तर खोजने के लिए वेब खोजना हो, एक टेक्स्ट-आधारित सिमुलेशन में घरेलू कार्यों की योजना बनाना हो, या सॉफ्टवेयर बग्स को ठीक करने के लिए कोड लिखना हो। इन एजेंटों को सिखाने के लिए, डेवलपर्स अक्सर 'सुपरवाइज्ड फाइन-ट्यूनिंग' नामक एक विधि का उपयोग करते हैं, जहाँ एक शक्तिशाली "शिक्षक" मॉडल आदर्श उदाहरण तैयार करता है, और एक छोटा "छात्र" मॉडल उन्हें कॉपी करना सीखता है। मानक दृष्टिकोण यह है कि छात्र को हजारों ऐसे पूर्ण, एंड-टू-एंड प्रदर्शनों (demonstrations) को खिलाया जाता है। हालाँकि, शोधकर्ताओं ने महसूस किया कि यह विधि छात्र को उसकी अपनी गलतियों से निपटने के लिए अक्षम छोड़ देती है। जब छात्र अंततः एक वास्तविक कार्य के दौरान कोई गलती करता है, तो वह खुद को एक ऐसे संदर्भ (context) में पाता है जिसे उसने पहले कभी नहीं देखा है, क्योंकि शिक्षक ने कभी यह प्रदर्शित नहीं किया कि किसी विशिष्ट प्रकार की विफलता के बाद क्या करना है।

इसे ठीक करने के लिए, टीम ने प्रशिक्षण डेटा उत्पन्न करने का एक नया तरीका प्रस्तावित किया। केवल शिक्षक को शुरुआत से लेकर काम पूरा करने तक देखने के बजाय, वे छात्र को पहले समस्या को हल करने का प्रयास करने देते हैं। जब छात्र अटक जाता है या गलत मोड़ ले लेता है, तो शोधकर्ता छात्र को रोक देते हैं और शिक्षक से हस्तक्षेप करने और ठीक उसी बिंदु से आगे बढ़ने का तरीका दिखाने के लिए कहते हैं जहाँ विफलता हुई थी। इसे "ऑन-पॉलिसी" (on-policy) डेटा कहा जाता है, क्योंकि यह छात्र के वास्तविक व्यवहार के आधार पर उत्पन्न किया जाता है न कि किसी काल्पनिक पूर्ण पथ के आधार पर। लेकिन इससे एक नया, व्यावहारिक प्रश्न खड़ा हुआ: शोधकर्ताओं को अपने सीमित संसाधनों को कैसे खर्च करना चाहिए? शिक्षक की प्रतिक्रियाएँ उत्पन्न करना महंगा और समय लेने वाला है। क्या उन्हें अपना बजट शुरू से पूरे लंबे प्रदर्शनों के लिए खर्च करना चाहिए? क्या उन्हें शिक्षक से छात्र की हर एक गलती के लिए लंबे, विस्तृत समाधान लिखने के लिए कहना चाहिए? या क्या उन्हें केवल कुछ त्वरित चरणों के लिए कहना चाहिए ताकि छात्र को वापस सही रास्ते पर लाया जा सके?

शोधकर्ताओं ने इसे एक बजट-आवंटन समस्या के रूप में माना। उन्होंने तीन अलग-अलग प्रकार के कार्यों में विभिन्न रणनीतियों का परीक्षण किया: एक सर्च इंजन का उपयोग करके जटिल प्रश्नों के उत्तर देना, एक सिम्युलेटेड घर के वातावरण में भौतिक क्रियाओं की योजना बनाना, और कमांड-लाइन इंटरफेस में कोड को डीबग करना। उन्होंने पूर्ण विशेषज्ञ प्रदर्शनों की नकल करने की मानक विधि की तुलना अपने नए दृष्टिकोण से की, जिसमें शिक्षक को छात्र की विशिष्ट विफलताओं के क्षणों पर छोटे, लक्षित सुधार प्रदान करने के लिए कहा गया। उन्होंने दो प्रकार के लागतों को सावधानीपूर्वक ट्रैक किया: शिक्षक की प्रतिक्रियाएँ उत्पन्न करने के लिए उपयोग की गई कंप्यूटर शक्ति की कुल मात्रा, और छात्र को प्रशिक्षित करने के लिए वास्तव में उपयोग किए गए डेटा की मात्रा।

परिणाम स्पष्ट और आश्चर्यजनक थे। प्रत्येक वातावरण में जिसका उन्होंने परीक्षण किया, उसमें केवल छात्र की विशिष्ट विफलताओं के बिंदुओं पर शिक्षक के मार्गदर्शन के कुछ चरणों की मांग करने वाली रणनीति सबसे कुशल सिद्ध हुई। जब शोधकर्ताओं ने शिक्षक को केवल कुछ चरणों तक सीमित कर दिया—कभी-कभी केवल एक या तीन चरण—तो छात्र ने उन लंबे, अधिक विस्तृत सुधारों पर प्रशिक्षित होने की तुलना में काफी बेहतर सीखा। वास्तव में, शिक्षक से विफलता के बिंदु से एक पूर्ण, आदर्श समाधान लिखने के लिए कहना अक्सर संसाधनों की बर्बादी थी। अतिरिक्त लंबाई ने छात्र को सीखने में मदद नहीं की; इसने केवल उनके बजट का अधिक उपभोग किया बिना प्रदर्शन में सुधार किए।

अध्ययन ने पाया कि शिक्षक के कुछ कदम, जो ठीक वहीं रखे गए जहाँ छात्र को उनकी आवश्यकता थी, एक लंबे और अधिक क्यूरेटेड समापन की तुलना में कहीं अधिक मूल्यवान थे। उदाहरण के लिए, कोडिंग कार्यों पर, एक पद्धति जिसने सामान्य प्रशिक्षण डेटा के एक छोटे से अंश का उपयोग किया, और इन छोटे, ऑन-द-फ्लाई सुधारों के साथ मिलकर, छात्र को उस सिस्टम के प्रदर्शन के बराबर पहुँचा दिया जिसे एक विशाल डेटासेट पर प्रशिक्षित किया गया था और फिर एक जटिल, बहु-चरणीय सुदृढीकरण शिक्षण (reinforcement learning) प्रक्रिया के अधीन किया गया था। शोधकर्ताओं ने यह भी पाया कि शिक्षक की प्रतिक्रियाओं को इस आधार पर फ़िल्टर करना कि वे "सफल" या "पूर्ण" थीं या नहीं, हमेशा संसाधनों का सबसे अच्छा उपयोग नहीं था। कभी-कभी, यह देखना कि एक शिक्षक एक कठिन स्थिति में कैसे नेविगेट करता है, भले ही अंतिम परिणाम पूर्ण न हो, केवल पूर्ण पथों को देखने की तुलना में अधिक शिक्षाप्रद था।

मुख्य निष्कर्ष यह है कि एक AI एजेंट को सिखाने का सबसे प्रभावी तरीका उसे यह दिखाना नहीं है कि कार्य कैसे किया जाना चाहिए, बल्कि उस क्षण में हस्तक्षेप करना है जब वह भटक जाता है। अपने बजट को लंबे प्रदर्शनों के बजाय छोटे, लक्षित सुधारों पर खर्च करके, डेवलपर्स अधिक स्मार्ट एजेंट बना सकते हैं जो अपनी गलतियों से उबरने में बेहतर होते हैं। यह शोध सुझाव देता है कि कई जटिल कार्यों के लिए, विशेषज्ञ मार्गदर्शन का थोड़ा सा हिस्सा, जो सही समय पर दिया गया हो, बहुत काम आता है। यह दृष्टिकोण अधिक कुशल शिक्षण की अनुमति देता है, जिसका अर्थ है कि समान कंप्यूटिंग शक्ति के साथ, हम ऐसे एजेंट बना सकते हैं जो अधिक मजबूत और वास्तविक दुनिया की अनिश्चितताओं को संभालने में सक्षम हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →