← नवीनतम पेपर
🤖 machine learning

Revisiting DAgger in the Era of LLM-Agents

यह शोध पत्र लॉन्ग-होरिज़न एलएलएम एजेंटों के लिए डेटासेट एग्रीगेशन (DAgger) का पुनरावलोकन करता है ताकि ऑन-पॉलिसी इंटरेक्शन को डेंस टीचर सुपरविजन के साथ जोड़कर कोवेरिएट शिफ्ट को प्रभावी ढंग से कम किया जा सके, जो सॉफ्टवेयर इंजीनियरिंग कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है जहाँ इस पद्धति के साथ प्रशिक्षित छोटे मॉडल बड़े बेसलाइन सिस्टम से बेहतर प्रदर्शन करते हैं।

मूल लेखक: Changhao Li, Rushi Qiang, Jiawei Huang, Chenxiao Gao, Chao Zhang, Niao He, Bo Dai

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changhao Li, Rushi Qiang, Jiawei Huang, Chenxiao Gao, Chao Zhang, Niao He, Bo Dai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (छात्र) को एक विशाल, अव्यवस्थित कोडबेस में जटिल सॉफ़्टवेयर बग्स ठीक करना सिखा रहे हैं। आप, मास्टर (शिक्षक), एक विशेषज्ञ हैं जो जानते हैं कि इन समस्याओं को कैसे हल किया जाता है।

लक्ष्य यह है कि प्रशिक्षु को इन समस्याओं को स्वयं हल करने के योग्य बनाया जाए, ताकि अंततः उन्हें आपकी सहायता की आवश्यकता न रहे। यह शोध पत्र तर्क देता है कि वर्तमान में प्रशिक्षुओं को सिखाने के दो सबसे सामान्य तरीके दोषपूर्ण हैं, और यह एक नई, स्मार्ट पद्धति प्रस्तावित करता है जिसे DAgger कहा जाता है (Large Language Models के युग के लिए पुनर्कल्पित)।

यहाँ समस्या और समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।

समस्या: दो दोषपूर्ण शिक्षण शैलियाँ

यह शोध पत्र इन AI एजेंटों को प्रशिक्षित करने के दो मौजूदा तरीकों की पहचान करता है, जिनमें से प्रत्येक की एक बड़ी कमजोरी है:

1. "परछाईं" वाली विधि (Supervised Fine-Tuning / SFT)

  • यह कैसे काम करती है: प्रशिक्षु मास्टर को एक समस्या को शुरू से अंत तक हल करते हुए देखता है और हर कदम की पूरी तरह से नकल करने की कोशिश करता है।
  • दोष (Covariate Shift): यह एक ड्राइवर को केवल खाली राजमार्गों पर आदर्श ड्राइविंग के वीडियो दिखाकर सिखाने जैसा है। लेकिन वास्तविक दुनिया में, प्रशिक्षु शुरुआत में एक छोटी सी गलती कर सकता है (जैसे कि पहिया थोड़ा जल्दी मोड़ देना)। क्योंकि उन्हें केवल "आदर्श" परिदृश्यों पर प्रशिक्षित किया गया था, वे उस गलती से उबरना नहीं जानते। वे घबरा जाते हैं, कार सड़क से उतर जाती है, और पूरी यात्रा विफल हो जाती है।
  • AI के संदर्भ में: मॉडल शिक्षक की नकल करना सीखता है, लेकिन यदि वह एक छोटी सी गलती करता है, तो वह एक ऐसी "अवस्था" (स्थिति) में प्रवेश कर जाता है जिसे उसने पहले कभी नहीं देखा होता, जिससे वह विफलता के चक्रव्यूह में फंस जाता है।

2. "प्रयास और त्रुटि" वाली विधि (Reinforcement Learning / RL)

  • यह कैसे काम करती है: प्रशिक्षु को अकेले कोडबेस में छोड़ दिया जाता है। वे समस्या को हल करने का प्रयास करते हैं, और यदि वे अंत में सफल होते हैं, तो उन्हें एक स्वर्ण पदक (gold star) मिलता है। यदि वे विफल होते हैं, तो उन्हें कुछ नहीं मिलता।
  • दोष (Sparse Feedback): यह किसी को खाना बनाना सिखाने जैसा है जहाँ आपको पूरा भोजन तैयार करने के बाद ही केवल यह बताया जाता है कि "अच्छा काम किया" या "बुरा काम किया"। यदि उन्होंने पहली सामग्री ही जला दी थी, तो उन्हें यह नहीं पता चलेगा कि किस कदम ने आपदा का कारण बना। उन्हें अनुमान लगाना होगा, और इसमें बहुत अधिक समय और बर्बाद भोजन (कंप्यूटिंग पावर) लगेगा।
  • AI के संदर्भ में: मॉडल को एक लंबे कार्य के बिल्कुल अंत में फीडबैक मिलता है, जिससे रास्ते में की गई विशिष्ट गलतियों से सीखना कठिन हो जाता है।

समाधान: "सुरक्षा जाल" विधि (DAgger)

शोध पत्र एक नई पद्धति प्रस्तावित करता है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाती है। कल्पना कीजिए कि एक ड्राइविंग इंस्ट्रक्टर बगल वाली सीट पर बैठा है लेकिन उसके पास एक सुरक्षा जाल (safety net) है।

यह नई विधि कैसे काम करती है:

  1. मिश्रण: प्रशिक्षु कुछ कदमों के लिए कार चलाता है (समस्या को हल करता है) है।
  2. हस्तक्षेप: यदि प्रशिक्षु भटकने लगता है या कोई गलती करता है, तो मास्टर (शिक्षक) रास्ता सही करने और कार को वापस सही मार्ग पर लाने के लिए एक क्षण के लिए स्टीयरिंग व्हील संभाल लेता है।
  3. पाठ: महत्वपूर्ण बात यह है कि प्रशिक्षु केवल मास्टर को इसे ठीक करते हुए नहीं देखता; उन्हें उस सटीक क्षण में सिखाया जाता है जब वे भ्रमित थे कि मास्टर क्या करते।
  4. सहायता कम करना: समय के साथ, मास्टर का हस्तक्षेप कम और कम होता जाता है। प्रशिक्षु अधिक दूरी तय करता है, लेकिन जब भी उन्हें कोई झटका लगता है, मास्टर वहां होते हैं और उस विशिष्ट झटके के लिए सही कदम दिखाते हैं।

यह क्यों बेहतर है:

  • यथार्थवाद: प्रशिक्षु उन अव्यवस्थित, वास्तविक दुनिया की स्थितियों को संभालना सीखते हैं जहाँ वे वास्तव में गलतियाँ करते हैं (जैसा कि "परछाईं" विधि में होता है)।
  • समृद्ध फीडबैक: उन्हें हर एक कदम के लिए विशिष्ट पाठ मिलता है, न कि केवल अंत में एक ग्रेड (जैसा कि "प्रयास और त्रुटि" विधि में होता है)।
  • दक्षता: क्योंकि मास्टर उन्हें शुरुआती गलतियों से उबरने में मदद करते हैं, इसलिए प्रशिक्षु विफलताओं के चक्रव्यूह में फंसकर समय बर्बाद नहीं करते हैं।

परिणाम: छोटे मॉडल, बड़ी जीत

शोधकर्ताओं ने इस पद्धति का परीक्षण सॉफ्टवेयर इंजीनियरिंग एजेंटों (कोड ठीक करने वाले AI) पर किया। उन्होंने दो आकारों के स्टूडेंट मॉडल का उपयोग किया: एक छोटा (4 बिलियन पैरामीटर्स) और एक मध्यम (8 बिलियन पैरामीटर्स)।

  • 4B मॉडल: इस नई पद्धति का उपयोग करके, छोटे 4B मॉडल ने कई प्रकाशित 8B मॉडलों से बेहतर प्रदर्शन किया। यह एक ऐसे छोटे कार जैसा था जिसके पास एक पूर्ण सुरक्षा जाल था और वह एक बड़े कार से बेहतर प्रदर्शन कर रहा था जिसका सुरक्षा जाल टूटा हुआ था।
  • 8B मॉडल: मध्यम मॉडल और भी बेहतर हो गया, और लगभग 32B मॉडलों (जो बहुत बड़े और महंगे हैं) के करीब पहुँच गया।

AI के व्यवहार में क्या बदलाव आया?

  • कम घबराहट: मॉडल अब लूप में फंसने या गलती होने पर हार मानने से बचते हैं।
  • बेहतर रिकवरी: जब वे कोई गलती करते हैं, तो उन्हें पता होता है कि उसे कैसे ठीक करना है और वापस पटरी पर कैसे आना है।
  • स्थिरता: प्रशिक्षण प्रक्रिया अधिक सुचारू हो गई और अन्य विधियों की तुलना में कम बार क्रैश हुई।

सारांश

शोध पत्र का तर्क है कि AI एजेंटों को लंबे, जटिल कार्यों (जैसे सॉफ़्टवेयर बग्स ठीक करना) को संभालने के लिए सिखाने हेतु, हमें उन्हें केवल आदर्श उदाहरण नहीं दिखाने चाहिए या उन्हें अंधे होकर विफल होने के लिए नहीं छोड़ना चाहिए। इसके बजाय, हमें उन्हें प्रयास करने देना चाहिए, उन्हें गलतियाँ करने देनी चाहिए, लेकिन तुरंत उन्हें उन विशिष्ट गलतियों को संभालने का सही तरीका सिखाना चाहिए। यह "सुरक्षा जाल" दृष्टिकोण (DAgger) छोटे, सस्ते AI मॉडलों को बहुत बड़े और महंगे मॉडलों के समान प्रदर्शन करने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →