← नवीनतम पेपर
🤖 AI

Pioneer Agent: Continual Improvement of Small Language Models in Production

यह शोध पत्र 'पायनियर एजेंट' (Pioneer Agent) का परिचय देता है, जो एक क्लोज्ड-लूप सिस्टम है जो कोल्ड-स्टार्ट अनुकूलन और प्रोडक्शन विफलता रिकवरी दोनों के लिए डेटा, हाइपरपैरामीटर और लर्निंग रणनीतियों को संयुक्त रूप से अनुकूलित करके प्रोडक्शन में छोटे भाषा मॉडलों के निरंतर सुधार को स्वचालित करता है, और नए प्रस्तावित 'एडैप्टएफटी-बेंच' (AdaptFT-Bench) पर महत्वपूर्ण प्रदर्शन लाभ और रिग्रेशन के विरुद्ध मजबूती प्रदर्शित करता है।

मूल लेखक: Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

प्रकाशित 2026-04-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन बहुत छोटा, रोबोट सहायक है। इसे चलाना सस्ता और तेज़ है, लेकिन अभी यह अपने विशिष्ट काम में थोड़ा अनाड़ी है। शायद यह ग्राहकों की शिकायतों को समझने में बुरा है, या यह गणित की गलतियाँ करता रहता है, या यह समाचार लेखों का सारांश सही ढंग से नहीं बना पाता है।

आमतौर पर, इस रोबोट को ठीक करना मानव इंजीनियरों के लिए एक दुस्वप्न होता है। उन्हें अंदाज़ा लगाना पड़ता है कि उसे कौन सा डेटा खिलाना है, कौन सी सेटिंग्स को ट्यून करना है, और वे यह उम्मीद करते हैं कि वे अनजाने में उन चीजों को खराब न कर दें जिनमें रोबोट पहले से ही अच्छा था। यह अंधेरे में कार चलाते समय रेडियो ट्यून करने की कोशिश करने जैसा है।

पायनियर एजेंट (Pioneer Agent) एक नया "सुपर-रोबोट" है जिसे उस अनाड़ी रोबोट को स्वचालित रूप से ठीक करने के लिए डिज़ाइन किया गया है। यह केवल अंदाज़ा नहीं लगाता; यह जांच करता है, सीखता है, और खुद को एक निरंतर लूप में सुधारता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. दो मोड: "इंटर्न" बनाम "सर्जन"

पायनियर एजेंट के पास स्थिति के आधार पर दो अलग-अलग काम होते हैं:

  • कोल्ड-स्टार्ट मोड (द इंटर्न): कल्पना कीजिए कि आप एजेंट को एक साधारण नोट देते हैं: "इस रोबोट को गणित की समस्याओं को हल करने में अच्छा बनाओ।" एजेंट अभी गणित के बारे में कुछ नहीं जानता। वह इंटरनेट से गणित की समस्याएं खोजता है, एक अभ्यास टेस्ट बनाता है, और रोबोट को प्रशिक्षित करना शुरू करता है। वह अलग-अलग शिक्षण विधियों (जैसे चरण-दर-चरण तर्क दिखाना बनाम केवल उत्तर देना) को आजमाता है और सबसे अच्छे तरीकों को चुनता है। यह एक अथक इंटर्न की तरह है जो शून्य से प्रशिक्षण कार्यक्रम तैयार करता है।
  • प्रोडक्शन मोड (द सर्जन): अब कल्पना कीजिए कि रोबốt पहले से ही एक वास्तविक कारखाने में काम कर रहा है, लेकिन वह विशिष्ट गलतियाँ कर रहा है (जैसे, वह "रिफंड" को "एक्सचेंज" के साथ भ्रमित करता रहता है)। एजेंट एक सर्जन की तरह कार्य करता है। वह रोबोट द्वारा की गई विशिष्ट त्रुटियों को देखता है, पता लगाता है कि वे क्यों हुईं, और केवल उन गलतियों को ठीक करने के लिए एक छोटा, लक्षित पाठ योजना (lesson plan) बनाता है। महत्वपूर्ण बात यह है कि वह यह सुनिश्चित करता है कि "रिफंड" की गलती को ठीक करते समय, वह अनजाने में रोबोट को "एक्सचेंज" को संभालने का तरीका न भुला दे।

2. असली मंत्र: "जासूस और फ़िल्टर"

पायनियर एजेंट का जादू केवल रोबोट को प्रशिक्षित करना नहीं है; यह इस बारे में है कि वह खराब डेटा को कैसे संभालता है।

वास्तविक दुनिया में, डेटा अव्यवस्थित होता है। कभी-कभी ग्राहक टाइपिंग की गलतियों के साथ प्रश्न लिखता है, या उत्तर कुंजी गलत होती है, या कोई रोबोट को धोखा देने की कोशिश करता है।

  • नेइव रिट्रेनिंग (पुराना तरीका): यदि आप इस अव्यवस्थित डेटा को वापस रोबोट में फीड करते हैं, तो वह भ्रमित हो जाता है। वह टाइपो और ट्रिक्स को भी सीख लेता है। यह स्टैटिक और गलत अनुवादों से भरी रेडियो स्टेशन को सुनकर फ्रेंच सीखने की कोशिश करने जैसा है। रोबोट और खराब हो जाता है।
  • पायनियर एजेंट (नया तरीका): एजेंट एक सख्त जासूस की तरह कार्य करता है। रोबोट को सिखाने से पहले, वह डेटा को फ़िल्टर करता है।
    • जासूस: "रुको, यह गणित की समस्या कहती है 'मैंने सेब नहीं खरीदा,' लेकिन उत्तर कुंजी कहती है 'खरीदा।' यह एक चाल है! मैं रोबोट को यह नहीं सिखाऊंगा।"
    • फ़िल्टर: यह खराब उदाहरणों को फेंक देता है और केवल स्पष्ट, सही उदाहरणों को रखता है। यह "हार्ड नेगेटिव्स" (tricky examples) भी बनाता है—ऐसे पेचीदा उदाहरण जो दिखने में समान हैं लेकिन जिनके उत्तर अलग हैं—ताकि रोबोट को बारीक विवरण सिखाए जा सकें।

3. "सेफ्टी नेट" (रोलबैक)

AI को ठीक करने में सबसे बड़े डर में से एक "रिग्रेशन समस्या" (Regression Problem) है। यह तब होता है जब आप एक बग को ठीक करते हैं, लेकिन अनजाने में किसी ऐसी चीज़ को तोड़ देते हैं जो ठीक चल रही थी।

पायनियर एजेंट में एक अंतर्निहित सेफ्टी नेट है।

  • हर बार जब वह कोई बदलाव करता है, तो वह एक परीक्षण चलाता है।
  • यदि रोबलेट नए कार्य में बेहतर होता है लेकिन पुराने कार्य में खराब हो जाता है, तो एजेंट तुरंत कहता है, "नहीं, यह काम नहीं किया," और पिछले संस्करण पर रोलबैक (वापस) हो जाता है।
  • यह एक वीडियो गेम में "अनडू" (Undo) बटन दबाने जैसा है जिसे आप गलती होते ही स्वचालित रूप से दबा देते हैं। यह सुनिश्चित करता है कि रोबोट समय के साथ कभी खराब न हो; वह या तो बेहतर होता है या वैसा ही रहता है।

4. "ग्राफ सर्च" (एक साथ कई रास्तों को आजमाना)

केवल एक के बाद एक सुधार आजमाने के बजाय (जिसमें बहुत समय लगता है), एजेंट मोंटे कार्लो ग्राफ सर्च (Monte Carlo Graph Search) नामक रणनीति का उपयोग करता है।

कल्प Imagine कीजिए कि आप एक भूलभुलैया में सबसे अच्छा रास्ता खोजने की कोशिश कर रहे हैं।

  • सामान्य दृष्टिकोण: एक रास्ते पर चलें, दीवार से टकराएं, वापस आएं, फिर अगला रास्ता आजमाएं।
  • पायनियर एजेंट दृष्टिकोण: यह एक ही समय में 10 अलग-अलग "एक्सप्लोरर्स" (खोजकर्ता) भेजता है। एक अधिक डेटा वाले पथ को आजमाता है, दूसरा अलग सीखने की गति को आजमाता है, तीसरा अलग शिक्षण शैली को आजमाता है।
  • जब एक एक्सप्लोरर को शॉर्टकट मिल जाता है, तो एजेंट कहता है, "बहुत बढ़िया! आइए उस शॉर्टकट को अन्य रास्तों के सबसे अच्छे हिस्सों के साथ जोड़ दें।" यह सबसे तेज़ और सटीक रास्ता खोजने के लिए बेहतरीन विचारों को आपस में मिला देता है।

5. परिणाम: अनाड़ी से मास्टर तक

पेपर दिखाता है कि यह सिस्टम अविश्वसनीय रूप से अच्छा काम करता है:

  • गणित और तर्क (Math & Reasoning): इसने एक छोटे रोबोट को, जो गणित के सवालों का मुश्किल से जवाब दे पाता था, लगभग 44% सही उत्तर देने वाले सॉल्वर में बदल दिया (एक छोटे मॉडल के लिए यह एक बड़ी छलांग है)।
  • ग्राहक सेवा (Customer Service): इसने एक रोबोट को ठीक किया जो विभिन्न ग्राहक इरादों (intents) को भ्रमित कर रहा था, जिससे इसकी सटीकता 85% से बढ़कर लगभग 99.3% हो गई।
  • कोड और लेखन: इसने कोड जनरेशन और सारांश (summarization) में काफी सुधार किया।

बड़ी तस्वीर (The Big Picture)

पायनियर एजेंट को AI विकास के लिए एक "सेल्फ-ड्राइविंग कार" के रूप में देखें।

  • पहले: आपको ड्राइवर बनना पड़ता था, मैन्युअल रूप से ट्रैफिक के बीच से गाड़ी चलानी पड़ती थी, अंदाज़ा लगाना पड़ता था कि कौन सा मोड़ लेना है, और यह उम्मीद करनी पड़ती थी कि आप दुर्घटनाग्रस्त न हो जाएं।
  • अब: आप बस कार को बताते हैं कि आप कहाँ जाना चाहते हैं ("इस रोबोट को ठीक करो"), और कार ट्रैफिक से बचती है, गड्ढों (खराब डेटा) से बचती है, लगातार मैप चेक करती है (रिग्रेशन टेस्टिंग), और आपको किसी भी इंसान की तुलना में कहीं अधिक तेज़ी से और सुरक्षित रूप से वहां पहुँचा देती है।

यह साबित करता है कि हमें बेहतरीन परिणाम प्राप्त करने के लिए विशाल, महंगे सुपर-कंप्यूटरों की आवश्यकता नहीं है। सही "स्वचालित मैकेनिक" के साथ, छोटे, सस्ते रोबोट भी अपने विशिष्ट कार्यों में विश्व स्तरीय विशेषज्ञ बन सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →