Hybrid-Gym: Training Coding Agents to Generalize Across Tasks
यह शोध पत्र Hybrid-Gym को प्रस्तुत करता है, जो एक प्रशिक्षण वातावरण है जिसमें स्केलेबल सिंथेटिक टास्क शामिल हैं जिन्हें भाषा मॉडलों को हस्तांतरणीय कोडिंग कौशल सिखाने के लिए डिज़ाइन किया गया है, जो SWE-Bench और SWT-Bench जैसे विविध वास्तविक-विश्व बेंचमार्क पर उनके सामान्यीकरण प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन प्रशिक्षु (apprentice) को एक मास्टर मैकेनिक बनने के लिए सिखाने की कोशिश कर रहे हैं।
पुराना तरीका (वर्तमान AI प्रशिक्षण):
आजकल के अधिकांश शोधकर्ता इस प्रशिक्षु को एक विशिष्ट समस्या देकर सिखाते हैं: "यह रहा एक टूटा हुआ कार इंजन (एक GitHub issue)। इसे ठीक करो।" वे ऐसा हजारों बार करते हैं। प्रशिक्षु उस विशिष्ट प्रकार के इंजन की समस्या को ठीक करने में बहुत माहिर हो जाता है। लेकिन यदि आप उन्हें एक टूटा हुआ टोस्टर, एक पंचर टायर, या शून्य से एक नया इंजन डिजाइन करने के लिए कहें, तो वे सुन्न पड़ जाते हैं। उन्होंने एक मैकेनिक होने के कौशल (skills) नहीं सीखे हैं; उन्होंने बस एक विशिष्ट कार को ठीक करने का तरीका याद कर लिया है।
नया तरीका (HYBRID-GYM):
इस पेपर के लेखकों ने महसूस किया कि एक सच्चा मास्टर मैकेनिक बनने के लिए, आपको केवल अंतिम समाधान (fix) पर ही नहीं, बल्कि उन मौलिक कौशलों पर अभ्यास करने की आवश्यकता है जो किसी भी मरम्मत कार्य पर लागू होते हैं। उन्होंने पूछा: "एक मैकेनिक वास्तव में रिपेयर का काम शुरू करने से पहले क्या करता है?"
उन्होंने काम को तीन मुख्य कौशलों में विभाजित किया:
- एक्सप्लोरेशन (Exploration - अन्वेषण): गैरेज में घूमना, बोनट के नीचे देखना और सही पुर्जे को ढूँढना।
- रीज़निंग (Reasoning - तर्क): यह समझना कि इंजन से वह आवाज़ क्यों आ रही है और मरम्मत की योजना बनाना।
- इम्प्लीमेंटेशन (Implementation - कार्यान्वयन): वास्तव में पाना (wrench) घुमाना और पुर्जे को बदलना।
पुराने प्रशिक्षण के साथ समस्या
आमतौर पर, इन कौशलों का अभ्यास करने के लिए, आपको एक पूर्ण, चालू कार (एक "runnable repository") की आवश्यकता होती है जो गैरेज में सेट हो। एक कार सेटअप करने में घंटों लगते है: आपको सही उपकरण, सही ईंधन और सही पुर्जों की आवश्यकता होती है। हर एक सबक के लिए एक प्रशिक्षण गैरेज बनाना महंगा और धीमा है।
HYBRID-GYM का समाधान
लेखकों ने एक वर्चुअल जिम (HYBRID-GYM) बनाया जहाँ उन्हें पूरी कार की आवश्यकता नहीं है। इसके बजाय, उन्होंने चार सरल, स्केलेबल ड्रिल बनाईं जो भारी मशीनरी के बिना कौशलों को सिखाती हैं:
"वेयर्स वॉल्डो" ड्रिल (फंक्शन लोकलाइजेशन):
- कार्य: "यहाँ एक पुर्जे का विवरण दिया गया है। ढूँढिए कि यह इस विशाल ब्लूप्रिंट के ढेर में ठीक कहाँ छिपा है।"
- कौशल: यह प्रशिक्षु को सिखाता है कि कोडबेस में प्रभावी ढंग से कैसे खोजा जाए ताकि वे खो न जाएं।
"डिटेक्टिव" ड्रिल (इश्यू लोकलाइजेशन):
- कार्य: "यहाँ एक ग्राहक की शिकायत है। मैनुअल का वह विशिष्ट पृष्ठ ढूँढें जहाँ गलती हुई है।"
- कौशल: यह सिखाता है कि समस्या को कैसे पढ़ें और उसे सोर्स कोड तक कैसे ट्रैक करें।
"फैमिली ट्री" ड्रिल (डिपेंडेंसी सर्च):
- कार्य: "इस पुर्जे को तीन अन्य पुर्जों की आवश्यकता है। उन तीनों को गोदाम में ढूँढें।"
- कौशल: यह सिखाता है कि कोड के विभिन्न हिस्से एक-दूसरे से कैसे जुड़ते हैं।
"फिल-इन-द-ब्लैंक्स" ड्रिल (फंक्शन जनरेशन):
- कार्य: "यहाँ एक पुर्जे का ब्लूप्रिंट है, लेकिन निर्देश गायब हैं। निर्देश लिखें।"
- कौशल: यह एक योजना के आधार पर नया कोड लिखना सिखाता है।
जादुई ट्रिक:
सबसे अच्छी बात? इन ड्रिल्स को चलाने के लिए आपको पूरी कार की आवश्यकता नहीं है। आपको बस एक ब्लूप्रिंट (कोड फाइल्स) की आवश्यकता है। यह इस प्रशिक्षण को पिछले तरीकों की तुलना में 16 गुना सस्ता और उत्पादन करने में बहुत तेज़ बनाता है।
परिणाम: प्रशिक्षु एक मास्टर बन जाता है
जब उन्होंने अपने AI (प्रशिक्षु) को इस "जिम" के कौशलों पर प्रशिक्षित किया, तो कुछ अद्भुत हुआ। उन्होंने AI को उन विशिष्ट वास्तविक दुनिया की समस्याओं को ठीक करने का कोई उदाहरण नहीं दिखाया जिन्हें वे बाद में टेस्ट करने वाले थे।
फिर भी, जब उन्होंने AI को एक असली टूटा हुआ इंजन (SWE-Bench), एक टेस्ट सुइट बनाने का अनुरोध (SWT-Bench), या एक नई लाइब्रेरी बनाने का अनुरोध (Commit-0) दिया, तो AI ने हजारों विशिष्ट उदाहरणों पर प्रशिक्षित मॉडल्स की तुलना में काफी बेहतर प्रदर्शन किया।
- उपमा (Analogy): यह एक छात्र को नक्शा पढ़ना, दिशा-सूचक यंत्र (compass) का उपयोग करना और जंगल में रास्ता खोजना सिखाने जैसा है। जब आप अंततः उन्हें एक नए, अज्ञात जंगल में छोड़ देते हैं, तो वे रास्ता ढूँढ सकते हैं, जबकि एक ऐसा छात्र जिसने केवल एक विशिष्ट पेड़ तक जाने का रास्ता रटा था, वह खो जाएगा।
आम पाठक के लिए मुख्य बातें
- सामान्य कौशल > विशिष्ट रटना: AI को क्या ठीक करना है यह दिखाने से कहीं अधिक शक्तिशाली उसे कैसे सोचना और अन्वेषण करना सिखाना है।
- सादगी स्केल करती है (Simplicity Scales): जटिल कौशल सिखाने के लिए आपको जटिल, महंगे सेटअप की आवश्यकता नहीं है। सरल, अच्छी तरह से डिज़ाइन की गई ड्रिल्स बेहतर काम करती हैं।
- "जिम" का प्रभाव: ठीक वैसे ही जैसे एक मानव एथलीट को एक अच्छा सॉकर खिलाड़ी बनने के लिए दौड़ने, वजन उठाने और स्ट्रेचिंग की आवश्यकता होती है, एक AI कोडिंग एजेंट को एक अच्छा कोडर बनने के लिए खोजने, तर्क करने और संपादन करने का अभ्यास करने की आवश्यकता होती है। HYBRID-GYM वही जिम है।
संक्षेप में, HYBRID-GYM ने AI को उत्तर रटने के बजाय समस्या सुलझाने वाला (problem-solver) बनना सिखाना शुरू किया। परिणाम? एक ऐसा AI जो आपके द्वारा दिए गए लगभग किसी भी कोडिंग कार्य को संभाल सकता है, न कि केवल उन्हें जिन्हें उसने प्रशिक्षण के दौरान देखा था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।