KAT-Coder-V2 Technical Report
KAT-Coder-V2 कुआईशौ (Kuaishou) द्वारा विकसित एक एजेंटिक कोडिंग मॉडल है जो पांच विशेषज्ञ डोमेन को प्रशिक्षित करने के लिए "स्पेशलाइज-देन-यूनिफाई" (Specialize-then-Unify) प्रतिमान का उपयोग करता है और फिर उन्हें एक एकल मॉडल में समेकित करता है, जिससे KwaiEnv इंफ्रास्ट्रक्चर और MCLA स्थिरीकरण जैसे नवाचारों के माध्यम से SWE-bench Verified और PinchBench जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-इंटेलिजेंट सॉफ्टवेयर इंजीनियर बनाने की कोशिश कर रहे हैं जो सब कुछ कर सके: टूटे हुए कोड को ठीक करना, सुंदर वेबसाइटों को डिजाइन करना, सर्वर कमांड प्रबंधित करना, उत्तरों के लिए वेब खोजना और यहाँ तक कि जटिल गणित की समस्याओं को हल करना भी।
अतीत में, AI मॉडल सामान्यज्ञ प्रशिक्षुओं (generalist apprentices) की तरह थे। वे सब कुछ थोड़ा-बहुत जानते थे लेकिन जब कार्य बहुत विशिष्ट या जटिल हो जाता था, तो वे संघर्ष करते थे। यदि आप उनसे एक विशाल कोडबेस में बग ठीक करने के लिए कहते, तो वे खो सकते थे। यदि आप उनसे एक ट्रेंडी वेबसाइट डिजाइन करने के लिए कहते, तो वे इसे उबाऊ और साधारण बना सकते थे।
KAT-Coder-V2 पेपर इन AI इंजीनियरों को प्रशिक्षित करने का एक नया तरीका पेश करता है। एक साथ हर चीज़ में परफेक्ट होने के लिए एक ही मस्तिष्क को सिखाने के बजाय, KwaiKAT टीम ने "स्पेशलाइज-देन-यूनिफाई" (Specialize-then-Unify) नामक रणनीति का उपयोग किया।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं के माध्यम से समझाया गया है:
1. "विशेषज्ञ टीम" दृष्टिकोण (Specialize-then-Unify)
कल्पना कीजिए कि आप एक हाई-एंड रेस्टोरेंट बना रहे हैं। एक ऐसे शेफ को काम पर रखने के बजाय जो एक ही समय में ब्रेड बेक करने, स्टेक ग्रिल करने और कॉकटेल मिलाने की कोशिश करता है, आप पाँच विशेषज्ञ शेफ नियुक्त करते हैं, जिनमें से प्रत्येक एक विशिष्ट स्टेशन में माहिर है:
- द SWE शेफ: टूटे हुए कोड को ठीक करने और डिबगिंग में विशेषज्ञ।
- द वेबकोडिंग शेफ: एक कलाकार जो वेबसाइटों को शानदार और स्टाइलिश बनाता है।
- द टर्मिनल शेफ: एक कमांड-लाइन जादूगर जो सर्वर और सिस्टम को प्रबंधित करता है।
- द वेबसर्च शेफ: एक शोधकर्ता जो ऑनलाइन सर्वोत्तम जानकारी खोजता है।
- द जनरल शेफ: तर्क (logic), गणित और जटिल निर्देशों का पालन करने में माहिर।
प्रक्रिया:
- विशेषज्ञों को प्रशिक्षित करना: टीम ने इन पाँचों "शेफ" में से प्रत्येक को भारी मात्रा में विशिष्ट डेटा का उपयोग करके अलग-अलग प्रशिक्षित किया। SWE शेफ केवल कोड मरम्मत देखता था; वेबकोडिंग शेफ केवल डिज़ाइन ट्रेंड्स देखता था। इसने उन्हें अन्य कार्यों से भ्रमित हुए बिना अपने विशिष्ट क्षेत्रों में विश्व स्तरीय बनने की अनुमति दी।
- "यूनिफाई" चरण (On-Policy Distillation): एक बार जब विशेषज्ञ तैयार हो गए, तो उन्हें एक ही सुपर-हेड शेफ (अंतिम KAT-Coder-V2 मॉडल) में संयोजित करने की आवश्यकता थी।
- चुनौती: यदि आप उनके दिमागों को बस मिला देते हैं, तो मॉडल चीजें करना भूल जाता है (जैसे एक छात्र जो गणित की परीक्षा के लिए पढ़ता है लेकिन खाना बनाना भूल जाता है)।
- समाधान: उन्होंने On-Policy Distillation नामक तकनीक का उपयोग किया। कल्पना कीजिए कि सुपर-हेड शेफ एक रेसिपी का अभ्यास कर रहा है। जब वह अटक जाता है, तो विशिष्ट विशेषज्ञ शेफ (जैसे, वेबकोडिंग शेफ) सही अगला कदम बताने के लिए हस्तक्षेप करता है। सुपर-हेड शेफ वास्तविक समय में विशेषज्ञ की सलाह सुनते हुए कार्य को करके सीखता है। इस तरह, अंतिम मॉडल बिना कुछ भूले सभी कौशल बनाए रखता है।
2. "अनंत खेल का मैदान" (KwaiEnv)
इन एजेंटों को प्रशिक्षित करने के लिए, आप केवल एक पाठ्यपुस्तक का उपयोग नहीं कर सकते। आपको एक विशाल, सुरक्षित खेल के मैदान की आवश्यकता है जहाँ वे चीजें आजमा सकें, उन्हें तोड़ सकें और उन्हें ठीक कर सकें बिना वास्तविक इंटरनेट को क्रैश किए।
टीम ने KwaiEnv बनाया, जो एक विशाल, स्वचालित थीम पार्क की तरह है जिसमें हजारों व्यक्तिगत "सैंडबॉक्स" कमरे हैं।
- मॉड्यूलर डिज़ाइन: इसे LEGO की तरह समझें। आप पूरे पार्क को फिर से बनाए बिना एक नया "डेटासेट" ब्लॉक, एक नया "टेस्टिंग" ब्लॉक, या एक नया "कोडिंग टूल" ब्लॉक जोड़ सकते हैं।
- उच्च गति: वे तुरंत हजारों ऐसे खेल के मैदान शुरू कर सकते हैं। यह AI को लाखों परिदृश्यों (जैसे बग ठीक करना या पेज डिजाइन करना) का एक साथ अभ्यास करने की अनुमति देता है, जिससे वह अपनी गलतियों से बिजली की गति से सीखता है।
3. स्मार्ट ट्रेनिंग ट्रिक्स (MCLA और Tree Training)
"ट्री" (एक निर्णय लेना, फिर दो संभावनाओं में विभाजित होना, फिर तीन और में) में सोचने वाले AI को प्रशिक्षित करना कम्प्यूटेशनल रूप से महंगा है। यह एक ऐसी किताब पढ़ने की कोशिश करने जैसा है जहाँ हर बार जब आप पन्ना पलटते हैं, तो संदर्भ समझने के लिए आपको पूरी कहानी को फिर से पढ़ना पड़ता है।
टीम ने दो चतुर शॉर्टकट विकसित किए:
- ट्री ट्रेनिंग (Tree Training): हर बार पूरी कहानी को फिर से पढ़ने के बजाय, उन्होंने महसूस किया कि "ट्री" की कई शाखाएं एक ही शुरुआत साझा करती हैं। उन्होंने काम को साझा करने का एक तरीका निकाला। यदि तीन अलग-अलग रास्ते एक ही वाक्य से शुरू होते हैं, तो कंप्यूटर उस वाक्य की गणना केवल एक बार करता है, जिससे समय की भारी बचत होती है (6.2 गुना तक तेज़)।
- MCLA (Monte-Carlo Log-probability Averaging): कल्पना कीजिए कि AI एक वाक्य में अगले शब्द का अनुमान लगाने की कोशिश कर रहा है, लेकिन यह थोड़ा "नॉइजी" या अस्थिर है। MCLA 8 त्वरित अनुमानों को लेने और एक सुचारू, स्थिर उत्तर प्राप्त करने के लिए उन्हें औसत निकालने जैसा है। यह AI को प्रशिक्षण के दौरान पागल होने से रोकता है और इसे तेजी से सीखने में मदद करता है।
4. परिणाम: यह कितना अच्छा है?
पेपर KAT-Coder-V2 की तुलना वर्तमान "किंग्स" (जैसे Claude Opus 4.6) से करता है।
- सॉफ्टवेयर इंजीनियरिंग: इसने वास्तविक दुनिया के बग्स को ठीक करने पर 79.6% स्कोर किया, जो कि सर्वश्रेष्ठ प्रोप्राइटरी मॉडल (80.8%) के लगभग बराबर है।
- डिज़ाइन: इसने एक डिज़ाइन बेंचमार्क पर 88.7 स्कोर किया, जो अन्य शीर्ष मॉडलों को पीछे छोड़ देता है। यह "इसे कूल और स्ट्रीट-स्टाइल बनाओ" जैसे अस्पष्ट प्रॉम्प्ट को लेकर उसे एक पेशेवर दिखने वाली वेबसाइट में बदल सकता है।
- बहुमुखी प्रतिभा: यह कमांड-लाइन कार्यों और सामान्य तर्क पर अच्छा प्रदर्शन करता है, जो यह साबित करता है कि यह केवल एक ही काम में माहिर नहीं है।
बड़ी तस्वीर
KAT-Coder-V2 पेपर यह दिखाता है कि AI कोडिंग का भविष्य एक ऐसे विशाल मस्तिष्क को बनाने के बारे में नहीं है जो सब कुछ अस्पष्ट रूप से जानता हो। यह विशेषज्ञों की एक टीम बनाने, उन्हें उनके काम में परफेक्ट होने के लिए प्रशिक्षित करने और फिर उन्हें एक सहज इकाई के रूप में एक साथ काम करने के लिए सिखाने के बारे में है।
विशेषज्ञ प्रशिक्षण, एक विशाल स्वचालित खेल के मैदान और स्मार्ट गणितीय ट्रिक्स को जोड़कर, उन्होंने एक ऐसा AI बनाया है जो एक सीनियर इंजीनियर के कौशल के साथ बग ठीक करने, साइट डिजाइन करने और जटिल समस्याओं को हल करने के लिए मानव डेवलपर्स के साथ काम करने के लिए तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।