← नवीनतम पेपर
💬 NLP

KAT-Coder-V2 Technical Report

KAT-Coder-V2 कुआईशौ (Kuaishou) द्वारा विकसित एक एजेंटिक कोडिंग मॉडल है जो पांच विशेषज्ञ डोमेन को प्रशिक्षित करने के लिए "स्पेशलाइज-देन-यूनिफाई" (Specialize-then-Unify) प्रतिमान का उपयोग करता है और फिर उन्हें एक एकल मॉडल में समेकित करता है, जिससे KwaiEnv इंफ्रास्ट्रक्चर और MCLA स्थिरीकरण जैसे नवाचारों के माध्यम से SWE-bench Verified और PinchBench जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao, Kun Yuan, Mengtong Li, Minglei Zhang, Pengcheng Xu, Wenhao Zhuang, Yizhen Shao, Zongxian Feng, Can Tang, Chao Wang, Chengxiao Tong, Fa
प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao, Kun Yuan, Mengtong Li, Minglei Zhang, Pengcheng Xu, Wenhao Zhuang, Yizhen Shao, Zongxian Feng, Can Tang, Chao Wang, Chengxiao Tong, Fan Yang, Gang Xiong, Haixuan Gao, Han Gao, Hao Wang, Haochen Liu, Hongliang Sun, Jiabao Li, Jingwen Chang, Jun Du, Junyi Peng, Leizhen Cui, Meimei Jing, Mingqi Wu, Shangpeng Yan, Shaotong Qi, Suzhe Xu, Wenxuan Zhao, Xianda Sun, Xuan Xie, Yanbo Wang, Yao Xia, Yinghan Cui, Yingpeng Chen, Yong Wang, Yuze Shi, Zhiwei Shen, Ziyu Wang, Ming Sun, Lin Ye, Bin Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-इंटेलिजेंट सॉफ्टवेयर इंजीनियर बनाने की कोशिश कर रहे हैं जो सब कुछ कर सके: टूटे हुए कोड को ठीक करना, सुंदर वेबसाइटों को डिजाइन करना, सर्वर कमांड प्रबंधित करना, उत्तरों के लिए वेब खोजना और यहाँ तक कि जटिल गणित की समस्याओं को हल करना भी।

अतीत में, AI मॉडल सामान्यज्ञ प्रशिक्षुओं (generalist apprentices) की तरह थे। वे सब कुछ थोड़ा-बहुत जानते थे लेकिन जब कार्य बहुत विशिष्ट या जटिल हो जाता था, तो वे संघर्ष करते थे। यदि आप उनसे एक विशाल कोडबेस में बग ठीक करने के लिए कहते, तो वे खो सकते थे। यदि आप उनसे एक ट्रेंडी वेबसाइट डिजाइन करने के लिए कहते, तो वे इसे उबाऊ और साधारण बना सकते थे।

KAT-Coder-V2 पेपर इन AI इंजीनियरों को प्रशिक्षित करने का एक नया तरीका पेश करता है। एक साथ हर चीज़ में परफेक्ट होने के लिए एक ही मस्तिष्क को सिखाने के बजाय, KwaiKAT टीम ने "स्पेशलाइज-देन-यूनिफाई" (Specialize-then-Unify) नामक रणनीति का उपयोग किया।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं के माध्यम से समझाया गया है:

1. "विशेषज्ञ टीम" दृष्टिकोण (Specialize-then-Unify)

कल्पना कीजिए कि आप एक हाई-एंड रेस्टोरेंट बना रहे हैं। एक ऐसे शेफ को काम पर रखने के बजाय जो एक ही समय में ब्रेड बेक करने, स्टेक ग्रिल करने और कॉकटेल मिलाने की कोशिश करता है, आप पाँच विशेषज्ञ शेफ नियुक्त करते हैं, जिनमें से प्रत्येक एक विशिष्ट स्टेशन में माहिर है:

  • द SWE शेफ: टूटे हुए कोड को ठीक करने और डिबगिंग में विशेषज्ञ।
  • द वेबकोडिंग शेफ: एक कलाकार जो वेबसाइटों को शानदार और स्टाइलिश बनाता है।
  • द टर्मिनल शेफ: एक कमांड-लाइन जादूगर जो सर्वर और सिस्टम को प्रबंधित करता है।
  • द वेबसर्च शेफ: एक शोधकर्ता जो ऑनलाइन सर्वोत्तम जानकारी खोजता है।
  • द जनरल शेफ: तर्क (logic), गणित और जटिल निर्देशों का पालन करने में माहिर।

प्रक्रिया:

  1. विशेषज्ञों को प्रशिक्षित करना: टीम ने इन पाँचों "शेफ" में से प्रत्येक को भारी मात्रा में विशिष्ट डेटा का उपयोग करके अलग-अलग प्रशिक्षित किया। SWE शेफ केवल कोड मरम्मत देखता था; वेबकोडिंग शेफ केवल डिज़ाइन ट्रेंड्स देखता था। इसने उन्हें अन्य कार्यों से भ्रमित हुए बिना अपने विशिष्ट क्षेत्रों में विश्व स्तरीय बनने की अनुमति दी।
  2. "यूनिफाई" चरण (On-Policy Distillation): एक बार जब विशेषज्ञ तैयार हो गए, तो उन्हें एक ही सुपर-हेड शेफ (अंतिम KAT-Coder-V2 मॉडल) में संयोजित करने की आवश्यकता थी।
    • चुनौती: यदि आप उनके दिमागों को बस मिला देते हैं, तो मॉडल चीजें करना भूल जाता है (जैसे एक छात्र जो गणित की परीक्षा के लिए पढ़ता है लेकिन खाना बनाना भूल जाता है)।
    • समाधान: उन्होंने On-Policy Distillation नामक तकनीक का उपयोग किया। कल्पना कीजिए कि सुपर-हेड शेफ एक रेसिपी का अभ्यास कर रहा है। जब वह अटक जाता है, तो विशिष्ट विशेषज्ञ शेफ (जैसे, वेबकोडिंग शेफ) सही अगला कदम बताने के लिए हस्तक्षेप करता है। सुपर-हेड शेफ वास्तविक समय में विशेषज्ञ की सलाह सुनते हुए कार्य को करके सीखता है। इस तरह, अंतिम मॉडल बिना कुछ भूले सभी कौशल बनाए रखता है।

2. "अनंत खेल का मैदान" (KwaiEnv)

इन एजेंटों को प्रशिक्षित करने के लिए, आप केवल एक पाठ्यपुस्तक का उपयोग नहीं कर सकते। आपको एक विशाल, सुरक्षित खेल के मैदान की आवश्यकता है जहाँ वे चीजें आजमा सकें, उन्हें तोड़ सकें और उन्हें ठीक कर सकें बिना वास्तविक इंटरनेट को क्रैश किए।

टीम ने KwaiEnv बनाया, जो एक विशाल, स्वचालित थीम पार्क की तरह है जिसमें हजारों व्यक्तिगत "सैंडबॉक्स" कमरे हैं।

  • मॉड्यूलर डिज़ाइन: इसे LEGO की तरह समझें। आप पूरे पार्क को फिर से बनाए बिना एक नया "डेटासेट" ब्लॉक, एक नया "टेस्टिंग" ब्लॉक, या एक नया "कोडिंग टूल" ब्लॉक जोड़ सकते हैं।
  • उच्च गति: वे तुरंत हजारों ऐसे खेल के मैदान शुरू कर सकते हैं। यह AI को लाखों परिदृश्यों (जैसे बग ठीक करना या पेज डिजाइन करना) का एक साथ अभ्यास करने की अनुमति देता है, जिससे वह अपनी गलतियों से बिजली की गति से सीखता है।

3. स्मार्ट ट्रेनिंग ट्रिक्स (MCLA और Tree Training)

"ट्री" (एक निर्णय लेना, फिर दो संभावनाओं में विभाजित होना, फिर तीन और में) में सोचने वाले AI को प्रशिक्षित करना कम्प्यूटेशनल रूप से महंगा है। यह एक ऐसी किताब पढ़ने की कोशिश करने जैसा है जहाँ हर बार जब आप पन्ना पलटते हैं, तो संदर्भ समझने के लिए आपको पूरी कहानी को फिर से पढ़ना पड़ता है।

टीम ने दो चतुर शॉर्टकट विकसित किए:

  • ट्री ट्रेनिंग (Tree Training): हर बार पूरी कहानी को फिर से पढ़ने के बजाय, उन्होंने महसूस किया कि "ट्री" की कई शाखाएं एक ही शुरुआत साझा करती हैं। उन्होंने काम को साझा करने का एक तरीका निकाला। यदि तीन अलग-अलग रास्ते एक ही वाक्य से शुरू होते हैं, तो कंप्यूटर उस वाक्य की गणना केवल एक बार करता है, जिससे समय की भारी बचत होती है (6.2 गुना तक तेज़)।
  • MCLA (Monte-Carlo Log-probability Averaging): कल्पना कीजिए कि AI एक वाक्य में अगले शब्द का अनुमान लगाने की कोशिश कर रहा है, लेकिन यह थोड़ा "नॉइजी" या अस्थिर है। MCLA 8 त्वरित अनुमानों को लेने और एक सुचारू, स्थिर उत्तर प्राप्त करने के लिए उन्हें औसत निकालने जैसा है। यह AI को प्रशिक्षण के दौरान पागल होने से रोकता है और इसे तेजी से सीखने में मदद करता है।

4. परिणाम: यह कितना अच्छा है?

पेपर KAT-Coder-V2 की तुलना वर्तमान "किंग्स" (जैसे Claude Opus 4.6) से करता है।

  • सॉफ्टवेयर इंजीनियरिंग: इसने वास्तविक दुनिया के बग्स को ठीक करने पर 79.6% स्कोर किया, जो कि सर्वश्रेष्ठ प्रोप्राइटरी मॉडल (80.8%) के लगभग बराबर है।
  • डिज़ाइन: इसने एक डिज़ाइन बेंचमार्क पर 88.7 स्कोर किया, जो अन्य शीर्ष मॉडलों को पीछे छोड़ देता है। यह "इसे कूल और स्ट्रीट-स्टाइल बनाओ" जैसे अस्पष्ट प्रॉम्प्ट को लेकर उसे एक पेशेवर दिखने वाली वेबसाइट में बदल सकता है।
  • बहुमुखी प्रतिभा: यह कमांड-लाइन कार्यों और सामान्य तर्क पर अच्छा प्रदर्शन करता है, जो यह साबित करता है कि यह केवल एक ही काम में माहिर नहीं है।

बड़ी तस्वीर

KAT-Coder-V2 पेपर यह दिखाता है कि AI कोडिंग का भविष्य एक ऐसे विशाल मस्तिष्क को बनाने के बारे में नहीं है जो सब कुछ अस्पष्ट रूप से जानता हो। यह विशेषज्ञों की एक टीम बनाने, उन्हें उनके काम में परफेक्ट होने के लिए प्रशिक्षित करने और फिर उन्हें एक सहज इकाई के रूप में एक साथ काम करने के लिए सिखाने के बारे में है।

विशेषज्ञ प्रशिक्षण, एक विशाल स्वचालित खेल के मैदान और स्मार्ट गणितीय ट्रिक्स को जोड़कर, उन्होंने एक ऐसा AI बनाया है जो एक सीनियर इंजीनियर के कौशल के साथ बग ठीक करने, साइट डिजाइन करने और जटिल समस्याओं को हल करने के लिए मानव डेवलपर्स के साथ काम करने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →