← 最新の論文
💬 NLP

KAT-Coder-V2 Technical Report

Kuaishou の KwaiKAT チームが開発したアジェンティックコーディングモデル「KAT-Coder-V2」は、5 つの専門ドメインを個別に学習させた後、オンポリシー蒸留で統合する「Specialize-then-Unify」パラダイムや、大規模 RL 学習を安定化・高速化する独自技術を採用し、SWE-bench Verified などで SOTA 級の性能を達成したことを報告しています。

原著者: Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao, Kun Yuan, Mengtong Li, Minglei Zhang, Pengcheng Xu, Wenhao Zhuang, Yizhen Shao, Zongxian Feng, Can Tang, Chao Wang, Chengxiao Tong, Fa
公開日 2026-03-31
📖 1 分で読めます☕ さくっと読める

原著者: Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao, Kun Yuan, Mengtong Li, Minglei Zhang, Pengcheng Xu, Wenhao Zhuang, Yizhen Shao, Zongxian Feng, Can Tang, Chao Wang, Chengxiao Tong, Fan Yang, Gang Xiong, Haixuan Gao, Han Gao, Hao Wang, Haochen Liu, Hongliang Sun, Jiabao Li, Jingwen Chang, Jun Du, Junyi Peng, Leizhen Cui, Meimei Jing, Mingqi Wu, Shangpeng Yan, Shaotong Qi, Suzhe Xu, Wenxuan Zhao, Xianda Sun, Xuan Xie, Yanbo Wang, Yao Xia, Yinghan Cui, Yingpeng Chen, Yong Wang, Yuze Shi, Zhiwei Shen, Ziyu Wang, Ming Sun, Lin Ye, Bin Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

KAT-Coder-V2 の技術報告書:わかりやすい解説

この論文は、中国の快手(Kuaishou)という会社が作った、**「AI プログラマー」の最新バージョン「KAT-Coder-V2」**についての報告書です。

この AI は、単にコードを書くだけでなく、**「自分で考えて、ツールを使い、実際に動かして修正する」**という、まるで人間のような「エージェント(自律型 AI)」としての能力を持っています。

この複雑な技術を、日常の例えを使ってわかりやすく説明しましょう。


1. 核心となるアイデア:「専門家のチーム」から「万能のリーダー」へ

この AI を開発する際、チームは「1 人の天才が何でもできる」のではなく、**「5 人の専門家のチーム」**を作りました。

  • SWE 専門家: ソフトウェアのバグ修正や開発が得意。
  • WebCoding 専門家: 美しいウェブサイトやプレゼン資料を作るのが得意。
  • Terminal 専門家: コマンドライン(黒い画面)での操作やシステム管理が得意。
  • WebSearch 専門家: 検索して情報を集め、答えを見つけるのが得意。
  • General 専門家: 一般的な質問や数学、コードの基礎が得意。

【アナロジー:料理のシェフ】
Imagine 5 人のシェフがいるレストランを想像してください。

  • A さんは「寿司」の天才。
  • B さんは「ステーキ」の天才。
  • C さんは「パスタ」の天才。
  • D さんは「デザート」の天才。
  • E さんは「飲み物」の天才。

それぞれが自分の分野で最高峰の技術(SFT:教師あり微調整)を磨き上げ、さらに**「試行錯誤(強化学習)」**を通じて、失敗から学び、より上手くなるように訓練しました。

しかし、お客様(ユーザー)は「寿司もステーキもパスタも全部作って!」と頼むかもしれません。そこで、KAT-Coder-V2 は**「オンポリシー蒸留(On-Policy Distillation)」**という魔法を使います。

これは、**「5 人の天才シェフが一緒に料理する様子を見ながら、1 人の『万能の料理長』がその技術をすべて吸収する」**ようなものです。結果として、1 人の料理長が、どの料理もプロレベルで作れるようになります。


2. 巨大な実験室:KwaiEnv(クワイエンブ)

AI を訓練するには、実際にコードを書いて、動かして、失敗したら直すという**「練習」が何万回も必要です。そのための実験室が「KwaiEnv」**です。

【アナロジー:大規模なシミュレーション・テーマパーク】

  • モジュール化された設計: このテーマパークは、アトラクション(データ)、乗り物(サンドボックス)、ガイド(スキャフォールド)、チェック係(検証器)がバラバラに作られています。
    • 新しいアトラクション(新しいデータセット)を作りたい時、乗り物やガイドを全部作り直す必要はありません。部品を交換するだけで済みます。
  • 超高速な同時運転: 一度に数万台のシミュレーションを同時に走らせることができます。まるで、何万人もの練習生が同時に料理の練習をしているようなものです。

これにより、AI は現実世界に近い環境で、失敗を恐れずに大胆に試行錯誤を繰り返すことができます。


3. 効率化の魔法:2 つの技術革新

AI を訓練する際、計算コストが莫大になるという問題がありました。それを解決する 2 つの技術が紹介されています。

① MCLA(モンテカルロ・ログ確率平均化)

【アナロジー:複数の目撃者の証言】
AI が「この行動が正しいか?」を判断する際、AI の内部状態(特に MoE という仕組み)が少し揺らぐことがあります。

  • 通常: 1 人の目撃者の証言だけだと、その日の気分やノイズで「正解」の判断がぶれてしまいます。
  • MCLA: 同じ質問を8 回繰り返し、8 人の目撃者(8 回の計算)の答えを平均して判断します。
    • これにより、「たまたまの勘違い」が減り、AI の学習が非常に安定します。

② Tree Training(ツリー・トレーニング)

【アナロジー:分岐する道案内】
AI が複雑なタスクをするとき、道が枝分かれすることがあります(例:A の方法で失敗したら、B の方法を試す)。

  • 従来の方法: 枝分かれしたすべての道(A→失敗→B、A→失敗→C など)を、最初から一から計算し直していました。これは「同じスタート地点から何度も歩き出す」ような無駄な作業です。
  • Tree Training: 共通のスタート地点(共通の接頭辞)は1 回だけ計算し、その先で分岐した道だけを計算します。
    • これにより、最大 6.2 倍のスピードアップを実現しました。まるで、分岐する道で「共通の区間はすでに舗装済み」として、新しい道だけを作れるようになったようなものです。

4. 結果:どれくらいすごいのか?

KAT-Coder-V2 は、世界最高峰の AI モデル(Claude Opus 4.6 など)と競い合えるレベルに達しました。

  • ソフトウェア工学(SWE-bench): 約 80% の正解率。これは、プロのエンジニアが解決する問題の 8 割を AI 単独で解決できることを意味します。
  • Web デザイン(PinchBench): 「かっこいい街の雰囲気」のような曖昧な指示でも、プロのデザイナーが認めるレベルの美しいページを作れます。
  • 汎用性: コマンド操作や複雑な推理タスクでも、トップクラスの性能を発揮しています。

【まとめ】
KAT-Coder-V2 は、**「5 人の専門家を育て上げ、その知識を 1 人の万能なリーダーに統合し、巨大な実験室で効率的に訓練した」**という、非常に洗練されたアプローチで作られた AI です。

これにより、AI は「コードを書く機械」から**「開発のパートナー」**へと進化し、人間が複雑なソフトウェア開発をよりスムーズに行える未来を切り開いています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →