KAT-Coder-V2 Technical Report
Kuaishou の KwaiKAT チームが開発したアジェンティックコーディングモデル「KAT-Coder-V2」は、5 つの専門ドメインを個別に学習させた後、オンポリシー蒸留で統合する「Specialize-then-Unify」パラダイムや、大規模 RL 学習を安定化・高速化する独自技術を採用し、SWE-bench Verified などで SOTA 級の性能を達成したことを報告しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
KAT-Coder-V2 の技術報告書:わかりやすい解説
この論文は、中国の快手(Kuaishou)という会社が作った、**「AI プログラマー」の最新バージョン「KAT-Coder-V2」**についての報告書です。
この AI は、単にコードを書くだけでなく、**「自分で考えて、ツールを使い、実際に動かして修正する」**という、まるで人間のような「エージェント(自律型 AI)」としての能力を持っています。
この複雑な技術を、日常の例えを使ってわかりやすく説明しましょう。
1. 核心となるアイデア:「専門家のチーム」から「万能のリーダー」へ
この AI を開発する際、チームは「1 人の天才が何でもできる」のではなく、**「5 人の専門家のチーム」**を作りました。
- SWE 専門家: ソフトウェアのバグ修正や開発が得意。
- WebCoding 専門家: 美しいウェブサイトやプレゼン資料を作るのが得意。
- Terminal 専門家: コマンドライン(黒い画面)での操作やシステム管理が得意。
- WebSearch 専門家: 検索して情報を集め、答えを見つけるのが得意。
- General 専門家: 一般的な質問や数学、コードの基礎が得意。
【アナロジー:料理のシェフ】
Imagine 5 人のシェフがいるレストランを想像してください。
- A さんは「寿司」の天才。
- B さんは「ステーキ」の天才。
- C さんは「パスタ」の天才。
- D さんは「デザート」の天才。
- E さんは「飲み物」の天才。
それぞれが自分の分野で最高峰の技術(SFT:教師あり微調整)を磨き上げ、さらに**「試行錯誤(強化学習)」**を通じて、失敗から学び、より上手くなるように訓練しました。
しかし、お客様(ユーザー)は「寿司もステーキもパスタも全部作って!」と頼むかもしれません。そこで、KAT-Coder-V2 は**「オンポリシー蒸留(On-Policy Distillation)」**という魔法を使います。
これは、**「5 人の天才シェフが一緒に料理する様子を見ながら、1 人の『万能の料理長』がその技術をすべて吸収する」**ようなものです。結果として、1 人の料理長が、どの料理もプロレベルで作れるようになります。
2. 巨大な実験室:KwaiEnv(クワイエンブ)
AI を訓練するには、実際にコードを書いて、動かして、失敗したら直すという**「練習」が何万回も必要です。そのための実験室が「KwaiEnv」**です。
【アナロジー:大規模なシミュレーション・テーマパーク】
- モジュール化された設計: このテーマパークは、アトラクション(データ)、乗り物(サンドボックス)、ガイド(スキャフォールド)、チェック係(検証器)がバラバラに作られています。
- 新しいアトラクション(新しいデータセット)を作りたい時、乗り物やガイドを全部作り直す必要はありません。部品を交換するだけで済みます。
- 超高速な同時運転: 一度に数万台のシミュレーションを同時に走らせることができます。まるで、何万人もの練習生が同時に料理の練習をしているようなものです。
これにより、AI は現実世界に近い環境で、失敗を恐れずに大胆に試行錯誤を繰り返すことができます。
3. 効率化の魔法:2 つの技術革新
AI を訓練する際、計算コストが莫大になるという問題がありました。それを解決する 2 つの技術が紹介されています。
① MCLA(モンテカルロ・ログ確率平均化)
【アナロジー:複数の目撃者の証言】
AI が「この行動が正しいか?」を判断する際、AI の内部状態(特に MoE という仕組み)が少し揺らぐことがあります。
- 通常: 1 人の目撃者の証言だけだと、その日の気分やノイズで「正解」の判断がぶれてしまいます。
- MCLA: 同じ質問を8 回繰り返し、8 人の目撃者(8 回の計算)の答えを平均して判断します。
- これにより、「たまたまの勘違い」が減り、AI の学習が非常に安定します。
② Tree Training(ツリー・トレーニング)
【アナロジー:分岐する道案内】
AI が複雑なタスクをするとき、道が枝分かれすることがあります(例:A の方法で失敗したら、B の方法を試す)。
- 従来の方法: 枝分かれしたすべての道(A→失敗→B、A→失敗→C など)を、最初から一から計算し直していました。これは「同じスタート地点から何度も歩き出す」ような無駄な作業です。
- Tree Training: 共通のスタート地点(共通の接頭辞)は1 回だけ計算し、その先で分岐した道だけを計算します。
- これにより、最大 6.2 倍のスピードアップを実現しました。まるで、分岐する道で「共通の区間はすでに舗装済み」として、新しい道だけを作れるようになったようなものです。
4. 結果:どれくらいすごいのか?
KAT-Coder-V2 は、世界最高峰の AI モデル(Claude Opus 4.6 など)と競い合えるレベルに達しました。
- ソフトウェア工学(SWE-bench): 約 80% の正解率。これは、プロのエンジニアが解決する問題の 8 割を AI 単独で解決できることを意味します。
- Web デザイン(PinchBench): 「かっこいい街の雰囲気」のような曖昧な指示でも、プロのデザイナーが認めるレベルの美しいページを作れます。
- 汎用性: コマンド操作や複雑な推理タスクでも、トップクラスの性能を発揮しています。
【まとめ】
KAT-Coder-V2 は、**「5 人の専門家を育て上げ、その知識を 1 人の万能なリーダーに統合し、巨大な実験室で効率的に訓練した」**という、非常に洗練されたアプローチで作られた AI です。
これにより、AI は「コードを書く機械」から**「開発のパートナー」**へと進化し、人間が複雑なソフトウェア開発をよりスムーズに行える未来を切り開いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。