CRAFT: Learn the Schema, Execute the Plan
CRAFTは、網羅的なプロンプト時におけるスキーマ注入を行うことなく、スキーマに裏付けられたプランニングおよび実行動作を学習することで、分析性能、一貫性、および効率性を大幅に向上させつつ、トークンオーバーヘッドを削減する、エンタープライズ向けコーディングエージェントのための2段階のポストトレーニングフレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが、超スマートなロボット・アシスタントと話し、普通の英語を使うだけで、複雑な数学を解かせたり、膨大なデータを分析させたり、コンピュータプログラムを書かせたりできる世界を想像してみてください。これは「コーディング・エージェント」の夢です。しかし、ここには落とし穴があります。このロボットが仕事を遂行するためには、それが扱っているデータベースの「秘密のルール」を知っておく必要があるのです。これは、シェフがグルメな料理を作ろうとしているようなものです。もしシェフが、パントリーにどんな食材があるのか、あるいはコンロがどのように機能するのかを知らなければ、料理を作ることはできません。かつては、ロボットを助けるために、エンジニアはあらゆるルール、テーブル名、カラム定義が記された巨大で埃をかぶった百科事典を、ロボットが質問をするたびにその脳内に詰め込んでいました。それは、シェフが玉ねぎを一つ刻む前に、百科事典を一冊丸ごと読ませるようなものでした。それは遅く、コストがかかり、もしパントリーの内容が少しでも変われば、システム全体が壊れてしまうものでした。
では、毎回百科事典を読む代わりに、シェフが数回の練習セッションを経て、キッチンのレイアウトを「記憶」できるとしたらどうでしょう? これが、この論文が取り組んでいる大きな問いです。AIアシスタントに、データベースのルールを一度だけ学習させ、毎回思い出させる必要がないように教え込むことはできるのでしょうか? 研究者たちは、AIにスキーマ(データの地図)と使用すべきツールを「内面化」させることで、会話が長く複雑になっても、より速く、より賢く、混乱しにくくできるかどうかを検証したかったのです。
論文:CRAFT – 地図を学び、そしてレースを走る
この論文は、CRAFT(学習のための二段階のレシピ)と呼ばれる新しいシステムを紹介しています。Amazonのチームである著者らは、広告の専門家が技術的な詳細に溺れることなく、キャンペーンデータを分析できるAIを構築したいと考えました。彼らは、従来の「プロンプトに膨大なドキュメントを詰め込む」方法は、バックパックにレンガを満載してマラソンを走るようなものだと気づきました。それはすべてを遅らせ、AIをミスに陥らせる原因となったのです。
そこで、彼らは異なるアプローチを試みました:スキーマを学び、計画を実行する。
ステージ1:「スキーマを剥ぎ取った」教室
まず、彼らは「百科事典」が取り上げられた特別な教室でAIを教えました。彼らはAIに問題解決の例を何千も与えましたが、生のデータベース・ルール(DDD)は入力から隠しました。ルールを読み上げる代わりに、AIはどのように考え、どのように計画を立てるかという「パターン」を学ばなければなりませんでした。
これは、数式のシートを見せないようにしながら、ステップや論理を示して数学の問題を解く方法を生徒に教えるようなものです。彼らは、考え方の「方法」を暗記しなければなりません。研究者たちはこれを**PLAN 有監督微調整(SноSFT)**と呼んでいます。これは、毎回カンニングペーパーを必要とすることなく、計画を構造化し、コードを書くための「筋肉の記憶」をAIに習得させているようなものです。
ステージ2:「強化学習」のジム
AIが基本的な筋肉の記憶を得たら、次は**強化学習(RL)**のためのジムに入れます。ここでは、AIが実際にコードを実行し、ツールを使用します。もしAIが、間違ったツールを呼び出したり、クラッシュするコードを書いたりといったミスをすれば、「マイナスのスコア」を与えられます。成功すれば、「プラスのスコスコア」が得られます。
研究者たちは、単にコードが実行されたかどうかだけでなく、そのコードが「良い」ものか、計画とコードが一致しているか、そして問題が発生したときにAIがどのように回復できるかを重視する特別なスコアリング・システムを使用しました。これは、コーチがランナーがただゴールするだけでなく、フォームやスピード、そしてつまずいたときの対処法までチェックするようなものです。Execution-Shaped GRPOと呼ばれるこのステージは、ユーザーがフォローアップの質問をしたり、会話の途中でルールを変更したりしても、AIが信頼でき、一貫性を保てるように教え込みました。
結果:より速く、より賢く、よりスッキリと
結果は非常に印象的なものでした。CRAFTを従来の「レンガ入りのバックパック」方式と比較してテストしたところ:
- スピード: 新しいシステムは、AIが読むテキスト(トークン)の量を約9倍削減しました。これはAIの脳にとって、劇的な減量です。
- 賢さ: 全体的な「エージェント・スコア」(仕事の遂行能力を測る指標)は9.6パーセントポイント上昇しました。
- 一貫性: AIは4.1パーセントポイントより一貫性を増しました。つまり、同じ質問を二度しても、同じ良い回答を出すようになりました。
- 混乱の軽減: 正しいツールを「探す」回数を最大5倍減少させました。
また、研究者たちは、AIがマルチターン(多段階)の会話を扱うのが非常に上手くなったことも発見しました。ユーザーが「売上を見せて」と言った後に、「次は赤いシャツだけに絞り込んで」と続けても、CRAFTのAIは文脈を記憶し、その流れを維持できましたが、旧システムではしばしば迷子になってしまいました。
できないこと(そして注意すべき点)
この論文が主張していないことも重要です。著者らは、このシステムが安定した既知のスキーマのために設計されていることを明確にしています。もしデータベースが突如として全く新しいタイプのデータを導入したり、AIが一度も見たことがない全く新しいツールが登場したりした場合、CRAFTは行き詰まる可能性があります。それは、キッチンを完璧に把握しているけれど、見たこともない奇妙な新型ガジェットの使い方は知らないシェフのようなものです。そのような場合には、依然としてルールを参照(リトリーバル)するか、再学習させる必要があるかもしれません。
また、論文では、AIは計画に従うことには長けているものの、コンピュータのメモリ使用量やサーバーでの実行コストの最適化については、まだ完全には対応できていないことも認めています。それは将来のアップグレードのための課題です。
まとめ
CRAFTは、AIの目の前に絶えず情報を押し付ける代わりに、ルールを一度学習させ、その後の計画実行を任せることができるということを示唆しています。「カンニングペーパーなし」のトレーニングフェーズと、「実践と修正」のフェーズを組み合わせることで、彼らはより軽く、速く、信頼できるエージェントを構築しました。これは、AIアシスタントを、マニュアルを読み上げるロボットではなく、ビジネスの仕組みを熟知した「専門的な同僚」のように進化させるための一歩です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。