← 最新の論文
🤖 AI

PROOF-Gen: From Optimized Data to Better Distillation

本論文は、教師モデルの失敗から成功した軌跡を復元するためにシナリオごとのプロンプト最適化を用いる手法であるPROOF-Genを紹介しており、これにより、ベンチマークおよびデプロイされたパイプラインにおける蒸留されたツール呼び出しエージェントの性能を大幅に向上させている。

原著者: Anh Ta, Junjie Zhu, Shahin Shayandeh

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Anh Ta, Junjie Zhu, Shahin Shayandeh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、より小さく高速なコンピュータプログラムに複雑なタスクを実行させるための一般的な方法は、より大規模で賢いプログラムにそのやり方を見せることです。蒸留(distillation)として知られるこのプロセスは、熟練した職人が弟子に完璧な技術を教える様子に似ています。弟子は師匠の成功した試行を観察し、それを模倣することを学びます。しかし、この手法には盲点があります。もし師匠がミスをした場合、弟子はその試行を単に無視し、次の成功したデモンストレーションを待つのです。ツール呼び出し(tool-calling)という特定の分野、つまりAIがデータベースの確認やメッセージの送信といった問題を解決するために、どのデジタルツールを使用するかを決定しなければならない場面において、これは大きな溝を生み出します。最も困難な問題は、多くの場合、師匠がもう少しで成功するところで、最後の最後の一歩で失敗してしまうようなケースです。標準的な学習方法では、こうした「惜しい失敗」を破棄してしまうため、弟子はその失敗を引き起こした特定の意思決定ポイントをどのように乗り越えるべきかを学ぶことができず、結果としてAIが最も難しいシナリオを解決できなくなってしまうのです。

Appleの研究者たちは、この溝を埋めるために「PROOF-Gen」と呼ばれる新しい手法を開発しました。失敗した試行を捨て去る代わりに、彼らはそれらを貴重な学習機会として扱います。マスタープログラムがタスクに失敗したとき、さらに高度な第2のプログラムが「内省的なコーチ」として機能します。このコーチは、一連のアクションと最終的なエラーを分析し、どこで間違えたのかを正確に特定します。そして、その全く同じ問題に対してマスターを再び導くための、具体的な指示のセット、すなわち「ガイド」を作成します。マスタープログラムは、このコーチによる新しい助言に従って、もう一度タスクに挑戦します。もし成功すれば、その成功した経路が新しいレッスンとして保存されます。極めて重要なのは、この新しいレッスンを弟子に見せる前に、ガイドが取り除かれることです。これにより、弟子はヒントを暗記するのではなく、純粋な成功のプロセスのみからスキルを学び取ることができます。これにより、弟子は特定のヒントを覚えるのではなく、スキルそのものを習得できるのです。

このアプローチによる結果は驚くべきものです。カスタマーサービスでのやり取りをシミュレートするように設計されたベンチマークを用いたテストでは、失敗を破棄するという標準的な手法では、マスタープログラムの成功率はわずか約7パーセントにとどまりました。新しい手法は、マスターが元々失敗していたタスクの93パーセントにおいて、成功した解決策を回収することに成功しました。より小さなAIモデルをこの拡張されたレッスンのコレクションで訓練したところ、タスクを完了する能力が劇的に向上しました。あるモデルはタスクの解決率を13パーセントから53パーセントへと跳ね上げ、別のモデルも同様の飛躍を見せました。研究者たちは、この向上は容易な部分の精度が高まったからではなく、困難な意思決定ポイントにおける正しい経路を学んだことによるものであることを確認しました。実際、あらかじめ選別された容易な成功例のみで訓練した場合、モデルの個々のツール呼び出しの能力は向上しましたが、タスク全体を完了させる能力には寄与しませんでした。回収された困難な例を含めることによって初めて、モデルはタスク全体を完遂する方法を学んだのです。

また、この手法は、AIの話し方や振る舞いを変えることなくAIシステムをアップグレードしたい企業にとって、実用的な利点をもたらします。最終的なレッスンからはコーチング用の指示が取り除かれているため、AIは強力なコーチの持つ問題解決能力を学びつつ、元のマスタープログラムの自然な声やスタイルを維持することができます。研究者たちが、カスタマーサービスで使用されている実際のプロダクションシステムでこれをテストしたところ、この手法によってAIの成功率は6.3パーセントポイント向上しました。これらの成果は、数十もの異なる言語や地域においても有効であり、失敗から回復する能力は、特定の言語や文化的背景に依存しない普遍的なスキルであることを示しています。失敗を構造化された学習プロセスに変えることで、研究者たちは、より賢いAIへの道は、単に完璧な例を見つけることではなく、不完全な例を理解し修正することにあることを証明したのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →