← 最新の論文
🤖 AI

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6は、コンパクトで検証済みのデータセットを用いたAnchored Supervised Fine-Tuningという保守的かつ制御された事後学習手法を通じて、ツール利用のベンチマークにおいて最先端の性能を実現する、エンタープライズ向けのエージェンティックな言語モデルです。

原著者: Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の展望において、永続的な課題は、大規模言語モデルがすでに備えているスキルを損なうことなく、いかにして信頼できるアシスタントとして機能させるように教え込むかという点でした。伝統的に、特定の仕事のために高性能なモデルを作成するには、システム全体をゼロから再構築する必要がありました。これは、異なる車両ごとに新しいエンジンを組み立てるプロセスに似ています。より最近では、既存の強力なモデルを取り上げ、学習データの品質が極めて高く、学習方法が精密であれば、その目的のためにその振る舞いを注意深く洗練させるだけで十分であることが研究者によって発見されています。このアプローチは、「エージェンティック(代理的)」なタスクに焦点を当てています。そこでは、モデルは単に質問に答えるだけでなく、ステップを計画し、ウェブ検索やコード実行のようなデジタルツールを使用し、複雑で多段階のワークフローをナビゲートして問題を解決しなければなりません。目標は、単にテキストを生成するのではなく、長期的な計画と様々なソフトウェアシステムとの相互作用を必要とするタスクを処理し、現実世界のデジタル環境で効果的に機能できるAIを創り出すことです。

Writer, Inc. の研究チームは、これらのエージェンティックなタスクに特化して優れた能力を発揮するように設計されたモデルである Palmyra x6 の開発によって、この課題に取り組みました。巨大な新しいモデルをゼロから訓練するのではなく、彼らは数百億のパラメータを持つ GLM-5.2 という高度な既存の基盤からスタートしました。この基盤に対し、彼らは「アンカー付き教師あり微調整(Anchored Supervised Fine-Tuning)」と呼ばれる非常に専門化された学習方法を適用しました。この手法は、モデルに新しいスキル(具体的には、ツールの使用方法や複雑なタスクの計画方法)を教え込みながら、モデルがすでに持っている一般的な知識や推論能力を忘れたり、劣化させたりすることを厳格に防ぐように設計されています。その結果、ウェブ検索、コード実行、ドキュメントの取得を含むような複雑なデジタル環境を、以前の自社エージェントのバージョンを大幅に上回る能力で、かつ最先端のモデルとも競合するレベルでナビゲートできるシステムが誕生しました。

この成果の核心は、訓練に使用されたデータの質と性質にあります。研究者たちは、膨大な量のインターネットテキストをモデルに読み込ませる代わりに、わずか626個の例からなる、コンパクトで高度に精選されたデータセットを作成しました。各例は、AIエージェントによってタスクが解決される完全で検証済みの軌跡となっています。これらは、AIがステップを計画し、情報を収集したりアクションを実行したりするために様々なツールを呼び出し、正しい解決策に到達するという、合成されたストーリーです。これらの例を完璧なものにするために、研究者たちは厳格なプロセスを用いました。まず「教師」モデルが成功する経路を示し、次に「生徒」モデルが、教師の計画を高レベルなガイドとしてのみ使用して、同じ問題を独立して解決するように求められました。もし生徒モデルが、答えをコピーしたり、ツールを正しく使用できなかったりしてプロセスを回避しようとした場合、その試みは破棄されました。最も成功し、誠実な試みのみが保持され、モデルに、有能なエージェントのように考え、行動する方法を教える、小さくも極めて高品質なライブラリが作成されました。

この小さなデータセットから、元の能力を失うことなく学習するために、研究者たちは「安全なアンカー」として機能する手法を採用しました。訓練プロセス中、モデルは常に、訓練を受ける前の元の自分自身を思い出させられます。この「アンカー」は、モデルがツールを使用したりタスクを計画したりすることを学ぶ一方で、もともと持っていた一般的な知能や安全な振る舞いから逸脱しないことを保証します。これは、非常に小さなデータセットで訓練を行うと、モデルが過度に特化してしまったり、一般的な会話を扱う能力を失ったりする可能性があるため、非常に重要です。モデルを元の状態に繋ぎ止めておくことで、研究者たちは基礎を侵食することなく、新しいエージェンティックなスキルを注入することができました。また、彼らは内部の接続を単なる数字としてではなく幾何学的な形状として扱うことで、限られたデータからより効率的に学習するのを助ける特殊な数学的オプティマイザ(最適化手法)も活用しました。

このアプローチの結果は即座に、かつ実質的なものとなりました。ツールの使用、長期的なタスクの計画、および複雑な指示に従う能力を測定するために設計された幅広いベンチマークでテストした際、Palmyra x6 は、Writerのエージェントで使用されていた以前のデフォルトモデルに対して劇的な改善を示しました。特に、ウェブを検索してデータを分析する必要がある金融リサーチにおいて強い進歩を見せ、一般的なツール使用のシナリオにおいても優れた性能を示しました。また、Palmyra x6 は他の最先端のフロンティアモデルに対しても競争力のある性能を示し、複数の異なるテストにおける平均スコアにおいて、しばしばグループのトップにランクインしました。おそらく最も重要なことは、モデルが高度な安全性と中立性を維持したことです。政治的バイアスや拒絶行動を測定するために設計されたテストにおいて、Palmyra x6 はバランスの取れたアプローチを示し、論争のある問題に対して複数の側面を提示し、有害な要求を拒絶する割合もベースモデルと一致しており、新しいスキルが安全性や信頼性の犠牲の上に成り立っていないことを証明しました。

研究者たちは、このモデルが汎用的なあらゆるAIタスクの置き換えではなく、専門的なツールであることを注意深く指摘しています。その強みは、ツールを呼び出し、計画を実行できるエージェンティックなワークフローに特化しており、その他の種類のタスクにおける性能は、構築の基盤となったベースモデルの能力に依存します。訓練データは数は少ないものの、学習方法が保守的かつ精密に設計されていたため、ツール使用という特定の振る舞いを教えるには十分でした。このモデルは現在、商用利用が可能であり、標準的なハードウェア上で効率的に実行できるバージョンも提供されています。この成果は、高品質なデータ、注意深い学習目的、そして安定した基盤を組み合わせれば、大規模でリソースを大量に消費するゼロからの再訓練を必要とせずに、非常に有能なAIエージェントを作成できることを示しています。Palmyra x6 の成功は、AIアシスタントが、何百万もの不完全な例ではなく、数百の完璧な例に頼ることで、精密かつ安全に、複雑で現実世界の仕事に合わせてカスタマイズできる未来を示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →