Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents
本論文は、Harness-Bench におけるオープンソースの FairyClaw フレームワークの優れた性能によって実証されたように、LLM エージェントの効率性、精度、および強制力を向上させるため、非公式な自然言語指示を実行可能な状態機械と JSON スキーマに置き換えるランタイムネイティブな抽象化である「Formal Skill」を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢く、非常に速いインターン(AI エージェント)を雇って、オフィス内の複雑な問題(壊れたソフトウェアの修理など)を解決すると想像してください。
従来の方法:「壁のようなテキスト」マニュアル
現在、ほとんどの AI エージェントは次のように機能します。あなたは彼らに、平易な英語で書かれた巨大で詳細な指示マニュアル(「プロンプトスキル」)を与えます。そこには次のようなことが書かれています。「まず、エラーログを確認してください。次に、コードを修正してみてください。テストファイルを削除しないようにしてください。失敗したら、もう一度試してください。完了したら、報告書を作成してください。」
この論文はこのアプローチを「非公式スキル」と呼んでいます。これには 3 つの大きな問題があります。
- 高コストであること:AI は一歩進むたびに、この巨大なマニュアルを読み直さなければなりません。これは AI の計算能力の通貨である「トークン」を大量に消費します。
- 曖昧であること:AI は「もう一度試す」や「削除しない」といった表現が実際に何を意味するのかを推測しなければなりません。「慎重に」と人間に伝える際、「慎重」とは具体的にどのような状態を指すのかを定義しないのと同じです。
- 脆弱であること:AI がミスをした場合、どこまで進んだかを思い出すために、会話履歴全体を振り返らなければなりません。完了したかどうか、あるいは一歩戻す必要があるかどうかを知るための組み込みの「チェックリスト」を持っていません。
新しい方法:「公式スキル」
著者たちは、「公式スキル」と呼ばれる新しい方法を提案しています。AI に長いテキストマニュアルを与えるのではなく、プログラム可能なツールキットを与えるのです。
これは、料理人に 50 ページのレシピ本を与える代わりに、組み込みの安全機能を備えたスマートキッチンを与えるようなものです。
- レシピはテキストではなくコード:段落を読む代わりに、AI は特定のボタン(ツール)と対話し、厳格なフローチャート(状態機械)に従います。
- 「フック」システム:クラブのボーダー(「フック」)を想像してください。AI が仕事のどの段階にいるかによって、ボーダーがどのドアを開けるかを決定します。
- 段階 1(調査):ボーダーは「検索ツール」へのドアのみを開けます。「削除」のドアは施錠されています。
- 段階 2(修正):ボーダーは「パッチツール」のドアを開けますが、「削除」のドアは再び施錠します。
- 段階 3(検証):ボーダーは、テストマシンから「合格」証明書を見せるまで、AI を部屋から出させません。
- 状態機械:AI は物語全体を記憶する必要はありません。「現在、修正フェーズにいる」と書かれた小さなデジタルバッジを持っているだけです。「修正」が完了する前に「報告」に飛び込もうとすると、システムが自動的にそれを停止します。
「FairyClaw」エンジン
これを実現するために、著者たちはFairyClawと呼ばれる新しいエンジンを構築しました。FairyClaw はショーを運営するスマートなマネージャーと考えることができます。
- それは AI と単にチャットするだけでなく、AI のツールとルールを積極的に管理します。
- 大きな仕事を小さなサブタスクに分解し、それぞれに適切な「公式スキル」を割り当てます。
- AI がどこにいるか、何をしたか、まだ何をする必要があるかを正確に記録し続けるため、AI が迷子になることはありません。
結果:より速く、安価で、安全
著者たちは、このシステム(FairyClaw)を、Harness-Benchと呼ばれる厳しいテストを用いて、他の人気のある AI エージェントシステムと比較しました。
- スコア:FairyClaw は、実際に仕事を完了させる能力において、他のシステムと同等かそれ以上のパフォーマンスを発揮しました。
- コスト:ここが大きな勝利です。FairyClaw は、他のシステムの平均と比較して、48% 少ないトークン(お金/計算能力)を使用しました。
- 比喩:他のシステムが、街中を走りながらドライバーに巨大な地図を声に出して読み聞かせる配送トラックのようなものだとすれば、FairyClaw は、次の曲がり角だけをドライバーに示し、必要になるまで残りの地図を隠し続ける GPS のようなものです。
- 「コード修理」テスト:バグのあるコードを修正するという特定のタスクにおいて、FairyClaw は明確な勝者でした。「公式スキル」が完了する前に AI に作業を検証させるため、他のエージェントが犯したような愚かなミスを犯しませんでした。
まとめ
この論文は、AI のスキルを長く曖昧な指示マニュアルとして扱うのをやめ、厳格で実行可能なソフトウェアプロトコルとして扱うべきだと主張しています。ルールを「AI が読むテキスト」から「AI が実行するコード」へと移行させることで、実行コストが安く、欺かれにくく、複雑な手順の遂行に優れたエージェントを得ることができます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。