技術サマリー: SkillZip
1. 問題提起
自己進化型エージェントは、成功した手順、失敗の修正、および警告をスキル・アーティファクトに追加することで向上します。しかし、このプロセスは、テキストの増大と手順の増大との間に系統的な不一致を引き起こします。エージェントが進化するにつれ、同じ要件が複数のブランチ、例、および警告の中で繰り返し記述されるようになり、共通のアクションシーケンスが再利用されるのではなく、コピーされてしまいます。
これは「スキルの肥大化(skill bloat)」をもたらします。実験では、真に新しい手順的内容が安定した後でも、スキルの長さが大幅に増加していることが観察されました(平均5.2倍)。この冗長性は、プリフィル(prefill)コストを増大させ、重要な指示を不明瞭にします。既存のソリューションには以下の限界があります:
- 汎用的なプロンプト圧縮: スキルをフラットなテキストとして扱うため、スキルの構造的性質(インターフェース、ワークフロー、契約、およびスコープ化されたルール)を考慮できていません。クエリへの関連性に基づいてトークンを削除することが多く、手順上の必要性を考慮していません。
- 評価ガイド型圧縮(例: SkillReducer): 圧縮の妥当性を検証するために、タスクのロールアウト、報酬、および行動検証器に依存しています。これは高い計算コスト、レイテンシ、および圧縮時の特定の評価セットへの依存をもたらし、テストされていないが極めて重要なガードや制約の喪失を招くリスクがあります。
核心となる課題は、ダウンストリームのタスク、ロールアウト、または検証器に頼ることなく、繰り返される構造を統合しつつ、稀なルールや独自の制約を厳格に保持しながら、進化したスキルを圧縮することです。
2. メソドロジー: SkillZip
SkillZipは、スキルの「最短かつ忠実な構造的説明」を見つけることでスキルを圧縮する、評価不要(evaluation-free)の手法です。これは「一度説明し、何度も参照する」という直感に基づいています。すなわち、繰り返されるルールを適切なスコープで一度だけ述べ、繰り返されるシーケンスを共有された手順へと集約し、差異のみを明示的な例外として保持するという考え方です。
A. 契約表現(The Contract Representation)
SkillZipは、スキルを以下の要素からなる型付き契約 C(S)=⟨I,G,T,C,O,E⟩ として定式化します:
- インターフェース (I): 名称、目的、トリガー、および除外事項。
- ワークフロー (G): アクション、順序、意思決定、ループ、およびフォールバック。
- ツール・プロトコル (T): ツール名、引数、前提条件、およびエラーハンドリング。
- スコープ化されたルール (C): 特定のスコープとガードを持つ義務および禁止事項。
- 出力契約 (O): レスポンス型、必須フィールド、およびバリデーション。
- エビデンス (E): 契約要素に紐付けられた例および根拠。
システムはスキルのテキストを型付きユニットへとパースします。もしあるスパンが自信を持って解釈できない場合は、「ロックされた残差(locked residual)」として扱われ、完全な形で保持されます。これにより安全性が確保されます。
B. 最適化目的関数
圧縮の目標は、最小記述長(MDL)問題として定式化されます。システムは、再利用可能な契約要素のライブラリ (K) と残差 (R) を求め、以下の総コストを最小化します:
(K∗,R∗)=arg(K,R)min[L(K)+L(R∣K)]
ここで、**ハード・カバレッジ制約(hard coverage constraint)**に従います:抽出されたすべての規範的要件(インターフェース、ワークフローのエッジ、ツールの要件、ルール、出力フィールド)は、圧縮された表現によってカバーされていなければなりません。これにより、サンプルされたタスクにおける出現頻度が低いという理由だけで、ユニークまたは稀なルールが削除されることを防ぎます。
C. 運用モード
SkillZipは2つのモードで動作します:
- ワンショット圧縮(One-Shot Compression): 既存の進化したスキル・チェックポイントに対して使用されます。これには、決定論的なスキャナー、スキーマ制約に基づいた契約の抽出、型互換性のある再利用候補の提案、および決定論的な最適化ステップ(動的計画法と重み付きパッキングを使用)を用いた最短の被覆説明の選択が含まれます。
- 書き込み時圧縮(Zip-on-Write / Continual): 自己進化ループに統合されます。新しいパッチが到着した際、現在のコンパクトな契約と比較されます。システムは、吸収(Absorb)(再記述)、洗練(Refine)(ガード/例外の追加)、拡張(Extend)(新しい要件の追加)、またはリファクタリング(Refactor)(新しい抽象化の作成)のいずれかを選択します。これにより、タスクの再生や履歴全体の再パースを回避します。蓄積されたパッチが新たなクロススコープの再利用機会を生み出した場合には、定期的な「リパッキング(repacking)」が行われます。
3. 主な貢献
- 評価不要の定式化: 本論文は、スキルの圧縮を進化したスキルに適した契約表現問題として定式化し、圧縮プロセスにおけるダウンストリームタスク、ロールアウト、または検証器の必要性を排除しました。
- 最短かつ忠実な説明目的関数: セマンティックな共有、スコープのリフティング、ワークフローの再利用、および例外のエンコーディングのバランスをとる統一された目的関数を提供します。決定的なことは、ハード・カバレッジ制約により、タスクの頻度に関わらず稀なルールを確実に保存できる点です。
- デュアルモード・アーキテクチャ: バッチ圧縮用のOne-Shot SkillZipと、継続的進化のためのZip-on-Writeの設計により、後者はコンパクトな状態を維持し、履歴全体の再パースを回避します。
- 実証的検証: 3つのバックボーン(Qwen3.7-Max, Qwen3.6-Plus, Kimi K2.6)を用い、3つのベンチマーク(BFCL-v4 Web Search, LiveMathematicianBench, SpreadsheetBench)において、圧縮性能、汎用性、およびコスト効率における大幅な改善を実証しました。
4. 実験結果
著者らは、3つのバックボーン(Qwen3.7-Max, Qwen3.6-Plus, Kimi K2.6)を用いて、3つのベンチマーク(BFCL-v4 Web Search, LiveMathematicianBench, SpreadsheetBench)でSkillZipを評価しました。
- スキルの成長 (RQ1): 自己進化はスキルの長さを単調に増加させ、平均して初期サイズの約5.2倍に達することを確認しました。これは圧縮の必要性を裏付けています。
- 忠実度とパフォーマンス (RQ2): SkillZipは平均 31.2%(範囲:27.1%〜36.9%)の圧縮率を達成しました。圧縮中に評価データを使用していないにもかかわらず、未圧縮の進化したスキルと同等、あるいはわずかに優れたタスクパフォーマンスを維持しました(マクロ平均スコア 0.577 対 0.570)。また、圧縮率とタスクパフォーマンスの両面でベースラインであるSkillReducerを上回りました。
- 効率性 (RQ3): SkillZipはSkillReducerに対して 3.5倍の高速化 を示しました。SkillReducerは検証のために1圧縮あたり40〜80回のタスク・ロールアウトを必要としますが、SkillZipは構造化された抽出と決定論的な最適化に依拠するため、ゼロのロールアウトで済みます。
- 汎用性 (RQ4): SkillZipによって圧縮されたスキルは、SkillReducer(0.91)と比較して高いクロスモデル保持率(LiveMathで0.97)を示しました。これは、明示的な構造保存がモデルに依存しない実行を助けることを示唆しています。
- 継続的圧縮 (RQ5): 進化の開始時からZip-on-Writeを有効にすると、スキル成長はシード長の1.6倍〜1.9倍に抑えられ、圧縮なしの場合の2.5倍〜3.7倍と比較して抑制されました。これは、冗長性を後から削除するよりも、発生を防ぐ方が効率的であることを裏付けており、精度へのトレードオフもありませんでした。
5. 意義と主張
本論文は、SkillZipが自己進化型エージェントにおける重大なボトルネック、すなわち価値を付加しない冗長な手順的テキストの蓄積に対処していると主張しています。SkillZipは、「コンテンツのフィルタリング」から「知識の統合」へとパラダイムをシフトさせることで、エージェントが「手順を忘れることなく、反復を忘れる」ためのメカニメントを提供します。
その意義は、その**評価不要(evaluation-free)**な性質にあります。タスクの分布ではなくスキルの内部構造に依拠することで、SkillZipは評価ガイド型の手法に伴うコストと過学習のリスクを回避します。ハード・カバレッジ制約を通じて、稀だが重要な制約の保存を保証し、圧縮されたスキルが忠実で実行可能、かつ人間が読めるアーティファクトであり続けることを保証します。著者らはこれを、継続学習システムにおけるスケーラブルなスキル・アーティファクトを維持するための、実用的で信頼性の高い手法として位置付けています。