← 最新の論文
🤖 AI

Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents

Trace2Policyは、エキスパートの意思決定ルールを、高精度かつ決定論的なPythonコードへと系統的に復元・改善するエラー駆動型反復的スキル洗練(EISR)フレームワークを導入しており、コンプライアンスが重視されるタスクにおいて、静的なLLM蒸留や純粋なLLMベースラインを凌駕すると同時に、洗練コストを大幅に削減します。

原著者: Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

公開日 2026-06-10
📖 1 分で読めます☕ さくっと読める

原著者: Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

忙しい物流会社を想像してみてください。そこでは熟練の監査員が、日々何千件もの配送請求書のレビューに時間を費やしています。彼らは写真を確認し、レポートを読み、「この損傷は運送業者の責任か、それとも荷主の責任か?」を判断します。これらの専門家は、長年培ってきた複雑で明文化されていない一連の「メンタル・ルール(思考の規則)」に基づいて判断を下しています。彼らは例えば、「もし写真には箱の破れが写っているのに、システム上では『無傷』と表示されていれば、写真を信じる」とか、「もしレビュー担当者が『C:』で始まるメモを書いていたら、それは密かに責任の所在を付け替えていることを意味する」といったことを熟知しています。

問題は、これらのルールが専門家の頭の中に閉じ込められていることです。AI(人工知能)に対して、単にいくつかの例を見せるだけでこの仕事を教えようとしても、AIは混乱してしまいます。専門家が使う巧妙で隠れたテクニックを見逃してしまうのです。

Trace2Policyは、この問題を解決するために設計された新しいシステムです。これは「ルール抽出・洗練マシン」と考えてください。その仕組みを、簡単な比喩を用いて説明します。

1. 探偵フェーズ(行動のキャプチャ)

まず、システムは「静かな探偵」として振る舞います。専門家のコンピューター作業を監視し、クリック、閲覧した画面、入力したメモのすべてを記録します。単に「何をクリックしたか」を記録するだけでなく、「なぜそれを行ったのか」という理由まで理解しようと試みます。

  • 比喩: コーチが熟練のシェフによる複雑な料理の調理過程を記録している様子を想像してください。コーチは単に「塩を加える」と書くだけでなく、「シェフはスープを味見し、眉をひそめ、出汁の酸味が強すぎると判断して塩をひとつまみ加えた」といった具合に記録します。

2. 下書きフェーズ(最初の試行)

システムはこれらの記録を取り込み、スマートなAIに対して「シェフが従っていると思われるルール」を書き出すよう命じます。

  • 問題点: 最初のドラフト(下書き)は、通常、表面的なものです。「箱を確認する」といった明らかなステップは捉えますが、「(システムはリアルタイムで更新されるため)元のコードではなく、現在のコードを確認する」といった、深く隠れたロジックを見落としてしまいます。
  • 結果: この最初のドラフト(「v1 スキル」と呼ばれます)は、まあままでしたが、決定の約70%しか正解できませんでした。これは、教科書の内容は暗記しているものの、期末試験のひっかけ問題には対応できていない学生のような状態です。

3. 「EISR」エンジン(魔法のループ)

これが核心となる革新技術です。システムはEISR(エラー駆動型反復スキル洗練:Error-driven Iterative Skill Refinement)と呼ばれるプロセスを使用します。

  • 仕組み: システムは、作成したドラフト・ルールをテストケースに適用します。間違いが発生したとき、システムは単に「間違い」と言うだけではありません。厳格な編集者のように振る舞います。
    1. 診断: 間違いをグループ化します。これらは「欠落(ルールが存在しない)」なのか、「誤り(ルールはあるが、答えが間違っている)」なのか、あるいは「競合(2つのルールが衝突している)」なのかを判別します。
    2. パッチ(修正): そのエラーグループに対して、具体的な修正案を作成します。
    3. 安全確認(回帰ゲート): 修正を保存する前に、以前正解していたケースを再度実行します。もし新しい修正によって、以前は機能していたものが壊れてしまった場合、その修正は破棄されます。
  • 比喩: 自動車のメカニックがエンジンを修理している様子を想像してください。エンジンの異音を直すためにボルトを締めるたびに、そのせいでスパークプラグが緩んでしまっていないか、すぐにエンジンをテストします。彼らは、他の部分を壊すことなく車が完璧に動くまで、このプロセスを繰り返します。

4. 「トラップ・ルール」の発見

このループを通じて、システムは「トラップ・ルール(罠のルール)」を発見しました。これは、一度のインタビューでは誰も書き出すことができない深い知識です。

  • 例: 画面上の特定のコードは「共同責任」のように見えるかもしれませんが、実際には「梱包損傷」から5分前に変更された一時的なラベルに過ぎない、という罠がありました。専門家はそのラベルを無視して、レビュー担当者が取った「アクション」を見るべきだと知っていました。AIは、間違いを繰り返し、修正を受けることで初めて、このことを学習しました。

5. 最終成果物:コンパイル型 vs プロンプト型

この論文は、ルールがどのように使用されるかについて、非常に具体的かつ驚くべき主張をしています。

  • プロンプト方式: ルールを長い指示リスト(プロンプト)としてAIに読み込ませる方法です。これは可能ですが、天才に対して「50ページの取扱説明書を読みながら数学の問題を解け」と頼むようなものです。正解率は約70%にとどまります。
  • コンパイル方式: システムはこれらのルールを、厳格なコンピュータプログラム(Pythonコード)に変換します。これは、取扱説明書を、単に計算を行うだけの「電卓」に変えるようなものです。
  • 結果: 「コンパイル版」は精度が 79.6% まで跳ね上がりました。論文は、このようなルール重視のタスクにおいては、AIの知能よりも「ルールの質」の方が重要であると論じています。悪いルールに従う賢いAIは失敗しますが、完璧なルールに従う単純なコンピュータは成功するのです。

6. 「フライホイール」(自己改善)

導入後も、システムは停止しません。

  • ループ: 人間の監査員は、(通常の業務の一環として)引き続きすべてのケースをレビューします。システムは、自身の回答と人間の回答を比較します。両者が一致しない場合、システムはそれをフラグ立てし、エラーを分析し、自動的に別の「EISR」ラウンドを起動してルールを修正します。
  • コスト: これを手動で行う場合、専門家が1サイクルあたり70時間を要します。自動化されたバージョン(Auto-EISR)は、わずか 5〜10ドル のコストと数時間の時間でこれを実行します。

まとめとしての主張

  • 何をするものか: 専門家の行動を、自己改善型の意思決定ルールへと変換します。
  • 判明したこと:
    • ワンショット学習(AIに一度だけ指示を出すこと)では、深く隠れたルールを捉えることはできません。
    • 反復的なエラー修正(EISR)は、「トラップ・ルール」を発見し、精度を大幅に向上させます。
    • この種のタスクにおいては、ルールを厳格なコンピュータプログラムとして実行する方が、AIにルールをプロンプトとして読ませるよりもはるかに優れています。
    • AIによる「セーフティネット(AIが確信を持てない時にルールを修正させる機能)」を追加することは、この特定のケースでは逆に精度を下げました。なぜなら、AIは請求を却下することに積極的すぎたのに対し、実際のルールは会社のニーズに完璧に調整されていたからです。
  • 範囲: これは物流会社のダメージ請求(3,349件)およびいくつかの法的推論ベンチマークでテストされました。著者らは、これがあらゆる種類の決定に適用できると主張しているのではなく、専門家が体系的かつ暗黙的なルールに従っているタスクに特化したものであることを明示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →