← 最新の論文
💻 computer science

ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation

ClawTrace は、高価で冗長なステップを標的的に剪定しつつ成功した振る舞いを維持することで LLM エージェントのコストを 32% 削減する CostCraft 蒸留パイプラインを可能にする詳細な TraceCards を生成する、コストを考慮したトレーシングプラットフォームを導入します。

原著者: Boqin Yuan, Renchu Song, Yue Su, Sen Yang, Jing Qin

公開日 2026-04-28
📖 1 分で読めます☕ さくっと読める

原著者: Boqin Yuan, Renchu Song, Yue Su, Sen Yang, Jing Qin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いけれど高価なロボットアシスタント(LLM エージェント)が、スプレッドシートの整理やコードの作成といった複雑な問題を解決しようとしていると想像してください。このロボットは、完璧に仕事をこなすこともあれば、失敗したり、非効率な経路を暴走して、一歩一歩にお金を燃やしたりすることもあります。

この論文は、このロボットを再学習させることなく、より賢く、より安価に動作させるための新しいシステム「ClawTrace」と、その手法「CostCraft」を紹介しています。

以下に、簡単な比喩を用いて解説します。

1. 問題点:「盲目」の教師

テストの答案を見て、生徒の勉強習慣を改善しようとする教師を想像してください。

  • 旧来の方法: 教師は、生徒が「A」を取ったか「F」を取ったかだけを見ています。
    • 「A」を取った場合、教師は「素晴らしい、今までのやり方を続けなさい」と言います。
    • 「F」を取った場合、教師は「この間違いを直しなさい」と言います。
  • 欠点: これは危険です。
    • シナリオ A: 生徒は「A」を取りましたが、1 時間しかかからないテストのために 10 時間勉強していました。旧来の教師は結果が良いので「続けなさい」と言います。生徒は時間を無駄にし続けます。
    • シナリオ B: 生徒は名前を書き忘れたために「F」を取りました。教師は「名前を直しなさい」と言います。しかし、生徒は間違った数学の問題に 5 時間も無駄遣いしていたかもしれません。教師は最終的な成績だけを見ていたため、その無駄を見逃してしまいます。

この論文は、既存の AI 学習ツールがこの「盲目」の教師と同じだと主張しています。それらは AI が成功したか失敗したかは知っていますが、各ステップがどれだけのコスト(金銭と時間)をかけたかは知りません。そのコストのシグナルがなければ、AI は高価で無用なステップを削り取ることを学べません。

2. 解決策:「領収書」(ClawTrace)

著者たちは、ロボットの脳に対するスーパーに詳細な領収書プリンターのようなツール「ClawTrace」を構築しました。

  • ロボットが脳(LLM 呼び出し)と対話するたび、ツール(ファイルのオープンなど)を使うたび、または補助ロボットを生成するたびに、ClawTrace はそれを記録します。
  • 「タスク完了」と言うだけでなく、TraceCard(小さな要約)を印刷します。内容は以下の通りです。
    • 「ステップ 1: ファイルを読み取る。コスト: 0.02 ドル。」
    • 「ステップ 2: 同じファイルを再度読み取る。コスト: 0.02 ドル。冗長!
    • 「ステップ 3: 回答を記述する。コスト: 0.01 ドル。」
  • この領収書はコンパクトで読みやすく、他のシステムが全体の厄介な会話履歴を必要とせずに「領収書」を分析できるようにしています。

3. 教師:CostCraft(3 つのアクションシステム)

これらの「領収書」を用いて、CostCraftと呼ばれる新しい蒸留パイプラインが、ロボットのための一連のルール(「スキル」)を作成します。これは、3 つの具体的な種類の助言を与えるコーチのように機能します。

  1. Preserve(「続けなさい」ルール):
    • 比喩: 「A を取り、この特定のことは正しくできた。続けなさい。」
    • 出所: 成功した実行から取得。
  2. Prune(「無駄を削れ」ルール):
    • 比喩: 「A を取ったが、同じファイルを 2 回読み取って 5 ドルも無駄にした。次は 1 回だけ読み取り、残りを節約しなさい。成績は落ちないが、金は節約できる。」
    • 出所: 高価で不要なステップを含んでいた成功した実行から取得。これがこの論文の大きな革新です。
  3. Repair(「間違いを直しなさい」ルール):
    • 比喩: 「数学を確認し忘れたために失敗した。次は提出前に数学を二度確認しなさい。」
    • 出所: 失敗した実行から取得し、正解を知るための「カンニングペーパー(オラクル)」を使用。

4. 結果:何が起きたか?

研究者たちは、30 件のスプレッドシートタスク(ロボットの数学試験のようなもの)でこれをテストしました。

  • コストが重要: 「コスト」情報を領収書から削除すると、ロボットは高価な間違いを犯し始めました。どのステップが無駄かがわからないため、作業を完全に停止したり、ゴミのような出力を生み出したりしました。
  • 「Prune」の驚き: 最も興味深い発見は、Pruneルールに関するものでした。
    • 研究者たちは、これらのルールが単にお金を節約するだけだと思っていました。
    • 現実: それらは実際にロボットの性能を救いました。「Prune」ルールを削除すると、ロボットの失敗率が大幅に上がりました。
    • なぜ?: ロボットが無駄(ファイルを 2 回読む、不要なものを確認するなど)を許されると、混乱して最終的な回答を書き忘れることがよくあることがわかりました。「Prune」ルールはガードレールのように機能し、ロボットが集中してクラッシュしないように保ちます。
  • クロスベンチマークテスト: スプレッドシートから学習したルールを、コード作成や文書分析など、全く異なるタスクに適用してみました。
    • 「Prune」ルール(無駄を削る)は、あらゆる場所でうまく機能しました。無関係なタスクでもお金を節約しました。
    • 「Preserve」ルール(特定の習慣を維持する)は、新しいタスクでは実際には状況を悪化させました。なぜなら、ロボットはスプレッドシート特有の習慣(特定のフォーマットスタイルなど)を学習しており、それがコーディングには意味をなさないからです。

まとめ

この論文は、AI エージェントに効率性を教えるには、最終的な成績(成功/失敗)だけを見ていてはならないと主張しています。各ステップのコストを正確に示す領収書(ClawTrace)が必要です。

この領収書を使うことで、AI に 3 つのことを教えることができます。

  1. 機能するものを維持する(Keep)。
  2. 高価だが無用なものを削る(Cut)。(これは驚くべきことに、AI が軌道に乗るのを助けます)
  3. 壊れたものを修正する(Fix)。

コストを知らなければ、AI は「高価で」「不器用」に学習し、時間を無駄にしなければ簡単に解決できたはずのタスクで失敗することがよくあります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →