← 最新の論文
🤖 machine learning

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

本論文は、コンテンツ・キーによる選択チャネルとポジション・キーによるタリー・チャネルを重畳させることで、歪みのないアクション選択と破ることのできないプロベナンス(由来)追跡を保証し、転売者による敵対的な削除や書き換えの試みに耐えうる、LLMエージェントの軌跡のための新しい2チャネル・ロバスト属性ウォーターマークであるTRACEを導入する。

原著者: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、フライトの予約、ピザの注文、Wi-Fiの修理ができる超スマートなロボットアシスタントを開発したと想像してください。あなたは、このロボットを仲介業者(リセラー)に販売し、その業者が顧客にレンタルします。ここで問題が発生します。仲介業者が、より安価なロボットをこっそり混ぜ込んだり、自分が作ったと主張したり、あるいは足跡を隠すためにログを改ざんしたりする可能性があるのです。

通常、誰がロボットの意思決定を行ったかを証明するために、ロボットが使用したすべてのツールと取ったすべての行動の記録である「日記(ログ)」を確認します。しかし、もし仲介業者がその日記の所有者であれば、彼らはページを消去したり、物語を書き換えたりして、あたかも自分たちが作業を行ったかのように見せかけることができます。既存のウォーターマーク(電子透かし)は、日記のページの上に書かれた「目に見えないインク」のようなものです。もし仲介業者がテキストを書き換えてしまうと、そのインクは消えてしまいます。

そこで登場するのが、日記の持ち主が痕跡を消そうとしても生き残るように設計された、新しい種類のデジタル指紋、TRACEです。TRACEは単にページに文字を書くのではなく、日記そのものを破壊することなく解除不可能な、2つの巧妙で目に見えない方法で「物語」自体を作り変えます。

2つのチャネルによる手品

TRACEは、互いに保護し合う2つの異なるコードを使うスパイのように、2つの「チャネル」を使用して証拠を隠します。

1. 「選択(Choice)」チャネル(見えない手)
ロボットがどのドアを通って進むべきかを選ばなければならない場面を想像してください。ドアは5つありますが、宝物につながるのは1つだけです。通常のロボットは自身のロジックに基づいてドアを選びます。TRACEの「選択」チャネルは、成功率を変えることなく、特定のドアを選ぶようにロボットを優しく促す「魔法の見えない手」として機能します。

  • 仕組み: これまでの物語(コンテンツ)に基づいた秘密の鍵を使用して、どのドアを選ぶかを決定します。
  • スーパーパワー: もし仲介業者が日記からページを削除(削除攻撃)した場合、物語は飛びますが、見えない手は即座に次のページに向けて再計算を行います。これは、曲がり角を間違えた時に即座にルートを再検索するGPSのようなものです。証拠は、ページ番号ではなく「選択の内容」に紐付いているため、生き残ります。
  • 弱点: もし仲介業者が物語を書き換えた場合(例:「ドアA」を「青いドア」に変更)、このチャネルは壊れます。見えない手は「ドアA」を探していたのに、今は混乱してしまうからです。

2. 「カウント(Count)」チャネル(マスターキー)
次に、ロボットの日記がグループごとに整理されていると想像してください。一つの決定に続いて、いくつかの観察事項が続きます。TRACEの「カウント」チャネルは、言葉の内容には関心がありません。それは「構造」に関心があります。これは、いくつかのグループに対して「ゴーストレコード(冗長なメモ)」を密かに追加することで、一部のグループのメモを1つではなく2つにします。

  • 仕組み: 日記の骨組み(スケルトン)に基づいた秘密の鍵を使用します。そして、「グループ1にはゴーストメモを入れ、グループ2には入れない」といった決定を下します。
  • スーパーパワー: もし仲介業者がテキストを書き換えたとしても(例:「ドアA」を「青いドア」に変更)、グループ内のメモの「数」は変わりません。構造は影響を受けないのです。このチャネルは、日記のフォーマットを壊さない限り、書き換えに対して無敵です。
  • 弱点: もし仲介業者がページを削除した場合、カウントが変わり、このチャネルは混乱します。

「ダブルブラインド」の防御策

ここが天才的な部分です。仲介業者が勝つことはできません。

  • もし彼らが「選択」チャネルを隠すためにページを削除しようとしても、「カウント」チャネル(構造に依存するもの)は完璧なまま残ります。
  • もし彼らが「カウント」チャネルを隠すためにテキストを書き換えようとしても、「選択」チャネル(内容に依存するもの)は完璧なまま残ります。
  • 両方のチャネルを消し去るには、仲介業者は日記の70%を削除し、かつ他のほぼすべてを書き換えなければなりません。しかし、それを行えば、日記はあまりにも壊れてしまい、使い物にならなくなります。彼らは、売ろうとしている製品そのものを破壊してしまうのです!

数字が示すこと

研究者たちは、2つの現実世界のロボットの課題、ToolBench(短いタスク、約1.4回の意思決定ステップ)とALFWorld(長いタスク、約23〜25回の意思決定ステップ)でこれをテストしました。

  • ロボットへのダメージなし: TRACEは「歪みフリー(distortion-free)」です。TRACEは、ウォーターマークのないロボットと同じ頻度でタスクを成功させます。実際、ALFWorldでは、ウォーターマークなしのロボットの成功率は82.4%でしたが、TRACEは83.6%でした。強制的に選択を行わせようとする他のウォーターマークは、成功率を8.1ポイントも低下させてしまいました!
  • 検出スコア: 長いタスク(ALFWorld)において、「選択」チャネルは z = 100 という検出スコアに達しました。これは驚異的に強い信号です。たとえ仲介業者が70%のステップを削除したとしても、スコアは検出ラインを上回っていました。
  • 書き換えテスト: 超スマートなAI(「LLMリライター」)がウォーターマークを隠すために日記を書き換えようとした際、「カウント」チャネルは全く変化しませんでした。そのスコアは微動だにしませんでした。一方で、古いウォーターマーク(「レッド・グリーン」法など)は、ほぼゼロ近くまで低下しました。
  • 不正のコスト: 両方のチャネルを同時に沈黙させるには、攻撃者はアクションの一定割合を破壊しなければなりません。論文では、単に「編集」して逃げ切ることはできず、サービスそのものを壊さなければならないことが数学的に証明されています。

TRACEが対象外とするもの

この論文は、TRACEが「できないこと」についても明確に述べています。

  • これは、仲介業者が単にロボットを全く別のモデルに入れ替えた場合に、それを防ぐ魔法の盾ではありません。もし彼らがあなたのロボットを全く使わなくなったのであれば、検出できるウォーターマークは存在しません。
  • これは、単一の例しかない短いタスク(ToolBench)に対する解決策ではありません。ToolBenchのような短いタスクでは、強力な信号を得るために、約**10個の軌跡(trajectory)**をまとめる必要があります。なぜなら、単一の短いタスクには十分な「意思決定エントロピー(ランダム性)」がないからです。
  • これは、仲介業者が正直であることを前提としていません。このシステムは、証拠を保持している人物が「敵」であるというシナリオを想定して設計されています。

結論

TRACEは、ログへのフルアクセス権を持ち、削除や書き換えを試みる可能性のある人物がロボットを販売している状況においても、ロボットの行動が作成者のものであることを証明できる、世界初のシステムです。これは、証明を2つの部分に分割することで機能します。一つは削除に耐え、もう一つは書き換えに耐えるものです。数学的な証明によれば、攻撃者がこれを打ち負かすためには、提供しようとしているサービスそのものを破壊しなければなりません。TRACEは、たとえ誰がペンを握っていようとも、真実を日記の中に留めておくための、堅牢で歪みのない方法なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →