← 最新の論文
💬 NLP

Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations

本論文は、マルチターン会話におけるシングルパス帰属手法の限界に対処するため、会話のターンを横断してトークンレベルの依存関係を再帰的に追跡することで、既存の手法と比較して複雑なプロベナンスグラフの復元において著しく高い精度を実現するスケーラブルなフレームワークであるTokengeistを紹介するものである。

原著者: Jessica Tang, Shraddha Barke, Sharad Agarwal

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Jessica Tang, Shraddha Barke, Sharad Agarwal

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

お気に入りのテレビドラマの探偵キャラクターが、なぜ突然特定のやり方で事件を解決することに決めたのか、その理由を突き止めようとしている場面を想像してみてください。あなたは最終的な答えを知っていますが、ドラマは時間を飛び越えて進みます。探偵が目撃者と話し、次に地図を確認し、次に友人に電話をし、最後に決断を下す様子が映し出されます。もし、最後のシーンだけを見たとしたら、その決断は友人から得たものだと考えてしまうかもしれません。しかし、もし友人が、目撃者が地図から得た情報をただ繰り返していただけだとしたらどうでしょう?物語を真に理解するためには、単に最後の瞬間を見るだけでは不十分です。すべての会話や行動を通じて、手がかりの跡を、一歩ずつ、遡って辿る必要があるのです。これは、科学者たちが人工知能(AI)を用いて解決しようとしている、まさにこの種のパズルです。

AIの世界、特に今日私たちが使っている超スマートなチャットボットである大規模言語モデル(LLM)において、ある問題が深刻化しています。これらのモデルは私たちと長い会話を行い、質問を投げかけ、回答を受け、データベースを確認し、そして最終的な答えを出します。時として、その最終的な答えは、5ターンも前に私たちが述べた極めて細かなディテールに依存していることがあります。モデルはその詳細を要約し、それに基づいてツールを呼び出し、最終的に答えを導き出します。ここで大きな疑問が生じます。「その長い会話のどの部分が、最終的な答えを形作ったのか」を、どのようにすれば正確に特定できるのでしょうか?現在、この問いに答えようとするほとんどのツールは、目の前の部屋だけに光を当てる懐中電灯のようなものです。会話全体の中でどの言葉が重要そうかは教えてくれますが、情報がどのように最初から最後まで旅をしてきたかという「ストーリーライン」を見落としてしまいます。AIがどこから事実を得たのかを辿ることができなければ、私たちはAIを信頼することも、間違いを修正することも、なぜAIが嘘をついているのかを理解することもできません。

そこで登場するのが、ジェシカ・タン、シュラッダ・バルケ、シャラド・アガルワルら研究者によって導入された新しい手法、「Tokengeist(トークンゲイスト)」です。AIの思考を辿る従来の方法を「平坦なマップ」だと考えてみてください。もし平坦なマップに噂の出所を探させたら、その噂を最後に聞いた人物を指し示すかもしれませんが、その人物が誰から聞いたのかまでは教えてくれません。研究者たちは、この失敗を「プロベナンス・コラップス(由来の崩壊)」と呼んでいます。それはまるで、メッセージが伝達過程で歪んでいたとしても、最終的なプレイヤーがメッセージの責任を負わされる「伝言ゲーム」のようなものです。平坦な手法は、全履歴を単一のレイヤーへと崩壊させてしまい、情報の深く多段階的な道のりを見失ってしまうのです。

この問題を解決するために、チームは「再帰的な探偵」として機能するTokengeistを構築しました。Tokengeistは、最終的な答えを見て「誰と話したのか?」と問うのではなく、「誰と話したのか?」と問い、さらに、その人物が挙げた全員に対して「そして、その人は誰と話したのか?」と問い続けます。会話のターンを遡り、一歩ずつ、段階的に掘り下げていくのです。それは会話を(アイデアの家系図のような)分岐する樹形図として扱い、最初の葉、つまりオリジナルのユーザー入力やツールの実行結果まで、枝を辿って遡ります。

研究者たちは、自ら作成した「MTCABENCH」という新しいベンチマークを用いてこのアイデアをテストしました。これには、665種類の異なるマルチターン会話から抽出された3,845個の具体的な回答部分が含まれています。これらの会話は、航空券の予約や銀行口座の確認といったツールを伴う非常に複雑なものであり、AIは多くのステップにわたって情報を連鎖させる必要がありました。その結果、従来の「平坦な」手法がいかに無力であるかが判明しました。情報のオリジナルのソースを見つけ出すよう求められた際、平坦な手法の成功率は20%未満でした。彼らは物語の途中で行き詰まってしまったのです。

対照的に、Tokengeistはゲームチェンジャーとなりました。経路を再帰的に遡ることにより、情報のオリジナルのソースを90%以上の確率で特定することに成功しました。それは単なる推測ではなく、全行程をマッピングしたのです。例えば、AIが「保険に加入されているので、フライトをキャンセルできます」と言った場合、平展な手法は単にキャンセル確認書を指し示すだけかもしれません。しかし、Tokengeistはその情報を、保険の存在を示すツール実行結果へと遡り、さらにそのツール実行結果をアンロックしたユーザーIDへと遡り、最終的にはユーザーのオリジナルのリクエストへと辿り着きました。

論文は、この再帰的なアプローチこそがAIの透明性を高める鍵であることを示唆しています。会話全体を一度に見るだけでは不十分であり、会話の「構造」、つまりあるターンが別のターンにどのように依存しているかを理解する必要があるのです。この手法は、テストされた特定のAIモデル(オープンソースで比較的小規模なもの)において最も高い効果を発揮しますが、その結果は、複雑で多段階的なAIエージェントに対して、会話を単なる言葉の平坦なリストとしてではなく、相互に依存するネットワークとして扱う必要があることを強く示しています。Tokengeistは、AIが何を言ったかだけでなく、それを言うに至った物語の全容を理解するための助けとなるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →