← 最新の論文
🤖 machine learning

The Attribution Contract: Feature Attribution for Generative Language Models

本論文は、出力、対象となる特徴量、生成プロセス、固定条件、およびモデルスコアを明示的に定義することで生成言語モデルにおける特徴量帰属の曖昧さを解消する「帰属契約」という概念的枠組みを導入し、帰属に関する対立をアルゴリズム的欠陥ではなく説明契約の相違として再定義するものである。

原著者: Giang Nguyen

公開日 2026-05-25
📖 1 分で読めます☕ さくっと読める

原著者: Giang Nguyen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ある料理人が特定の料理を作った理由を推測していると想像してください。最終的な味わいにおいて、どの材料が最も重要だったのかを知りたいのです。

昔(単純な「分類器」モデルの時代)は、これは簡単でした。料理人に材料のリスト(入力)を与え、彼が一品の料理(出力)を作ると、塩やコショウを指差して、「ああ、塩が塩味を出したんだ」と言えたのです。材料は固定されており、料理は完成していました。

しかし、生成言語モデル(このテキストを書いている AI など)では、調理プロセスははるかに複雑です。料理人は一品を作るだけでなく、一口ずつ、まるで全宴を調理するかのように進めます。そしてここが難しい点です:彼が最初に調理した一口は、次の一口の材料となるのです。

もし料理人が最初に「Le」(フランス語で「The」)を調理すれば、その「Le」はカウンターに置かれ、次の単語「chien」(犬)の材料として使われるのを待っています。

問題:「誰が何をしたのか」の混乱

この論文は、AI が特定の単語を書いた理由を説明しようとする際、私たちが混乱するのは、実際に何を問うているのかが明確でないためだと主張しています。

著者はこの混乱を**「自己帰属の誤謬」**と呼んでいます。

簡単な例え話があります:
リレー競争を見ていると想像してください。

  • ランナーAがバトンをランナーBに渡します。
  • ランナーBは速く走り、レースに勝ちます。

「ランナーBが速く走ったことに責任があるのは誰か?」と問う場合、

  1. 問いA:「今、ランナーBが速く走るのを助けたものは何か?」
    • 答え:ランナーAから渡されたバトン!(前の単語が最も重要な要因です)
  2. 問いB:「チームが勝つことになった元の計画のどの部分が原因だったか?」
    • 答え:コーチがランナーAに与えた指示!(元のプロンプトが最も重要な要因です)

この論文によると、多くの AI 研究者は同じツールを使って両方の問いに答えようとしていますが、混同してしまっています。彼らは「ランナーA」(前の単語)が「ランナーB」の速度に責任があると見て、「コーチの指示は関係なかった!」と結論づけます。しかし、それは間違いです。彼らは間違った問い方をしただけなのです。

解決策:「帰属契約」

これを解決するため、著者は**「帰属契約」と呼ばれる新しい規則集を提案します。これは、AI の分析を始める前に必ず記入しなければならない作業指示書レシピカード**のようなものです。

AI に「なぜこれを書いたのか?」と問う前に、以下の 5 つ(SCOPE)を定義する契約に署名しなければなりません。

  1. S (Score:スコア):何を測定するのか?(次の単語の確率か、文全体か?)
  2. C (Conditioning:条件付け):何を固定するのか?(AI がすでに書いた単語を無視するのか、それとも材料として扱うのか?)
  3. O (Output:出力):何を説明するのか?(次の単語だけか、段落全体か?)
  4. P (Process:プロセス):AI はそれをどのように作ったのか?(左から右へ書いたのか、拡散モデルのように消して書き直したのか?)
  5. E (Eligible Features:対象機能):何を非難したり称賛したりしてよいか?(ユーザーの元のプロンプトだけか、それとも AI 自身の前の単語も含めるか?)

なぜこれが重要か:「魔法の眼鏡」の例え

AI が魔法の眼鏡をかけていると想像してください。

  • もし契約A(ローカルな次のトークン)を使って AI に単語を説明させると、その眼鏡は前の単語が鮮やかな赤く光っていることを示します。「この単語は、前の単語がそれを確率的に引き起こしたからここにある!」と言っているのです。
  • もし同じ単語を契約B(プロンプト条件付き)を使って説明させると、眼鏡は前の単語の光を消し、元のプロンプトを鮮やかな赤く光らせます。「この単語は、あなたがプロンプトで求めたからここにある!」と言っているのです。

この論文の主な主張は:眼鏡の結果に基づいて AI が「間違っている」あるいは「正しい」とは言えないということです。あなたは契約Aと契約Bが二つの異なる問いを投げかけていることを認める必要があります。

もしある研究者が「AI はソース文書を無視しているため、幻覚を見ている」と主張するが、実際には前の単語を見る契約Aを使っていた場合、彼らは結果を誤解しています。ソース文書が本当に原因かどうかを確認するには、前の単語を固定しソースだけを見る契約Bに切り替える必要があります。

結論

この論文は、数値を計算する新しい方法を発明したのではありません。代わりに、数値について語る新しい方法を発明したのです。

それは、生成 AI の世界には、どの入力が最も重要だったかという単一の「真実」は存在しないことを教えてくれます。あるのは、契約に対する相対的な真実だけです。

  • AI がどのようにステップバイステップで考えているかを知りたい場合は、「ローカル」契約を使用します。
  • あなたの指示が最終的な物語をどのように形作ったかを知りたい場合は、「プロンプト条件付き」契約を使用します。

これらを同じものとして扱うのをやめるまで、私たちは実際には異なる問いを投げかけているのに、AI の説明について議論し続けることになります。「帰属契約」は、答えを探す前に、私たちが全員同じ問いを投げかけていることを保証するための単なるツールに過ぎません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →