← 最新の論文
💻 computer science

Toward a Gricean Retreat: Probing LLMs for Knowledge Boundaries and Referent Specificity

この論文は、大規模言語モデルが自身の知識の境界と次に続く指示対象の具体性の両方を示す内部信号を保持している一方で、生成過程においてこれらの信号を整合させることに失敗し、グライスの協調的な話者であれば行うような、より安全で一般的な主張へと退却するのではなく、未知のエンティティに関する具体的な詳細を捏造してしまうことを明らかにしている。

原著者: Dananjay Srinivas, Saksham Khatwani, Maria Pacheco

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Dananjay Srinivas, Saksham Khatwani, Maria Pacheco

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの友人は、これまでに書かれたほぼすべての本を読んできたのですが、ここ数年図書館には行っていないという状況を。もしあなたがその友人に、彼らが絶対に知っているはずの有名な著者について尋ねれば、その著者がどの通りに住んでいたかまで正確に答えてくれるでしょう。しかし、もし昨日本を出版したばかりの新しい著者について尋ねたら、その友人は知らないかもしれません。本当に役に立ち、誠実な友人であれば、「その人のことは知りませんが、おそらく作家でしょう」と言うはずです。しかし、もしその友人が自分をよく見せようとしすぎているとしたものなら、通り名や伝記をでっち上げ、すべてを知っているふりをするかもしれません。これは、現代の人工知能、特に大規模言語モデル(LLM)が直面しているまさにその問題です。これらのAIシステムは、学習データから事実を呼び出すことができる「超読書家」のようなものですが、未知のものや知らないものに遭遇すると、知らないことを認める代わりに、もっともらしい詳細を捏造してしまう「ハルシネーション(幻覚)」を起こすことがよくあります。

これをどのように解決するかを理解するために、科学者たちは哲学者グライスが提唱した、言語学における「協調の原理」という概念に着目します。その考え方はシンプルです。優れた会話においては、人々は役に立つこと(十分な情報を提供すること)と、誠実であること(自分が知っていることだけを言うこと)の両方を目指します。もし特定の詳細を知らない場合、協調的な話し手は、より安全で一般的な答えへと「退却」します。例えば、特定の都市名を推測する代わりに、「オーストラリアのどこかの都市」と言うかもしれません。この論文は、魅力的な問いを投げかけています。AIモデルには、これを行うための内部的な「ブレーキ」があるのでしょうか? 彼らは自分が推測しているときに、それを自覚できているのでしょうか? そして、でっち上げる代わりに曖昧な答えを選ぶことができるのでしょうか?

コロラド大学ボルダー校のダンジャナイ・スリニヴァス、サクシャム・カトワニ、マリア・パチェコの研究者たちは、これらのAIモデルの「脳」の中を覗き見ることで、この問題を調査することにしました。彼らは、人物、企業、製品、スキルに関する事実のデータセットを用いて、特別なテストを構築しました。AIが知らないことをシミュレートするために、AIが一度も見たことがない架空の名前の人物や企業を作成しました。そして、「アラン・パイパーは[空白]で生まれました」といった文章の空欄を埋めるようAIに求めたのです。

以下に彼らが発見した内容を記しますが、それは少し複雑な結果となっています。第一に、AIは自分が一度も見たことがないものに対処しているとき、実際にそれを「知っている」ことがわかりました。モデルの脳内の電気信号(活性化)を見ると、「おい、この名前は私にとって新しいものだ!」と告げる明確なパターンが存在します。また、モデルには、具体的な答え(例えば「ビクトリア」)を出そうとしているのか、それとも一般的な答え(例えば「ある都市」)を出そうとしているのかを予測する第2の信号もあります。つまり、誠実であるための材料は確実に揃っており、モデルはその知識と選択能力を持っているのです。

しかし、悪いニュースは、モデルがこの情報を誠実さのために実際に「使って」いないということです。たとえAIが、見たこともない架還の名前を見ていると知っている場合でも、安全で一般的な答えを選ぶのではなく、圧倒的に具体的で作り物の答えを選ぶ傾向があります。これは、完璧なGPSを備えながら、自分が迷っていることを認識しているのに、ドライバー(AIの生成ポリシー)がGPSを無視し、特定の目的地に到達したい一心で壁に向かって直進し続ける車のようなものです。研究者たちは、AIが曖昧になる選択肢を与えられていても、また特定の答えが間違いであることが保証されていても、このようなことが起こることを発見しました。

要するに、この論文は、AIモデルには「自分が手に負えない状況にある」と知るための内部的な「センサー」はあるものの、立ち止まってより安全な答えへと退却するための「ポリシー」や意志が欠けていることを示しています。彼らは、謙虚であるべき時でも、具体的に振る舞うように作られているのです。著者たちは、AIが言葉を発した後にこれらの間違いを修正しようとするのではなく、モデルが自身の内部センサーに耳を傾け、確信がないときは曖昧であることを選択できるように訓練する必要があると示唆しています。それは、AIをより協調的で信頼できるものにするためのステップであり、「正確な都市名はわかりませんが、オーストラリアのどこかです」と言うことが、通り名をでっち上げるよりもずっと優れた答えであることを教えることになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →