Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks
本論文は、事実に基づくタスクにおける大規模言語モデルの信頼性の低いことが多い知識を考慮した拒否能力を効果的に測定し、明らかにするために、拒否確率と誤り確率との相関に基づいた新たな指標である拒否指数(RI)を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
「LLM は知らない質問を拒絶できるか?」という論文を、平易な言葉と創造的な比喩を用いて解説します。
大きな問題:過信する生徒
非常に難しい歴史の試験を受ける生徒を想像してください。本当に賢い生徒は、自分が答えを知らないときを把握しており、「これは確信が持てません」と手を挙げて言います。しかし、大規模言語モデル(LLM)は、しばしば過信する生徒のようです。答えが全くわからない場合でも、自分が知らないことを認める代わりに、自信満々に物語(「幻覚」)を捏造してしまいます。
これは危険です。なぜなら、医療や法律のアドバイスを AI に求める場合、確信が持てないときは「わかりません」と言うべきであり、自信を持って誤った情報を提供してはならないからです。
従来の測定方法:間違いの数を数える
以前、研究者たちは AI がこの点においてどれほど優れているかを測定するために、2 つの単純な数値を見ていました。
- 回答を拒絶する頻度
- 正解する頻度
この論文は、これらの方法に欠陥があると主張しています。それは、生徒を「『わかりません』と言った回数」だけで評価するようなものです。
- 生徒に「すべてに『わかりません』と言ってください」と指示すれば、彼らは 100% の確率で手を挙げます。しかし、それは彼らが賢いという意味ではなく、単に指示に従っているに過ぎません。
- 逆に、「何があってもすべて答えなさい」と指示すれば、より多くの質問に正解するかもしれませんが、同時に自信を持って誤った回答も与えてしまいます。
従来の指標では、賢明に難しい質問を拒絶する生徒と、単にランダムに拒絶したり回答したりする生徒の違いを区別できませんでした。
新しい解決策:「拒絶指数(RI)」
著者たちは、**拒絶指数(Refusal Index: RI)と呼ばれる新しいスコアを作成しました。これは「真実を語るスコア」**と考えることができます。
AI が「わかりません」と言う回数を単に数えるのではなく、RI はこう問いかけます:「AI は質問が難しいときに特に『わかりません』と言い、質問が簡単なときに回答しているか?」
- 高い RI: AI は賢明な司書のようになります。それは難解で不可能な質問を拒絶しますが、簡単な質問には喜んで回答します。違いを理解しています。
- 低い RI: AI は混乱したロボットのようになります。回答可能な簡単な質問を拒絶したり、逆に不可能な質問に自信満々に回答したりするかもしれません。その「拒絶」の行動はランダムか、破綻しています。
測定方法:「2 パス」のトリック
AI の内部の「思考」(私たちが直接見ることができないもの)を知る必要なくこのスコアを計算するために、研究者たちは巧妙な2 パスのトリックを使用しました。
- パス 1(正直なテスト): AI に一連の質問を投げかけ、「回答したいか、『わかりません』と言いたいのか」を決定させます。どの質問を拒絶したかを記録します。
- パス 2(強制回答): パス 1 で AI が拒絶した質問のみを取り出します。そして、「わかった、これらは今、必ず答えなければならない。スキップ禁止だ」と言って戻ります。AI が実際に試みれば正解できたかどうかを確認します。
2 ラウンドを比較することで、AI が回答できない質問を賢明に拒絶していたかどうかを判断できます。パス 1 で難しい質問を拒絶し、パス 2 でそれらを間違えた場合、その AI は高い拒絶指数を持っています。
発見されたこと
研究者たちは GPT-4、Claude、Llama などの 16 種類の異なる AI モデルをテストし、いくつかの驚くべき事実を発見しました。
- 精度は知恵を保証しない: AI が質問に答えるのが非常に得意(精度が高い)だからといって、いつ止めるべきかを知っているわけではありません。非常に賢いモデルでも、知らないことについて自信を持って推測する場合があります。
- 「ファミリー」が最も重要: AI がいつ拒絶すべきかを知っているかどうかの最も重要な要因は、そのサイズや正解する質問の数ではありません。それはどの会社が作ったかです。ある AI「ファミリー」(Claude や Qwen など)は、サイズに関係なく、他のもの(Gemini や GPT-4.1 など)よりも一貫して賢明に振る舞います。
- 文脈が鍵: AI に文書を読みさせて、その文書に含まれていない質問をされた場合、AI は混乱します。文書に固執するのではなく、自身の学習データに基づいて推測しようとし、拒絶するべき場面で失敗することがよくあります。
結論
この論文は、AI を評価する新しい方法が必要であると結論付けています。単に「何問正解しましたか?」と問うだけでは不十分です。私たちはまた、**「いつ止めて『わかりません』と言うべきかを知っていましたか?」**と問う必要があります。
拒絶指数はこれに対する新しい物差しです。それは、単に賢いだけでなく、自分の限界を認めることができる謙虚で信頼できるAI モデルを見つけるのを助けます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。