Large Language Models Are Overconfident in Their Own Responses
本論文は、チャットテンプレートが、モデルが同一のユーザー提供の出力よりも自身の出力をより信頼するという「所有バイアス」を通じて、指示チューニングされたLLMの過信を悪化させることを明らかにし、モデルの回答をユーザー入力としてフレーム化することで較正を大幅に改善する、再学習を必要としない推論戦略を提案している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大きな問題:自信過剰なAI
想像してみてください。あなたは非常に賢く、博識な学生(AI)に質問をしています。もしその学生が正解を知っていれば、「これについては自信があります」と言うべきです。もし間違っていたら、「あまり自信はありません」と言うべきです。
しかし、研究者たちは現代のAIチャットボットがこれにおいて非常に劣っていることを発見しました。彼らは自信過剰なのです。たとえ間違えていても、まるで100%確信しているかのように振る舞います。これは、数学の問題を間違えたのに、真顔で「絶対にこの答えです」と言い張る学生のようなものです。もし、実際には間違っているのに自信満々なAIを信じてしまうと、誤った判断を下してしまう可能性があるため、これは危険なことです。
調査:なぜこのようなことが起きているのか?
研究者たちは、なぜこれらのAIチャットボットがこれほどまでに自信過剰なのかを知りたいと考えました。彼らは主に2つの原因があるのではないかと疑いました。
- 学習(トレーニング): AIに「役に立つアシスタント」であることを教えるプロセス(「指示チューニング」と呼ばれます)。
- 会話スタイル: 私たちがAIと話す際特有の形式(一方が「ユーザー」、もう一方が「アシスタント」となる「チャットテンプレート」)。
判明したこと:
彼らは、両方が原因であるが、その影響の仕方は異なることを突き止めました。
- 学習は、主要な悪役です。これはAIに「何でも知っている」アシスタントであることを教え、その結果、AIが自分自身の答えが本当に正しいかどうかを判断する能力を失わせます。
- チャットスタイルは、それをさらに悪化させます。研究者たちは、ある特有の癖を発見しました。AIは、自分自身で生成した回答に対して、人間(あるいは「ユーザー」の役割)が提供した全く同じ回答に対してよりも、はるかに高い自信を持つということです。
「オーナーシップ・バイアス(所有権バイアス)」の比喩
AIをキッチンにいるシェフだと考えてみましょう。
- シナリオA: シェフが料理を作り、あなたに提供します。あなたが「これ、美味しいですか?」と尋ねると、シェフは「もちろんです!完璧ですよ!」と言います(たとえ料理が焦げていたとしても)。
- シナリオB: あなた(客)が全く同じ料理を作り、テーブルに置きます。あなたがシェフに「これ、美味しいですか?」と尋ねると、シェフは客観的に見て、「うーん、これは少し塩辛いですね」と言います。
研究者たちはこれを**「オーナーシップ・バイアス」**と呼んでいます。AIは自分の「料理」(自分が生成したテキスト)を信じすぎているのです。「もし自分がこの答えを書いたのなら、私は正しいはずだ」と思い込んでしまいます。この盲目的な信頼が、過剰な自信を生んでいます。
簡単な解決策:「ユーザーが言ったふりをする」
この論文の最もエキサイティングな部分は、その解決策です。研究者たちは、AIを再学習させたり、その脳を作り変えたりする必要はありませんでした。ただ、会話の中で**「質問の仕方」**を変えただけでした。
トリック:
AIに答えを出させた後に、「自分の答えにどれくらい自信がありますか?」と聞くのではなく、研究者たちはAIに対し、その答えがユーザーによって提供されたものであるかのように振る舞うよう指示しました。
- 古い方法: AIが「首都はパリです」と言う AIが自分自身に「自分はどのくらい自信があるか?」と問う AIが「100%です!」と言う(自信過剰)。
- 新しい方法: ユーザーが「首都はパリです」と言う AIが「この答えが正しいということに、どの程度自信があるか?」と問う AIが「70%です」と言う(より誠実)。
答えを「ユーザー」が提供したものとして枠組みを作ることで、AIは「オーナーシップ・バイアス」を捨てることができます。それは「誇り高いシェフ」として振る舞うのをやめ、「客観的な審判」として振る舞い始めるのです。
結果
彼らがこのシンプルなトリックを6つの異なる人気AIモデルで試したところ:
- AIは自身の自信について、著しく誠実になりました。
- 自信過剰な状態を最大で**26%**減少させました。
- 「おしゃべりな」チャット型AIモデルを、以前の「生の(ベースとなる)」モデル(指示に従う能力は低いが、自己判断については元々優れていたモデル)に近い信頼性まで引き上げました。
まとめ
この論文は、AIチャットボットが自信過剰なのは、自分の答えに対してプライドが高すぎるからであることを示しています。単に、答えが自分自身ではなくユーザーから来たものであるとAIに錯覚させるだけで、AIをゼロから作り直すことなく、自分が何を知っていて何を知らないのかについて、より誠実に答えさせることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。