"very likely" Means "uncertain"? How LLMs Diverge from Humans in Linguistic Uncertainty Quantification
本論文は、最適化ベースのアルゴリズムであるMETHODNAMEを導入することで、反復的なサンプリングに依存することなく、モデルの出力から言語的マーカーの最適な確率写像を学習し、人間と大規模言語モデルにおける言語的不確実性定量化の相違を明らかにするものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
私たちは話すとき、しばしば言葉を濁したり、断定を避けたりします。「おそらく」「可能性がある」「ほぼ確実である」といった言葉を使い、それによって自分がどれほど真実を知っているのかを示します。このように疑念を表現する能力は、メタ認知の一形態であり、自分自身の知識の境界を認める精神的な確認作業です。これは人間同士のコミュニケーションにおいて極めて重要な要素であり、答えを持っていないにもかかわらず、あたかも答えを持っているかのように振る舞うことなく、不確実性を乗りこなすことを可能にします。人工知能の世界、特に大規模言語モデルにおいては、この同じ能力が重要な安全機能になりつつあります。これらのモデルは、時として自信に満ちた口調で、事実とは異なる情報を生成することがあり、これは「ハルシネーション(幻覚)」として知られる現象です。医療や法律のような繊細な分野でこれらのシステムを信頼するためには、モデルがいつ確信を持てていないのかを知る必要があります。課題は、AIが不確実性を表現するために使う言葉が、人間の聞き手にとってと同じ意味を、機械自身にとっても持っているのかどうかを見極めることにあります。
ある研究チームは、大規模言語モデルが表現する言語的な不確実性が、人間の理解と一致しているかどうかを調査することに着手しました。彼らはまず、「非常に可能性が高い」や「不確かである」といったフレーズを人間がどのように解釈するかという膨大なコレクションを集めました。数十年にわたる心理学や意思決定科学の研究から、これらの一般的なフレーズを特定の数値的な確率へとマッピングするリファレンスガイドを作成しました。例えば、人間の精神において「非常に可能性が高い」というフレーズは高い程度の確信に対応し、「可能性がある」は中間あたりに位置します。その後、研究者たちはいくつかの高度な言語モデルに対してテストを行い、質問に答えさせるとともに、これらの自然言語のフレーズを用いて自身の確信度を説明させました。そして、モデルの回答を人間のリファレンスガイドと比較し、機械がユーザーと同じ言語を話しているかどうかを確認しました。
結果は、重大な乖離があることを明らかにしました。モデルはそれらの言葉を使うことはできますが、人間とは異なる確信度をそれらの言葉に割り当てていました。例えば、人間が「非常に可能性が高い」と聞くと、それを強い確率として解釈しますが、研究対象となったモデルは、実際にはかなり確信が持てない状況に対してこのフレーズを使用することがよくありました。逆に、モデルは人間が単なる推測とみなすフレーズに対して、高い程度の確信を表明することがありました。このミスマッチは、モデルの出力を読み、その言葉による手がかりが内部状態を反映していると仮定することが、誤解を招く可能性があることを意味しています。この研究は、人間が作った不確実性の辞書に頼るだけでは、機械の確信度を正確に把握するには不十分であることを示しました。モデルには、それらの言葉が何を意味するかについて、独自の明確な内部ロジックが存在していたのです。
この溝を埋めるために、研究者たちはVOCALと呼ばれる新しい手法を開発しました。モデルに人間の定義に従わせるのではなく、このアプローチは、モデル自身の振る舞いから不確実性の言葉の具体的な意味を直接学習します。このシステムは、モデルの数千もの応答を分析し、正解したときにどのフレーズを使い、不正解のときにどのフレーズを使うのかを記録します。そして、モデル特有の言語習慣を正確な確率スコアへと翻訳するカスタムマップを構築します。このプロセスには、データの平滑化を行う数学的な最適化が含まれており、たとえモデルが滅多に使わない表現であっても、似たような響きのフレーズには似たようなスコアが割り当てられるように設計されています。解釈を特定の機械に合わせてカスタマイズすることで、この手法はモデルが確信を持てていないことを検知するための、より信頼性の高い方法を生み出します。
実験の結果、このカスタマイズされたアプローチは、機械に人間の標準を強制しようとするよりも、大幅に優れた成果を上げることが実証されました。複雑な数学の問題や医学的な質問を含む様々なデータセットを用いたテストにおいて、この新手法は、人間のリファレンスガイドのみを使用した場合と比較して、モデルの回答が正しいか間違っているかを予測する上ではるかに正確でした。場合によっては、その改善は劇的であり、ランダムな推測とほとんど変わらない性能だった手法を、エラーを確実に特定できるレベルへと変貌させました。研究者たちは、この技術が、モデルに複数の回答を生成させて比較させるという、よりコストのかかる手法に匹敵するパフォーマンスを、追加の時間や計算能力を費やすことなく達成できることを見出しました。
本研究は、大規模言語モデルは人間の発話パターンを模倣することはできるものの、その不確実性に関する内部的な理解は、私たちとは根本的に異なるものであると結論付けています。「非常に可能性が高い」というフレーズは、人間にとっての重みとは異なる重みを機械には持っています。これらのシステムを真に信頼できるものにするためには、単に人間に似た話し方をさせ、それが人間と同じ意味を持つと期待するだけでは不十分です。むしろ、私たちは彼ら独自の「不確実性のダイアレクト(方言)」を読み解かなければなりません。モデル固有の言語信号を明確な確信の信号へと翻訳するカスタムマップを作成することで、正しい回答と自信に満ちたハルシネーションをより良く区別できるようになり、テクノロジーを現実世界での使用においてより安全で信頼できるものにすることができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。