← 最新の論文
🤖 machine learning

Improved Confidence Estimates for Black-Box Large Language Models

本論文は、既存の信頼度スコアとターゲットデータセット内の類似したクエリの正誤性を用いて、回答の正確性を予測する単純な分類器を学習することにより、ブラックボックス型の大規模言語モデルの不確実性定量化を改善する低オーバーヘッドな手法を提案する。

原著者: Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

公開日 2026-08-21
📖 1 分で読めます☕ さくっと読める

原著者: Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、執筆、コーディング、質問への回答において強力なツールとなりましたが、ある隠れたリスクを抱えています。それは、モデルが時として絶対的な確信を持って事実を捏造してしまうことです。「ハルシネーション(幻覚)」としばしば呼ばれるこの現象は、誤った回答が深刻な結果を招きかねないヘルスケアや科学研究といった、高い信頼性が求められる分野において、これらのシステムを利用する上での大きな障壁となっています。これを解決するために、研究者たちは、特定の回答に対してどの程度信頼すべきかを教えてくれるシステムを構築しようと長年試みてきました。その目的は、すべての回答に対して、その信頼性を示すスコアを割り当てることです。現在、モデル自身に自信の度合いを評価させたり、同じ質問を異なる方法で投げかけた際に回答がどの程度変化するかを分析したりするなど、これらのスコアを生成する方法は数多く存在します。しかし、既存のスコアの多くは、個々の新しい質問をあたかもモデルが初めて見たかのように扱い、過去に同様の質問に対してモデルがどのように回答したかという視点を欠いたまま、孤立して機能しています。

Layer 6 AIとTD Insuranceの研究チームは、自信(コンフィデンス)を固定された属性としてではなく、学習可能なパターンとして扱う異なるアプローチを提案しました。彼らは、既存の手法が事前のデータを必要とせずに生の不確実性スコアを生成する一方で、現実世界のアプリケーションには、ほとんどの場合、正誤がすでに確認されている質問と回答のデータセットが存在すると主張しています。研究者たちは、このラベル付けされたデータは、未開拓の膨大なリソースであることに気づきました。不確実性をゼロから測定する新しい方法を考案する代わりに、彼らは既存のスコアを取り込み、それをモデルが過去に同様の質問にどのように回答したかという情報と組み合わせるシンプルなシステムを構築しました。標準的なコンピュータプログラムを用いて、これらの入力と実際の回答の正誤との関係性を認識するように学習させることで、彼らは元のスコア単体よりも一貫して優れた性能を発揮する新しい手法を作り上げました。

彼らの研究の核心は、人間の専門家が新しい主張を検証するプロセスを模倣した、2段階のプロセスにあります。まず、システムは新しい質問と、大規模言語モデルが提供する回答を受け取ります。次に、システムはモデルや他のツールが通常生成する標準的な不確実性スコアを算出します。続いて、システムは過去に回答された質問の参照ライブラリを調べ、新しい質問に最も類似した質問を見つけ出します。そして、モデルが過去にそれらの類似した質問に対して正解したか不正解だったかを確認し、それらが現在の質問とどの程度近いかを測定します。これらの詳細、すなわち標準的なスコア、類似した質問の履歴、およびそれらに対するモデルの過去のパフォーマンスが、シンプルな分類器(クラシファイア)に投入されます。この分類器は、新しい回答が正しいかどうかを予測することを学習し、生の不確実性の信号を、較正された真実の確率へと効果的に変換します。

研究者たちは、常識的な推論、科学的事実、一般的な知識問題のベンチマークを含むいくつかの異なるデータセットを用いて、さまざまなサイズの言語モデルでこの手法をテストしました。彼らは、モデルに自身の自信を語らせる方法や、回答のバリエーションを多数生成して一貫性をチェックする方法など、既存の最良の手法と比較しました。その結果、彼らのアプローチは、正解と不正解の予測において一貫してより正確な結果を提供することが示されました。ほとんどすべてのテストにおいて、この新手法は、元のスコア単独よりも正解と不正解を区別する能力に優れていました。さらに、このシステムは「較正された(キャリブレーションされた)確率」を生み出しました。つまり、システムがある回答の正解確率を80パーセントと予測した場合、実際にその回答が正しい割合も約80パーセントであったということです。この較正は意思決定において極めて重要であり、ユーザーがシステムが提供する数値に対して信頼を置くことを可能にします。

最も重要な発見の一つは、この手法が非常に少ない追加情報であっても効果的に機能したことです。いくつかのテストでは、モデルの回答のバリエーションを複数生成する必要はなく、単一の回答と類似した質問の履歴のみを使用していました。これにより計算コストが低く抑えられ、スピードと効率が重要となる実世界の利用において、この手法を実用的なものにしています。また、研究者たちは、これらの信号を組み合わせる最善の方法は特定のタスクに依存することを発見し、あらゆる問題に適用できる「万能な解決策」よりも、柔軟に適応できるアプローチが優れていることを示唆しました。自信の推定を固定された計算ではなく学習問題として扱うことで、チームは、モデルの内部構造へのアクセスや高価な再学習を必要とせずに、既存のデータを利用して大規模言語モデルの安全性と信頼性を大幅に向上させられることを証明しました。

本研究は、現在のツールによって生成される初期の不確実性スコアは有用ではあるものの、信頼性の最終的な答えではないと結論付けています。モデルが類似した種類の質問に対して一貫したパフォーマンスを示すという単純な事実を活用することで、教師あり学習の枠組みは、これらのスコアをより信頼できる推定値へと洗練させることができます。これは優れた不確実性指標の必要性を置き換えるものではなく、むしろそれらを強化し、生のデータを実行可能な洞察へと変えるものです。この研究は、より安全な人工知能への道は、単により優れたモデルを構築することだけでなく、それらのモデルが提示する回答を理解し、解釈するためのより優れた方法を構築することにあると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →