← 最新の論文
🤖 AI

Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking

本論文は、大規模言語モデルは、記述が不十分なマルチターン・タスクにおいて追加情報の必要性を認識できる一方で、必要な量を体系的に過小評価し、最小限で十分なクエリを特定できず、さらにクエリの順序付けにも苦慮するということを示す、制御された評価スイートであるMT-InfoSeekを導入するものであり、それによって、彼らの情報探索能力と現在の評価指標との間の明確な乖離を明らかにする。

原著者: Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

医師が患者の向かいに座っており、患者がただ「痛みがあります」とだけ言っている場面を想像してみてください。診断を下すために、医師は推測することはできず、欠けている詳細を埋めるための具体的な質問をしなければなりません。その痛みは鋭いものですか、それとも鈍いものですか? 正確な位置はどこですか? どのくらいの期間続いていますか? 人工知能の世界において、大規模言語モデルは質問に答える能力については頻繁にテストされますが、情報が全く足りない場合に、答えを出さないという判断ができるかどうかについては、めったにテストされません。これは重大なギャップです。有能なAIは、状況が不完全であることを認識し、何が不足しているのかを正確に把握した上で、結論を出す前にそれを求めることができるべきです。もし早まった推測をしてしまえば、自信満々に間違えるリスクを負うことになります。

ハーバード大学とGoogle DeepMindの研究者たちは、この特定のスキルをテストするための新しい方法を構築しました。彼らは、人工知能に欠落したピースを持つパズルを与える、制御された環境を作り出しました。そのパズルは、隠された数字を持つ数学の問題、欠けた事実を持つ論理パズル、あるいは聞き出されていない症状を持つ医学的なシナリオかもしれません。目標は、AIが単にパズルを解くことではなく、答えが明らかになるまで、正しい質問を正しい順序で投げかけるプロセスをナビゲートすることです。研究者たちは、これらのモデルが、どのような証拠が必要かを正確に知っている熟練した調査員のように振る舞えるのか、それとも不十分な手がかりで結論を急いでしまうのかを確かめたかったのです。

チームは、数学、論理学、生物学、医学、一般知識の5つの異なる分野にわたる5,000以上の異なる問題を含むテストスイート「MT-INFOSEEK」を開発しました。これらのテストでは、AIには意図的に不完全な出発点が与えられます。例えば、医学のテストでは、AIは患者に骨盤の痛みがあることは知っていますが、その痛みがどのくらい続いているのか、あるいは患者が妊娠しているのかどうかは知りません。AIはその後、真の答えを提供するシステムである「オラクル(神託)」に対して、一度に一つの質問を行いながら対話を進めなければなりません。AIは、いつ質問をやめて最終的な答えを出すべきかを判断する必要があります。研究者たちは、成功の尺度として、最終的な答えが正しいかどうかだけでなく、AIがその答えを確信できるだけの情報を実際に収集できたかどうかについても測定しました。

結果は、現在のモデルにおける重大な弱点を明らかにしました。AIシステムは、情報が不足していることは概して認識していたものの、どれほど多くの情報が必要であるかを一貫して過小評価していました。研究者が、解くために2つの欠落した情報が必要な問題を作成した際、モデルはしばしば、欠けているのは1つだけだと推測しました。論理パズルにおいて、モデルは情報を過大評価するよりも、過小評価する確率の方が約4倍高かったのです。また、彼らは問題を解決するために実際に必要な特定の質問を特定することにも苦戦しました。たとえ研究者が、いくつの質問をする必要があるかをモデルに正確に伝えたとしても、モデルはしばло適切な質問のセットを選ぶことができませんでした。彼らは無関係な質問をしたり、途中で質問をやめてしまったりして、パズルを未解決のままにしてしまいました。

研究は、質問が行われる順番についても調査しました。医学のような分野では、情報の順序が重要になります。医師は、次にどの検査をオーダーするかを決める前に、痛みが急性なのか慢性なのかを判断しなければなりません。研究者たちは、AIモデルが正しい質問をしているにもかかわらず、順番が間違っている場合、最終的な精度が大幅に低下することを発見しました。これは、何を問うべきかを知ることだけでは戦いの半分に過ぎず、いつそれを問うべきかを知ることも同様に重要であることを示唆しています。さらに、研究者たちは、モデルが悪い最初の質問から挽回できることも発見しました。モデルが最初に役に立たない質問をしたとしても、その後のターンで関連する質問を継続していれば、依然として正しい解決策に到達できるのです。しかし、多くのモデルは粘り強く継続することができず、十分な証拠を集めていないにもかかわらず、数ターンのうちに止まってしまうことがよくありました。

おそらく最も驚くべき発見は、モデルの「良い答えを出す能力」と「良い質問をする能力」は別物であるということです。研究者たちは、AIがすべての必要な情報を収集した会話を取り出し、別のモデルに対して、その会話のみに基づいてパズルを解かせるというテストを行いました。その結果、一部のモデルは、たとえ自らその事実を収集することに失敗したとしても、全事実を与えられればパズルを完璧に解けることが分かりました。これは、モデルの失敗が、そのモデルの推論や知識にあるのではなく、情報を求めるプロセスにあることを意味しています。モデルは問題を解くのが下手なのではなく、自分が何を知らないのかを知ることが下手だったのです。

研究者たちは、現在の人工知能の評価は不完全であると結論付けました。モデルの最終的な回答の精度だけを測定することは、モデルが推測によって、あるいは欠落した情報を無視してその答えに到達した可能性を隠してしまいます。AIが世界とどのように相互作用するかを真に理解するためには、不確実性を認識し、何が欠けているかを特定し、その欠けている情報をステップ・バイ・ステップで取得する能力を測定しなければなりません。この新しいフレームワークは、まさにそれを実行する方法を提供しており、今日のモデルは強力ではあるものの、いつ推測をやめて問い始めるべきかを知っている人間の専門家のような直感的な感覚がいまだに欠けていることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →