← 最新の論文
💬 NLP

Beyond Questions: Evaluating What Large Language Models (Actually) Know

本論文は、大規模言語モデルを事前に定義された質問ではなく、開放的な誘発を通じて自然に表現される知識に基づいて評価する新たなオープン知識評価パラダイム「Beyond Questions(BeQu)」を導入し、規模や推論の努力など多様な要因にわたるモデルの能力に関する重要な知見を明らかにする。

原著者: Luca Giordano, Simon Razniewski

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Luca Giordano, Simon Razniewski

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ある有名な歴史上の人物、例えばマーティン・ルーサー・キング・ジュニアについて、学生が実際に何を知っているのかを把握しようとしている状況を想像してください。

従来の方法(「クイズ番組」アプローチ)
長年にわたり、研究者たちは AI モデルを厳格なクイズ番組の司会者のようにテストしてきました。彼らは具体的で狭い範囲の質問を投げかけます。「彼の生年月日は何ですか?」あるいは「彼の妻は誰ですか?」といった質問です。

  • 問題点: これは、シェフを評価する際に、彼にグラタンチーズサンドイッチを作らせることだけで判断するようなものです。もしそのシェフがパティシエの巨匠である一方で、サンドイッチ作りが下手であれば、クイズの結果は「あのシェフは料理が下手だ」と示します。このテストは、クイズの設計者が「何を質問すべきだと思ったか」しか測っていません。もし設計者がシェフの好きな色について一度も質問しなかったなら、その事実に対する AI の知識は見えません。これを利用可能性バイアスと呼びます。

新しい方法(「発表会」アプローチ)
この論文は、オープン・ナレッジ・エバリュエーションと呼ばれる新しい手法を紹介しています。クイズの代わりに、AI に「マーティン・ルーサー・キング・ジュニアについて、あなたが知っていることをすべて教えてくれ」と尋ねると想像してください。

  • 目的: 私たちは、AI が特定の質問に対して正解するかどうかだけでなく、それが語る物語全体を見ています。私たちは以下を確認します:
    1. 精度: 事実を捏造(ハルシネーション)しましたか?
    2. 再現性: 知っていることをすべて思い出しましたか、それとも重要な詳細を抜け落ちさせましたか?

ツール:BeQu(Beyond Questions)
これをテストするため、著者たちはBeQuという巨大な遊び場を構築しました。

  • 彼らはウィキペディアから1 万個のランダムな項目(人物、場所、出来事)を選びました。
  • それぞれについて、ウィキペディアやウェブから事実を集め、「参照ライブラリ」を構築しました。
  • 20 種類の異なる AI モデルに、これら 1 万の項目について「知っていることをすべて教えてくれ」と依頼しました。
  • その後、超スマートな AI 判定者が、モデルが語った物語を参照ライブラリと比較し、何が真実で、何が誤りであり、何が欠落しているかを判定しました。

彼らが発見したもの(結果)

  1. 巨大モデルはまだ勝利している(ただしオープンソース系は追い上げている):
    AI モデルを学生だと考えてください。「商用」の学生(有料の巨大モデル、例えば Claude Opus など)はまだ最高得点を獲得しています。しかし、いくつかの「オープンソース」の学生(無料モデル)は驚くほど近い得点を出しており、非常に競争力があることを証明しています。

  2. 一生懸命考えることはあまり役立たない:
    「AI に『もっと深く考えろ』や『答えを出す前にもっと推論せよ』と言えば、より多くのことを知っているようになるのではないか」と思うかもしれません。しかし、この論文はこの特定のタスクにおいては、これは主に神話であると結論付けています。AI が「考える」のに 1 秒かかったか 10 秒かかったかに関わらず、引き出した事実の量はほとんど変わりませんでした。知識はすでに存在しており、ただそれを口にする必要があっただけです。

  3. 「厳格な先生」と「創造的な作家」:
    研究者たちは、AI に特定の列を持つスプレッドシートのような厳格な形式で答えるよう強制してみました。

    • 結果: AI は非常に正確(高精度)になりましたが、多くの事実を共有しなくなりました(再現性が低い)。これは、教師が尋ねたことだけを正確に答え、追加の文脈を一切付け加えることを拒む学生のようなものです。
    • 逆に、自由に開放された場合、AI は時に小さな間違いを犯すとしても、より多くの事実を共有しました。
  4. より多くを求めればより多く得られる(ある限界まで):
    研究者が AI に「5 つの事実」をリストアップするよう求めた場合と「100 の事実」を求めた場合を比較すると、より大きな要求をした AI は通常、より多くの知識を共有しました。しかし、AI を数百の事実をリストアップするよう過度に追い詰めると、クォータを満たすために事実を捏造(ハルシネーション)し始めました。

  5. 「架空の人物」テスト:
    彼らは、存在しないもの(例えば「アンドラの国際空港」など)について AI に質問しました。最も優れたモデルは単に「それについては何も知りません」と答えました。一方、性能の低いモデルは、推測しているのではなく知っているふりをするために、架空の詳細を捏造し始めました。

結論
この論文は、AI を多肢選択式テストの機械のように扱うのをやめる必要があると主張しています。AI が実際に何を知っているのかを真に理解するためには、AI に自由に話させ、現実世界をどの程度記述できるか、それをどの程度正確に記述するか、そして何をあえて省略するかを見る必要があります。新しい「BeQu」ベンチマークは、この「発表会」能力を測定するためのツールであり、AI が賢くなっている一方で、常に共有しようとしているわけではない、多くの隠された知識を持っていることを明らかにしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →