従来の方法(「クイズ番組」アプローチ) 長年にわたり、研究者たちは AI モデルを厳格なクイズ番組の司会者のようにテストしてきました。彼らは具体的で狭い範囲の質問を投げかけます。「彼の生年月日は何ですか?」あるいは「彼の妻は誰ですか?」といった質問です。
問題点: これは、シェフを評価する際に、彼にグラタンチーズサンドイッチを作らせることだけで判断するようなものです。もしそのシェフがパティシエの巨匠である一方で、サンドイッチ作りが下手であれば、クイズの結果は「あのシェフは料理が下手だ」と示します。このテストは、クイズの設計者が「何を質問すべきだと思ったか」しか測っていません。もし設計者がシェフの好きな色について一度も質問しなかったなら、その事実に対する AI の知識は見えません。これを利用可能性バイアスと呼びます。
20 種類の異なる AI モデルに、これら 1 万の項目について「知っていることをすべて教えてくれ」と依頼しました。
その後、超スマートな AI 判定者が、モデルが語った物語を参照ライブラリと比較し、何が真実で、何が誤りであり、何が欠落しているかを判定しました。
彼らが発見したもの(結果)
巨大モデルはまだ勝利している(ただしオープンソース系は追い上げている): AI モデルを学生だと考えてください。「商用」の学生(有料の巨大モデル、例えば Claude Opus など)はまだ最高得点を獲得しています。しかし、いくつかの「オープンソース」の学生(無料モデル)は驚くほど近い得点を出しており、非常に競争力があることを証明しています。
結果: AI は非常に正確(高精度)になりましたが、多くの事実を共有しなくなりました(再現性が低い)。これは、教師が尋ねたことだけを正確に答え、追加の文脈を一切付け加えることを拒む学生のようなものです。
逆に、自由に開放された場合、AI は時に小さな間違いを犯すとしても、より多くの事実を共有しました。
より多くを求めればより多く得られる(ある限界まで): 研究者が AI に「5 つの事実」をリストアップするよう求めた場合と「100 の事実」を求めた場合を比較すると、より大きな要求をした AI は通常、より多くの知識を共有しました。しかし、AI を数百の事実をリストアップするよう過度に追い詰めると、クォータを満たすために事実を捏造(ハルシネーション)し始めました。
「架空の人物」テスト: 彼らは、存在しないもの(例えば「アンドラの国際空港」など)について AI に質問しました。最も優れたモデルは単に「それについては何も知りません」と答えました。一方、性能の低いモデルは、推測しているのではなく知っているふりをするために、架空の詳細を捏造し始めました。
ランダム: 長さ、Wikidata 文の数、曖昧さの不在でフィルタリングされた 1 万個の Wikipedia 記事。その後、LLM ジャッジ(Llama 4 Scout)によって情報量と適切性に基づいてスコアリングされます。
ドメイン: 10 のドメイン(例:人物、組織、出来事)それぞれから 100 個のエンティティ。
存在しないもの: 幻覚を検証するために手動で作成された 10 個の架空のエンティティ。
参照コーパスの構築: 各エンティティについて、完全な Wikipedia 記事と最大 20 件の Web ドキュメント(Brave Search API を通じて)から参照コーパスを構築します。LLM はこれらのソースから事実的なトリプル(主語、述語、目的語)を抽出し、これを真実(グラウンドトゥルース)として機能させます。
パフォーマンス: 商用モデルが一般的に上位を占めています(例:Claude Opus 4.6、Kimi K2.5、Gemini 3 Flash)が、いくつかのオープンウェイトモデルが驚くほど近いパフォーマンスを示しています。
スケーリング: F1 スコアは一般的にファミリー内(Anthropic、OpenAI、Google など)でモデルサイズが増加するにつれて上昇します。ただし、スケーリング効果は様々です。より大きなモデルはしばしば高い再現率を示しますが、精度が低下することもあります。
精度・再現率のフロンティア: 明確なトレードオフが存在します。高い精度と高い再現率を同時に達成するモデルはありません。モデルは「高精度・低再現率」(例:GPT-5 Nano)または「高再現率・中程度の精度」(例:Claude Opus 4.6)のグループにクラスター化します。上位の F1 スコアは主に再現率によって駆動されており、制限要因は誤った事実を主張することではなく、既知の事実を主張し忘れることであることが多いことを示唆しています。
2. 推論の努力
最小限の影響: Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro などのモデルにおいて、推論の努力(低、中、高)を変化させても、全体の F1 スコアへの影響は negligible(無視できる程度)でした(変動 < 0.05)。これは、事実知識が明示的で努力を要する推論ステップを必要とせず、主にエンコードされ検索されることを示唆しています。