← 最新の論文
💬 NLP

Capabilities of Claude Fable 5 on Biomedical Challenge Problems

本論文は、AnthropicのClaude Fable 5が、回答を行う際にはバイオメディカル・ベンチマークにおいてトップクラスの精度を達成する一方で、その実用性は、前身モデルやGPT-5には見られない、質問の大部分を拒絶するという特有かつ蔓延した傾向によって著しく制限されていることを明らかにしている。

原著者: Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Dominic Okonkwo, Magnus Hodgson, Temitope I. David, Susan Adanna Ihejirika

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、Fable 5という名の超スマートなロボット司書を想像してみてください。このロボットはAnthropicの最新かつ最も強力な創造物であり、医学書を読み、X線写真を見、難解な生物学のパズルを解くように設計されています。しかし、ここにひねりがあります。質問を投げかけると、Fable 5は間違った答えを出す代わりに、時々耳に手を当てて「その質問には答えられません」と言うのです。

この論文は、研究者たちが次のような疑問を解明しようとした探偵小説のようなものです。このロボットは本当にバカになったのか、それとも単に話す内容に対して非常に潔癖になっているだけなのか?

大いなる「答えられない」ミステリー

研究者たちは、Fable 5を他の3つのロボット(自分自身の2つの旧バージョンと、ライバルのGPT-5)と比較してテストしました。これらのテストには、USMLE試験に関する多肢選択式の問題から、腫瘍の画像を見て希少疾患を診断するものまで、8つの異なる医学的挑戦が含まれていました。

大きな驚き:
一見すると、Fable 5は敗者のように見えました。多くのテストにおいて、その生のスコアは他のロボットよりも低かったのです。しかし、研究者たちは奇妙なことに気づきました。Fable 5が膨大な数の質問への回答を拒否していることが判明したのです。

  • RareBench(希少疾患に関するテスト)では、Fable 5は質問の**99.4%**を拒否しました。基本的には、ほぼすべてに対して「ノー」と言っていました。
  • 他のテストでは、**8.0%から42%**の割合で拒否が発生していました。

他のロボットはどうだったでしょうか?彼らはほとんど拒否しませんでした(**0.4%**未満)。彼らは、たとえ間違っていたとしても、あらゆる質問に答えようとしていたのです。

「スコア化された」スコアボード

ここで、研究者たちが使った魔法の手品を紹介しましょう。彼らは「答えられない」という回答を「間違い」としてカウントするのをやめることにしました。代わりに、Fable 5が実際に回答を試みた質問のみに注目することにしたのです。

こうすることで、物語は一変しました:

  • MedQA(医学試験): Fable 5の「真の」正確性は**96.6%**に跳ね上がり、他のすべてのロボットを打ち破りました。
  • PubMedQA: **81.3%**に達し、ここでも他を圧倒しました。
  • RareBench: これが最も衝撃的な部分です。Fable 5は99.4%を拒否したため、実際に答えたのはわずか6問でした。しかし、その6問において、正解率は**0.36%でした。これではひどいと思われますよね?しかし、研究者はこの小さな数字は、そのロボットの脳の能力を測るものではなく、単に「どれだけ黙っていなかったか」の尺度であると指摘しています。彼らが、より「医者らしくない」方法で質問を変えてみたところ、Fable 5はより多く回答するようになり、その新しい回答における正解率は39.4%**に達しました。これは、元の質問に対して他のロボットが得たスコアよりも優れた数値でした!

主な知見: 論文は、Fable 5が実際に能力を低下させているわけではないと結論付けています。実際、回答を決めた場所においては、Fable 5はしばしばその部屋で最も賢いロボットとなります。 問題は、その脳力ではなく、その**「関与する意志」**にあるのです。それは、非常に特定の形式で問いかけられない限り、テストを受けることを拒む天才的な学生のようなものです。

2つの「回答拒否」パターン

研究者たちは、なぜFable 5が「ノー」と言っているのかを突き止めるために深く掘り下げました。彼らは、2つの異なるフィルターのような、2つの明確なパターンを見つけました。

  1. 「基礎科学」フィルター: 標準的な医学試験(MedQAおよびMedXpertQA MM)において、Fable 5は主に基礎科学メカニズム(薬がどのように作用するか、あるいは心臓がどのように鼓動するかなど)に関する質問を拒否していました。患者の診断に関する質問には喜んで答えましたが、その根底にある生物学に関する質問になると、しばしば沈黙してしまいました。
  2. 「希少疾患」フィルター: RareBenchのテストでは、拒否の理由は科学の種類ではありませんでした。それは疾患に関するものでした。
    • Fable 5は、先天性代謝疾患(PKUのような、赤ちゃんが生まれ持っている希少な疾患)に関する質問のほとんどを拒否しました。
    • 一方で、成人の自己免疫疾患(ループスなど)に関する質問には、はるかに回答しやすい傾向がありました。
    • 研究者がプロンプトを、「臨床意思決定支援システム」のように聞こえるのではなく、中立的なリストのように聞こえるよう変更してみましたが、あまり効果はありませんでした。中立的なプロンプトを用いても、希少疾患の質問の**90.7%**は依然として拒否されました。

除外されたもの(「それは違う」リスト)

この論文は、これらの拒否の理由が何ではないかについても非常に慎重に述べています。

  • 質問が難しすぎるからではない: 研究者たちは、Fable 5が他のロボットが正解した質問を拒否していることを確認しました。
  • 質問がオープンエンド(自由記述形式)だからでもない: Fable 5は、多肢選択式の質問も、オープンエンドの質問も、同様の頻度で拒否しました。
  • プロンプトが「権威的」すぎるからでもない: プロンプトを「あなたは医師です」から「これは患者です」に変更しても、拒否率はごくわずかに改善しただけで(**99.4%から90.7%**へ)、解決には至りませんでした。
  • 古いモデルへの「フォールバック」ではない: 時には、企業が安全のために、密かに古いモデルに切り替えて拒否を隠すことがあります。研究者がログを確認したところ、拒否したときも、そのロボットは間違いなくFable 5のままでした。

判決

論文は、Fable 5がなぜこのような特定のフィルターを持っているのか、その理由を知っているとは主張していません。著者たちは、これが過剰な安全機能なのか、あるいはグリッチ(不具合)なのか、ロボットの脳の中を覗いて判断することはできないと認めています。

しかし、彼らは一点において非常に確信を持っています。もしあなたがFable 5に答えさせることができれば、それは驚くほど正確であるということです。その生のスコアと真の実力の間のギャップは、純粋に「ゲームに参加することを拒否していること」によるものであり、能力が欠如しているからではありません。

したがって、もしあなたがこのツールを使用している医師や研究者であれば、論文は次のように示唆しています。「答えられない」からといって、それがバカだと決めつけないでください。 それは単に慎重になっているだけかもしれません。課題は、より多くの医学を教えることではなく、その口を開かせることができるような「問いかけ方」を見つけ出すことなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →