← 最新の論文
💬 NLP

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

本論文は、30 の多様な医療タスクと 61 の評価済みモデルからなる包括的なオープンソースベンチマークスイート「Medmarks」を導入し、最先端の推論モデルが精度とトークン効率において他を凌駕する一方で、小規模モデルは回答順序バイアスに対して脆弱であることを明らかにする。

原著者: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed
公開日 2026-05-05
📖 1 分で読めます☕ さくっと読める

原著者: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界を巨大で賑やかな病院だと想像してみてください。長らく、どの AI「医師」が実際にその仕事を上手にこなしているのかを突き止めようとしてきました。しかし、それらを評価するために使われてきたテストは、壊れた得点板のようになってきています。難しすぎて(そうするとすべての AI が A+ を取ってしまう)、秘密主義すぎて(誰も作業を検証できない)、あるいは AI が患者の問題を本当に考え抜けるかどうかではなく、教科書を暗記できるかどうかだけをテストするものになってしまっているのです。

そこで登場したのが、研究者チームによって作成された、新しい完全オープンソースの AI 向け「医学部」であるMEDMARKSです。これは巨大で透明なジムのようなもので、61 種類の異なる AI モデル(小さく予算に優しいものから、巨大なスーパーコンピューター版まで)が、30 種類の身体的および精神的なテストを受ける場となっています。

以下に、論文の発見を簡単に説明します。

1. テストスイート:多様な挑戦

「フランスの首都は何ですか?」といった AI にとって簡単な質問をするのではなく、MEDMARKS はモデルに多様な挑戦を投げかけます。

  • 多肢選択クイズ(MEDMARKS-V): AI がリストから正解を選ぶ、標準的な国家試験のようなものです。これには、厄介な数学問題や、長く複雑な患者の症例が含まれます。
  • 自由回答面接(MEDMARKS-OE): ここでは AI が「患者」と会話したり、治療計画を作成したりする必要があります。単一の正解がないため、研究者は「判定 AI(賢い審判員)」を使って会話を評価し、まるで人間の教師が論文を採点するようにします。
  • 「補助車輪」付き(MEDMARKS-T): これらのテストの一部は、AI を鍛えるためのジムとして使用するように設計された特別なサブセットです。研究者はこれらを使って AI を実際に訓練し、より良くすることができます。これは、コーチが選手を向上させるためにドリルを使うのと同じです。

2. 結果:誰がメダルを獲得したか

研究者は、誰が最上位に立つかを確認するために、異なる設定で 71 回異なるテストを実行しました。

  • 重量級が勝つ(主に): OpenAI(GPT-5.1/5.2)や Google(Gemini 3)などの企業から出ている、最大かつ最も強力な AI モデルが、一般的に最高得点を獲得しました。これらは AI のオリンピック選手のような存在です。
  • 「専門家」対「一般主義者」: 一部の AI モデルは、医学書やノートに特化して訓練されました。これらの「専門家」モデルは、何でも少し知っているだけの大規模な「一般主義者」モデルをしばしば凌駕します。これは、年に一度しか訪れない有名なセレブリティ医師よりも、自分の地域のことをよく知っている地元の医師のようなものです。
  • 効率性のギャップ: ここに驚くべきひねりがあります。トップクラスのクローズドソース AI モデル(有料のもの)はフェラーリのようでした。最高の結果を出しながら、非常に少ない燃料(コンピューターパワー)しか消費しなかったのです。一方、オープンソースモデル(無料でダウンロード可能)はトラックのようでした。時には仕事をこなすことができましたが、それには莫大な量の燃料を消費しました。一部のオープンモデルは、同様のスコアを出すために、5 倍ものコンピューターパワーを必要としました。

3. 癖と欠陥

論文はまた、これらの AI「医師」に見られる面白く、かつ懸念される習慣も発見しました。

  • 「過剰思考者」: AI が質問に間違えたとき、正解したときよりも多く話すことがよくありました。まるで、答えがわからない学生が、正解にたどり着けることを願って神経質におしゃべりを続けるようなものです。
  • 「順序バイアス」: 多肢選択の答えの順序(A、B、C、D)をシャッフルすると、一部の小さな AI モデルは混乱し、内容が同じであっても答えを変えてしまいました。まるで、答えを知っているからではなく、真ん中にあるという理由だけで「C」を選ぶ学生のようなものです。
  • 「ツール」のトラブル: 研究者が AI に数学を助けるための電卓ツールを与えたとき、多くのモデルは実際には悪化しました。電卓を無視したり、間違って使ったり、指示に混乱したりしました。まるで、料理人に新しい包丁を与えたところ、その新しい道具に慣れていなかったために、誤って間違った材料を切ってしまったようなものです。

4. 全体像

主な教訓は、AI が医療タスクにおいて非常に上手になっている一方で、まだ完璧ではないということです。

  • フロンティアモデル(最新かつ最大のもの)が現在のリーダーです。
  • 特化された訓練は役立ちますが、最大規模のモデルに勝つことを保証するものではありません。
  • 効率性は大きな問題です。無料モデルは、コンピューター時間の観点からすると、実行するにはあまりに「高価」であることが多いです。
  • 信頼性は依然として問題です。モデルは質問の形式によって簡単に欺かれたり、ツールを使用する際に混乱したりする可能性があります。

著者らは、MEDMARKS を「生きているリーダーボード」として構築しました。スポーツリーグが毎週ランキングを更新するのと同じように、このベンチマークは、新しい AI モデルがリリースされるたびに絶えずテストを行うように設計されており、現在の「最高」の医療 AI が誰であり、どこでまだ苦労しているのかを常に把握できるようにします。彼らはすべてのコードとデータを公開し、誰もがテストを実行して結果を検証できるようにすることで、この分野に透明性をもたらしました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →