人工知能の世界を巨大で賑やかな病院だと想像してみてください。長らく、どの AI「医師」が実際にその仕事を上手にこなしているのかを突き止めようとしてきました。しかし、それらを評価するために使われてきたテストは、壊れた得点板のようになってきています。難しすぎて(そうするとすべての AI が A+ を取ってしまう)、秘密主義すぎて(誰も作業を検証できない)、あるいは AI が患者の問題を本当に考え抜けるかどうかではなく、教科書を暗記できるかどうかだけをテストするものになってしまっているのです。
そこで登場したのが、研究者チームによって作成された、新しい完全オープンソースの AI 向け「医学部」であるMEDMARKSです。これは巨大で透明なジムのようなもので、61 種類の異なる AI モデル(小さく予算に優しいものから、巨大なスーパーコンピューター版まで)が、30 種類の身体的および精神的なテストを受ける場となっています。
以下に、論文の発見を簡単に説明します。
1. テストスイート:多様な挑戦
「フランスの首都は何ですか?」といった AI にとって簡単な質問をするのではなく、MEDMARKS はモデルに多様な挑戦を投げかけます。
多肢選択クイズ(MEDMARKS-V): AI がリストから正解を選ぶ、標準的な国家試験のようなものです。これには、厄介な数学問題や、長く複雑な患者の症例が含まれます。
自由回答面接(MEDMARKS-OE): ここでは AI が「患者」と会話したり、治療計画を作成したりする必要があります。単一の正解がないため、研究者は「判定 AI(賢い審判員)」を使って会話を評価し、まるで人間の教師が論文を採点するようにします。
「補助車輪」付き(MEDMARKS-T): これらのテストの一部は、AI を鍛えるためのジムとして使用するように設計された特別なサブセットです。研究者はこれらを使って AI を実際に訓練し、より良くすることができます。これは、コーチが選手を向上させるためにドリルを使うのと同じです。
2. 結果:誰がメダルを獲得したか
研究者は、誰が最上位に立つかを確認するために、異なる設定で 71 回異なるテストを実行しました。
重量級が勝つ(主に): OpenAI(GPT-5.1/5.2)や Google(Gemini 3)などの企業から出ている、最大かつ最も強力な AI モデルが、一般的に最高得点を獲得しました。これらは AI のオリンピック選手のような存在です。
「専門家」対「一般主義者」: 一部の AI モデルは、医学書やノートに特化して訓練されました。これらの「専門家」モデルは、何でも少し知っているだけの大規模な「一般主義者」モデルをしばしば凌駕します。これは、年に一度しか訪れない有名なセレブリティ医師よりも、自分の地域のことをよく知っている地元の医師のようなものです。
効率性のギャップ: ここに驚くべきひねりがあります。トップクラスのクローズドソース AI モデル(有料のもの)はフェラーリのようでした。最高の結果を出しながら、非常に少ない燃料(コンピューターパワー)しか消費しなかったのです。一方、オープンソースモデル(無料でダウンロード可能)はトラックのようでした。時には仕事をこなすことができましたが、それには莫大な量の燃料を消費しました。一部のオープンモデルは、同様のスコアを出すために、5 倍ものコンピューターパワーを必要としました。
3. 癖と欠陥
論文はまた、これらの AI「医師」に見られる面白く、かつ懸念される習慣も発見しました。
「過剰思考者」: AI が質問に間違えたとき、正解したときよりも多く話すことがよくありました。まるで、答えがわからない学生が、正解にたどり着けることを願って神経質におしゃべりを続けるようなものです。
「順序バイアス」: 多肢選択の答えの順序(A、B、C、D)をシャッフルすると、一部の小さな AI モデルは混乱し、内容が同じであっても答えを変えてしまいました。まるで、答えを知っているからではなく、真ん中にあるという理由だけで「C」を選ぶ学生のようなものです。
「ツール」のトラブル: 研究者が AI に数学を助けるための電卓ツールを与えたとき、多くのモデルは実際には悪化しました。電卓を無視したり、間違って使ったり、指示に混乱したりしました。まるで、料理人に新しい包丁を与えたところ、その新しい道具に慣れていなかったために、誤って間違った材料を切ってしまったようなものです。
著者らは、MEDMARKS を「生きているリーダーボード」として構築しました。スポーツリーグが毎週ランキングを更新するのと同じように、このベンチマークは、新しい AI モデルがリリースされるたびに絶えずテストを行うように設計されており、現在の「最高」の医療 AI が誰であり、どこでまだ苦労しているのかを常に把握できるようにします。彼らはすべてのコードとデータを公開し、誰もがテストを実行して結果を検証できるようにすることで、この分野に透明性をもたらしました。