← 最新の論文
💬 NLP

Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

本論文は、6,000 以上のウェブ展開型医療大規模言語モデルを対象とした大規模評価を提示し、幻覚、ポリシー違反、プライバシーの欠如という重大なリスクを明らかにするとともに、将来の安全性向上を導くための新たな評価フレームワークとデータセットを導入する。

原著者: Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

AI 向けのインターネット上の「App Store」を想像してみてください。ただし、ゲームや生産性ツールではなく、そこには何千ものデジタル医師が並んでいます。これらは、誰でも作成・公開できるカスタム AI チャットボット(MedGPT と呼ばれる)であり、医療アドバイスを提供したり、症状を診断したり、治療法を説明したりします。

ご提供いただいた論文は、このデジタル市場に対する大規模な隠密な健康診断のようなものです。研究者たちは、評価が高く人気のある医師たちだけでなく、6,000 人以上の医師を監査し、それらが安全で誠実なのか、あるいは実際に危険なのかを確認しました。

以下に、彼らの発見を簡単な概念に分解して示します。

1. 「自信に満ちた嘘つき」の問題(ハルシネーション)

歴史の事実をでっち上げながら、絶対的な自信を持って語るツアーガイドを想像してください。医療の世界では、これをハルシネーション(幻覚)と呼びます。

  • 発見: これらの AI 医師の約**25% から 30%**が「嘘をついて」いたり、医療的な事実をでっち上げていたりします。彼らは、危険な薬を服用するよう、あるいは深刻な症状を無視するよう、自信を持ってあなたに言うかもしれません。
  • 意外な事実: 最も人気のある医師が最も安全だと考えるかもしれません。しかし、この研究では人気は悪い嘘発見器であることがわかりました。「有名」な AI 医師は、あまり知られていない医師と同じくらいでっち上げをする可能性がありました。実際、人気が低いものの方が、よりひどいケースが多かったのです。
  • ユーザーの盲点: 研究者たちは、ユーザーがこれらの嘘に気づいていないことを発見しました。AI が滑らかで自信に満ちた回答を与えれば、アドバイスが医学的に誤っていても、人々は 5 つ星の評価を与えます。まるで、美味しそうに見えるが有毒な食事を提供するシェフに 5 つ星の評価を与えるようなものです。

2. 「悪意ある行為者」の問題(設計の悪用)

これらの AI 医師の中には、単に偶然間違っているだけでなく、リスクを伴うように設計されているものもあります。

  • 発見: AI 医師のほぼ**50%**が、その設計において「赤信号」を示していました。
  • 比喩: 「私たちは病院です」と看板を掲げている(実際は違うのに)、メニューを隠し、食材の由来を明らかにすることを拒むレストランのオーナーを想像してください。
  • 具体的な事例:
    • 一部の作成者は、人々が本物の医師だと誤信するように、ボットの名前を「即座のがん診断」のようにしました。
    • これらのボットの多くには「アクション」という機能(外部ウェブサイトへの接続を可能にするもの)がありますが、その57% にプライバシーポリシーがありませんでした。まるで、医師が血液サンプルを採取するものの、それを使って何をするのかを明らかにしないクリニックに足を踏み入れるようなものです。
    • 仮にプライバシーポリシーを持っていたとしても、その70% 近くが破綻していたり、曖昧だったり、実際にはデータを保護していなかったりしました。

3. 「オープンソース」対「市販品」の対決

研究者たちは、これらの市販の AI 医師と、「オープンソース」のもの(開発者が自由に共有するモデルで、コミュニティのレシピブックのようなもの)を比較しました。

  • 市販品(MedGPT): これらは一般的に賢く正確に聞こえる点で優れていました(事実を正しく把握する頻度が高かった)。しかし、安定性は低く、時には素晴らしい回答を与えたかと思えば、次に同じ質問をすると、全く異なり混乱させる回答を与えることがありました。
  • オープンソース: これらは一貫性が高く(毎回同じ回答を与える)、事実の正確性については低かったものの、安定していました。
  • 教訓: どちらの種類も完璧ではありません。「洗練された」ものは聞こえは良いが揺らぎがあり、「コミュニティ」のものは安定しているが詳細を誤る可能性があります。

4. 「信頼のシグナル」は破綻している

通常の App Store では、アプリに悪いレビューや低い評価があれば、それを避けます。

  • 発見: この医療 AI ストアでは、評価やレビューは安全性について何も教えてくれません
  • 比喩: 最も多くの試乗が行われ、最も高い「5 つ星」の評価を得ている車が、実際にはブレーキが壊れている車であるような自動車ディーラーのようなものです。研究者たちは、人々が AI とどれだけ話したかが、AI が実際に真実を語っているかどうかとほとんど無関係であることを発見しました。

結論

この論文は、これらの AI 医師が人気があるから、あるいは自信に満ちて聞こえるからといって、信頼してはならないと結論付けています。

  • システムは破綻している: これらのボットをチェックする現在の方法(ユーザーレビューや星評価に依存する)は機能していません。
  • 危険性: 患者は医療の訓練を受けていないことが多いため、AI が嘘をついているときや、医師が権威を「偽装」しているときに気づくことができません。
  • 解決策: 患者と話すことを許可される前に、AI の事実、その設計、プライバシー規則をチェックする新しい種類の「健康検査員」が必要です。研究者たちは、これらの検査員を構築するための新しいデータセットと一連のツールを公開しました。

要約すると: デジタル医療市場には、自信に満ちた嘘つきとリスクのある設計が溢れており、「顧客レビュー」はそれらを見抜く助けにはなっていません。これらの AI 医師を私たちの生活に入れる前に、より良い安全チェックが必要です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →