コンピュータに皮膚疾患を認識させる方法を教える場面を想像してみてください。長年、最高のAIシステムは「秘密のクラブ」のようなものでした。それらは、ごく一部の大規模病院しかアクセスできない、膨大な非公開の患者写真を用いて学習されてきました。これらのシステムは学習データを隠し持っていたため、他の誰も、そのシステムに偏り(バイアス)がないかを確認したり、間違いを修正したり、あるいは小さなクリニックにある単純なノートパソコンで実行したりすることさえできませんでした。それはまるで、医学の教科書を共有することを拒む天才的な医師がいるようで、その結果、世界の大部分の人々はその専門知識にアクセスできずにいるような状態でした。
この論文における画期的な成果を理解するには、2つのことを知る必要があります。第一に、「基盤モデル(foundation models)」とは、特定のタスクでテストされる前に、膨大なデータから一般的なパターンを学習する超スマートな学生のようなものです。第二に、「対照学習(contrastive learning)」とは、関連するもの同士のペア(例えば、発疹の写真と「湿疹」という言葉)をAIに見せ、そのペアを脳内で近づけ、無関係なものは遠ざけるように教える手法です。難しい点は、皮膚の画像には多くの場合、診断名、部位、症状のリスト、視覚的概念といった「多くの異なる記述」が同時に付随していることです。従来のAIは、これらすべての記述を一つのぼやけた答えへと平均化しようとしてしまい、正確な診断に不可欠な微細な詳細を見失っていました。
この論文は、世界クラスの医療AIを構築するために秘密のプライベートデータが必要であるという概念に挑戦する、新しい完全オープンな皮膚科AIシステム「UniDerm」を紹介しています。清華大学、Baichuan Inc.、およびその他の機関のチームによる著者らは、完全に公開されている画像とテキストのデータのみで学習されたモデルを構築しました。皮膚病変のさまざまな記述を泥混じりの混合物のように平均化する代わりに、UniDermは「スーパービジョン・デノイジング(supervision-denotyping)」と呼ばれる巧妙なトリックを使用しています。これは、まるで群衆が一度に叫んでいる声を聞くだけの探偵ではなく、特定の質問(「その発疹はどのように見えるか?」対「それはどこに位置しているか?」)を投げかけることで、各タスクに対して明確で鋭い答えを得る探偵のようなものです。
結果は驚くべきものです。UniDermは5大陸にわたる11の異なるベンチマークでテストされ、公開データのみで学習されているにもかかわらず、主要な「秘密のクラブ」モデルと同等、あるいはそれを上回る性能を示すことが分かりました。実際、UniDermはわずか3分の1程度の専門家ラベルのみを使用して、プライベートモデルと同じ高い精度に達しました。皮膚癌の検出において、AUROC(受信者動作特性曲線下面積)0.946というスコアを叩き出し、これは302名の人間による専門家パネルのコンセンサスよりも高い数値です。おそらく最も重要なことは、UniDermが多くのAIシステムが失敗する領域である「濃い肌の色(ダークスキン)」に対しても良好に機能すること、そして高価で強力なグラフィックスカードを必要とせず、標準的なコンピュータで動作できることです。
この論文は、このアプローチが医療AIを「民主化」するものであると主張しています。モデルのコード、重み、そして学習データをどのように再構築するかという正確なレシピを公開することで、著者らはコミュニティに鍵を渡しているのです。これにより、リソースの乏しい地域のクリニックでも、所有権を持つ検証不可能な製品を購入するのではなく、自分たちでAIをダウンロードし、監査し、改良できるようになります。著者らは、この手法が放射線科や病理学といった他の分野において、専門家レベルのAIを構築するための設計図になり得ると示唆しており、公的な利益を生むためにプライベートな秘密は必要ないということを証明しています。
技術要約:UniDerm – オープンな皮膚科用基盤モデル
問題提起
皮膚疾患は世界的に大きな疾病負荷をもたらしていますが、訓練を受けた皮膚科医へのアクセスは、特に低・中所得国において極めて限定的です。基盤モデルは専門家レベルのケアを拡張できる可能性を示してきましたが、現在の最先端システム(例:PanDerm)は、ほとんどの研究機関がアクセスできないプライベートな臨床コホートに依存しています。さらに、これらのシステムはモデルの重みのみを公開し、学習データやレシピを公開しないことが多く、独立した再現、バイアス監査、またはコミュニティ主導の洗練を妨げています。
公開されている皮膚科データの活用における具体的な技術的課題は、「1枚の画像に対する多種多様なテキスト」という制限です。公開データセットは通常、単一の皮膚画像と、複数の異質なテキスト記述(例:診断名、身体部位、視覚的概念、臨床的キャプション)をペアにしています。標準的な対照学習(例:2タワー型のCLIPアーキテクチャ)は、単一の固定された画像埋め込みをこれらすべてのテキストと整合させようとします。この平均化効果はローパスフィルタとして機能し、高周波でタスク固有の詳細情報を破棄し、異なる監督信号をノイズとして扱うため、微細な特徴を識別するモデルの能力を低下させます。
手法
著者らは、公開されている画像・テキストデータのみを用いて訓練された、完全オープンな皮膚科基盤モデルである UniDerm を提示します。核心となる革新は、**監督デノイジング対照学習(supervision-denosing contrastive learning)**であり、これは以下の2つのメカニズムを通じて「1枚の画像に対する多種多様なテキスト」の問題を解決します。
- 指示条件付きアーキテクチャ(Instruction-Conditioned Architecture): 2タワー型モデルとは異なり、UniDermは統一されたビジョン・ランゲージ・トランスフォーマーを利用します。画像(I)と自然言語によるシステム指示(S)を単一のトークンストリームへと結合します。これにより、モデルは同じ画像に対してであっても、指示(例:「この病変を診断せよ」対「色素ネットワークを特定せよ」)に応じて異なるタスク固有の埋め込みを生成できるようになります。
- 監督デノイジング目的関数(Supervision Denoising Objective): 学習目的は、指示条件付きの画像埋め込み(E(I,S))を、その指示に答える特定のターゲットテキスト(T)のみに一致させることです。これにより、マルチターゲット問題をシングルターゲット問題へと分解し、平均化によって破棄されてしまうはずの微細な監督信号を回収します。
学習データとレシピ:
- コーパス: モデルは、5つのソース(Derm1M, ISIC2019, SCIN, PubMed Central Open Access, BIOMEDICA)からなる505,658枚のユニークな公開画像を用いて訓練され、合計570万件以上の指示・ターゲットペアに達します。
- 合成: 生の画像・テキストペアは、マルチタスク指示合成(診断、ICD-11コーディング、形態学的記述、臨床的キャプション)およびICD-11オントロジー拡張(公式の定義とハードネガティブな兄弟サンプリングを使用)を通じて、タスク固有の指示・ターゲットペアへと拡張されました。
- オープン性: モデルの重み、コード、および「データレシピ」(公開ソースからコーパスを再構築するための指示)はすべて、Apache-2.0ライセンスの下で完全に公開されています。プライベートな臨床コホートは使用されていません。
モデルのバリアント:
- UniDerm: 20.7億パラメータを持つ統一トランスフォーマー。
- UniDerm-VE-lite: UniDermのビジョンエンコーダを構造的にプルーニング(枝刈り)し、ラベルなしで蒸留した0.1億パラメータのモデル。CPUのみのハードウェアへのデプロイを想定しています。
主な貢献
- 完全オープンなシステム: UniDermは、重み、コード、およびデータレシピがすべて完全に公開されている最初の皮膚科基盤モデルであり、独立した再現と監査を可能にします。
- 監督デノイジング対照学習: 異質なテキストターゲットによって導入されるノイズを解消する新しい学習パラダイムであり、公開データから微細でタスク固有の表現を学習することを可能にします。
- ラベル効率: 本モデルは、プライベートコホートを用いたモデルよりも大幅に少ないエキスパートラベルを使用して、最先端の性能を達成しています。
- コンテキスト対応推論: 患者のコンテキスト(年齢、部位、症状)をトークンストリームに直接融合させることで、UniDermは診断精度を向上させます。一方、2タワー型モデルはコンテキストを追加すると性能が低下することがよくあります。
- 性能の公平性: モデルはフィッツパトリックの肌の色(FST)に対して堅牢性を示しており、特に既存のシステムの多くが失敗する暗い肌の色(FST V–VI)において顕著です。
結果
UniDermは、ダーモスコピーおよび臨床写真を含む、5大陸8カ国にわたる11のベンチマークで評価されました。
- ラベル効率: Few-shot線形プロービング(ラベル10%)において、UniDermはプライベートコホートを用いたPanDermを平均バランス精度で20.2ポイント(相対的に46.8%の向上)上回りました。30%のラベルにおいて、UniDermはPanDermのフルラベル(100%)時の性能に匹敵しました。
- ゼロショット性能: UniDermは、7つのゼロショット診断ベンチマークすべてで第1位となり、公開データモデルおよびプライベートコホートのPanDermLIPの両方を上回りました。
- リーダー研究(読者研究):
- Tschandl-948サブセット(302人の読者パネル)において、UniDermのゼロショット悪性度検出(AUROC 0.917)は読者の合意(AUROC 0.914)と一致し、そのfew-shot版(AUROC 0.946)はそれを大幅に上回りました。
- Diverse Dermatology Images (DDI) ベンチマークにおいて、UniDermはFST V–VI(暗い肌)のサブグループにおいて、他のすべての比較対象を上回りました(AUROC 0.770 対 次点の0.681)。これは、暗い肌に対して性能を向上させた唯一のモデルでした。
- 効率性: UniDerm-VE-lite(0.1Bパラメータ)は、すべてのベンチマークにおいてPanDerm(0.3Bパラメータ)を上回り、かつGPUなしの4つのCPUスレッドで3.1倍高速に動作しました。
- 検索機能: UniDermは、コンセプト・トゥ・イメージ検索およびクロスモーダル・エビデンス検索においてトップの成績を収め、臨床的な特徴やテキスト記述に基づいて画像を検索することを可能にしました。
意義と主張
本論文は、公開データのみから専門家レベルの医療AIを構築できることを証明しており、「臨床グレードの性能にはプライベートで独占的なコホートが必要である」という前提に異を唱えています。
- 民主化: プライベートデータへの依存を取り除き、(軽量なVE-liteバリアントを通じて)高価なハードウェアへの依存を軽減することで、リソースの乏しいコミュニティが、独占的な製品を購入するのではなく、独自の診断ツールを構築、監査、所有することを可能にします。
- 透明性と説明責任: 完全なオープン性は、独立したバイアス監査とコミュニティによる反復的な洗練を可能にし、プライベートコホート・システムが抱える「ブラックボックス」的な性質に対処します。
- 汎用性: 著者らは、監督デノイジング・パラダイムは皮膚科に特有のものではなく、放射線科や病理学のような、データは豊富だが専門知識が不足している他の医療分野のテンプレートになり得ると主張しています。
著者らは、モデルが公開されている読者リファレンスに達しているものの、これらは遡及的な比較であることを指摘し、控えめな立場を維持しています。彼らは、臨床への準備ができているという主張を行う前に、前向きなマルチサイト検証が必要であることを強調しています。また、学習コーパスは、その構成要素の最も制限的なライセンス(CC BY-NC 4.0)に拘束されるため、著者らはデータライセンスを遵守するために、生の集約コーパスではなく「レシピ」を公開しています。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録