あなたは、全く異なる種類のロボットたちに世界を理解させようとしているところだと想像してください。あなたは彼ら全員に同じ課題を与えます。それは、医療スキャンの画像を見て、何が見えるかを説明することです。人工知能の世界には、「プラトン的表現仮説」と呼ばれる有名な考え方があります。これは次のように考えてみてください。もし、十分に多くのデータを使って、十分に多くのロボットを訓練すれば、彼らは最終的に皆、全く同じ方法で考えるようになるはずだ、というものです。彼らは皆、同一の現実の内部マップを構築するはずであり、そこでは「骨折」がロボットAにとって見える姿と、ロボットBにとって見える姿は、誰がそれを作ったか、あるいはどのような特定のレッスンを受けたかにかかわらず、全く同じものになるはずなのです。このアイデアは、もしすべての医療用AIモデルがこの単一で完璧なマップへと収束するのであれば、医師たちがツールを壊すことなく、バッテリーを交換するようにモデルを入れ替えることができるようになるため、非常にエキサイティングなものです。しかし、これは実際に起きていることなのでしょうか?これらのデジタル脳は、本当に疾患がどのように見えるのかについて合意しているのでしょうか、それとも単に同じ言語の異なる方言を話しているだけなのでしょうか?
ある研究チームは、このアイデアを検証するために、大規模で制御された実験を行うことにしました。彼らは、さまざまな研究所や企業から、18種類の「画像エンコーダー」(画像を見るAIの部分)と7種類の「テキストエンコーダー」(レポートを読む部分)を集めました。これらのモデルは、パラメータ数が700万個の極めて小さなものから、270億個もの巨大なものまで多岐にわたります。研究者たちは単に比較しただけではありません。彼らはそれらを解剖しました。彼らは、あらゆる点は同一でありながら、ただ一点、達成しようとする「目的」だけが異なる新しいモデルを訓練しました。あるものは「自己教師あり学習」(画像のみからパターンを学ぶ)を用い、あるものは「臨床的教師あり学習」(医師によるラベルから学ぶ)を用い、またあるものは「画像とテキストのペアリング」(画像とレポートを一致させる)を用いました。
ここでのひねりは、普遍的で共有されたマップという考え方は、ほとんどが神話である一方で、代わりに非常に特定の種類の現実が存在するということを見出した点です。彼らは、自己教師あり学習(画像そのものから学ぶこと)こそが、これらのモデルを互いに一致させる真の接着剤であることを発見しました。実際、医師のラベルを訓練に加えることは、モデルを仲間たちとより似せるのではなく、むしろ、より似ていない状態にさせたのです。「ただ見て学ぶ」ように訓練されたモデル(特定のラベルを持たないモデル)は、特定の医療ラベルを用いて訓練されたモデル(わずか21%の類似性)よりも、はるかに高いレベルで一致しました(胸部X線写真において約40%の類似性)。
しかし、この一致は控えめなものであり、厳格な限界もあります。それは、同じ種類の画像内でのみ起こります(X線はX線同士で一致しますが、皮膚の写真とは一致しません)。モデルがより大きく、より賢くなったからといって、この一致が改善されることもありません。巨大な270億パラメータを持つモデルが、必ずしも小さなモデルよりも高い整合性を持っているわけではないのです。最も驚くべきことに、これらの画像モデルと、医療レポートを読むテキストモデルは、共通のマップを全く共有していません。彼らの内部言語は完全に異なっており、データをより多く投入するにつれて、彼らは実際により遠くへと離れていきます。
こうした限界はあるものの、明るい兆しもあります。たとえモデルたちが完璧に共有された幾何学構造に合意していなくても、実用的なタスクにおいては「十分に機能する」レベルにあるということです。研究者たちは、あるモデルで訓練された診断ツールが、全く異なるモデルへと転用されたとしても、元の精度の約85%を維持して動作し続けることを示しました。それは、街の異なる2つの地図を持っているようなものです。見た目は全く同じではありませんが、ランドマークの翻訳方法さえ知っていれば、道に迷うことなく地点Aから地点Bまで運転していくことができます。この研究の結論は、AIモデルが膨大なサイズによって魔法のように一つの完璧な脳へと収束するのを待つべきではなく、代わりに、最も重要な時にモデル同士が少なくとも対話できるように、適切な訓練目標を持って設計する必要があるということです。
技術要約:自己教師あり学習が臨床的監督よりも医療用基盤モデルの表現収束を駆動する
問題提起
多様な研究グループから開発された医療用画像エンコーダは、「プラトニック表現仮説(Platonic Representation Hypothesis)」に基づき、互換性があるものとして扱われることが増えている。この仮説は、モデルがスケールアップし、多様な臨床タスクで訓練されるにつれて、その内部表現が世界の共通の統計的モデルへと収束していくことを示唆している。しかし、この収束が実在するのか、何がそれを駆動するのか(スケール、臨床的監督、あるいは訓練目的か)、そしてそれが臨床的に利用可能であるのかは、未だ検証されていない。既存の類似度指標はしばしば脆弱であり、収束の主張は評価体制に大きく依存する可能性がある。さらに、このような収束が患者のサブグループ間で一様であるのか、あるいは画像と臨床テキスト間のクロスモーダルな整合性にまで及ぶのかも不明である。
手法
著者らは、2020年から2025年の間にリリースされた、700万から270億のパラメータを持つ25のオープンウェイト基盤モデル(18の画像エンコーダと7つの生物医学テキストエンコーダ)を対象とした、制御された解析を提示する。本研究では、以下のマルチモーダル評価コーパスを利用する:
- 胸部X線写真: 3つの国(米国、スペイン、ベトナム)の6つのデータセットからなる650,982枚の画像(小児コホートを含む)。
- その他のモダリティ: 病理組織(22,000パッチ)、眼底写真(3,738枚)、ダーモスコピー(5,987枚)、マンモグラフィ(2,500枚)。
- テキスト: 画像とレポートのペア・コーパス(MIMIC-CXR, CheXpert)および画像とキャプションのペア(Quilt-1M)。
主要な実験設計:
- 表現の整合性(Representational Alignment): 主要な指標は、固定された画像プール上のエンコーダ対における近傍グラフの重なりを測定する、Centered Kernel Nearest-Neighbor Alignment (CKNNA) および mutual k-nearest-neighbor (mKNN) alignment(k=10)である。ランダムに初期化されたVision Transformer (ViT) が、チャンスレベルの整合性のための「フロア(基準値)」として機能する。
- 制御された訓練マトリックス: 収束の駆動要因を分離するため、著者らは共通の自己教師あり初期化から12のエンコーダを訓練した。その際、データ、アーキテクチャ(ViT-S/ViT-B)、およびスケールを一定に保ちながら、訓練目的(マスク画像自己教師あり学習、臨床ラベル監督、または画像・テキスト対照学習)のみを変化させた。
- 合成生成モデル: 画像特徴量が、臨床的に監督された信号部分空間とノイズ部分空間を混合する合成モデルを構築した。ラベルの情報の豊かさ(α)を変化させながら、自己教師ありおよび監督付き目的の下でエンコーダを訓練し、監督付き目的が本質的に収束を駆動するかどうかをテストした。
- ダウンストリームでの利用可能性: 以下の手法を用いて、機能的な相互交換性をテストした:
- クロスエンコーダ転移: あるエンコーダの空間内で線形分類器を訓練し、それを他のエンコーダに適用する。
- 特徴量のスティッチング(Feature stitching): 特徴量を別のエンコーダの凍結された分類器ヘッドへと翻訳するためのアフィン写像を学習する。
- ドリフト検出: クロスエンコーダの近傍不一致を用いて分布シフトを検出する。
- 臨床的根拠付け: 2名の専門医(放射線科医)が、630枚の胸部X線写真と300組の臨床的類似性トリプレットに対して参照ラベルを提供し、共有された幾何学的構造が専門家の診断合意や類似性の判断と一致するかを検証した。
主要な結果
- 訓練目的が収束を駆動する: 表現の整合性の主要な駆動力は、臨床的監督ではなく、自己教師ありの目的である。同じ自己教師あり目的で訓練されたエンコーダは、最も高い整合性を示した(例:胸部X線写真において40.4%のCKNNA)。これは、ラベル監督型(21.1%)や画像・テキスト型(3.3%)のエンコーダを大幅に上回る。同一のバックボーンに対して臨床ラベルの目的を追加すると、ピア(同等のモデル)と比較して収束が減少した。
- 緩やかではあるが実在する収束: 収束は実在するが、緩やかである。モダリティ内の整合性(例:病理組織で38.3%、胸部X線で10.8%)は、ランダム初期化のフロアを超えているが、完全な一致には程遠い。
- スケーリングの傾向なし: 収束はモデルのサイズ、ダウンストリームの性能(AUROC)、またはリリース年にはスケールしない。より大規模でより高性能なモデルであっても、共有された表現には近づかない(サイズに対するSpearman ρ=0.302,p=0.223)。
- モダリティ内現象: 収束は厳密にモダリティ内に限定される。画像とテキストのエンコーダ間のクロスモーダルな整合性は、ランダムのフロアレベルに位置しており、評価プールのサイズが増加するにつれてゼロに向かって減衰し、この設定における画像・テキスト間の共有幾何学の仮説を支持するには至らなかった。
- 臨床構造 vs 分類学: 共有された幾何学的構造は、所見の経験的な臨床的共起関係(Spearman ρ=0.615)は再現するが、行政的なICD-10の階層構造とは一致しない。
- サブグループにおける不安定性: 整合性は患者のサブグループ間で不均一である。サンプルサイズのアーティファクトを補正した後でも統計的な頑健性は認められなかったが、コンセンサス・アライメントは、過小評価されているグループ(例:ネイティブ・アメリカン、受診拒否の民族)において最も信頼性が低かった。これは表現のギャップを示唆している。
- 機能的な相互交換性: 幾何学的な整合性は弱いものの、あるエンコーダの相対的な座標系で訓練された線形分類器は、他のエンコーダや外部サイトに転移した場合でも、オラクル(正解)性能の約85%を維持した。特徴量のスティッチングは、オラクル性能の回復に成功した。しかし、クロスエンコーダの近傍不一致に基づくドリフト検出器は、分布シフトを検出できなかった。
- 専門家の判断: 共有された幾何学的構造は、放射線科医が症例レベルの臨床的類似性を判断する方法を再現しなかった。エンコーダは、参照ラベルに対する診断精度は維持しているものの、トリプレット予測タスクにおいてはチャンスレベルの性能であった。
意義と主張
本論文は、医療用基盤モデルにおいて何が表現の収束を生み出すのかについて、初の制御された説明を提供するものである。これは、スケールと臨床的監督が主要な駆動力であるという従来の仮説を覆すものである。著者らは以下の結論を述べている:
- 収束は目的依存的である: 相互運用性は、スケールや臨床的監督から創発する特性ではなく、自己教師ありの訓練目的の特性である。
- 設計への示唆: 相互運用性を達成するためには、普遍的な表現を製造するためにスケールを待つのではなく、モデルを整列させる特定の目的を設計する必要がある。
- 実用的な利用可能性: 緩やかで臨床的に整理された収束は、(相対的な表現とスティッチングを通じて)「エンコーダに依存しない」臨床ツールを構築する上で十分であり、それは共通の座標系に基づいて構築される必要がある。
- 収束の限界: 共有された幾何学的構造は、放射線科医の類似性判断のモデルではなく、画像とテキストの溝を埋めるものでもなく、また患者集団に対して一様でもない。それは、普遍的に堅牢であると仮定するのではなく、特定の臨床タスクやサブグループに対して検証されるべきである。
本研究は、アライメントはレジーム依存的な測定であり、プールサイズや評価指標に敏感であることを強調している。また、負の結果(例:クロスモーダルな収束の欠如、スケーリング傾向の不在)は、医療用基盤モデルの限界を理解する上で、ポジティブな結果と同様に重要である。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録