私たちの体内にある微小な世界において、健康と疾患は、何百万もの細胞の中に隠れている少数の特定の細胞の存在に左右されることがよくあります。広大な砂浜の中から、たった一粒のユニークな砂粒を探し出す場面を想像してみてください。これは、白血病の初期段階やウイルス感染を示唆する希少な細胞集団を見つけ出そうとする科学者たちが直面している課題です。現代のテクノロジーは、数千個の個々の細胞に対して数十種類のタンパク質を同時に測定する能力を研究者に与え、免疫系の高解像度なマップを作成することを可能にしました。しかし、これらの発見を可能にするデータそのものが、極めて個人的なものです。それは、その人の疾患の状態、免疫の履歴、さらには遺伝的な素因までも明らかにする可能性があります。この敏感さゆえに、厳格なプライバシー法によって、病院が患者データを他の病院と単純に共有することは禁じられています。これにより、もどかしいボトルネックが生じています。希少な細胞を確実に発見するためには、科学者は大規模で多様な患者グループを用いてコンピュータモデルを訓練する必要がありますが、そのために必要なデータを法的に統合することができないのです。
研究チームは現在、このパズルを解くための新しい方法を開発しました。これにより、病院は互いの生の患者データを決して目にすることなく、希少な細胞の発見に向けて協力できるようになります。彼らの研究は、これらの希少な細胞サブセットを特定するために設計された「CellCnn」と呼ばれる特定の種類の人工知能に焦点を当てています。研究者たちは、実際の数値を隠したまま、複数のコンピュータが共有の数学的問題に対して共同で作業できる安全なシステムを構築しました。彼らは、すべてのデータをランダムで無意味な断片に分割し、それらを異なるコンピューティングサーバーに配布することでこれを実現しました。これらのサーバーは、断片に対して行われる複雑な計算を実行し、結果を組み合わせるために互いに通信します。どの時点においても、単一のサーバー、あるいは研究者自身でさえも、元の患者情報や計算の中間ステップを見ることはありません。このシステムは、最終的な結果が、データをオープンに結合した場合と同じくらい正確でありながら、個人のプライバシーが完全に保たれるように設計されています。
チームは、サイトメガロウイルス感染症および急性骨髄性白血病を含む実世界のデータセットを用いて、彼らの手法をテストしました。これらのテストにおいて、彼らは彼らの安全なシステムを、標準的な非プライバシー型のAI、および以前のプライバシー重視の試みと比較しました。結果は、彼らの安全なアプローチが、標準的な手法とほぼ同等の精度で疾患に関連する細胞を特定できることを示しました。例えば、ウイルス感染に関連する細胞を探す際、彼らのシステムは約73パーセントの精度を達成しましたが、これは非プライバシー版と事実上同一でした。対照的に、暗号化に合わせてAIの「脳」を簡略化しなければならなかった以前のプライバシー保護手法は、精度が約63パーセントに低下し、明らかに性能が劣っていました。新しいシステムは、古い手法では破棄せざるを得なかった、コンピュータがパターンを学習するのに役立つ活性化ステップのような、AIの複雑な部分を維持することができました。
分類だけでなく、研究者たちは、彼らの安全なシステムがより困難なタスク、すなわちサンプル内に存在する希少な癌細胞の正確な数を推定することもできることを実証しました。これは、治療後にごくわずかな癌細胞が残っているかどうかを医師が知る必要がある、微小残存病変をモニタリングする患者の監視において極めて重要です。安全なシステムは、真の値に対して0.98の相関で希少細胞の割合を予測し、これは標準的な非プライバシーモデルに極めて近いパフォーマンスレベルでした。この能力は、以前のプライバシー保護手法では全く不可能だったものでした。研究者たちはまた、プロセスに要した時間も測定し、ローカルネットワーク上でのモデルの訓練には約20分かかったものの、その速度はコンピュータ間の通信帯域幅に大きく依存すると指摘しました。
この研究は、患者のプライバシーを損なうことなく、強力な医療AIモデルを機密データに基づいて訓練することが可能であることを裏付けています。データを丸ごとではなく、秘密の断片として共有する技術を用いることで、研究者たちは、病院がプライバシー規制に違反することなく効果的に協力できることを示しました。現在のシステムは、コンピューティングサーバーがルールに従い、プロトコルから逸脱しないことを前提としていますが、この研究は将来の医学研究への強力な基盤を提供しています。それは、個々の患者の詳細なプライバシーがプロセス全体を通じて完全に隠されたまま、多くの病院の集合的な力が希少疾患の検出に使用できるという、前進への道を示唆しています。
技術要約:セキュアなマルチパーティ計算による希少疾患関連細胞サブセットのプライバシー保護型検出
問題提起
希少疾患に関連する細胞サブセット(例:微小残存病変における白血病芽細胞や、サイトメガロウイルス感染における特定のNK細胞サブセット)の検出は、疾患の進行を理解する上で極めて重要であるが、その頻度が極めて低い(低くとも0.01%)ため、技術的に困難である。CellCnnとして知られる畳み込みニューラルネットワーク(CNN)アーキテクチャは、高次元のシングルセル・マスサイトメトリー・データからこれらの集団を特定することに成功しているが、その適用はデータの不足によって制限されている。堅牢なモデル訓練には、単一の機関では通常収集できないような、大規模かつ多様な患者コホートが必要となる。しかし、シングルセル・データは疾患の状態や遺伝的素因を明らかにする非常に敏感な情報であるため、GDPRやHIPAAのような厳格なプライバシー規制の下、機関をまたいだデータの共有は妨げられている。PriCell(準同型暗号を使用)のような既存のプライバシー保護ソリューションは、多項式回路の予算内に収めるために、ReLU活性化関数、バイアス項、および回帰機能を取り除くといったアーキテクチャ上の制約を課しており、それによってモデルの表現力と精度を低下させている。
手法
著者らは、完全に秘密分散されたデータ上でCellCnnのエンドツーエンドの訓練および推論を可能にする、セキュアなマルチパーティ計算(MPC)フレームワークを提案している。本システムは、2つの計算プロキシ(P0,P1)と1つのヘルパー・パーティ(P2)を用いた3者構成による、誠実な多数派(honest majority)を前提としたセミホネスト(semi-honest)セキュリティモデルの下で動作する。
- データの表現: データ所有者(医療機関)は、自身のシングルセル測定値を環 Z264 上の2つのランダムな加法的なシェアに分割し、一方のシェアを各プロキシに送信する。どのパーティも生のプレーンテキスト・データを観測することはない。
- 計算: プロキシは局所的な加算を実行し、ヘルパーから提供されるBeaverトリプルを用いて乗算のために相互作用する。実数値計算は固定小数点演算を介して行われる。
- アーキテクチャの適応: MPC環境に適応しつつCellCnnの完全な表現力を維持するために、著者らは特定の非多項式操作を以下のように置き換えた:
- 最適化アルゴリズム: 除算や平方根を必要とするAdam最適化を、モーメンタムを用いたミニバッチSGDに置き換えた。
- 活性化関数: 畳み込み層におけるReLU活性化関数を保持し(ネイティブにサポートされている)、セキュアな比較を避けるために平均プーリングを使用した。
- 出力ヘッド: 標準的なソフトマックス/クロスエントロピー・ヘッドを、3次最小二乗多項式によって近似されたクラスごとのシグモイド関数に置き換えた。回帰タスクについては、マスクされたセキュアな指数関数と除算を用いたtanhベースのヘッドを実装した。
- バイアス項: 前述のHEベースのアプローチとは異なり、バイアス項は畳み込み層および全結合層の両方で保持された。
主な貢献
- フルアーキテクチャMPCの実装: 本論文は、PriCellのような従来のプライバシー保護型バリアントで省略されていた重要なアーキテクチャ構成要素(ReLU、バイアス項)を保持した、CellCnnの初のMPC実装を提示している。
- 回帰能力: 本フレームワークは、tanhベースのヘッドを通じて連続的な結果予測(回帰)をサポートしており、準同型暗号ベースの前身による分類限定の有用性を拡張している。
- デカップルされた訓練: 本プロトコルは、計算が固定された専用の計算パーティによって行われるため、データ所有者がシェアを提供して切断することを可能にする。これは、すべてのデータ保持者がオンラインであり続ける必要がある同期的な連合学習モデルとは異なる。
結果
本手法は、CMV(NK細胞)分類、AML(3クラス)分類、およびAML MRD(微小残存病変)回帰の3つのベンチマークで評価された。
- CMV分類: MPC実装は、マルチセル入力精度 0.727±0.141 およびフェノタイプ精度 0.681±0.146 を達成した。これらの結果は、プレーンテキストのCellCnnのベースライン(それぞれ 0.721±0.173 および 0.716±0.158)と密接に一致しており、PriCellのベースライン(0.633±0.127)を大幅に上回った。
- AML分類: 3クラスAMLタスクにおいて、MPC実装は 0.935±0.047 のマルチセル精度を達成し、プレーンテキストの天井値(1.0)に対してPriCell(0.898±0.055)よりも近い値を示した。
- AML MRD回帰: 回帰タスクにおいて、MPCモデルはプレーンテキストのベースライン(r=0.99、MAE = 0.8 pp)に対し、ピアソン相関係数 r=0.98 および平均絶対誤差(MAE)1.0 pp で、基礎となる芽細胞分画を復元した。
- 実行時間: 5 GbpsのLAN環境でCMVモデルを20エポック訓練するのに、約1,200秒を要した。著者らは、帯域幅が主要なボトルネックであることを指摘しており、速度を1 Gbpsに下げると訓練時間が2,700秒に増加した。
意義と主張
著者らは、彼らのアプローチが、多施設間のデータ共同作業の統計的な必要性と、データのプライバシーに関する法的・倫理的な制約との間の溝を埋めることに成功したと主張している。ReLUやバイアス項を含む完全なCellCnnアーキテクチャを保持し、回帰をサポートすることで、提案されたMPCフレームワークは、従来のプライバシー保護型ベースラインよりも高い精度と幅広い適用可能性を提供する。本論文は、この手法が、生患者データや中間値をいかなる計算パーティにもさらすことなく、希少な細胞サブセットの正確な分析を可能にすることを強調している。著者らは、セミホネスト・脅威モデルへの依存や、回帰ベンチマークにおける合成グラウンドトゥルースの使用といった限界を認めており、今後の研究は、セキュリティを悪意のあるモデル(malicious models)へと強化し、より大規模で現実世界の臨床コホートで検証することに焦点を当てるべきであるとしている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録