Rapid patient-specific neural networks for intraoperative X-ray to volume registration
本論文は、手動アノテーションを必要とせずに、術中 X 線ガイダンスのための迅速かつ高精度で汎用性の高い 2D/3D 登録を実現するために、パン解剖学的基盤モデルと患者固有のニューラルネットワークを組み合わせる自己教師ありフレームワーク「xvr」を導入する。
原著者:Vivek Gopalakrishnan, David-Dimitris Chlorogiannis, Andrew Abumoussa, Anna M. Larson, Nazim Haouchine, Darren B. Orbach, Sarah Frisken, Neel Dey, Polina Golland
原著者: Vivek Gopalakrishnan, David-Dimitris Chlorogiannis, Andrew Abumoussa, Anna M. Larson, Nazim Haouchine, Darren B. Orbach, Sarah Frisken, Neel Dey, Polina Golland
従来の手法は、すべての患者に対して単一の汎用的なアルゴリズムを用いてマップを整合させようとします。これは、ニューヨーク市での走行のみで訓練された標準的な GPS アプリを使って、スイスアルプスの小さな村をナビゲーションしようとするようなものです。特に患者に独特の解剖学的特徴がある場合や、医師が奇妙な角度から X 線撮影を行う場合、しばしば混乱をきたします。他の手法では、人間のエキスパートが新しい患者ごとに 3D マップ上のランドマークを手動でラベル付けする必要があります。これは、毎回旅行する前に地図製作者を雇って手書きで地図を再描画させるようなもので、時間がかかりすぎ、費用も高すぎます。
「仮想シミュレーター」(自己教師あり学習): 各患者の X 線がどのように見えるかという実世界の例を必要とする代わりに、xvr は物理ベースのシミュレーターを使用します。これは、患者の 3D マップを取り込み、あらゆる可能な角度から瞬時に数千枚の偽の X 線写真を生成できるビデオゲームエンジンと想像してください。コンピュータはこれらの偽の写真をどのように生成したかを正確に知っているため、人間が確認する必要なく正解(グラウンドトゥルース)を知っています。これはパイロットがフライトシミュレーターで訓練するのと似ています。彼らは地面を離れることなく、何千回もの離陸と着陸を練習できます。
「基盤モデル」(巨匠シェフ): 特定の患者に取り組む前に、システムは全身、骨盤、脳など、さまざまな身体部位からの 2,000 以上の異なる 3D スキャンの膨大なライブラリで訓練されています。これは、何千もの異なる料理を味わい、料理の基本的なルールを学んだ巨匠シェフと考えることができます。この「基盤モデル」は、人間の解剖学的構造が一般的にどのように見えるかを知っています。
この個別化されたネットワークが準備できると、手術室で撮影されたライブの 2D X 線を見て、カメラの位置を瞬時に推測します。通常は非常に近い位置ですが、完璧にするために、ミリ単位まで位置を微調整するクイックな「磨き上げ」ステップ(反復最適化)を実行します。
速度: これを数秒で完了します。
精度: 従来の手法よりも大幅に正確であり、しばしば 10 倍の精度を誇ります。
堅牢性: 医師が X 線の角度を変更した場合、患者に希少な疾患がある場合、またはスキャンが異なる種類の機械からのものである場合でも機能します。患者自身のデータから学習するため、汎用的な訓練セットで見たことのないものに混乱することがありません。
重要性(論文によると)
論文は、この手法が手動ラベル付けの必要性を排除し(すべてのスキャンに人間に線を引かせる必要がなくなる)、分布外(out-of-distribution)の失敗の問題を解決すると主張しています(古い AI モデルが、訓練データとは異なる患者を見るとクラッシュしてしまう問題)。各個人に対して迅速にカスタマイズされた基盤モデルを使用することで、xvr は、骨折の修復から繊細な脳血管のナビゲーションまで、多様な手術において高精度な 3D ナビゲーションを可能にし、手術ワークフローを遅らせることなく実現します。
要約すれば、xvr は、汎用的で遅く、しばしば不正確な整合プロセスを、高速で個別化され、極めて精密なプロセスへと変換します。これにより、医師は 2D X 線という窓を通して、患者の体の 3D 現実をクリスタルのように鮮明に視覚化できるようになります。
技術的概要:術中 X 線から体積への登録のための迅速な患者固有ニューラルネットワーク
問題定義 画像誘導介入および手術用ロボットは、3 次元術前体積(CT、MRI など)と 2 次元術中 X 線画像(蛍光透視など)の精密な整合に依存しています。しかし、既存の 2D/3D 登録手法は、臨床展開において重大な限界に直面しています。従来の強度ベースの最適化手法は初期化誤差に敏感であり、開始姿勢が数センチメートルずれるだけで誤った解に収束する傾向があります。一方、深層学習アプローチは通常、広範な手動ラベル付きデータセットを必要とし、学習させた特定の解剖構造に制約されます。これらの教師あり手法は、多様な患者集団、病理、および非標準的な術中ビューに対する汎化に苦しみ、分布外失敗を招きます。さらに、臨床記録におけるグランドトゥルースの C アーム姿勢の不足が、教師ありモデルの学習におけるデータボトルネックを生み出しています。
微分可能な合成データ合成: xvr は、微分可能な X 線レンダラーを用いて、患者自身の術前 3 次元体積から直接合成学習データを生成します。C アーム姿勢(回転α,β,γおよび並進x,y,z)をシミュレートし、レイキャスティング(三線形補間または Siddon 法を使用)を介して合成 X 線をレンダリングすることで、既知のグランドトゥルース姿勢を持つ無制限の学習ペアを生成します。このプロセスは、3D ラベルマップが利用可能な場合、特定の解剖構造のレンダリングもサポートします。
ファウンデーションモデルと転移学習: 患者固有モデルに関連する長い学習時間を解決するため、著者らは 2,000 以上の全身 CT および MR 体積のコーパス上で「ファウンデーションモデル」を事前学習させます。このモデルは、人間の解剖学と C アーム姿勢分布の集団レベル表現を学習します。
アーキテクチャ: ネットワークは C アーム姿勢を回帰するために ResNet34 バックボーンを使用します。剛体変換($SE(3)$)の多様体性を処理するために、モデルはオイラー角や標準的な四元数に内在する不連続性を解決する連続表現である四元数随伴を回帰します。
適応: 新規患者に対しては、ファウンデーションモデルを、その特定の患者の術前スキャンから生成された合成 X 線上でファインチューニングします。これにより、ゼロから学習する場合に必要な数時間から、約5 分に学習時間が短縮されます。
ドメインシフトへの頑健性: 可変的な術中取得パラメータ(C アームのパンニング、視野の変化など)に対処するため、xvr は幾何学的リサンプリング戦略を採用します。術中 X 線は、ネットワークに入力される前に、学習中に使用された標準的な内部パラメータと一致するようにリサンプリングされます。精緻化段階では、システムは臨床画像の元の高分解能内部パラメータを使用して合成 X 線をレンダリングします。
反復姿勢精緻化: ニューラルネットワークは正確な初期姿勢推定を提供しますが、システムは勾配ベースの最適化器を用いてこの推定値を精緻化します。微分可能なレンダラーを用いて、最適化器は実際の術中 X 線と合成 X 線の類似性を最大化します。著者らは、大きな誤差領域における頑健性のためにマルチスケール正規化相互相関(mNCC)を、深度推定における精度のために勾配正規化相互相関(gradNCC)を組み合わせ、ミリメートルレベルの精度を達成します。