Atlases Are Already Inside: Recovering Population Templates from Pretrained Diffusion Models
本論文は、学習済みの拡散モデルがその学習されたダイナミクスの中に集団レベルの解剖学的アトラスを暗黙的に符号化しており、それによって、明示的なレジストレーションやアトラス特有の学習目的関数を必要とせずに、決定論的な推論を通じて、鮮明で年齢条件付きかつレジストレーションに匹敵する脳テンプレートの直接的な復元が可能であることを実証するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ある都市全体の「平均的な」顔を見つけようとしている場面を想像してみてください。昔は、これを行うために、あらゆる人の写真を撮り、全員の目や鼻が完璧に並ぶように、一人ひとりの顔を手作業でドラッグしたり引き伸ばしたりして、何時間も費やす必要がありました。それらがすべて整列したら、それらをブレンドして、たった一つの完璧な「都市の顔」を作り出していました。このプロセスは「解剖学的アトラス(解剖学的地図)」の構築と呼ばれ、医療画像における礎となっています。医師たちは、患者の脳や身体を「正常な」集団と比較するための地図として、これらのアトラスを使用します。しかし、従来の方法は時間がかかり、複雑で、引き伸ばしによって解剖学的構造が歪まないようにするために、多くの手動調整を必要としました。
ここで、拡散モデル(ディフュージョン・モデル)が登場します。これは、ゼロから見事な画像を生成することで最近有名になった一種の人工知能です。拡散モデルを、何千種類もの異なるスープを味わってきた熟練のシェフだと考えてみてください。もしあなたがそのシェフに「完璧な」スープを説明するように頼んだとしたら、シェフはレシピ本を見る必要はありません。これまで味わってきたすべてのスープのパターンを学習しているため、その味のプロファイルを知っているのです。これらのモデルは、静止したノイズ(テレビの砂嵐のようなもの)から始まり、クリアな画像が現れるまで、ステップ・バイ・ステップで「デノイジング(ノイズ除去)」を行うことで学習します。科学者たちが投げかけた大きな疑問は、「もしこのAIが、集団全体の脳の『味』を学習しているとしたら、モデルの脳の中に、すでに『完璧な平均の脳』が存在し、発見されるのを待っているのではないか?」というものでした。
論文「Atlases Are Already Inside(アトラスはすでに中にある)」は、こう答えています。「はい、存在します」。
著者たちは、画像の整列や引き伸ばしといった重労働をもう行う必要はないことを発見しました。すでに学習済みの拡散モデル(医療画像を生成するように学習されたもの)を使用し、純粋なランダムノイズから「逆プロセス」を実行すれば、AIは自然に単一の鮮明な画像へと収束します。この画像こそが集団テンプレート、つまりそのグループにおける完璧な平均の脳なのです。それはまるで、AIが脳を描く方法を学ぼうとしているうちに、偶然にも、見たすべての脳の「重心」を暗記してしまったかのようです。ノイズから画像を生成するように指示すると、AIは単にランダムな脳を選ぶのではなく、すべての異なる脳が重なり合う一点を見つけ出し、従来の整列作業なしに、明確で利用可能な地図を作り出すのです。
さらに素晴らしいのは、このモデルは地図を作るように「訓練」されたわけではないということです。モデルは単に画像を作るように訓練されました。地図は単なる嬉しい偶然、つまり「副産物」なのです。研究者たちはこれを脳スキャンでテストし、AIが生成した地図が、人間が何年もかけて構築してきた最高の地図と同等に優れていることを発見しました。実際、彼らが「条件」(例えば、その人の年齢など)を加えると、AIは瞬時に、20歳、50歳、あるいは80歳の脳の異なる地図を生成することができました。AIは、年齢が上がるにつれて脳が縮小し、液体のスペースが拡大するという生物学的な事実にも一致するように、正しく示していたのです。
チームはまた、この手法が脚や膝といった他の身体部位でも機能するかどうかを確認しましたが、うまくいきました。しかし、一つ注意点も見つかりました。もしAIが学習した画像のグループがあまりに乱雑であったり、一貫性がなかったりする場合(例えば、異なる種類のスキャナーを混ぜたり、非常に異なる体型を混ぜたりした場合)、AIは単一の地図について合意できず、結果がぼやけたり混乱したりしてしまうのです。しかし、よく整理されたグループに対しては、「平均」はすでにコードの中に隠されており、簡単なコマンドで引き出す準備ができているのです。
したがって、全員を型にはめようと強制することで地図を作る代わりに、この手法は、その「型」はすでにそこにあり、発見されるのを待っているのだということを示唆しています。地図作成という困難な仕事を、AIに「平均」について「考え」させ、その答えを出現させるという単純な行為へと変えてしまうのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。