想象一个计算机不仅能通过复制所见之物,还能通过理解事物构建的深层、隐藏规则来构思新事物的世界。这就是生成式人工智能(Generative AI)的领域,这一领域已经教会了计算机写诗、绘画,甚至作曲。但在处理 3D 医学扫描(如 CT 和 MRI)时,存在一个棘手的障碍。这些并非平面的图像,而是厚实的、块状的数据堆叠,就像一整条面包,每一片都是不同的图像。要教会计算机逐片地构思出一条全新的、真实的“面包”(或一个新的人体器官)极其困难。这需要海量的内存,就像试图同时在脑海中记住整个图书馆一样。如果计算机试图记住每一片中每一个微小的细节,它就会不堪重负并崩溃。科学家们一直试图寻找一种方法,将这些巨大的 3D 数据块压缩成更小、更容易处理的形式,同时又不丢失重要的细节,以便他们能够生成新的、真实的医学数据,来帮助医生训练和测试他们的工具。
于是,由墨尔本大学的研究人员 Zhenkai Zhang、Krista A. Ehinger 和 Tom Drummond 发明的 TCAM-Diff 登场了。可以将他们的方法想象成一种聪明的技巧:将一个巨大的 3D 拼图缩小为三张平坦的纸张,却不丢失原图。他们的方法不是尝试一次性记住整个 3D 块,而是学习使用三个“三平面”(triplanes)来表示物体——即三个相互垂直的 2D 网格,就像地板、墙壁和天花板在角落相遇一样。通过将 3D 数据投影到这三个平面上,该模型可以用少得多的内存捕捉到肿瘤或器官的复杂形状。
该论文介绍了一个两步走的过程。首先,他们使用一种特殊的“仅解码器”(decoder-only)机器来学习如何将这三张平坦的纸张还原回完整的 3D 体积。与以往那些通过压缩再解压往往会导致细节模糊的方法不同,这种新方法就像一位只专注于最终塑形的雕塑大师,确保细节保持锐利。其次,他们使用了一种“扩散模型”(diffusion model)——一种通过从静态噪声开始并逐渐清理噪声来学习生成图像的 AI 类型——来学习如何生成这三张平坦的网格。神奇之处在于它们如何连接这些网格:他们使用了一个“交叉注意力”(cross-attention)系统,让地板、墙壁和天花板能够相互“对话”,从而确保 3D 形状保持一致且真实。
研究人员在三个不同的医学数据集上测试了他们的想法:脑肿瘤(缩放至 128×128×128)、胰腺肿瘤(256×256×256)和结肠扫描(512×512×512)。他们发现,与以往的方法相比,该模型能以更高的清晰度重建原始医学图像,且使用的计算资源更少、时间更短。当他们要求模型构思新的、虚假的医学扫描图像时,结果是如此逼真,以至于一个专门用于识别伪造品的“评论家”AI 给出的评分远高于旧模型。事实上,TCAM-Diff 生成的虚假扫描图像与真实数据如此接近,以至于可以用于训练其他检测疾病的 AI 工具,这证明了这种处理 3D 数据的新思维方式是医学成像领域迈出的强大一步。
技术摘要:TCAM-Diff
问题陈述
现有的 3D 医学成像(如 CT 和 MRI)生成模型在处理高分辨率体积数据时,面临着内存占用和解剖学准确性方面的重大挑战。虽然潜在扩散模型(LDMs)通过在低维潜在空间中运行,推动了图像合成技术的发展,但目前依赖标准 3D 自编码器(如 VAE-GAN 和 VQ-GAN)的方法在处理高分辨率数据集时仍难以应对。这些传统架构受限于极高的计算负载、漫长的训练时间,以及在压缩和双步编码-解码过程中关键细节的丢失。此外,现有方法无法有效地表示稠密 3D 体积,因为三平面(triplane)表示法此前主要局限于建模物体表面,而非稠密医学数据。