← 最新论文
💻 computer science

Predicting Functions, Not Features: KANs with Function-Space Joint-Embedding Predictive Learning for Medical Image Segmentation

本文引入了函数空间联合嵌入预测学习(FS-JEPA),这是一种通过以掩码自监督方式预测单个边缘函数的结构化多半径特征,从而增强柯尔莫哥洛夫-阿诺德网络(KANs)在医学图像分割领域表现的新型框架,并借此在五个基准测试中实现了最先进的性能。

原作者: Yungeng Liu, Xuanzi Fang, Yuge Zhang, Shuqi Ren, Haijin Zeng, Yongyong Chen

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yungeng Liu, Xuanzi Fang, Yuge Zhang, Shuqi Ren, Haijin Zeng, Yongyong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人根据 X 光片画出一颗心脏。这就是**医学图像分割(medical image segmentation)**的世界——这是人工智能的一个分支,计算机通过它学习在医学扫描图像中围绕器官、肿瘤或组织绘制精确的轮廓。这是一项艰巨的任务,因为医学图像通常很模糊,健康组织与病变组织之间的边界也十分模糊,而且机器人必须具备极高的准确性才能辅助医生。

为了实现这一目标,现代 AI 使用“神经网络”,它们就像由数学连接组成的巨大网络。长期以来,这些网络使用固定规则(比如始终开启或关闭的电灯开关)来处理信息。但一种更新颖、更华丽的网络类型——**柯尔莫哥洛夫-阿诺德网络(Kolmogorov–Arnold Network, KAN)**已经问世。KAN 不使用固定规则,而是在每一条连接上使用“可学习函数”。你可以这样理解:在普通的网络中,每根导线都是一根硬管;而在 KAN 中,每根导线都是一根具有弹性的、可以变形的橡胶带,网络可以根据需要将其调节得弯曲、笔直或扭曲。核心问题在于,研究人员正在思考:我们该如何教这些橡胶带以“完美”的方式进行拉伸?

这就是一项新研究的切入点。研究人员发现,虽然 KAN 功能强大,但标准的训练方式有点像只通过整个管弦乐团最终呈现的声音来评判一名音乐家,而从未听过每一位小提琴手的演奏。他们意识到,“橡胶带”(即函数)在它们的声音混合在一起之前,并没有得到关于其自身行为的足够具体反馈。为了解决这个问题,他们发明了一种新的训练技巧,称为 FS-JEPA。FS-JEPA 不仅仅关注最终结果,而是让 AI 提前预测每根橡胶带行为的“形状”。通过在五个不同的医学图像数据集上进行测试,他们证明了这种方法能帮助 AI 绘制出比以往基于 KAN 的方法更清晰、更准确的轮廓,使平均准确率得分提升了 2.25 个百分点

问题所在:“管弦乐团” vs. “独奏者”

让我们深入了解其机制。在标准的 KAN 中,网络由层组成。每一层接收输入,并通过这些特殊的“橡胶带”函数来产生输出。问题在于,网络通常是通过观察最终输出(即“管弦乐团”的乐曲)来进行训练的。如果乐曲好听,网络就会获得一颗金星;如果不好听,它就会得到红灯。

但问题在于:许多种不同组合的橡胶带都可以产生相同的最终乐曲。也许有一根橡胶带被拉得太长,但另一根被挤压得恰到好处,从而抵消了前者。网络得到了金星,但单个橡胶带却从未理解自己为什么要那样被拉伸。它们在盲目猜测,没有明确的目标来指导自身的行为。这就像一位指挥家告诉小提琴手:“音乐很好听”,却从未告诉小提琴手他的具体音符是否准音。

解决方案:预测橡胶带的“形状”

这项研究的作者们(由 Yungeng Liu 和 Xuanzi Fang 领导)决定改变游戏规则。他们问道:“如果我们能在橡胶带混合进最终乐曲之前,就教会 AI 预测其行为,会怎样呢?”

他们创建了一个名为 函数空间联合嵌入预测学习(Function-Space Joint-Embedding Predictive Learning, FS-JEPA) 的系统。以下是它的工作原理,我们使用一个有趣的类比:

想象你有一根神奇的橡胶带(一个 KAN 边缘函数)。在旧的方法中,你只能在橡胶带被拉伸到某一个特定点时观察它。但橡胶带在那个点的左侧或右侧一点点的地方,表现可能会非常不同。也许在那里它很僵硬,或者在那里它非常有弹性。

新方法 FS-JEPA 不仅仅看一个点。它要求 AI 预测一个**“多半径特征”(multi-radius signature)**。你可以把这理解为不仅在中心点,还在周围六个不同的位置(就像一个测量光环)拍摄橡胶带形状的快照。这个“特征”能精确告诉 AI 橡胶带在局部是如何表现的。

训练过程就像一场“猜形状”的游戏:

  1. 掩码在线分支(The Masked Online Branch): AI 被展示了橡胶带行为的一个“被遮盖”的版本(部分内容被隐藏了)。它必须猜出完整的“特征”(即在六个位置上的形状)。
  2. 目标分支(The Target Branch): 一个“教师版”的 AI(它的变化缓慢且稳定,就像一位冷静的导师)观察完整的、未被遮盖的橡胶带,并生成正确的特征。
  3. 匹配(The Match): 学生 AI 尝试去匹配教师的特征。如果它猜对了形状,它就学会了。

至关重要的一点是,AI 不仅仅是在猜测形状,它还会记录自己正在观察的是“哪一根”橡胶带。由于存在数以千计的橡胶带,系统使用“坐标”来确保学生正在猜测的正是教师所展示的那根橡胶带。这确保了学习的精确性,而不会发生混淆。

结果:更清晰的轮廓,更高的分数

研究人员在五个不同的医学图像数据集上测试了这种新方法,包括乳腺病变的超声图像、甲状腺扫描和组织学腺体图像。他们将 FS-JEPA 方法与现有的最强 KAN 模型以及其他标准医学 AI 模型进行了对比。

结果非常明确:

  • 更高的准确度: FS-JEPA 方法在所有五个数据集上实现了最高的平均 Dice 分数(83.37%)IoU(75.04%)
  • 击败竞争对手: 它在 Dice 分数上比最强的竞争对手 KAN 方法(UUEKAN)高出了 2.25 个百分点
  • 无额外成本: 最棒的部分是,这种“预测性学习”只发生在训练阶段。一旦 AI 完成训练,额外的“猜测”部分就会被移除。最终的模型与原始模型的大小和速度相同,但因为它在训练过程中养成了更好的习惯,所以变得更加聪明。

为什么这很重要

论文指出,通过将学习目标从最终的“管弦乐团”声音转向每个独立乐器的特定“形状”,我们可以更有效地训练这些灵活的网络。作者发现,仅仅预测一个点是不够的;AI 需要看到“局部变化”(即多半径特征)才能真正理解该函数。

在实验中,他们排除了其他想法,例如仅预测最终特征或预测橡胶带的单一响应。这些方法的效果并不理想,这表明捕捉函数的“局部行为”是解锁 KAN 全部潜力的关键。

最终,这项研究表明,我们不需要通过把医学 AI 模型做得更大或更复杂来获得更好的结果。相反,通过改变我们“教导”它们的方式——通过要求它们预测自身内部函数的详细形状——我们可以帮助它们在对医学至关重要的领域周围,绘制出更清晰、更准确的边界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →