← 最新论文
🤖 AI

KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA

本文提出了 KEPO,一种知识增强的偏好优化框架,该框架通过将质量门控的在线策略蒸馏与知识引导的探索相结合,以克服标准强化学习中固有的训练不稳定性和探索失败问题,从而提升医学视觉问答中的多模态推理能力。

原作者: Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教导一位非常聪明但缺乏经验的学生(一个 AI 模型),如何利用图片(如 X 光片或 MRI 扫描)和文本来解决复杂的医学难题。目标不仅是让学生猜出正确答案,还要像医生解释诊断过程那样,一步步展示其推理过程。

这篇论文介绍了一种名为KEPO(知识增强偏好优化)的新教学方法。为了理解 KEPO 的独特之处,让我们先看看旧的教学方法存在哪些问题。

问题所在:“学习悬崖”与“糟糕的模仿”

1. 稀疏奖励问题(“学习悬崖”)
想象你在玩一款电子游戏,在一个长达 10 小时的关卡中,你只有在最后才会收到“游戏结束”或“你赢了”的信息。如果你在第一个小时犯了一个微小的错误,你可能直到最后才意识到,而那时已经太晚无法修正了。
在 AI 术语中,这被称为稀疏奖励。AI 尝试解决一个医学问题,但只有在最后才会收到“正确”或“错误”的信号。如果 AI 在推理的早期阶段犯了错误,它并不知道哪一步出错了。这通常会将 AI 困在“学习悬崖”中,因为它从未获得如何改进的提示,从而不断失败。

2. 均匀蒸馏问题(“糟糕的模仿”)
为了解决“悬崖”问题,其他教师尝试了一种新方法:让一个超级聪明的“教师 AI"观察学生并一步步模仿其每一个动作。这被称为蒸馏
然而,论文指出,这种旧方法就像强迫一个困惑的学生去抄写老师的作业。

  • 缺陷: 如果学生在早期犯了逻辑错误(例如,“这看起来像骨折”),老师可能会试图从这个错误的起点开始引导。学生最终会模仿一个“有缺陷的上下文”,学会自信地犯错。这就像试图通过让学生模仿你的方向盘动作来教他们开车,即使你不小心把车开进了沟里。学生学会的是那个急转弯,而不是修正动作。

解决方案:KEPO

作者提出了KEPO,它就像一位明智的导师,确切知道何时提供帮助以及如何提供帮助。它拥有两大主要超能力:

1. “质量门”(只模仿好的部分)

KEPO 不像旧方法那样强迫学生模仿老师的每一个动作,而是设立了一道质量门

  • 工作原理: 学生尝试解决问题。如果学生在最后获得了“正确”信号(或高分),那么老师才会介入,说:“干得好!让我们一步步看看你是怎么做到的,以便你能再次做到。”
  • 比喻: 如果学生失败了,老师会说:“不行,先别模仿那个,你当时很困惑。”如果学生成功了,老师会说:“完美!这是你成功的详细蓝图。”
  • 为何有效: 这防止了学生从自己的错误或老师的困惑中学习。它确保学生只模仿“与奖励一致”(成功)的路径。

2. “基于提示的救援”(逃离悬崖)

有时,学生陷入困境,无论尝试多少次都无法独自找到任何一个正确答案。这就是“学习悬崖”。

  • 工作原理: 当学生反复失败时,KEPO 会触发一次救援任务。教师 AI 生成一个“提示”(关于如何思考的线索)并将其交给学生。然后学生利用这个提示作为指南再次尝试。
  • 比喻: 想象学生迷失在一片黑暗的森林中(复杂的医学问题)。他们正在原地打转。老师不只是大喊“你错了!”相反,老师用手电筒照亮正确的路径,说:“试着走这条路。”学生跟随光亮,找到宝藏(正确答案),并学会了路径。
  • 关键细节: 论文指出,老师仅在训练期间将“正确答案”作为秘密指南来生成提示。学生从未直接看到最终答案;他们只看到提示。这保持了学习的诚实性。

结果:医学试驾

作者在医学视觉问答任务上测试了这种方法。

  • 设置: 他们仅使用 MRI 扫描(一种医学图像)来训练 AI。
  • 测试: 随后,他们要求 AI 使用它从未见过的其他七种类型的图像(如 CT 扫描、X 光片或皮肤照片)来解决问题。这是一个非常困难的测试,称为“分布外”泛化。

结果:

  • 旧方法: AI 难以转移其知识。它要么陷入“学习悬崖”,要么从均匀模仿中学到了坏习惯。
  • KEPO: AI 的推理能力变得更强。它不仅记住了 MRI 扫描,还学会了如何逻辑地思考医学图像。与其他方法相比,它在新的、未见过的图像类型上表现显著更好。

总结

KEPO是一种更聪明的 AI 推理训练方法。与其盲目模仿老师或等待可能永远不会到来的奖励,它:

  1. 筛选学习过程: 只有当学生表现良好时,才允许学生模仿老师。
  2. 引导探索: 当学生完全陷入困境时,给予学生一个“提示”,帮助他们逃离“学习悬崖”。

其结果是,AI 能够更稳定地学习推理,并且比以前更好地将这种推理能力应用到新的、困难的情境中(如不同类型的医学扫描)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →