← 最新论文
💻 computer science

Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA

本文提出了一种强化学习框架,通过在具有不确定性估计的分层数字孪生表示上进行操作,训练大语言模型实现感知与推理的解耦,通过引入一种新颖的合理性感知奖励机制以及 REAL-Colon-Reason 数据集,在手术视频问答(VideoQA)基准测试中达到了最先进的性能。

原作者: Yiqing Shen, Han Zhang, Mathias Unberath

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiqing Shen, Han Zhang, Mathias Unberath

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教导一名才华横溢但缺乏耐心的学生(一个人工智能)如何回答关于实时手术视频的复杂问题。

问题所在:“快照即走”陷阱 (The "Snap-and-Go" Trap)
目前,大多数 AI 系统试图通过对视频进行快速抓拍,将其转化为简单的关键词列表(如“手术刀”、“血液”、“向左移动”)并立即猜测答案。作者认为,这就像是通过看单帧画面来猜测电影的剧情一样。这破坏了时间和空间的连续流。如果 AI 需要弄清楚工具为什么要移动,或者下一步会发生什么,这种“快照即走”的方法就会失效,因为它丢失了步骤之间的联系。

解决方案:“数字孪生”工作坊 (The "Digital Twin" Workshop)
作者提出了一种新的训练 AI 的方法,其核心概念是数字孪生 (Digital Twin)。请不要将其仅仅视为一个视频文件,而应将其视为一个与视频并行的、详细且具有交互性的 3D 模型或“虚拟副本”。

与其强迫 AI 在观察原始视频的同时进行思考,不如将这项工作拆分为两个不同的团队:

  1. 观察者(基础模型): 这些是专门的 AI 工具,充当资深外科医生的眼睛。它们观察视频并构建“数字孪生”。它们不只是说“这里有一个工具”;它们会说:“中心位置有一个‘Kerrison’工具,正以 95% 的置信度移动,深度为 2 毫米。”它们还会记录自身的确定性(例如,“我对这种组织类型的把握仅为 60%”)。
  2. 推理者(大语言模型): 这是主要的 AI 学生。它并不直接观察视频,而是阅读由“观察者”构建的数字孪生报告。它利用这些结构化、高质量的数据,像侦探破案一样,循序渐进地规划其答案。

训练方法:带有“临床教练”的强化学习 (Reinforcement Learning with a "Clinical Coach")
他们是如何教会 AI 做好这件事的呢?他们使用了强化学习,这就像玩电子游戏一样,AI 做得好会得分,做错则会扣分。

  • 结构: AI 被要求遵循严格的剧本:思考问题 -> 规划如何构建数字孪生 -> 阅读孪生数据 -> 思考答案 -> 给出最终答案。
  • 奖励机制: AI 的得分基于两点:
    1. 它是否遵守了规则?(是否使用了正确的格式?)
    2. 答案在医学上是否合理? 一个“临床教练”(另一个 AI)会检查答案是否合乎逻辑。如果 AI 说“医生正在用勺子切割心脏”,即使语法完美,它也会受到巨额惩罚。如果答案逻辑严密且与数据相符,它会获得高分。
    3. 不确定性检查: 如果 AI 非常自信,但“观察者”提供的数据却显示不确定,那么 AI 会被降低评分。这教会了 AI 要保持谦逊和准确,而不是盲目自信。

测试:“REAL-Colon-Reason”基准测试 (The "REAL-Colon-Reason" Benchmark)
为了证明其有效性,作者创建了一个名为 REAL-Colon-Reason 的新测试。这是一个包含 2,000 个关于结肠镜视频问题的集合,难度从简单(这是什么工具?)到极难(根据当前的运动和工具功能预测下一步动作)。

结果
这种新方法碾压了竞争对手。

  • 它显著超越了现有的最先进模型(在最难的问题上表现提升了约 17%)。
  • 它证明了通过将“观察”(构建数字孪生)与“思考”(对孪生进行推理)分离,AI 可以处理以往模型无法处理的复杂多步逻辑。
  • 它在现有的旧手术视频测试中也表现出色,显示出其作为一种通用改进方案的通用性。

简而言之
与其要求一个 AI 盯着模糊且快速移动的视频并进行猜测,不如教它先构建一份清晰、结构化且诚实的“虚拟报告”,然后再利用这份报告进行逻辑思考。这就像是与其根据一张模糊的截图去猜电影结局,不如在写下自己的结论之前,先读完一份详细的剧本梗概。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →