← 最新论文
📄 medicine

Schema-enforced large language model framework for sarcoma tumor board simulation: a methodology development and reproducibility pilot study

本研究开发并验证了一种基于模式强制(schema-enforced)的大语言模型框架,该框架在模拟肉瘤肿瘤委员会决策方面实现了高复现性并消除了结构性幻觉,为未来针对历史多学科团队结果的一致性研究建立了一种稳健的方法论。

原作者: Tekoshin Ammo, Moritz Englich, Fabio Dos Santos Adrego, Maximilian Jacobi, Alida Wilckens, Philipp Kruppa, Bastian Bonaventura, Stefan Niemuth, Selina M. Weiler, Victoria Wachenfeld-Teschner, Anja M.
发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Tekoshin Ammo, Moritz Englich, Fabio Dos Santos Adrego, Maximilian Jacobi, Alida Wilckens, Philipp Kruppa, Bastian Bonaventura, Stefan Niemuth, Selina M. Weiler, Victoria Wachenfeld-Teschner, Anja M. Boos, Gerrit Freund

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明、博学多才的机器人如何像一组专家医生那样行事。这些医生被称为“肿瘤委员会”(tumor board),他们聚在一起讨论棘手的癌症病例,并决定最佳治疗方案。他们是最终的决策者,结合了外科医生、放射科医生和肿瘤科医生的知识,以挽救生命。但问题在于,你正在训练的这个机器人是一个大语言模型(LLM)。把 LLM 想象成一本数字百科全书,它几乎读过了所有被写下来的东西,但它有一个淘气的习惯。有时,当被问及某个具体的医学问题时,它可能会自信满满地编造一个虚假的医学研究,发明一个不存在的统计数据,或者如果你问同一个问题两次,它会给出不同的答案。这被称为“幻觉”(hallucinating),就像一个学生因为太害怕说“我不知道”而是在考试时瞎猜答案一样。

对于医生来说,这是一个大问题。如果一个机器人给出的治疗方案在每次询问时都会改变,或者它发明了一个不存在的规则,那么没有人会信任它来帮助救治病人。大问题在于:我们能否为这些机器人建立一个“护栏”?我们能否强迫它们停止猜测和编造事实,转而每次被问及时都能给出完全相同、可靠的答案?如果我们能做到这一点,也许这些机器人就能成为医生办公室里的得力助手,在不产生造假风险的情况下,帮助核对方案或整理复杂信息。


机器人的新规则手册

在这项研究中,来自德国石勒苏益格-荷尔斯泰因大学医院的一个研究小组决定测试,他们是否可以为协助处理一种非常特定且棘手的癌症——肉瘤(sarcoma)——构建这样一个护栏。肉瘤是生长在骨骼或软组织中的罕见肿瘤,由于其类型众多,它们就像是一个拼图,其中的碎片往往无法轻易拼凑在一起。研究人员想要看看,他们能否让机器人在处理这些病例时表现得像一个肿瘤委员会,而不至于让机器人感到困惑或编造事实。

为了实现这一目标,他们并没有只是用普通的聊天方式问机器人:“我们该怎么办?”相反,他们为机器人制定了一本严格的“规则手册”。想象一下你在玩一款电子游戏,你不能随心所欲地输入任何内容,而是必须从特定的菜单中选择你的答案。如果你尝试输入不在菜单上的内容,游戏根本不会让你按下“回车键”。研究人员做了类似的事情。他们强制要求机器人以一种非常特定的结构化格式(称为 JSON,这只是一种组织数据的方式,类似于数字表格)输出答案。他们给了机器人 21 个具体的问题,机器人必须回答,比如“什么样的手术?”或“多少辐射量?”,并强制它从预先批准的选项列表中进行选择。如果机器人试图创造一个新的选项或发明一条虚假的医学指南,系统会立即拒绝它。

大测试

团队从他们的医院记录中提取了 51 个真实的、但完全匿名的肉瘤病例。这些病例涵盖了各种各样的患者、年龄和肿瘤类型。他们要求机器人解决每个病例的谜题,但他们不仅仅是问了一次。对于每一个病例,他们都问了完全相同的问题三次。这是为了观察机器人是否每次都会给出相同的答案,还是会像抛硬币一样反复无常。

结果非常令人惊喜。当机器人被迫使用这本严格的规则手册时,在所有三次尝试中,它在 93.9% 的决策上给出了完全相同的答案。这意味着,在 1,000 多个具体的决策中,它只有 6% 的概率会改变主意。更棒的是,机器人完全停止了编造虚假事实。在过去,机器人可能会编造一个虚假的医学研究来支持某种说法,但在这次测试中,没有出现任何虚假的指南或捏造的统计数据。“幻觉”消失了。

机器人依然犹豫的地方

然而,机器人并不完美。在它改变主意的少数几次中,并不是因为它感到困惑或在编造事实。相反,这种情况发生在即使是人类医生也可能产生分歧的情况下。例如,在决定手术后如何重建身体部位(重建)时,机器人有时会在“局部皮瓣”和“蒂式皮瓣”之间犹豫不决。研究人员指出,这不是一个错误;这仅仅是因为在现实生活中,这两个选项通常都是有效的,不同的外科医生可能会根据自己的风格做出不同的选择。同样,机器人在精确的辐射剂量上也会有所波动,但它选择的所有剂量都在医生认可的安全范围内。

一个涉及高龄患者且肿瘤生长缓慢的具体病例引起了最多的麻烦。机器人无法在“观察等待”和“进行手术”之间做出决定。研究人员意识到这并不是一个漏洞,而是一个特性。在这种特定情况下,即使是人类医生团队也可能对最佳路径产生争论。机器人正确地展示了在这里并没有唯一的“正确”答案。

这意味着什么

这项研究的主要结论是,通过给机器人加上这些严格的“护栏”,研究人员使其变得更加可靠。他们证明了,如果强迫机器人遵循一种结构化格式,它就会停止编造事实,并开始给出一致的答案。这并不意味着机器人明天就可以取代医生。这项研究仅测试了机器人是否能保持一致性,而不是测试其医学建议是否真的是“最佳”建议。但这迈出了巨大的一步。它表明,我们可以建立一个系统,让机器人成为一个稳定、可预测的工具,它不会撒谎或反复无常,这是让它在未来协助医生做出真实决策的第一步。研究人员现在计划测试这些一致的答案是否真的符合人类医生的决定,但就目前而言,他们已经成功地教会了机器人如何遵守规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →