GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning
GuideSkill 引入了一种与模型无关的框架,该框架将临床实践指南编译为可执行的诊断函数,随后通过病例数据进行优化,从而在无需更新骨干模型的情况下,显著增强大语言模型在临床推理方面的准确性和技能覆盖范围。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图破解一个巨大且复杂的谜案。你拥有一位才华横溢的侦探(大语言模型,或称 LLM),他擅长阅读线索、推测嫌疑人并讲述精彩的故事。但这位侦探有时会分心、忽略细节,或者忘记法律的严格规定。另一方面,你拥有一本厚重、落满灰尘的规则手册(临床实践指南),其中包含了解决每类犯罪的精确、循序渐进的法则。问题在于,如果你只是把规则手册交给侦探,他们可能会读过这些规则,但并不一定会真正遵循它们,或者会被冗长的段落搞糊涂。如果与其让侦探阅读这本书,我们能将这些规则转化为一套自带检查功能的魔法工具呢?想象一下,为每个嫌疑人配备一个特殊的“真相探测器”,它能根据证据立即闪烁绿灯或红灯,而不是让侦探去猜测。这就是医疗 AI 的世界:试图将聪明的计算机大脑所具备的创意与叙事能力,与医疗规则那僵硬、救命的精准度结合起来。
名为“GuideSkill”的论文介绍了一种巧妙的新方法,正是为了实现这一目标。研究人员构建了一个名为 GuideSkill 的系统,它充当了一个翻译官,将枯燥的医疗规则手册转化为一个“可执行技能”库。把这些技能想象成微小的计算机程序或“清单”,它们可以自动运行。与其让 AI 仅仅阅读一份指南并寄希望于它能理解,GuideSkill 将规则编译成可以实际检查患者症状并输出评分的代码:“此证据强烈支持疾病 A,”或者“此证据排除了疾病 B。”
该系统分为两个非常酷的阶段。首先是 GuideSkill-Zero。这是“入门包”。研究人员将现有的医疗指南转化成了这些可执行技能。这就像是将一本食谱中的每道菜谱都变成了一个机器人厨师,只有当你给出完全正确的食材时,它才能开始烹饪。仅凭这一点,它就已经比单纯让 AI 阅读指南的表现更好了。但真正的魔力发生在第二个阶段,GuideSkill-Evo。在这里,系统从真实的病例故事中学习。如果“入门包”中缺少某种罕见病的规则,或者某个规则过于模糊,系统就会观察数千个真实案例,弄清楚专家们实际是如何操作的,并据此更新或添加新的技能到库中。这就像机器人厨师去上了烹饪学校,品尝了真实的菜肴,并学会了原书里没有的新食谱。
当一名新患者到来时,系统会进行一场团队协作。AI 侦探首先列出一份可能的嫌疑人名单(鉴别诊断)。然后,GuideSkill 库会对每个嫌疑人运行其自动化检查。它将侦探的直觉与来自技能的硬性数学评分相结合,从而选出最终的胜者。结果令人印象深刻:在四项不同的医学测试中,这种团队协作的准确性远高于 AI 单独工作或仅仅阅读指南的表现。事实上,通过加入“从病例中学习”这一步骤,该系统覆盖了测试中所涉及疾病的 99.5%,而最初的规则仅覆盖了 56.5%。更棒的是,人类医生审查了新增的技能,并表示它们在医学上是合理且可靠的。论文表明,这种方法——将规则作为独立的、可检查的工具,而不是试图将它们记忆在 AI 的大脑内部——是让医疗 AI 更安全、更可靠的一种强大方式,而且无需在每次发现新规则时都重新训练 AI 的整个大脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。