Grounding Health AI: Architecture and Evaluation of a Domain-Expert Metabolic Health Agent
本文介绍了 HPP 个人健康智能体(HPP Personal Health Agent),这是一种领域专门化的 AI 系统,它结合了群体层面的表型数据、专家临床工具以及声明式行为约束,以消除幻觉并在代谢健康报告中实现高准确度,证明了值得信赖的医疗 AI 需要严谨的、由评估驱动的系统架构,而非仅仅依赖于通用型语言模型。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它能读任何书,写任何故事,还能像人类一样交谈。这个机器人是一个“大语言模型”(LLM)。它非常擅长表现得自信且流利。但问题在于,如果你要求这个机器人做数学题或根据你的个人数据提供具体的医疗建议,它可能会为了让表达听起来很完美而胡编乱造。这就像一个有天赋的演员,可以即兴表演一段关于天气的精彩演讲,但如果你问他准确的温度,他可能会随口猜一个“72度”,即便当时正下着雨且天气寒冷。在健康领域,这是非常危险的。如果机器人告诉你你的血糖水平正常,而实际上并不正常,或者凭空捏造了一个你并不存在的风险,这可能会导致错误的决策。科学家们正在努力研究如何阻止这些机器人“幻觉”(即胡编乱造),并强迫它们坚持客观事实,尤其是在涉及我们身体健康时。
这篇题为《构建接地气的健康人工智能》(Grounding Health AI)的论文,讲述了如何为这些健康机器人建立一个安全网。研究人员创建了一个名为“人类表型项目个人健康代理”(Human Phenotype Project Personal Health Agent,简称 PHA)的系统。你可以把它想象成给机器人一本严格的规则手册、一支专家计算器团队,以及一个庞大的真实人类数据库来供其在开口说话前进行核对。他们通过输入人们佩戴血糖监测仪(追踪血糖的设备)和食物日志两周的真实数据,测试了这个系统。结果如何?当机器人使用这个新系统时,它不再编造数字。它不再猜测你的血糖模式,而是使用真实的工具进行计算。它不再凭空捏造风险,而是在信息不足时承认自己缺乏足够的信息。研究团队发现,通过将这些“工具”与“技能”(关于如何交谈的规则)相结合,他们可以将一个在结构和事实方面准确率仅为 37% 的机器人,提升到 91% 的准确率。这是迈向开发医生和患者都能真正信任的人工智能的重要一步。
问题所在:那个为了显得体面而撒谎的机器人
想象一下,你交给一个未来的机器人一份记录了你两周饮食内容的日记和一张你的血糖水平图表。你问:“我的代谢情况如何?”一个标准的、超级聪明的 AI 可能会写出一份优美、流畅的报告。它可能会说:“你吃了 172 顿饭!”(而实际上你只吃了 70 顿),或者在你的血糖波动其实非常剧烈时说:“你的血糖波动很轻微。”它听起来很完美,但这是一个谎言。这个机器人太擅长写作了,以至于它用看起来合理的猜测来填补空白,而这些猜测完全是错误的。
研究人员发现,即使是世界上最好的 AI 模型也会出现这种情况。它们会发明一个名为“MAGE”(衡量血糖上下跳动程度的指标)的指标,并说它是 41,而实际的数学计算结果是 84.8。它们会声称分析了 172 顿饭,而数据中其实只有 70 顿。它们甚至会在没有实际计算工具的情况下预测未来的健康风险。这就像一位不懂烹饪的厨师,却对从未品尝过的菜肴写下了五星好评。对于普通人来说,这令人困惑;对于医生来说,这很危险。
解决方案:“接地气”堆栈
为了解决这个问题,团队构建了一种新型的 AI 代理,即 PHA。他们不仅仅是告诉机器人“要小心”。相反,他们构建了一个四层的“接地气”(grounding)系统。想象一下机器人正在参加一场考试。
- 参考资料库(人类表型项目): 首先,他们给了机器人一个包含超过 13,000 名真实人类数据的庞大资料库。这不仅仅是随机数字;它深入观察了真实人类的身体对食物和运动的反应。如果机器人想要说“你的血糖很高”,它必须检查这个资料库,看看和你同龄、同性别的人中有多少人处于同样的水平。这就像是有一个由 13,000 名学生组成的巨大班级来对比你的考试成绩,而不是靠瞎猜来判断你考得好不好。
- 专家工具(计算器): 接下来,他们给了机器人一个包含 21 个特定计算器的工具箱。机器人不允许在脑子里进行数学运算。如果它需要知道你的平均血糖,它必须请求特定的工具来进行计算。如果它需要知道你的心脏风险,它必须使用特定的心脏风险计算器。机器人只是信息的传递者;工具才负责繁重的计算工作。
- 行为技能(规则手册): 这是最聪明的部分。机器人的行为有一套写在简单文本文件中的“技能”(就像一本规则手册)。这些规则告诉机器人什么可以说,什么不能说。例如,一条规则可能是:“如果你没有用工具计算餐数,你就不能说这个人吃了多少顿饭。”另一条规则可能是:“如果你没有血压数据,你就不能猜测心脏风险。”这些规则阻止了机器人即便想编造也无法编造的行为。
- 测试驱动循环(评分员): 最后,团队构建了一个在构建过程中不断测试机器人的系统。每当机器人犯错(比如捏造数字)时,团队都会编写一个特定的测试,以便下次能抓住这个完全相同的错误。这就像玩电子游戏,每当你掉进坑里,游戏就会增加一个新的陷阱,确保你再也不会掉进那里。
他们发现了什么:工具 vs 规则
研究人员进行了一项大规模实验。他们提取了 14 个人的真实数据,并要求机器人使用不同的设置来撰写报告。他们对比了:
- 基准模型(Baseline): 只有聪明的机器人,没有任何工具或规则。
- 仅有工具(Tools Only): 机器人拥有计算器但没有规则手册。
- 完整系统(Full System): 机器人同时拥有计算器和规则手册。
结果清晰且令人惊讶。
- 基准机器人: 在“可靠性”测试中得分仅为 0.37(满分为 1.0)。它表达很流利,但充满了编造的事实。
- 仅有工具: 当他们给机器人计算器但没有规则时,得分略微上升到了 0.49。机器人现在可以做数学题了,但它仍然不知道如何正确地报告它。它有时会忘记提到数学计算过程,或者说一些工具并不支持的内容。
- 完整系统: 当他们在工具之上增加了规则手册(技能)后,得分跃升至 0.91。
这里的大教训是:工具和规则承担着不同的职责。工具让数字变得准确(从 14% 的准确率提高到 90%);而规则让报告变得完整、诚实且结构合理。没有规则,机器人虽然有了答案,却不知道如何呈现它们。有了规则,它就变成了一个值得信赖的助手。
“拒绝”超能力
这个新系统学到的最酷的一点是学会了如何说“我不知道”。在旧的测试中,当机器人数据不足(比如缺少血压读数)时,它仍然会硬猜心脏风险。它会说“你的风险很高”,尽管它根本无法计算。
然而,新系统学会了停止。当机器人试图在没有血压数据的情况下计算心脏风险时,规则强制它必须说:“由于缺少血压数据,我无法进行计算。请先获取该数据。”它拒绝撒谎。这是一个巨大的转变。它不再是一个总是给出答案(哪怕是错误的答案)的机器人,而是一个知道自己局限性的机器人。
这套系统适用于其他领域吗?
团队还测试了该系统是否能处理不同类型的健康问题。他们尝试询问关于一般代谢健康甚至心脏健康(心血管风险)的问题。系统在两者方面表现良好,得分从约 0.37 的低分跳升到了 0.70 或 0.72。这表明他们发现的“配方”——结合真实数据、特定工具和严格规则——可以用于医学的不同部分,而不局限于血糖。
总结
这篇论文表明,要让 AI 在医疗领域变得安全,我们不能仅仅依赖于让 AI 变得“更聪明”。我们必须构建一个系统,强迫 AI 使用真实的计算器、对照真实的人类数据,并遵循关于其发言内容的严格规则。其结果是一个不太可能编造可怕或错误事实的系统。
研究人员承认,这目前还不是一个完美的解决方案。他们是在一个小群体中进行的测试,且主要针对书面报告而非实时对话。他们还指出,报告的“本质”(例如它对患者来说有多么有帮助或多么亲切)很难用计算机来测试,需要人类医生来进行评估。但在报告的“形式”上(即数字、来源和诚实度),新系统取得了巨大的进步。它将一个听起来自信但实际上是错误的机器人,变成了一个因为正确而显得自信的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。