← 最新论文
💻 computer science

ChainTrust-LLM: Secure and Auditable Hallucination Mitigation in Medical LLMs Using Blockchain and Expert Feedback

本文介绍了 ChainTrust-LLM,这是一个将专家反馈与基于有向无环图(DAG)的区块链账本相结合的新型框架,旨在检测并缓解医疗大语言模型中的幻觉问题,在确保安全、可审计交互且保持极低延迟的同时,实现了错误率 64.8% 的降低。

原作者: Muhammad Ismail Mohamand

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Ismail Mohamand

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个你可以与一位超级聪明的机器人图书管理员交谈的世界,它读过每一本医学教科书。这个被称为“大语言模型”(LLM)的机器人非常擅长聊天、回答问题,甚至能帮助医生向患者解释事物。但问题在于:有时这个机器人会表现得过于自信,从而编造事实。它可能会告诉你某种药物可以治愈它无法治愈的疾病,或者某个症状意味着它并不代表的含义。在医学领域,这些编造的事实被称为“幻觉”(hallucinations),它们是危险的,因为可能导致错误的决策。

为了解决这个问题,科学家们正试图构建一个系统,充当一名严格的编辑。他们希望有一种方法来检查机器人的工作,保留每一次更正的永久记录,并确保机器人能从错误中学习而不遗忘。这就是“信任”概念引入的地方。如果机器人答对了问题,我们对它的信任度就会增加;如果它答错了,我们的信任度就会降低。但要追踪所有这些信任度,并确保没有人能偷偷修改记录,是一个巨大的挑战。这就是为什么研究人员正在考虑将人类专家与一种特殊的数字账本——“区块链”结合起来,区块链就像一个公开的笔记本,一旦在上面写了东西,就无法被删除或更改。

这正是“ChainTrust-LLM”这篇论文所讲述的内容。由 Muhammad Ismail Mohmand 及其团队领导的研究人员想要解决医学幻觉问题,特别是针对甲状腺功能减退症(一种甲状腺问题)。他们注意到,当机器人谈论疲劳、体重增加或月经周期异常等症状时,经常会弄错细节。为了解决这个问题,他们构建了一个名为 ChainTrust-LLM 的新框架。把它想象成一个高科技安全网,能够安全地记录机器人的错误和更正,创造出一条可审计的轨迹,以提高未来的表现。

以下是他们的系统是如何运作的,我们用一个简单的故事来说明:想象这个医疗机器人是一个正在参加考试的学生。每当它回答一个问题时,三位真正的医生(专家)都会检查答案。如果学生答对了,他们会给出“赞成”;如果答错了,他们会给出“反对”,并写下正确的答案。但 ChainTrust-LLM 并不是把这些笔记仅仅存在一堆乱七八糟的纸堆里,而是将每一次评分和更正都记录在一个使用区块链技术的“数字日记”中。这本“日记”是不可更改的,这意味着一旦错误被记录下来,它就会永远留在那里作为证据。

该系统还有一个关于时间的特殊规则。如果机器人在今天答对了问题,它的“信任分数”就会上升。但如果它很长时间没有接受检查,这个信任分数就会慢慢消退,就像电池电量耗尽一样。这确保了系统保持新鲜感,不会依赖于陈旧的、可能已经过时的数据。当机器人犯错时,系统会使用一个“风险检测器”,根据答案与真相之间的差异来识别谎言,然后安全地记录整个事件。

团队在三个著名的医疗机器人上测试了这个想法:GPT-4、MedPaLM 和 Claude。他们针对甲状腺功能减退症的症状、治疗和实验室检查提出了 300 个不同的问题。在使用 ChainTrust-LLM 之前,这些机器人的错误率相当高。例如,GPT-4 出现幻觉(编造事实)的频率为 23.1%。在应用了新系统后,这个数字大幅下降至 8.5%,降幅约为 63%。对于其他机器人,改进效果同样显著,错误率最高下降了 64.8%。

不仅机器人的错误减少了,系统在了解自己何时正确或错误方面也变得更加出色。“信任校准准确度”(即机器人的信心与现实匹配的程度)从 GPT-4 的约 75% 跳升到了 91% 以上。检查答案的专家们之间的意见也更加一致,其一致性得分从 0.65 上升到了 0.87。这意味着该系统不仅是在修复错误,还在创造一种可靠的、共享的真理理解。

这项研究最酷的部分之一是它的运行速度。即使在进行所有的额外检查和区块链记录时,系统也只增加了极小的延迟。平均而言,记录一笔交易仅需 211 毫秒(不到四分之一秒)。这表明此类系统实际上可以在不降低速度的情况下在医院中使用。

论文得出结论,ChainTrust-LLM 是让医疗 AI 变得更安全的一种强大且安全的方式。通过结合人类专家、基于时间的信任系统以及不可更改的区块链记录,他们创建了一个能够显著减少危险医学谎言的框架。虽然这项研究专门针对甲状腺功能减退症的症状(如疲劳和体重增加),但该方法为使 AI 在其他医学领域也变得值得信赖提供了一条路径。它不是一个能瞬间解决一切问题的魔杖,但它是迈向我们可以信任数字医疗助手之未来中非常有前景的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →