ChatIBD: design, safeguards, and early international use of a guideline-grounded generative AI tool for inflammatory bowel disease (IBD) professionals
本文描述了 ChatIBD 的设计、运行保障措施及其早期的国际部署,这是一款面向炎症性肠病专业人员的检索增强生成式人工智能工具,该工具在最初六个月内展示了可行性和全球采用率,同时也强调了对其准确性和临床有效性进行进一步正式验证的必要性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,互联网是一个巨大的、混乱的图书馆,其中的每一本书都由不同的作者编写,而其中一些作者甚至以信口开河著称。这就是通用人工智能(AI)的世界。这些数字大脑极其聪明,几乎可以聊任何话题,但它们有一个棘手的习惯,叫做“幻觉”。这就像一个学生,在被问及某个历史事件的具体细节时,自信满满地编造了一个听起来很真实但从未发生过的故事。在医疗领域,一个错误的实事可能导致危险,这是一个大问题。医生需要的答案不仅要聪明,更要严格真实,并有可靠来源的支持。
为了解决这个问题,科学家们正在打造“专业图书管理员”。他们不再让 AI 在整个图书馆里闲逛,而是将其锁在一个小型的、经过精心挑选的房间里,里面只装有最可靠的医学教科书和规则手册。这种技术被称为检索增强生成(RAG)。把它想象成给 AI 戴上了一副眼镜,这副眼镜只能让它看到那些获准出版的书籍页面。当你提问时,AI 必须在这些页面之内找到答案,并向你展示它是在哪一页找到的。如果书中没有答案,程序会设定 AI 说:“我不知道”,而不是胡编乱造。这篇论文介绍了一种专门为治疗炎症性肠病(IBD,一种会导致肠道疼痛性肿胀的疾病)的医生设计的全新专业图书管理员。
论文:ChatIBD 的前六个月
这项研究背后的研究人员是一群医生,他们也是名为 ChatIBD 工具的创造者。他们想看看他们这个新的 AI 图书管理员在现实世界中的表现如何。他们不仅仅是在实验室里进行测试;他们让这个工具在互联网上“放养”了六个月,以观察医生实际上是如何使用它的。
设置:一个受保护的聊天机器人
ChatIBD 是一个医生可以询问有关 IBD 问题的网站。但与可能会瞎猜的普通聊天机器人不同,它的构建遵循严格的安全规则。它基于一个“精选语料库”——这是一种高级说法,指的是由顶级机构发布的 32 到 35 份官方医学指南组成的特定集合。当医生提问时,系统不仅仅是“思考”出一个答案;它首先会搜寻这些特定的指南以找到相关的文本。然后,它利用 AI 来总结该文本,并且至关重要的一点是,它必须提供一个指向答案来源确切页面的可点击链接。
为了使其更加安全,系统还拥有一个特殊的“剂量卡”功能。如果医生询问关于给患者服用多少药物的问题,AI 不会猜测数字。相反,它会从一个基于欧洲官方法规、经过人工检查的独立数据库中提取剂量,并以清晰的卡片形式展示出来。AI 仅被允许识别正在询问的是哪种药物;数字本身则来自一个固定不变的刚性列表。
实验:谁在使用它?如何使用?
该研究观察了 2025 年 10 月 1 日至 2026 年 4 月 1 日期间收集的数据。在此期间,共有 913 人注册了该工具。在这些人中,684 人(约 75%)实际发送了至少一条消息,349 人(约 38%)是“活跃用户”,即发送了三条或更多消息的用户。
该工具被来自 69 个不同国家的医生使用,涵盖 28 种语言。最活跃的用户来自英国和西班牙。有趣的是,该工具主要在工作日使用(占 85.1% 的时间),这表明医生是在工作期间将其作为快速参考工具,而不是作为深夜的学习伴侣。
他们发现了什么?
最常见的问题是关于药物治疗。近一半的消息(46.6%)是关于药物治疗的。系统成功触发了其特殊的“剂量卡”功能 1,332 次,这表明医生确实依赖它进行快速、安全的剂量检查。
研究人员还观察了医生的使用目标。最常见的目标是“指南综合”,即医生要求 AI 总结规则中关于特定主题的内容。其他常见的请求包括寻求定义、检查安全警告或弄清治疗顺序。
安全检查:它出错了吗?
团队密切关注着工具的表现。我们记录了 16 次用户给出明确反馈的情况。其中 15 次是正面评价。然而,有一个负面评价触发了安全审查。一位医生对有关 Risankizumab(瑞施利珠单抗)药物的回复提出了异议。AI 的句子略显含糊,可能会被误解为该药物对某些患者而言比实际情况更糟糕。团队审查了这一点,意识到这种措辞具有风险,并修改了系统,以防止未来出现此类特定类型的混淆。
这意味着什么(以及不意味着什么)
研究表明,ChatIBD 正在被国际上的医生反复使用,且他们似乎觉得该工具在处理复杂的医疗规则方面非常有用。这表明,一个专门的、基于指南的 AI 可以成为专业人士的实用工具。
然而,作者非常谨慎,没有过度吹捧结果。他们明确指出,这项研究并不能证明该工具在医学上是准确、安全或有效的。 他们并没有测量患者是否康复,或者医生是否犯了更少的错误;他们仅仅测量了有多少人使用了该工具以及他们是如何使用它的。那次被标记出的错误提醒我们,即使有严格的保障措施,人工审查仍然是必要的。
简而言之,ChatIBD 通过其出现、被使用以及在被指出错误时能捕捉到自己的失误,通过了它的第一次现实世界测试。但研究人员强调,这仅仅是个开始。这个工具是一个充满前景的“专业图书管理员”,但它仍需要更严格的测试,以证明它能够完全信任于高风险的患者护理领域。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。