← 最新论文
📄 health informatics

Quality of physicians responses using a conversational artificial intelligence system: a randomized vignette experiment in Latin America

在一项针对拉丁美洲医师进行的随机情境实验中,一个具有证据可追溯性的对话式人工智能系统相比于常规检索实践,显著提高了临床响应的综合有效性,尽管由于样本基于志愿者招募,研究结果被视为探索性的。

原作者: Castano-Villegas, N., Monsalve, K., Villa, M. C., Quiros Gomez, O. I., Velasquez, L., Zea, J.

发布于 2026-09-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Castano-Villegas, N., Monsalve, K., Villa, M. C., Quiros Gomez, O. I., Velasquez, L., Zea, J.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在拉丁美洲繁忙的诊所里,医生经常面临着片刻的静默与不确定:患者表现出一系列复杂的症状,而正确的治疗路径并非显而易见。几十年来,解决方案一直是停下来寻找答案,翻阅教科书或在数字数据库中输入查询。这一过程依赖于医生快速查找、阅读和解读海量医学信息的能力。如今,一种新工具进入了这一领域:对话式人工智能。这些系统构建在庞大的人类知识集合之上,能够进行对话、回答问题并能在数秒内总结复杂话题。其前景在于,此类工具可以作为床边的伙伴,帮助医生更快、更准确地检索证据。然而,这些系统的多数测试都是在受控且静态的环境中进行的,远离了中低收入国家繁忙医院的现实情况。关键的问题仍然在于:当这些数字助手被真实的医生在真实的场景中使用时,它们究竟是能提高医疗质量,还是仅仅是听起来充满自信但几乎无法提供实际帮助的高级聊天机器人。

为了寻找答案,拉丁美洲的研究人员设计了一项涉及两百零二名医生的直接对比实验。他们设计了一个情景,要求医生解决四个模拟病例,每个病例都需要回答四个开放式问题。医生被随机分为两组。一组使用他们通常的方法来寻找信息,即按照往常习惯搜索标准资源。另一组则使用一种特定的对话系统,该系统旨在提供可以追溯至医学证据的答案。为了确保公平,两名独立的专家在不知道每位医生使用了哪种方法的情况下,对每一个回答进行了评分。他们根据六个不同的维度对答案进行评估,并创建了一个反映所给医疗建议整体有效性的综合得分。

结果显示,两种方法之间存在明显的差异。使用对话系统的医生所产生的答案,平均而言比依赖常规搜索实践的医生更具有效性。支持组的分数更高,中位数为 2.83,而常规实践组为 2.46。当研究人员对学术学位等因素进行调整后,数据表明,使用该系统的医生更有可能给出符合高标准有效性的答案。这种优势在专家评委达成高度一致的大多数具体评价标准中均成立。然而,研究也揭示了一个细微之处:如果仅严格考察事实本身的准确性,两组之间的差异并未达到统计学上的显著水平。这使得研究人员将更广泛的综合有效性指标定为主要发现,这一决定在外部评估员重复仅针对准确性的分析并得出相同结论(即缺乏差异)后得到了进一步证实。

除了答案的质量外,研究还考察了医生对过程的感受以及所需的时间。使用该系统的医生报告了极高的满意度,认为该工具是可以接受且易于使用的。有趣的是,完成任务所需的时间以及医生报告的搜索次数在两组之间并未显示出明显的差异,尽管研究人员指出,由于数据的缺失,这种特定的比较难以进行确定性的解释。研究最后对其研究范围提出了一个重要的提醒:参与者是选择完成该练习的志愿者,这意味着研究结果具有探索性,而非证明该工具在每种情况下对每位医生都有效的决定性证据。虽然该系统并没有成为瞬间解决所有问题的魔杖,但证据表明,当在这一地区的执业医生中使用时,它可以帮助提升他们向患者提供的医疗信息的质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →