Calibrating trust in AI-assisted pituitary surgery
本研究表明,通过为 AI 辅助垂体手术决策支持系统增加解释性特征和置信度标签,可以改善临床医生信任度的校准——在 AI 表现不佳时减少过度依赖——并与基础界面相比,促进更高的连贯性和资深水平的表现。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下你是一名外科医生,正在对颅内深处一个微小且复杂的结构——垂体进行一场精细的手术。这就像是在蒙着眼睛穿越迷宫,但你拥有一个高科技 GPS(人工智能),它会在你的屏幕上画出一条发光的线,指引出安全的路径。
这个研究提出的核心问题是:你应该在多大程度上信任这个 GPS?
如果你在它出错时过度信任,可能会导致“车祸”;如果你在它正确时信任不足,可能会错过捷径。研究人员想要观察,改变这个 GPS 的“外观与感觉”是否能帮助外科医生找到完美的信任平衡点。
实验:两种类型的 GPS
研究人员召集了 70 名经验丰富的医生和医学生,让他们参加了一个类似虚拟现实的在线测试。他们要求参与者在六段真实的临床手术视频片段中,描绘出垂体的轮廓。
参与者被分为两组,每组使用不同版本的 AI 助手:
- “基础型” GPS: 这个版本仅仅是画出那条线。它就像一个标准的 GPS,只说“在此左转”,但不会解释为什么要这么做,或者它有多确定。
- “增强型” GPS: 这个版本就像是一个会说话的副驾驶。它不仅会画线,还会显示一个置信度计(一个告诉用户 AI 有多确定的百分比),并提供关于 AI 如何训练以及其通常可靠程度的小型简报。
转折点:GPS “压力过大”
为了测试信任度,研究人员并没有只展示完美的视频。他们对视频片段进行了排序,让 AI 从开始表现得完美,然后逐渐变得越来越差、越来越混乱,最后在结尾处又稍微好转了一些。这就像是在晴朗的城市驾驶,然后进入了大雾弥漫的地带,接着又进入了一个 GPS 开始给出奇怪指令的施工区域。
发生了什么?
1. 当 AI 表现完美时:
两组对 AI 的信任程度相当。有趣的是,“增强型”组(拥有会说话的副驾驶的那一组)并没有比“基础型”组表现出更高的信任度。然而,增强型组中的资深医生在描绘线条方面做得实际上稍微更好一些。看起来,额外的信息帮助专家们感到更有信心去更有效地利用这个工具,就像是在“精选” AI 建议中最好的部分。
2. 当 AI 陷入混乱时(大雾阶段):
这是研究最有趣的地方。当 AI 开始出错时,“基础型”组仍然过度信任它。他们就像那些即使 GPS 告诉他们要开进湖里,仍坚持跟随 GPS 的司机。
然而,“增强型”组停止信任的速度要快得多。因为他们看到了“置信度计”下降,并且知道 AI 正在挣扎,所以他们显著降低了信任度。这被称为信任校准。他们意识到:“嘿,这个工具今天状态很差,我不应该盲目依赖它。”
3. 信任降低的结果:
尽管“增强型”组在 AI 出错时信任度较低,但他们的描绘结果并不一定比“基础型”组更好。然而,他们的结果更加一致。他们没有犯下离谱且危险的错误。这就像是“增强型”组决定:“GPS 坏了,所以我还是小心驾驶,依靠自己的直觉吧”,而“基础型”组则继续尝试跟随那个坏掉的 GPS,结果表现得手忙脚乱。
总结
研究发现,向外科医生提供更多信息(如置信度评分和关于 AI 的背景信息)有助于他们校准信任。
- 优秀的 AI: 额外的信息能帮助专家更高效地使用工具。
- 糟糕的 AI: 额外的信息充当了安全检查,让外科医生意识到:“这行不通”,从而防止他们盲目跟随错误。
研究人员得出结论,虽然这些额外的信息并不能让 AI 变得完美,但它能帮助外科医生判断何时该信任它,以及何时该忽略它。在这些工具真正进入实际手术室之前,这是一个至关重要的安全特性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。