← 最新论文
💻 computer science

Artificial Intelligence in Surgical Qualitative Research: A Comparison of Human and AI-Assisted Thematic Analysis

本研究比较了外科定性研究中人类与人工智能辅助的主题分析,发现尽管两种方法都能识别出相似的宏观主题,但由于人类生成的编码本具有更清晰的主题界限,因此具有更高的编码者间信度,这表明结合人工智能的高效性与人类精炼性的混合方法可能是最优选择。

原作者: Bonnie E Laingen, Wesley H Iobst, Jarrett Dobbins, Jacob W Johnson, Gabriel E Cambronero, Lucas P Neff, Maggie E Bosley

发布于 2026-06-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Bonnie E Laingen, Wesley H Iobst, Jarrett Dobbins, Jacob W Johnson, Gabriel E Cambronero, Lucas P Neff, Maggie E Bosley

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个装有 200 张外科医生手写便笺的大箱子。每张便笺都回答了一个问题:“在你们医院进行特定手术(LCBDE)时,最困难的事情是什么?”

你的目标是阅读所有这些便笺,根据提到的问题将它们分类成不同的堆,并为每一堆贴上标签。这个过程被称为主题分析(Thematic Analysis)。通常,人类通过阅读、讨论和不断完善标签,直到他们对每个标签的含义达成一致。

这篇论文提出了一个简单的问题:机器人(人工智能)能否像人类一样出色地完成这项分类工作?

以下是他们如何测试这一点的故事,其中用到了一些简单的类比。

两支队伍

研究人员设置了一场比赛,让两支队伍对同样的 200 张便笺进行分类:

  1. 人类团队: 两名医生阅读这些便笺。他们开始时没有任何标签。随着阅读的深入,他们创建了自己的类别列表(例如“资金不足”、“时间不足”、“设备糟糕”)。他们不断完善这些标签,直到它们变得非常清晰且具有辨识度。这就是他们的人类编码本(Human Codebook)
  2. AI 团队: 他们将所有 200 张便笺作为一个大批次输入到一个强大的 AI(ChatGPT)中。他们告诉 AI:“观察这些便笺并创建你自己的类别列表。”AI 在没有任何人类帮助或示例的情况下瞬间完成了这项工作。这就是 AI 编码本(AI Codebook)

结果:谁分类得更好?

两支队伍都成功找到了宏观层面的问题。无论是人类还是机器人阅读这些便笺,他们都一致认为主要问题是:

  • 设备问题
  • 资金/成本问题
  • 时间限制
  • 缺乏上级支持
  • 手术频率不够高(低手术量)

然而,他们在“如何”分类方面存在差异。

“模糊堆”问题

可以将人类团队的标签想象成清晰、独立的盒子。如果一张便笺说“我们没有合适的工具”,它就会进入“设备”盒;如果说“我们没有时间”,它就会进入“时间”盒。这些盒子之间几乎没有重叠。

AI 团队的标签则更像是模糊、重叠的圆圈。AI 创建了一些非常宽泛的类别。例如,它可能会创建一个名为“工作流与文化”的标签。一张关于“医院更倾向于另一种手术”的便笺可能同时符合三个不同的 AI 类别。

由于 AI 的类别过于宽泛且相互重叠,试图使用 AI 列表来对便笺进行分类的两位人类编码员经常感到困惑。他们并不总能就一张便笺属于哪个“模糊”堆产生共识。

计分板

研究人员测量了两位编码员达成一致的频率(编码者间信度,Inter-Coder Reliability)。

  • 人类团队: 他们的达成一致率(Kappa 值)为 95.1%,其一致性得分(Kappa)为 0.75
  • AI 团队: 他们的达成一致率为 92.3%,其一致性得分(Kappa)为 0.64

虽然 AI 表现得相当不错,但人类的稳定性更高。论文指出,这种差异具有统计学意义,这意味着这并非偶然现象;人类的标签确实更加清晰。

“混合型”解决方案

该论文的结论是,AI 就像一个快速、得力的助手,它可以迅速观察一个凌乱的房间并说:“好了,这里主要的杂物类型有:衣服、书和餐具。”

但 AI 可能并不擅长定义“袜子”究竟该放在哪里,如果它和“毛巾”混在一起的话。人类需要随后介入并说:“实际上,让我们为袜子制定一个具体的规则,这样每个人都能明确知道该把它们放在哪里。”

核心启示:
你可以利用 AI 快速完成寻找主要主题的繁重工作。但为了确保规则清晰且每个人分类的方式一致,需要人类介入来完善定义。最好的方法是混合模式:让 AI 进行初步处理,然后由人类来润色标签。

这篇论文“没有”说的话

需要注意的是,本研究并未声称以下内容:

  • 没有说 AI 已经准备好完全取代人类研究员。
  • 没有测试 AI 处理长篇、复杂访谈的能力(仅测试了简短的调查回答)。
  • 没有测试不同版本的 AI 或不同的提问方式(它使用的是“零样本/zero-shot”方法,即在没有事先训练或示例的情况下直接询问 AI)。
  • 没有声称 AI 找错了主题;AI 找到了正确的宏观概念,只是它在像人类那样清晰地划定界限方面遇到了困难。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →