← 最新论文
💬 NLP

A Multi-Agent LLM Framework for Rating the Quality of Surgical Feedback

本文介绍了一种两阶段多智能体大语言模型框架,该框架能够发现可解释的外科手术反馈质量标准,以自动评分实时手术室互动,并在预测反馈有效性和受训者行为调整方面展现出优于先前方法的性能。

原作者: Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen, Jasmine Lin, Cherine H. Yang, Atharva Deo, Ujjwal Pasupulety, Peter Wager, Anima Anandkumar, Andrew J. Hung

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen, Jasmine Lin, Cherine H. Yang, Atharva Deo, Ujjwal Pasupulety, Peter Wager, Anima Anandkumar, Andrew J. Hung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将手术手术室比作一场高风险的交响乐演出。受训的外科医生是首席小提琴手,而主治医生(即导师)则是指挥家。为了让音乐完美无缺,指挥家需要给予反馈。但问题在于:有时指挥家的反馈是轻柔的低语,有时是尖锐的呼喊,有时则只是令人困惑的喃喃细语。

多年来,研究人员一直试图通过倾听指挥家“说了什么”(例如,“修正这个音符”与“大声演奏”)来对这些音乐指令进行分级。但这篇新论文认为,反馈的“传达方式”与话语本身同样重要。老师听起来是否急切?指令是否清晰?他们听起来是否具有鼓励性?

来自加州理工学院和塞达斯 - 西奈医疗中心的研究团队构建了一个“智能机器人听众”(一种大型语言模型框架)来解决这一问题。以下是他们如何做到的,分解为简单步骤:

1. “头脑风暴派对”(发现)

与其猜测什么是好的反馈,研究人员不如让一组 AI 代理(将其想象为五位不同的专家音乐评论家)聆听数千次真实的外科对话。

  • 设置:他们向这些 AI 代理提供了一份关于“好”的标准清单(例如“学生纠正了错误”),并要求他们找出为什么某些反馈有效,而某些则无效。
  • 结果:AI 代理提出了一份冗长且杂乱的点子清单。研究人员随后召开了一次“整合会议”,将相似的想法归类,并将其提炼为六条黄金法则
    1. 鼓励性:它是否增强了信心?(例如:“做得好!”)
    2. 紧迫性:它是否大喊“立刻停止!”?(例如:“不要凝固!”)
    3. 可执行性:它是否是一个具体的步骤?(例如:“将针头向左移动 2 厘米。”)
    4. 及时性:它是在行动发生时说的,还是几小时后才说的?
    5. 清晰度:它是否易于理解,还是令人困惑?
    6. 反思性:它是否促使学生思考?(例如:“你为什么选择那个?”)

2. “机器人法官”(评分)

一旦有了这六条法则,他们便将 AI 转变为法官。他们向 AI 输入了 4,200 条真实的外科反馈片段,并要求它根据这六条法则对每条片段进行 1 到 5 分的评分。

  • 类比:想象一位老师批改学生的论文。这位机器人不是仅仅给出一个字母等级,而是提供一份详细的成绩单:“你的紧迫性得分为 5/5,但清晰度仅为 2/5。”

3. 验证(它有效吗?)

该团队测试了这些机器人评分是否真的能预测手术室中接下来发生的情况。

  • 测试:他们观察学生是否改变了行为(例如正确移动器械),或者仅仅说“好的”以示对老师的回应。
  • 结果:AI 的六条法则在预测学生反应方面,比仅关注对话主题的先前方法更为有效
    • 示例:他们发现,“紧迫性”和“可执行性”反馈使学生行动得更快。但“反思性”和“清晰度”反馈使学生回应得更多。
    • 意外发现:“鼓励性”反馈实际上使学生改变行为或发言的可能性降低。论文指出,这是因为鼓励通常用于学生已经做得很好的时候,因此无需改变!

4. 人工核查(可靠性)

为了确保机器人没有产生幻觉,他们邀请真正的人类外科医生使用 AI 的六条法则对相同的反馈进行评分。

  • 匹配度:人类与 AI 之间的意见相当一致(约 60-70% 的吻合度)。这证明这些法则足够清晰,人类和机器都能理解。

为什么这很重要(根据论文)

该框架就像为每位外科导师提供了一面“质量控制仪表盘”。

  • 它不仅告诉你教了什么;它还告诉你教得有多好
  • 它可以自动对数千小时的手术进行评分,而无需人类坐在那里连续数天做笔记。
  • 它有助于识别导师是否过于模糊、过于滞后或过于令人困惑,从而可能有助于改进外科医生的培训方式。

简而言之:该论文构建了一个 AI 系统,该系统学会根据外科导师的传达风格而非词汇量来对其进行评分。研究发现,清晰、紧迫和可执行是让学生实时修正错误的秘诀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →