Perspective independence, more than personas, drives LLM teams - and where they reverse
本研究表明,虽然通过视角独立性和适度综合而非专家人格,多智能体大语言模型团队在基准数据集上的诊断召回率有所提高,但这种优势在现实世界的急诊病例中会发生逆转,即专家角色列表表现出更优越的性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
在人工智能飞速发展的世界中,研究人员正在探索如何让计算机程序在理解语言方面更加可靠,特别是在被要求解决难题时。一种流行的策略是要求计算机表现得像是一个由不同专家组成的团队,每个专家都有特定的职责,例如心脏科医生或外科医生,共同协作以得出结论。这种方法依赖于这样一种理念:拥有多样化的专业声音,比要求计算机给出单一、直接的回答,能产生更好的答案。然而,这种提升究竟是源于这些专家所持有的特定头衔,还是仅仅因为计算机在合并结果之前生成了多个独立的思考过程,目前仍不明确。这个问题至关重要,因为这些系统正越来越多地被用于辅助医疗等高风险领域,在这些领域中,正确诊断与漏诊之间的差异可能是改变人生的。
最近的一项研究旨在通过测试不同设置在真实医疗案例中的表现,来理清这两种可能性。研究人员将标准的单次请求与两种更复杂的方法进行了对比。在其中一种方法中,他们要求计算机在单次对话中扮演五个不同的专家角色。在另一种方法中,他们创建了五个独立的、隔离的计算机实例,每个实例扮演不同的专家,然后使用第六个实例充当协调员,负责倾听所有人的意见并综合他们的答案。他们利用一个模拟临床医生判断力的系统对结果进行评分,并在涉及急诊室访问和复杂医学推理的数百个案例上测试了这些方法。
结果显示,性能表现根据所解决问题的类型出现了令人惊讶的分歧。当研究团队在旨在检查计算机能列出多少正确可能性的广泛医疗案例集上测试这些系统时,隔离代理(isolated agents)的团队表现优于单次直接调用。隔离组在排名前三和前五的建议中找到了更多的正确答案,且这种差异具有统计学上的显著性。进一步的分析表明,这种成功并非因为计算机在假装成为专家。相反,收益来自于代理们独立生成想法,然后由一名协调员进行合并。分配给代理的具体头衔或角色并没有增加任何额外价值;其益处纯粹在于通过分离的思想进行并行工作,然后再汇聚在一起的这种结构。
然而,当研究人员将这些相同的方法应用于现实世界的急诊室场景时,情况发生了彻底的变化。在这种更加混乱且对时间敏感的环境中,单次直接调用表现优于隔离代理团队。单次调用在约 40% 的案例中正确识别了主要问题,而团队方法仅在约 34% 的案例中做到了这一点。在这种特定语境下,优势发生了反转,且驱动力来自于专家角色列表而非独立想法的生成。这项研究表明,并不存在组织这些人工智能团队的最佳单一方式。最有效的方法完全取决于所提出的具体问题以及可用信息的性质,这意味着对于某一类医疗挑战有效的策略,对于另一类挑战可能会失效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。