Using Human-LLM Disagreement to Improve Checklist-Based Quality Appraisal
本文表明,通过分析人类与大语言模型(LLM)在基于清单的质量评估中的分歧,可以识别出模糊的标准,并且修订这些项目能显著提高一致性,同时保持研究的相对排名,从而支持更可靠的大语言模型辅助研究合成工作流。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
每年,科学界都会产生大量的研究成果,这为那些试图理清头绪的人带来了挑战。当科学家想要了解一个课题的全貌时,他们会进行系统综述,这是一个涉及收集某一主题下所有相关研究并检查每一项研究质量如何的过程。这种质量检查至关重要,因为它能将可靠的发现与有缺陷的发现区分开来,但这个过程也极其缓慢且令人精神疲惫。专家必须阅读密集的报告,并判定研究人员是否遵循了规则,这项任务每项研究可能需要耗费一小时,且在人感到疲劳时容易出错。最近,被称为大语言模型的强大计算机程序作为这项工作的潜在助手出现了。这些程序能够阅读并理解文本,从而引出了一个充满希望的想法:计算机能否接管这项枯燥的质量检查工作?然而,仅仅把一份清单交给计算机是不够的。如果清单上的问题模糊不清或令人困惑,即使是聪明的计算机也会难以给出正确的答案,就像人类一样。
一个研究小组着手测试这个想法,更重要的是,测试他们如何能让计算机与人类专家达成更好的共识。他们专注于一套被称为 GRoLTS 的特定规则,该规则用于评判追踪人群随时间变化的追踪研究。研究人员首先要求几个不同的计算机模型将这些规则应用于一组关于创伤的真实研究,而人类专家此前已经对这些研究进行了评分。他们发现计算机并不完美;它们在某些问题上与人类达成一致,但在另一些问题上经常产生分歧。这些分歧并非随机发生。当清单条目措辞方式允许多种解释时(例如,当研究仅报告了部分模型时,却询问是否对“所有”模型都执行了某项操作,或者使用难以确定的宽泛术语时),分歧发生得最为频繁。计算机往往会找到一段证据并回答“是”,而人类专家由于寻求更严格的标准,则会回答“否”。
研究人员并没有仅仅接受这些错误,而是将这些分歧作为修复清单本身的地图。他们提取出那些令人困惑的问题,并将其改写得更加清晰、具体。他们将同时询问两件事的复杂问题拆解为独立的、更简单的提问。他们移除了需要进行猜测的“如果-那么”场景,并用具体的观察示例取代了模糊的术语。一旦他们创建了这个改进后的第二版清单,他们就要求计算机和人类专家再次对研究进行评分。结果显示出明显的进步。计算机和人类在新版本上达成一致的频率高得多。导致计算机绊倒的困惑在很大程度上消失了。更重要的是,研究人员发现,即使计算机在单个问题上犯了一些小错,它们在对研究进行从优到劣排序方面仍然表现出色。这意味着,只要它所遵循的规则编写得足够清晰,计算机就可以可靠地帮助研究人员确定哪些研究应该优先查看。
这项研究表明,使人工智能对科学综述产生作用的关键不仅在于选择更聪明的计算机程序,还在于设计出更好的问题让其回答。当规则具有歧义时,人类和机器都会感到困难,但当规则精确时,机器就会成为可靠的伙伴。研究人员并未发现计算机可以完全取代人类专家,因为一些困难的问题仍需要人类的判断。相反,他们展示了通过分析计算机与人类的分歧点,可以识别出工具中的薄弱环节并加以修复。这种方法将不匹配转化为了改进的工具,表明科学综述的未来在于一种伙伴关系:由计算机处理明确的任务,而人类则专注于复杂的任务,并由旨在让两者都能理解的清单进行引导。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。