Introducing HALC: A general pipeline for the systematic and reliable construction of prompts for automated coding with LLMs in the computational social sciences
本文介绍了 HALC,这是一个旨在为使用大语言模型的自动化内容分析系统地、可靠地构建提示词的通用流水线,通过广泛的实证评估,证明了其在不同数据集、语言和编码任务中的有效性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在社会科学领域,研究人员长期以来一直依赖于一种缓慢且谨慎的过程来理解人类传播。他们阅读成千上万份文件——报纸文章、政治演讲或社交媒体评论——并根据文本所表达的内容将其分类。这被称为内容分析。几十年来,最受信任的方法是雇佣人类读者来进行这种分类。人类具有灵活性,能够理解细微差别,但他们也速度较慢、成本高昂,且受限于工作时长。近年来,被称为大语言模型的强大计算机程序脱颖而出。这些程序能够以卓越的技巧阅读和编写人类语言,为自动化这一分类过程提供了希望。然而,仅仅要求计算机阅读文本并进行分类往往会导致结果不一致。计算机可能会在两次询问同一段文本时给出不同的答案,或者它可能会误解研究人员心中特定的规则。核心挑战在于如何将研究中精心制定的规则转化为计算机可以可靠遵循的指令,而不丢失人类专家所提供的准确性。
霍恩海姆大学的一支研究小组开发了一种解决这一问题的新方法,他们称之为 HALC。他们的目标是创建一个逐步的流水线,使科学家能够系统且透明地使用这些强大的计算机模型进行编码,而不是依赖猜测。研究人员首先承认,虽然这些计算机模型令人印象深刻,但它们并不完美。它们可能是不可预测的,其表现会随着指令方式的不同而变化。为了构建一个可靠的系统,该团队首先进行了一项大规模的初步研究。他们选取了一组关于气候运动的评论,并要求计算机模型反复阅读这些评论。他们测试了数百种不同的指令(即“提示词”)表述方式,以观察哪些方式能产生最一致且最准确的结果。他们发现,要求计算机阅读同一段文本五次,然后取出现频率最高的答案,可以显著稳定结果。他们还发现,用于教导计算机的初始人类数据的质量至关重要;如果人类的“地面真值”(ground truth)是不稳固的,那么计算机的结果也会是不稳固的。最重要的是,他们了解到最好的指令并非短小或模糊的。最成功的提示词是详细的,要求计算机逐步解释其推理过程,并为其最终决定提供理由,就像人类编码员在写下答案之前思考问题一样。
基于这些发现,研究人员将 HALC 流水线正式化。这一过程始于一个标准的、由人类制定的“编码手册”,其中包含了特定研究项目的定义和规则。研究人员并没有试图重新发明轮子,而是将这些人类规则直接转化为结构化的提示词。然后,他们在一小部分数据样本上测试该提示词,将计算机的输出与原始的人类编码进行对比。如果计算机不符合人类的可靠性标准,研究人员不会仅仅去猜测新的指令。相反,他们会遵循一个严格的、基于规则的过程来优化提示词,例如增加更具体的例子或澄清某个定义,然后再次进行测试。这个循环会持续进行,直到计算机达到的与人类编码员的一致程度被认为是符合科学标准的。只有到那时,他们才会使用计算机处理整个数据集。这种方法将计算机视为一个必须针对人类判断进行仔细校准的工具,而不是一个可以自行运作的“魔法盒”。
为了证明该系统在现实世界中有效,团队将 HALL 管道应用于两种完全不同类型的数据。第一类是来自五个不同国家、涵盖英语、德语和西班牙语的大规模政党宣言集。任务是识别哪些句子讨论了移民问题,以及这些句子是侧重于边境控制还是侧重于对已居住在该国人口的融合。第二个数据集由三十家主要德国公司的年度报告组成,目标是确定写作的基调——是积极的、消极的还是中性的。在这两种情况下,研究人员都使用了英文指令来引导计算机,依靠模型理解不同语言的能力,而无需为每种语言编写单独的提示词。结果令人鼓舞。对于政治文本,计算机实现的可靠性得分与原始人类编码员非常接近,成功应对了不同的语言和政治背景。对于商业报告,当使用一种专门用于复杂推理的模型时,计算机的表现甚至更好,这表明该流水线可以适应不同类型的任务。
研究结论指出,虽然大语言模型功能强大,但不能简单地交给它们一项任务就期望它们表现完美。它们需要一种结构化的、系统化的方法来确保其输出是值得信赖的。HALC 流水线提供了一种弥合人类专业知识与机器速度之间鸿沟的方法。通过将计算机指令植根于既定的人类规则,并在全面部署前进行严格测试,研究人员可以在不牺牲研究发现有效性的情况下实现自动化工作。作者认为,这种方法使编码过程变得透明且可复现,允许其他科学家清晰地看到指令是如何构建和验证的。尽管计算机模型在不断进化,但核心原则保持不变:可靠的自动化来自于人类设计与机器执行之间的精细协作,从而确保最终数据如同由人类专家团队分类一样坚实可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。