← 最新论文
🤖 AI

A Framework for Using and Evaluating LLMs as Surrogate Experts in Security Surveys: Reliability, Bias, and Implications

本文提出了一个框架,证明了虽然大语言模型能够为安全调查生成一致的合成响应,但它们表现出的系统性偏差和同质化特征,使其仅适用于试点研究和假设生成,而不足以取代实际的专家访谈。

原作者: Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在网络安全这个高风险的世界中,了解人类专家如何思考至关重要。当安全漏洞发生时,安全运营中心(SOC)分析师所做的决策可以决定威胁是被遏制还是在网络中蔓延。为了理解这些决策过程,研究人员通常依赖于对这些专业人士的调查和访谈。然而,寻找足够的专家来回答这些调查是出了名的困难。这些专家往往工作过度,应对着不断的警报和职业倦怠的威胁,而且许多人受限于严格的保密规则,无法分享有关其日常工作的细节。因此,研究往往面临样本量过小的问题,导致研究人员无法获得完整的行业图景。

最近,一种新的工具出现了,它有望解决这种短缺:大语言模型。这些是经过大量人类文本训练的高级计算机程序,能够生成听起来非常像真人的文本。一些研究人员开始怀疑,这些人工智能是否可以作为真实专家的替代品,通过生成数千个合成响应来填补调查数据的空白。这个想法很有吸引力:如果一台计算机可以模仿专家,它就可以让科学家测试他们的问题、探索不同的场景,并在不需要追踪忙碌的人类的情况下收集数据。但一个关键问题仍然存在:机器真的能像安全专业人员一样思考吗?还是它仅仅是在制造一个令人信服的模仿,却错失了真实人类经验中的细微差别?

一个研究小组致力于回答这个问题,他们建立了一个严谨的框架,以测试这些人工模型是否可以作为安全调查中人类专家的可靠替代品。他们不仅仅是问模型几个问题看看会发生什么;相反,他们设计了一个全面的实验,以观察这些计算机生成的答案在受到审查时是否站得住脚。研究人员从医疗保健到金融等不同领域的六名网络安全专业人员那里收集了真实的调查数据。这些专家的经验水平各异,职位也不同,包括经理、分析师和专家。随后,研究人员要求六个不同的语言模型模拟这些特定的专家,创建与真实人物背景和职称相匹配的数字人格。

该实验通过三种不同的方式进行,以从各个角度测试模型。首先,研究人员要求模型扮演个体专家,试图复制真实人类的具体观点。其次,他们要求模型生成整个群体的总体模式,模拟大规模调查的聚合结果。最后,他们测试了模型随时间的变化,要求模型预测专家观点在现实世界数据中数年间的转变情况。在整个过程中,研究人员多次运行每次模拟,以观察模型在重复提问时是否给出相同的答案,从而检查一致性和稳定性。

结果显示,人工模拟与人类现实之间存在明显的差距。虽然大语言模型在自身内部表现出极高的一致性——即在多次被问及同一问题时经常给出相同的答案——但它们未能捕捉到人类思想的真正多样性。真正的安全专家表现出广泛的观点范围;有些人对自己的选择充满信心,而另一些人则犹豫不忡,且他们的答案会根据其特定经验和工作场所的独特压力而变化。相比之下,模型倾向于收敛到一个单一的、安全的、中间地带的答案。它们抹平了人类专家之间自然的争论和不确定性,产生的响应过于统一且过于礼貌。

当研究人员将模型的答案分布与真实数据进行比较时,模型似乎掌握了数据的总体轮廓,但却丢失了细节。它们倾向于避免极端或罕见的观点,将响应聚集在平均值周围。这种“趋中倾向”意味着,虽然模型可以生成看似合理的调查结果,但它们实际上抹去了使人类专业知识具有价值的那些变异性。例如,在讨论采用新工具的挑战时,真实的专家强调了具体的、棘手的操作障碍,而模型则提供了通用的、教科书式的困难,缺乏实际实践中的质感。

研究还考察了这些模型是否能够追踪行业随时间的变化。研究人员发现,模型在很大程度上对时间是不敏感的。即使被要求模拟不同年份的响应,模型也会产生静态的模式,无法反映网络安全威胁和实践的演变本质。这表明模型并不是在以人类专家的方式学习或适应新信息;相反,它们是在回忆一套固定的概念,这些概念并不会随时代而变化。这种缺乏时间意识的特点意味着,它们无法被信任去预测专家观点可能如何变化,也无法准确反映历史趋势。

最终,研究人员得出结论:虽然这些大语言模型是强大的工具,但它们尚未准备好取代安全研究中的人类专家。模型非常适合研究的早期阶段,例如帮助研究人员起草调查问题、测试问题的清晰度,或生成用于探索假设场景的内容。它们可以作为想法的有用讨论平台。然而,它们绝不应被用来取代实际的专家意见收集。人类判断那种独特的、多变的、有时甚至是矛盾的性质,是算法无法合成的。为了了解网络安全的真实世界,研究人员仍必须依赖于那些生活并工作在其中的人类所提供的混乱、复杂且无价的洞见。这项研究提供了一个重要的指南,确保在领域拥抱新技术的同时,不会忽视作为安全基础的人类专业知识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →