A Cautionary Evaluation of LLMs for TLS Normative Requirement Classification
本文评估了大型语言模型在利用 NIST SP 800-52 Rev. 2 实现 TLS 规范性要求自动分类方面的表现,发现虽然集成方法达到了 93.75% 的准确率,但“SHOULD NOT”与“MAY”用语之间的系统性混淆使得当前的 LLM 在独立合规性审计方面仍不够可靠。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
互联网依赖一种被称为传输层安全性(TLS)的数字握手协议,来保护我们的私密消息、银行交易和电子邮件免受窥视。这套系统通过就如何加密和解密数据的特定规则集达成一致来运作。这些规则并非即兴发明,而是记录在被称为技术标准的庞大且复杂的文档中。这些文档告诉工程师哪些规则是强制性的,哪些仅仅是建议,以及哪些是被禁止的。其使用的语言极其精确且具有法律色彩,依赖于“必须”(must)、“应该”(should)和“可以”(may)等特定词汇来定义规则的强度。“必须”意味着规则是不可逾越的,而“可以”则意味着它是可选的。然而,文本往往变得复杂,会将这些词汇与条件混合在一起,例如说某个规则在发生非常特定的紧急情况之前是不被鼓励的。对于安全专家而言,准确掌握这些规则关乎安全;将一个建议误读为一种许可,可能会让整个系统处于易受攻击的状态。
多年来,将这些数千页的文本转化为计算机能够理解的清单的唯一方法,是让专家阅读每一行并进行人工翻译。这个过程缓慢、昂贵且容易产生人为错误。最近,一种被称为大语言模型的新型计算机程序出现了,它们能够以卓越的技能阅读并理解人类语言。这些模型可以回答问题、总结文本,甚至编写代码。这引发了一个令人期待的问题:这些智能程序能否阅读安全标准,并自动确定哪些规则适用于哪些数字连接,从而为专家节省数月的工作时间?意大利布鲁诺·凯斯勒基金会(Fondazione Bruno Kessler)的一个研究小组致力于测试这个想法,他们不是要看这项技术能否写出一个故事,而是要看它能否执行一项“一旦出错就可能危及整个互联网安全”的任务。
研究人员专注于名为 NIST SP 800-52 的主要安全标准中的一个特定章节,该标准规定了应如何配置 TLS。他们选择了一个包含 144 种特定数字连接模式(称为密码套件)的数据集,这些模式是安全通信的基础构建模块。他们的目标是观察大语言模型是否能正确识别每种模式的状态:它是硬性要求、建议、许可还是禁止?为了使任务公平且严谨,他们并没有仅仅让模型去猜测。相反,他们构建了一个系统,迫使模型进行逐步思考。他们向模型提供了关键词的确切定义,并要求它们遵循一个六阶段逻辑路径:检查文本、寻找关键词、检查否定词,最后做出决定。为了确保结果的稳健性,他们在四种不同的主流大语言模型上运行了这项测试,并使用了一种投票系统来整合答案,该系统会给表现较好的模型赋予更高的权重。
结果呈现出一种令人印象深刻的能力与令人清醒的局限性并存的状态。该系统表现得足够好,在近 94% 的案例中都能得出正确答案。这比使用任何单个模型本身的效果略有提升,证明了结合多个模型的“意见”可以消除它们各自的怪癖。然而,研究人员发现,虽然这种准确度对于许多任务来说已经很好,但对于安全合规性而言还远远不够。在网络安全领域,6% 的错误率是灾难性的。如果一个工具用于审计系统,而它漏掉了一个被禁止的规则,那么该系统可能会带着已知的漏洞投入使用。研究表明,模型的失败并非随机发生,而是以一种非常特定且可预测的方式发生。
问题的症结在于标准语言中一个微妙但至关重要的区别。模型很难区分“除非绝对必要,否则不要这样做”与“你可以这样做”之间的区别。在标准的专业术语中,前者是一个仅在严格条件下才被允许的“不被鼓励”的规则,而后者则是一个简单的“许可”。研究人员发现,超过一半的模型错误涉及混淆这两个类别。模型会读到一段话,其中一方面不推荐某种做法,另一方面又允许在紧急情况下使用,而它们会将“允许”的部分解读为核心信息,从而忽略了“不鼓励”的警告。它们看到了许可,却忽略了条件。
即使研究人员在系统中构建了这种逐步思考的过程,这一问题也未能得到解决。即便在被迫写出推理过程时,模型仍然犯了同样的错误。它们可以正确识别“不推荐”和“可以被使用”这些词汇,但无法正确权衡它们之间的关系以得出正确的结论。研究人员得出结论,虽然这些计算机程序是强大的文本阅读工具,但它们尚未具备取代人类专家进行安全审计所需的深度理解力、细微差别处理能力和条件逻辑能力。这项技术尚未准备好独立工作。研究表明,这些工具或许可以作为初步筛选工具,标记出潜在的规则供人类审查,但它们还不能被信任去做出最终决定。在这些模型能够可靠地理解“被不鼓励的例外情况”与“简单的许可”之间的区别之前,维护互联网规则的任务仍必须由人类掌控。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。