← 最新论文
💻 computer science

Anomaly Detection in Cybersecurity Service Contracts

本文提出了一种基于机器学习的方法,用于检测公共机构与私营供应商之间网络安全服务合同中的异常情况,并利用案例研究来对指示偏离既定法律实践的属性进行分类与分析。

原作者: Pavol Sokol, Laura Bachňáková Rózenfeldová, Dávid Varga, Simona Rudohradská, Regina Hučková

发布于 2026-09-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Pavol Sokol, Laura Bachňáková Rózenfeldová, Dávid Varga, Simona Rudohradská, Regina Hučková

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在法律领域,可预测性是一种美德。当双方签署合同时,他们期望条款遵循一种熟悉的模式,就像森林中一条被反复踩出的路径。如果出现了一个大幅偏离这条路径的条款,就会引发一个问题:这是一种针对独特情况的必要调整,还是某种异常、甚至可能是风险的迹象?这种标准与奇特之间的张力,正是探讨网络安全服务合同的一项新研究的核心。这些合同是公共组织(如城市或医院)与受聘保护其数字系统的私营公司之间签署的协议。由于这些合同通常在编写时拥有极大的自由度,因此它们可能千差万别。研究人员想要知道,他们是否可以使用计算机来识别那些看起来与众不同的合同——其目的不是为了评判其好坏,而是为了理解是什么使其变得独特。通过将法律文件视为数据,他们应用了一种称为系统性内容分析的方法,该方法将文本分解为特定的、可计数的特征,并将其与机器学习相结合——这是一种无需被明确告知要寻找什么就能学习识别模式的计算机程序。

研究人员专注于 2019 年至 2025 年间间歇性签署的 567 份斯洛伐克公共机构与私营网络安全供应商之间的合同。他们通过人工阅读这些文件,将复杂的法律语言转化为结构化的特征列表。他们记录了合同是否包含特定元素,例如关于每月付款的条款、对何为重大违约的定义,或者要求供应商交付软件和硬件的要求。他们还记录了数值细节,如雇佣方的员工人数和交易的总价值。一旦这些信息整理完毕,他们就将其输入到一个旨在寻找离群值的机器学习系统中。这个系统预先并不知道哪些合同是“错误”或“正确”的;相反,它只是寻找那些在典型群体中显得最为突出的文档。目标是确定哪些特定特征使得一份合同与数据集中的数百份其他合同相比显得不同寻히。

研究表明,在这个领域中,什么是“正常”其实是非常具体的。最典型的合同——即计算机识别为标准的合同——通常是简单的咨询服务协议。它们通常涉及较小的市镇或社会护理设施,并以常规的月度分期付款方式进行支付。这些标准合同往往比较简短,依赖于通用法律来填补空白,而不是写出每一种可能发生的情景。相比之下,系统标记为高度异常的合同通常要复杂得多。它们经常涉及大型战略实体,如医院、地区政府或主要的国有企业。这些合同不仅仅是为了提供建议;它们通常还包括物理软件或硬件的交付、详细的 IT 监控系统以及针对各种失败类型的广泛处罚条款。

其中一个最引人注目的发现是,合同的复杂程度是其“异常”评分的主要驱动因素。计算机识别出,具有高度详细的责任规定、针对延迟的特定制裁以及对实质性违约严格定义的合同,在统计学上是罕见的。例如,一份城市与网络安全公司签署的合同,如果包含了关于城市延迟付款的罚款条款,或者允许供应商仅在非常特定条件下撤回合同的条款,就会被标记为异常,因为数据集中的大多数其他合同并不具备这些具体的、严厉的细节。同样,涉及医疗设施的合同也经常被视为离群值,这可能是因为保护患者数据的风险极高,导致其条款比与小城镇签署的协议更加严谨和具体。研究人员指出,在一种极端情况下,一份关于小型月度服务的合同被标记为异常,是因为该成本占供应商总收入的比例过高,这是一个计算机立即捕捉到的统计学上的怪异现象。

然而,研究人员谨慎地澄清说, being “anomalous”(异常)并不意味着一份合同在法律上有缺陷或不公平。这个术语仅仅意味着该文档在统计平均值上看起来有所不同。事实上,这项研究表明,许多这些“奇特”的合同很可能是各方试图更加谨慎的结果。当一份合同涉及巨额资金或像医院安全这样关键的服务时,各方编写更多规则来保护自己是合理的。计算机看到了简单、低风险合同的模式,因此将这些详细、高风险的协议解释为偏差。研究还强调了法律数据记录中的一个潜在盲点。例如,如果文本中没有明确提到“无权撤回”,研究人员就会将合同编码为“无权撤回”,即便法律本身可能已经赋予了这一权利。这意味着计算机有时是对特定句子的缺失而非法律权利的缺失做出反应。

最终,这项工作为审视法律文件提供了一种新视角。通过使用计算机绘制网络安全合同的图景,研究人员创建了一个关于什么是普遍现象以及什么是罕见现象的基准。这并不意味着应该避开那些罕见的合同;相反,它为公共官员提供了一个工具,让他们能够看到自己何时正踏入未知的领域。如果一个城市正准备与一家医院签署一份复杂的交易,系统可以向他们展示,这类协议与他们通常签署的数百份更简单的协议看起来是不同的。这种意识使他们能够仔细核查这些不寻常的条款是出于刻意且经过深思熟虑的,还是由于疏忽造成的。研究结论认为,虽然机器可以识别出离群值,但它无法判断其价值。理解一份复杂的合同是必要的还是过度的,真正的任务仍然属于必须在现实需求背景下解读这些数字的人类专家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →