Invariant Discovery for Networked Systems
本文介绍了 Autogram,这是一个将 AI 驱动的语法发现与统计驱动的搜索相结合的系统,旨在自动生成用于网络化系统的、可审计且具有形式化保证的不变量,从而有效地克服了人工编写以及现有自动挖掘工具在处理现实世界数据噪声方面的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
请不要将互联网想象成一片神奇的云雾,而要将其想象成一座繁忙、庞大的数据之城。在这座城市里,数十亿个微小的信息包在道路上疾驰,在红绿灯前停顿,并在仓库中堆积。为了维持这座城市的运转,工程师们需要了解“交通规则”。这些规则被称为不变性(invariants)。可以将它们视为网络中不可打破的物理定律,例如:“从停车场驶出的车辆数量必须等于驶入车辆的数量,正负误差极小。”如果这些规则被打破,就意味着红绿灯卡住了、道路封闭了,或者有人在窃取数据。
长期以来,寻找这些规则就像是在为一种从未有人说过的语言编写词典。工程师们不得不坐下来,通过手动方式编写每一条规则,去猜测数据的行为方式。这既缓慢又枯燥,且需要一位既精通计算机科学又了解其特定网络特性的超级专家。最近,人们尝试利用计算机自动学习这些规则,但那些计算机过于僵化;它们要求完美的、精确的匹配,并会丢弃任何不完全符合 100% 完美标准的数据,尽管现实世界的数据总是带有一定的杂乱性。随后,人们开始使用超智能的 AI(大语言模型)来提供帮助,但这些 AI 就像是偶尔会信口开河(幻觉)的创意作家,无法证明其工作的真实性。核心问题在于:我们如何在获得 AI 的创造力的同时,又不承担它胡编乱造的风险?
这篇论文介绍了一种名为 Autogram 的新系统,它通过将工作一分为二解决了这个难题。作者意识到,虽然 AI 非常擅长猜测可能存在“哪类”规则,但它并不擅长“证明”这些规则是真实的。因此,他们构建了一个系统,让 AI 扮演“语法架构师”的角色。它观察数据点的名称(如“router_A_output”或“link_B_traffic”),并建议一系列可能的规则结构,就像一份潜在句子的菜单。它从不直接声称某条规则是真实的,它只是说:“这里有一些可能合理的句子。”
一旦 AI 拟好了这份菜单,一个严格、枯燥且逻辑完美的计算机引擎就会接管工作。这个引擎会根据真实数据检查菜单上的每一个句子。它利用数学来观察规则是否成立,即使它并不完美。它允许一定的波动空间(称为“软性/softness”),因为现实数据是有噪声的,但它在接受一条规则之前会要求统计学上的证明。如果 AI 建议了一条看起来很酷但并不符合数据的规则,逻辑引擎会立即将其拒绝。如果 AI 遗漏了某条规则,系统可以要求 AI 重写菜单并再次尝试。
研究人员在来自公共网络的真实世界互联网流量数据以及一家公司使用的大规模生产网络上测试了 Autogram。他们发现,Autogram 能够重新发现人类专家已经写下的每一条规则,但它还发现了许多此前从未被察觉的新颖且有用的规则。例如,它发现从路由器流出的流量始终比预期少约 2%,事实证明这是由于数据计数方式的一个特定且可解释的特性,而非灾难。虽然之前的工具因为要求完美的准确性而几乎错过了所有这些规则,但 Autogram 找回了它们。
论文表明,这种方法效果良好且速度很快,分析一个拥有数百个路由器的网络仅需约十分钟。然而,作者也谨慎地指出,这还不是解决一切问题的魔杖。该系统仍然依赖 AI 来猜测正确的“规则菜单”,如果数据标签错误,AI 可能会感到困惑。他们还指出,该系统目前还无法自主地将简单的规则组合成复杂的、全新的结构。但他们认为,这是迈向未来的一步:在那个未来,计算机可以帮助我们发现数字世界中隐藏的规律,使互联网在无需人类从头开始编写每一条规则的情况下,变得更加安全和可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。