← 最新论文
💻 computer science

Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All

本文介绍了 Live-kBench,这是一个具有标准化环境 (kEnv) 的自进化评估框架,用于基准测试大语言模型(LLM)智能体在新鲜 Linux 内核漏洞上的表现,揭示了截断时间前与截断时间后问题之间显著的性能差距,同时证明了反馈暴露能实质性地提高崩溃解决率。

原作者: Chenxi Huang, Alex Mathai, Feiyang Yu, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Eugene Wu, Kostis Kaffes, Junfeng Yang, Baishakhi Ray

发布于 2026-06-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenxi Huang, Alex Mathai, Feiyang Yu, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Eugene Wu, Kostis Kaffes, Junfeng Yang, Baishakhi Ray

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将 Linux 内核视为全球城市电网中一个庞大且古老的引擎。它如此复杂,以至于只要一个齿轮发生滑动,整个城市都可能陷入黑暗。多年来,自动化工具(如“模糊测试器/fuzzers”)一直在向这个引擎投掷随机的扳手,以观察哪里会损坏。当某些东西损坏时,就会生成一份“崩溃报告”。

核心问题是:人工智能(AI)能否修复这些损坏的齿轮?

这篇论文介绍了一种新的方法,用于针对这项特定的、高风险的任务来测试 AI。以下是利用简单的类比对他们工作的拆解:

1. 问题所在:“旧教科书”陷阱

此前,研究人员会在一组静态的旧漏洞列表(就像一本 2018 年的教科书)上测试 AI。

  • 问题在于: AI 模型就像是在学习特定教科书的学生。如果测试题来自这本教科书,学生可能只是在背诵答案,而不是真正学习如何解决问题。这被称为“数据污染”。
  • 现实情况是: Linux 引擎一直在不断重新设计。昨天有效的修复方案,今天可能会破坏引擎。旧的测试无法反映当前这个鲜活的机器。

2. 解决方案:一个“实时”测试实验室

作者构建了两个主要部分来解决这个问题:

A. KENV(通用工作坊)
想象一个标准化的机器人工作坊。无论你派去的是哪位 AI 技师,他们都拥有相同的工具、相同的防护装备以及启动引擎的相同指令。

  • 为什么这很重要: 以前,每个 AI 团队都建立了自己的混乱工作坊,导致无法比较谁的水平更高。KENV 确保每个人都在完全相同的赛道上进行比赛。

B. LIVE-KBENCH(实时动态馈送)
该系统不是使用旧教科书,而是直接连接到实时的新闻动态,获取正在发生的全新引擎故障。

  • 类比: 这就像是引擎崩溃的“突发新闻”滚动条。系统抓取一个新鲜的漏洞,将其发送给 AI,并立即检查该修复是否有效。
  • 目标: 观察 AI 是否能够修复它从未见过的错误,从而确保它具备真正的智能,而不仅仅是记忆旧答案。

3. 实验结果:他们的发现

研究人员在 534 个新鲜漏洞上测试了顶尖的 AI 智能体。以下是关键结论:

  • “截止日期”效应: AI 模型具有“知识截止日期”(其训练数据停止的日期)。

    • 结果: 对于发生在训练停止之前的漏洞,AI 的表现明显更好(就像解决教科书里的数学题)。
    • 结果: 当面对训练停止之后的漏洞时,性能出现了下降。这证明了面对非常新的问题时,AI 在泛化能力方面仍面临困难,而不仅仅是回忆事实。
  • “第一次尝试” vs. “完美修复”:

    • AI 通常能在第一次尝试时就阻止引擎崩溃(成功率 74%)。
    • 然而,只有约 20% 的修复方案是完全符合人类专家做法的。
    • 类比: AI 可能会在破裂的管道上贴一块胶带来止水。这确实起作用了(崩溃停止了),但人类水管工会更换整个阀门(完美的修复)。AI 通常能做到“足够好”以阻止灾难,但还不够“完美”到成为理想的解决方案。
  • 反馈的力量:

    • 当允许 AI 尝试修复、查看是否再次崩溃,然后再次尝试(反馈循环)时,其成功率提升了 29%。
    • 类比: 这就是猜答案的学生与能够检查自己的作业、发现错误并修正后再提交的学生之间的区别。
  • 完美的代价:

    • 检查修复是否真的有效需要编译并运行庞大的 Linux 引擎,这需要大量的计算能力和时间(每次测试约 30 分钟)。
    • AI 花费大量时间等待这些测试完成,这既昂贵又缓慢。

总结

这篇论文不仅仅是在说“AI 擅长修复漏洞”。它构建了一个公平、实时且不断更新的赛道,用来测试 AI 处理世界上最复杂软件的能力。

他们发现,虽然 AI 在阻止崩溃方面表现得惊人地好,但在达到人类专家的精准度方面仍有困难,尤其是面对那些全新的、且 AI 在其训练数据中从未“见过”的问题时。这项研究强调,要真正掌握这些系统,AI 需要学会如何学习,而不只是记忆过去。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →