← 最新论文
💻 computer science

Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection

该论文提出了名为 SecLens-R 的多利益相关者评估框架,通过定义五种不同角色(如 CISO、首席 AI 官等)的特定权重配置,揭示了现有大语言模型在漏洞检测任务中因单一指标评估而掩盖的显著性能差异,证明了基于角色视角的评估对于理解模型在不同安全目标下的表现至关重要。

原作者: Subho Halder, Siddharth Saxena, Kashinath Kadaba Shrish, Thiyagarajan M

发布于 2026-04-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Subho Halder, Siddharth Saxena, Kashinath Kadaba Shrish, Thiyagarajan M

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何给 AI 安全模型打分”**的新故事。

想象一下,你是一家大公司的老板,你想买一套**“智能防盗系统”(也就是用大语言模型来检测代码漏洞)。市面上有很多品牌(比如 GPT-5.4, Claude, Gemini 等),它们都拿着一个“综合得分”**向你推销,说自己是“第一名”。

但这篇论文的作者(来自 Mattersec Labs 和 Kalmantic Labs)说:“等等!这个‘第一名’的分数可能骗了你。”

🕵️‍♂️ 核心问题:一把尺子量不了所有人

现有的评测就像是用一把尺子去量所有人的身高。

  • CISO(首席信息安全官) 关心的是:“有没有漏掉大老虎?”(哪怕误报多一点,也不能放过真正的危险)。
  • 工程总监 关心的是:“别老给我报假警报!”(如果系统天天喊“着火了”,但其实是只猫,开发团队会疯掉的)。
  • AI 总监 关心的是:“这系统贵不贵?能不能自己干活?”(性价比和自动化能力)。
  • 安全研究员 关心的是:“它懂不懂原理?”(能不能解释清楚为什么这里有个漏洞)。

如果只用一个“综合分”,你可能会选到一个**“综合分第一,但漏掉了所有大老虎”的模型,这对 CISO 来说是灾难;或者选到一个“综合分第一,但天天误报”**的模型,这对工程团队来说是噩梦。

🔍 新方案:SecLens-R(安全透镜)

作者发明了一个叫 SecLens-R 的新系统。它不再只给一个分数,而是像五副不同的眼镜,让不同的人戴上,看到不同的世界。

这五副眼镜(角色)分别是:

  1. CISO 眼镜:只看“有没有漏掉致命漏洞”。
  2. AI 总监眼镜:看“性价比”和“能不能自动干活”。
  3. 研究员眼镜:看“推理深度”和“分类准不准”。
  4. 工程总监眼镜:看“误报率”和“速度”。
  5. AI 演员眼镜:看“系统稳不稳定,会不会崩溃”。

🎭 有趣的发现:同一个模型,不同的命运

作者找了 12 个最厉害的 AI 模型,用这 5 副眼镜分别给它们打分。结果非常惊人:

  • 同一个模型,分数能差 30 多分!

    • 比如 Qwen3-Coder 模型:
      • 工程总监眼里:它是 A 级 优等生(因为它很谨慎,很少乱报假警报,干活快)。
      • CISO 眼里:它是 D 级 差生(因为它太谨慎了,很多真正的漏洞它都不敢报,漏掉了太多危险)。
    • 比如 GPT-5.4
      • 工程总监给它 A,CISO 给它 D
  • 排行榜第一,不一定适合你。

    • 排行榜上的“冠军” Gemini 3 Flash,在 CISO 眼里是 B 级。
    • 但排行榜第 8 名的 Claude Haiku 4.5,在 CISO 眼里却是 B+(甚至更好),因为它虽然总分不高,但它漏掉致命漏洞的概率极低,这正是 CISO 最在意的。

🛠️ 他们是怎么做的?(简单的比喻)

  1. 35 个指标(35 种测试题)
    他们设计了 35 个具体的测试点,比如“能不能找到漏洞位置”、“会不会乱说话”、“花了多少钱”、“能不能识别 10 种不同的编程语言”等。

  2. 加权打分(给不同的题不同的分值)

    • CISO 会把“漏报率”这道题的分值拉得极高(比如 10 分),把“价格”这道题的分值拉得很低。
    • 工程总监 会把“误报率”和“速度”的分值拉高。
    • 这样,同一个模型,因为大家关注的题目不同,算出来的总分自然就不同了。
  3. 两层测试

    • 第一层(CIP):直接把代码给 AI 看,让它找茬。这就像**“看图说话”**,便宜又快。
    • 第二层(TU):让 AI 像真人一样,去翻文件夹、读文件、用工具。这就像**“实地侦查”**,更真实,但更贵、更慢。
    • 研究发现,对于大多数公司,第一层测试(看图说话)就够用了,没必要每次都花大价钱做实地侦查。

💡 这篇文章告诉我们什么?

  1. 没有“万能冠军”:不要盲目相信排行榜上的第一名。如果你是管安全的,你要找“不漏报”的;如果你是管开发的,你要找“不误报”的。
  2. 视角决定命运:一个模型是“好”是“坏”,完全取决于谁在用,以及用来做什么
  3. 定制化很重要:公司应该根据自己的需求(比如更看重成本,还是更看重安全),调整评价的权重,而不是照搬别人的榜单。

总结一句话:
这就好比买汽车。如果你是个赛车手,你会选“法拉利”(速度快,但可能不安全);如果你是个送孩子的家长,你会选“沃尔沃”(安全,但可能不够快)。SecLens-R 就是告诉你:别只看“综合性能榜”,要看“谁最适合你的需求”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →