← 最新论文
🤖 machine learning

Responsiveness Verification: Will Predictions Change? How Much? How Often?

本文引入了一个用于衡量“响应性”(即机器学习模型的输出在输入受到交互、噪声或操纵影响时发生变化的概率)的框架与算法,为增强再犯预测、内容审核及大语言模型基准测试等领域的安全性与可靠性提供了统计保证。

原作者: Harry Cheon, Meredith Stewart, Bogdan Kulynych, Tsui-Wei Weng, Berk Ustun

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Harry Cheon, Meredith Stewart, Bogdan Kulynych, Tsui-Wei Weng, Berk Ustun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在玩一款电子游戏,每当你按下按钮时,规则都会发生变化。如果你跳跃,地板可能会移动;如果你射击,敌人可能会传送。在现实世界中,“玩家”是人,而“游戏”是决定某些事情的机器学习模型,比如谁能获得贷款、谁会被标记为机器人,或者哪个人工智能聊天机器人是可以安全使用的。这些模型通常是在世界的静态快照(就像一张照片)上进行训练的。但现实世界是一部电影;人们会改变他们的行为,有时是为了钻系统的空子,有时仅仅是因为生活在其中。科学家们提出的重大问题是:如果一个人改变了他们的输入(比如他们的收入、社交媒体帖子或打字方式),模型的答案是否会发生可预测的变化?还是说模型会陷入僵局,无论人做些什么,它都给出同样的错误答案?这就是“响应性”(responsiveness)的问题。如果一个模型没有响应性,它可能是危险的,因为它可能会永久地将某人拒之于机会之外,或者让坏人悄无声息地溜走。

这篇论文介绍了一种测试这些模型的新方法,不是通过尝试从头开始构建一个完美的模型,而是扮演一名压力测试工程师的角色。作者 Harry Cheon 及其团队提出了一种衡量“响应性”的方法——即当一个人与模型交互时,模型的预测实际上发生变化的概率。这就像是对桥梁进行的“摇摆测试”。我们不只是看蓝图,而是派一辆卡车开过去,看看桥梁是会摇晃、保持稳固,还是会坍塌。该团队开发了一个工具包,让任何人都可以定义一个人可能如何尝试改变其数据(例如“我可以增加储蓄,但我无法改变年龄”),然后利用数学来模拟成千上万次这样的变化。他们不只是靠猜测;他们使用严格的统计规则来说:“我们有 95% 的把握确定,这个模型在 88% 的情况下会改变主意”,或者相反,“这个模型很固执,即使你尝试了,它也不会改变主意。”

研究人员发现,许多模型都出奇地固执。在一次涉及累犯预测(猜测某人是否会再次犯罪)的测试中,他们发现大约有 17.3% 被预测为会累犯的人属于“被排除在外”的情况——这意味着无论他们在模拟中如何清理犯罪记录,模型仍然判定“是的,他们会再次犯罪”。模型基本上忽略了他们的努力。在另一个关于内容审核(捕捉虚假机器人账号)的测试中,他们展示了某些模型在纸面上看起来表现出色,但实际上很容易被欺骗。当他们用无害的提示词测试大语言模型(智能聊天机器人)时,有些模型看起来很安全。但当他们通过添加拼写错误或将其翻译成其他语言来“操纵”提示词时,模型的安全性显著下降。例如,一个名为 OLMo 2 7B 的模型最初看起来非常安全,但在这些交互式测试下,它对有害请求的顺从度大幅上升,使其看起来远不如最初那样安全。

论文反对“我们需要在设计出所有‘可预测’的模型之前就先使用它们”的观点。相反,他们建议我们应该首先测试现有的模型,看看它们在哪里失效。他们构建了一个 Python 库来帮助人们进行这种测试。他们的主要发现是,通过衡量响应性,我们可以捕捉到这些隐藏的失败,从而在造成现实世界的伤害之前阻止它们。他们不仅建议这可能有效;他们还提供了算法、统计保证以及现实世界的案例,准确展示了在不同情景下预测发生了多少变化(或没有变化)。他们证明了如果没有这种测试,我们可能会信任那些实际上非常脆弱的模型,或者更糟的是,信任那些不可改变且不公平的模型。论文总结道,虽然我们无法控制人们如何与我们的系统进行交互,但我们绝对可以构建更好的工具,来观察我们的系统如何对这些交互做出反应,从而确保即使在周围世界发生变化时,系统依然保持安全和公平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →