Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation
本文提出了一种自动化的多智能体红队测试框架,该框架通过迭代的假设生成与变异来合成具有挑战性的对抗性样本,从而在无需人工标注的情况下,显著增强多模态大语言模型针对安全违规行为的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个超级聪明的机器人如何识别互联网上危险或不当的图片。这个机器人是一个“多模态大语言模型”(MLLM),这意味着它能同时观察图像并阅读文本,从而判断某物是否安全。但棘手的部分在于,坏人一直在试图欺骗这个机器人。他们会制造一些看起来初看很安全、实则违反规则的隐蔽、怪异或令人困惑的图像。这就像一场捉迷藏游戏,而“躲藏者”正变得越来越擅长于融入环境。
为了教导这个机器人,我们通常需要向它展示一些“反面教材”。但寻找这些具有欺骗性的例子非常困难。如果要求人类去画出所有可能欺骗机器人的方式,在机器人学会所有内容之前,人类就会精疲力竭。这就是“主动学习”(Active Learning)发挥作用的地方——这是一个高级术语,指的是让计算机自己搞清楚下一步需要从哪些例子中学习。然而,即使是这种方法,在面对过于复杂或数量过多的例子时也会陷入停滞。科学家们提出的核心问题是:我们能否构建一个系统,让它能够自动发明这些具有欺骗性的例子,从而让机器人变得更强大,而不需要人类去画每一张图片?
这篇论文介绍了一个巧妙的解决方案,名为“基于多级智能体数据策展的自动困难样本合成”。你可以把它想象成一个数字化的“红队(Red Team)”——一群其唯一职责就是试图攻破安全机器人的 AI 智能体。作者并没有让一个机器人去猜测,而是建立了一个由三个专门的 AI “角色”组成的团队协作系统。首先是架构师(Architect),一个高层思考者,负责构思如何欺骗安全机器人的疯狂想法(例如:“如果我们把一个幼犬繁殖场做成可爱的宠物店广告会怎样?”)。接着是操作员(Operator),他负责将这些想法转化为实际生成的图像。最后是一个由其他 AI 组成的委员会(Committee),负责审查新生成的图像,看看它们是否成功骗过了安全机器人,或者是否显得过于明显。
该系统像视频游戏循环一样运作。架构师尝试一个新想法。如果委员会一致认为这是一个棘手的、处于边缘地带的案例,系统就会将其保存为“困难样本”。如果想法失败了,系统并不会直接丢弃它;而是使用一种称为“探索与变异(Explore and Mutate)”的策略。这意味着它要么尝试一个全新的想法(探索),要么拿一个之前接近成功但仍有瑕疵的想法进行微调(变异),使其变得更加隐蔽。作者发现,最好的策略是大部分时间尝试新想法(75%),但偶尔也对旧想法进行微调(25%),以避免陷入重复错误循环的怪圈。
实验结果非常令人印象深刻。当安全机器人在名为 HoliSafe 的基准测试中接受测试时,最初漏掉了大量的危险图像,未能识别出其中的 41.2%(这是一个很高的假阴性率)。但在团队利用这些 AI 智能体生成这些棘手的例子,并将它们作为“学习指南”(一种被称为“上下文学习/In-Context Learning”的技术)展示给机器人后,机器人的表现有了显著提升。失败率大幅下降至 24.5%。这一过程完全没有人类参与绘图或标注数据。论文指出,使用更先进的 AI 智能体“大脑”(如 Gemini 3 模型)生成的例子,比起旧模型,能更有效地发现机器人的弱点。
简而言之,这篇论文表明我们可以构建一个自我完善的安全系统。通过让一组 AI 智能体通过“玩耍”和“攻击性地尝试破坏规则”,我们可以自动找到那些最令人困惑的极端情况。这有助于安全机器人比等待人类去发现每一个诡计时,更快、更准确地学会识别那些隐蔽的内容。这就像拥有一个不知疲倦、极具创造力的教练,不断发明新的训练项目来增强运动员的力量,确保机器人能够应对未来可能出现的任何怪异或危险的图像。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。