← 最新论文
🤖 machine learning

Learning from the Test: Self-Referential Differential Testing for Deep RL Agents

本文提出了 Delta,这是一个通过将安全性测试与离线强化学习相结合,以生成用于差异化测试的挑战者智能体,从而有效识别深度强化学习(DRL)智能体中安全性关键故障和最优性缺陷的新型框架,旨在解决深度强化学习中的测试预言问题。

原作者: Junda He, Jieke Shi, Zhou Yang, Mingfei Cheng, David Lo

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Junda He, Jieke Shi, Zhou Yang, Mingfei Cheng, David Lo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

深度强化学习是人工智能的一个分支,其中计算机程序通过与世界进行交互来学习如何做出决策,就像儿童通过摔倒和不断尝试来学习骑自行车一样。这些被称为“智能体”的程序根据其行为获得的奖励或惩罚来接收反馈,从而逐渐形成一种策略,以在长时间内实现尽可能好的结果。这项技术已经从研究实验室走向了现实世界,为从工厂中的机械臂到自动驾驶汽车的导航系统等各种应用提供动力。然而,随着这些系统承担起越来越多的责任,一个关键的问题随之而来:我们如何知道它们不仅是安全的,而且是在尽其所能地完成任务?虽然工程师们长期以来一直专注于确保这些智能体不会发生碰撞或造成伤害,但在它们是否在做出最有效或最优选择方面,一直存在一个盲点。机器人可能会成功避开一堵墙,但如果它采取了一条迂回且耗能的路径,那么它就未能通过另一种测试。难点在于知道“完美”是什么样子的;在复杂多变的环境中,理想的解决方案往往是未知的,这使得判断一个智能体仅仅是表现良好还是真正达到了极致水平变得几乎不可能。

为了填补这一空白,新加坡管理大学和阿尔伯塔大学的研究人员开发了一种名为 Delta 的新型测试框架。Delta 并不试图去猜测完美的解决方案,而是使用了一种巧妙的自我比较形式。该过程始于一个标准的安全性测试,在此过程中,受检智能体会被置于一系列困难的情境中,以观察其是否会发生碰撞或违反安全规则。至关重要的是,研究人员不仅仅是在观察失败,他们还会记录智能体在这一压力测试阶段所做的每一次动作,从而创建一个详细的行为日志。这个日志成为了一个数据的宝库,包含了智能体的成功操作和失误。随后,研究人员利用这些记录的数据来训练第二个竞争智能体。这个新智能体被称为“挑战者”,它专门从原始智能体的历史中学习。由于它是通过成功与失败的混合数据进行训练的,它学会了复制优秀的环节并规避糟糕的部分,从而有效地成为了原始智能体的一个稍聪明一点的版本。

一旦挑战者准备就绪,两个智能体就会进行一场面对面的对决。它们被置于相同的起始情境中,并通过它们累积的总奖励来衡量表现。如果挑战者持续获得比原始智能体更高的分数,系统就会将其标记为一个“最优性缺陷”(optimality bug)。这种方法解决了一个测试中的重大问题:它不需要预先知道理论上的最佳解决方案。如果挑战者能够找到完成任务的更好方法,就证明了原始智能体并未做到最好。研究人员在五种不同的环境中测试了这种方法,范围从平衡小车上的杆到控制模拟跳跃机器人。他们发现,挑战者智能体(特别是使用一种称为 BCQ 的特定学习方法进行训练的智能体)在发现这些隐藏的低效问题方面非常有效。平均而言,该系统在每个环境中发现了超过 2,500 个最优性问题,发现的问题显著多于现有的测试方法。

这一发现的价值不仅在于发现错误,更在于它提供了一条改进的清晰路径。研究人员证明,由挑战者识别出的优越策略可以用于微调原始智能体,使其既更高效又更鲁棒。在若干案例中,这个过程不仅提高了智能体的得分,还完全消除了安全故障,将一个仅仅是“安全”的系统转变为一个既“安全”又“最优”的系统。这项研究证实,在安全性测试期间收集的数据(通常被视为副产品)实际上是构建更好智能体的关键资源。通过将测试过程转化为学习机会,Delta 提供了一种切实可行的方法,以确保未来的智能系统不仅可靠,而且在其设计的任务中真正表现卓越。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →