Learning What to Fail On: Failure-Mode Contextual Bandits for Adversarial Data Curation
本文介绍了一种故障感知型对抗性检索增强框架,该框架将数据策展视为一个上下文多臂老虎机问题,以自适应地选择并针对特定的模型故障模式进行重训练,从而在无需额外人工标注的情况下,显著提升了在多个基准测试中的自然语言理解鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,计算机在阅读和理解人类语言方面正变得异常出色。它们可以回答问题、总结故事,甚至可以检查一个事实陈述是否真实。然而,这些系统通常有一个隐藏的弱点:它们是脆弱的。就像一个孩子仅通过毛色来识别狗一样,人工智能可能会通过捕捉特定的词汇来学习解决问题,而不是理解实际的含义。如果你改变那个词或稍微扭转句子的结构,计算机就会彻底失败,即便意思并没有改变。这种脆弱性是构建可靠技术的一大障碍。研究人员长期以来一直试图通过向计算机输入更多示例来解决这个问题,但仅仅增加数据往往只会强化同样的坏习惯。真正的挑战不仅在于寻找更多的数据,而在于寻找能教导计算机进行更深层思考的特定类型的错误。
本·古里安大学的一个研究小组开发了一种新方法,通过完全关注系统的失败来教导这些系统。该方法不是尝试生成成千上万个随机示例并寄希望于其中一些是有用的,而是像一个智能过滤器一样,学习如何针对失败进行学习。他们创建了一个系统,该系统首先生成旨在欺骗计算机模型的困难句子。当模型在这些句子上出错时,系统并不会简单地将它们丢弃或全部保留。相反,它会将这些错误归类,例如由混淆否定引起的错误、混淆名称引起的错误,或忽略逻辑矛盾引起的错误。随后,系统使用一种学习策略来决定哪些错误类别最值得研究。它将选择这些错误的过程视为一场游戏,目标是挑选出能让玩家得分提高最多的动作,从而在学习新知识与承担遗忘已知知识的风险之间取得平衡。
这一过程始于一个已经经过语言理解训练的计算机模型。研究人员要求一个强大的语言生成器创建与真实示例相似但设计得具有迷惑性的新句子。这些新句子随后会被用来测试该模型。如果模型答对了,则将其丢弃;如果模型答错了,系统会通过一个由其他人工智能组成的评审团来检查答案,以确保这个错误是真实的,而不仅仅是一个小故障。一旦错误得到确认,它就会被归入特定的失败类型。例如,一组可能包含所有模型混淆“是”与“否”的错误,而另一组则可能包含模型未能注意到两个不同人物的错误。
核心创新在于系统如何选择下一步要研究的组别。它既不是随机选择,也没有使用固定的规则。相反,它使用一种学习策略来观察每个错误组的特征,例如错误组中的错误数量、模型的困惑程度,以及模型在过去学习类似错误时的进步程度。系统会选择这些组别的混合体来进行模型重训。重训之后,系统会检查模型是否在处理这些困难案例方面确实得到了进步,同时没有在处理简单案例时退步。这种反馈循环使得系统能够学习哪些类型的失败对于修复是最有价值的。这是一个自我改进的循环,即数据策展人(负责挑选示例的部分)成为了学习者,不断调整其策略以寻找最具影响力的教训。
当研究人员将这种方法应用于标准的语言理解任务时,结果非常显著。他们最初使用的模型已经相当出色,在名为 SNLI 的测试中得分约为 88%。在应用了这种方法(涉及生成并仔细筛选特定的失败示例)后,模型的得分上升到了 92% 以上。在其他困难测试中,提升更为剧烈,其中一个基准测试从大约 54% 跳升至接近 72%。这些收益是在没有任何人类专家编写新示例或标注新数据的情况下实现的。系统自行生成了示例,自动验证了它们,并学习了哪些示例值得使用。研究人员还展示了这种方法适用于不同类型的任务,例如事实核查,在这些任务中,它帮助一个大型模型达到了超过 82% 的准确率。
这项研究明确反对“仅仅生成海量合成数据是提高人工智能最佳途径”的观点。他们发现,即使是由强大的计算机生成的,无目标的数据往往会稀释学习过程,因为其中包含了太多容易或无关的示例。他们的方法证明了质量比数量更重要。通过专注于模型失败的具体方式并学习优先处理这些失败,系统变得更加稳健。研究人员还证明,该方法可以防止模型忘记已有的知识,这是在困难新数据上进行训练时的一个常见问题。他们通过在训练过程中将新的、困难的示例与原始的、简单的示例进行仔细混合,确保了在学习新技能与保留旧知识之间的平衡。
这项工作为使人工智能更加可靠开辟了一条新路径。与其依赖人类专家手动策划每一个困难示例,不如让系统学会识别自身的弱点,并寻求克服这些弱点所需的特定教训。研究人员发现,这种自适应方法比使用固定规则选择数据的静态方法更有效。虽然这项研究是在特定的语言任务上进行的,但这种通过学习失败模式来提升性能的底层原理可以应用于许多其他机器需要具备稳健性的领域。研究结果表明,通过让数据选择过程本身成为一个学习代理,我们可以构建出不仅更聪明,而且更具适应性且不易出现目前限制其用途之错误的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。