Learning From How Humans Correct
本文提出了一种新颖的“在纠错中学习”方法,该方法利用人类纠错反馈来重新标记噪声数据并增强深度学习模型,使一个工业文本分类数据集的测试准确率从 91.7% 提升至 92.5%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人读心术,但你不是通过大脑,而是通过喂给它一个海量的文本库。这就是自然语言处理(NLP)的世界,计算机试图理解人类语言。长期以来,让这些机器人变得聪明的“秘诀”一直是“深度学习”,这是一种让计算机通过观察数百万个示例来学习的方法,有点像孩子通过看成千上万张猫的照片来学会识别猫。最近,一个名为 BERT 的超级模型出现了,它就像一个超级读者,在你提问之前,它几乎已经读完了整个互联网。但问题在于:即使是超级读者也会犯错,而且有时它们读的书(我们提供给它们的数据)会有拼写错误或错误的标签。如果机器人因为人类的一个失误而被教导将“狗”识别为“猫”,那么机器人就会一直认为狗是猫。科学家们正在问的一个大问题是:我们能否教会机器人不仅是阅读,还要像人类在有人指出错误时那样,从自己的错误中学习?
这篇题为《向人类如何纠错学习》(Learning From How Humans Correct)的论文提出了一种巧妙的方法,旨在教计算机模型模仿人类自我纠正的习惯。作者在处理一个工业应用的真实世界文本分类问题时注意到,他们的人工标注数据中包含“噪声”样本——即原始的人类标签很可能是错误的情况。他们没有简单地丢弃这些坏样本,也没有盲目信任计算机,而是创建了一个五步训练循环。首先,他们在一个包含 200 万个条目的海量数据集上训练了一个模型(我们称之为“模型 A”)。然后,他们利用模型 A 扫描了整个数据集,找出了 30 万个计算机的猜测与人类原始标签不符的条目。这些条目被标记为“噪声”麻烦制造者。
这就是奇迹发生的地方:人类回到这些有争议的 30 万个条目前,进行了人工重新标注。但他们不仅仅是更改了标签;他们还记录了在人类修正之前,计算机认为的标签是什么。这创造了一种特殊的训练数据,其中包含了两种信息:“之前”(计算机错误的猜测)和“之后”(人类正确的标签)。随后,他们利用这种双重信息训练了一个更聪明的模型(模型 C)。目标是教模型 C 不仅仅是进行文本分类,还要学习“纠正”计算机先前错误的特定技能。
结果表明,这种方法是有效的。当他们测试这些模型时,原始模型(模型 A)答对了 83.3% 的测试题。在人类修复了噪声数据并重新训练了一个标准模型(模型 B)后,准确率跃升至 91.7%。但真正的明星是模型 C,即那个学习了纠错过程的模型,它在测试集上达到了 92.5% 的准确率。更令人印象深刻的是,当人类对 5,000 个真实世界条目的结果进行评估时,模型 C 获得了 97.7% 的认可率。该论文认为,这种方法对于工业界是实用的,因为它不需要庞大的新标注团队;相反,它专注于修复计算机与人类产生分歧的具体数据点,有效地将计算机的错误转化为学习机会。作者表示,虽然这是一个稳健的进步,但仍有增长空间,例如可以专注于计算机在两个答案之间犹豫不决的情况,但就目前而言,他们已经证明了教机器从自身的纠错中学习是一条通往更智能 AI 的可行路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。