DTO: a Differentiable Training Objective for Effective Counterfactual Story Rewriting
本文提出了一种新颖的可微训练目标(DTO),该目标利用端到端反向传播损失联合优化参考保真度与语义一致性,有效解决了反事实故事改写中局部修改的挑战,并优于传统基线方法和强化学习方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个关于名叫朱莉的角色在足球比赛中打入制胜一球的故事。现在,想象有人说:“如果朱莉根本没上场呢?如果她只是在看台上观看呢?”
你的任务是重写故事的结局以匹配这个新的“如果”情景。但棘手之处在于:你只需要更改受朱莉观赛影响的部分,同时保持其他所有内容(其他球员、比分、兴奋感)完全不变。如果你改动太多,故事会显得支离破碎;如果你改动太少,故事在新的规则下就讲不通了。
这篇论文旨在教导计算机完美地完成这项“故事编辑”工作。
问题:计算机过于笨拙
作者解释说,大型计算机大脑(称为大型语言模型)非常擅长创作故事,但在处理这种特定的“编辑”任务时却力不从心。
- “复制 - 粘贴”问题:如果你只是告诉计算机尽可能多地复制原始故事,它只会照搬朱莉进球的原始结局。它不会意识到需要做出任何更改。
- “过度编辑”问题:如果你试图通过复杂的试错方法(如强化学习)强迫计算机修改故事,它往往会感到困惑并更改得太多,从而毁掉整个故事。
这就像试图修复画作上的微小划痕,要么完全无视它,要么重绘整个画布。
解决方案:“软”训练目标(DTO)
作者提出了一种教导计算机的新方法,称为DTO(可微训练目标)。
将训练计算机想象成为学生备考。
- 旧方法(最大似然):老师说:“你的目标是逐字匹配答案键。”学生试图死记硬背确切的单词。如果答案键写着“猫坐着”,而学生写的是“猫科动物坐着”,即使意思相同,他们也会被扣分。
- 新方法(DTO):老师说:“你的目标是确保你的故事听起来像我们想要的编辑后版本,但同时听起来与我们不想要的原始版本非常不同。”
为了实现这一点,作者使用了一种名为BARTScore的特殊工具。想象 BARTScore 是一位非常聪明、速度极快的编辑,它可以阅读两个故事并告诉你:“这两个故事有多相似?”
这篇论文的魔法在于使这位“编辑”可微。
- 类比:通常,当计算机写故事时,它一次只选择一个特定的词(比如“猫”)。这就像一个电灯开关:要么是开,要么是关。你无法平滑地将电灯开关调整到“半开”状态。
- 创新:作者教导计算机使用“软”单词来写作。计算机不再只选择“猫”,而是输出一个“可能性云”(50%“猫”,30%“猫科动物”,20%“小猫”)。这个“云”是平滑且可调整的。
- 结果:由于输出是平滑的,计算机可以查看“编辑”的反馈(BARTScore),并轻轻推动其“云”以获得更好的分数。这就像雕塑家用手 smoothing 黏土,而不是用锤子敲凿岩石。
他们的发现
作者在名为TIMETRAVEL的 28,000 个故事的数据集上测试了这种新方法。
- 优于基础方法:他们的新方法击败了标准的“复制 - 粘贴”训练方法。它编写的故事更接近人工编辑的版本,并且更好地保持了原始故事的流畅性。
- 优于复杂方法:它也击败了其他试图通过猜测和检查来学习的先进方法(如 CPO),但速度更快且更稳定。
- 小模型,大成果:他们使用了一个相对较小的计算机模型(约 4 亿参数)。尽管像 GPT-4o 这样的大型模型要大 100 到 500 倍,但这个经过巧妙训练的小模型在此特定任务上的表现与大型模型一样好,甚至更好。
结论
这篇论文证明,你并不总是需要一台巨大且昂贵的计算机来执行复杂的任务。如果你给一台较小的计算机配备一位更好的“老师”(一种直接奖励你所需要的特定类型编辑的训练目标),它就能学会以人类编辑的精确度重写故事,在保持故事连贯性的同时做出恰到好处的更改。
简而言之:他们找到了一种方法,教导计算机成为精确的编辑者,而不仅仅是生成器,使用了一种平滑且对数学友好的方法,避免了旧技术的猜测过程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。