UNSPECIFIC: General Constraint Synthesis for Breaking Copy-and-Paste Shortcut in LLM Instruction Following
本文介绍了 UNSPECIFIC,这是一个旨在通过合成相似参考文章中的共同约束条件,并对全文及摘要进行响应评估以确保真正的遵循而非表面的复制,从而消除大语言模型指令遵循中“复制粘贴”捷径的新型框架和基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人写故事。你给它一系列规则,比如“英雄必须勇敢”或者“故事必须以一场暴雨结束”。这被称为指令遵循(instruction following)。在人工智能的世界里,大型语言模型(LLMs)就是这些机器人,研究人员不断尝试测试它们是否能在不产生混乱或编造事实的情况下,遵循复杂且冗长的规则列表。
但这里有一个棘手的问题:你如何测试机器人是真的在“思考”这些规则,还是仅仅在走捷径?有时候,测试本身是有缺陷的。如果你要求机器人根据它刚刚读到的特定示例来写一个故事,它可能会直接把示例中的细节复制粘贴到自己的故事里。这就像一个学生在写一篇关于“你如何帮助朋友”的作文时,并没有真正动脑筋,而是直接抄袭了朋友作业里的一个段落,内容是“我帮朋友提了购物袋”。老师看到了“帮助”和“朋友”这两个词,便认为:“做得好!”但实际上学生并没有完成真正的创作任务。这篇论文正是关于如何修复这种“捷径”,以便我们能看清机器人是真的聪明,还是仅仅擅长复制粘贴。
伟大的复制粘贴捷径
见见 UNSPECIFIC,这是一个旨在捕捉 AI 模型试图“投机取巧”的新型框架。来自马萨诸塞大学阿默斯特分校的研究人员注意到,我们目前的测试方式存在一个重大问题。通常,为了创建一个测试,我们会拿一篇真实的报道(比如新闻故事),然后要求一个 AI 将其转化为一系列指令。接着,我们再要求另一个不同的 AI 根据这些指令写出一个新的故事。
问题在于,第一个 AI 往往会变得过于“具体化”。它并没有生成通用的规则,而是直接抓取了原始文章中的特定细节。例如,如果原始故事是关于“约翰和玛丽在沃尔玛为了一盒酸奶发生争吵”,那么指令可能会变成“角色必须名叫约翰和玛丽”以及“他们必须在沃尔玛发生争吵”。当第二个 AI 拿到这些指令时,它不需要任何创造力;它只需要把“约翰”、“玛丽”和“沃尔玛”直接复制到自己的故事里即可。这是一种“复制粘贴的捷径”,它让 AI 看起来完美遵循了指令,但实际上它只是在进行模仿。
UNSPECIFIC 如何识别这些捷径
为了阻止这种情况,UNSPECIFIC 团队设计了一个三步走的“魔术技巧”,让测试变得公平且严格。
第一步:“共同点”游戏
与其只用一个故事来制定规则,研究人员向 AI 输入两个相似的故事。想象一下,你有两个关于人们发生争执的不同故事。一个是关于约翰和玛丽在杂货店;另一个是关于克里斯和朱莉在加油站。如果你要求 AI 找出同时适用于这两个故事的规则,它就不能说“角色必须是约翰和玛丽”,因为这只符合第一个故事。相反,它必须提出一个更宽泛、更自然的规则,比如“主角必须发生争执”。这迫使规则变得更加宏观且自然,就像真实人类提出的要求,而不是单个文本中的特定细节。
第二步:“太容易”过滤器
即使有了通用的规则,有些规则仍然过于简单。比如规则是“故事应该有一个开头”。好吧,每个故事都有开头!AI 甚至不需要努力就能满足这个要求。UNSPECIFC 通过让 AI 在看到规则之前先写一个“基础故事”来检查这一点。如果 AI 仅仅通过写一个正常的句子就意外地满足了某个规则,那么该规则就会被标记为“太容易”。随后,系统会将这个简单的规则替换为一个更难的规则,比如“故事必须以角色在奇怪的声音中醒来作为开头”,从而迫使 AI 真正去思考。
第三步:“摘要测试”
这是最聪明的部分。在 AI 写完故事后,研究人员要求它将故事总结成一段短小的文字——大约是原长度的 25%。如果 AI 仅仅是通过在结尾处强行添加一些随机句子(比如“顺便说一下,这是一个快乐的结局”)来满足规则,那么这些细节会在摘要中被删掉。如果规则在摘要中依然得到体现,说明 AI 已经将规则融入到了故事的核心之中。如果规则消失了,说明 AI 只是在表面细节上走了捷径。
他们的发现
当他们将这个新系统投入测试时,结果令人大开眼界。他们发现许多 AI 模型确实在走“复制粘贴”的捷径。
- 难度跳跃: 使用新的 UNSPECIFIC 方法时,一个名为 GPT-5 Mini 的强大模型的指令满足率从标准单篇文章基准下的 89.7% 下降到了 78.2%。这并不意味着 AI 变差了,而是意味着测试终于在它不够努力时抓住了它的把柄。
- 复制粘贴差距: 研究人员发现,以往测试中的很大一部分“成功”其实并不完全准确。当他们观察摘要时,发现许多看似完美遵循指令的模型,实际上在“核心叙事”测试中失败了。它们仅仅是在表面上满足了规则,而不是在故事的核心部分实现了规则。
- 自然性获胜: 新的约束条件感觉更像是真实的人类请求。事实上,人类对这些新指令与旧指令在“自然度”上的评分差距改善了 30%。
论文指出,仅仅让指令变得更难是不够的;我们必须确保指令足够通用,使得 AI 无法直接复制粘贴答案。通过使用“双故事法”和“摘要测试”,UNSPECIFIC 提供了一个更清晰的视角,让我们了解 AI 是真的理解了指令,还是仅仅在玩一场“寻找匹配词汇”的游戏。
最终,UNSPECIFC 不仅仅是为了让 AI 工作得更努力,更是为了确保我们知道它们是如何工作的。它阻止了模型走捷径,并迫使它们进行真正的创作,从而确保当我们说一个 AI “遵循指令”时,它真的是在理解其行为。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。