In-Context Fixation: When Demonstrated Labels Override Semantics in Few-Shot Classification
本文揭示,上下文学习模型在机制上被限制为将演示令牌视为完备词汇表,导致当标签槽位被同质化甚至语义有效的令牌填充时准确率崩溃,而这一现象局限于特定神经回路,它们以格式驱动的令牌检索取代了语义理解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但略显死板的机器人玩猜谜游戏。你给它展示几个游戏运作的示例(演示),然后让它对新情况做出猜测。这被称为“上下文学习”。
通常,我们认为机器人是从你的示例中学习了游戏的规则。但这篇论文发现了一个奇怪的漏洞:机器人实际上并没有学习规则;它只是在复制你给它的答案列表。
以下是研究人员发现的要点,使用简单的类比进行说明:
1. “答案列表”陷阱
想象你正在向机器人展示如何识别动物。
- 正常情况: 你给它看 4 张狗的照片和 4 张猫的照片。它学会了:“哦,答案通常是‘狗’或‘猫’。”
- 漏洞(同质标签): 你给它看 8 张猫的照片,并告诉它所有答案都是“猫”。然后你给它看一张狗的照片,问:“这是什么?”
- 你的预期: 机器人看到狗,会说:“那是狗。”
- 实际发生: 机器人看着你给出的 8 个“猫”的答案列表,决定“猫”是游戏中唯一允许的单词,于是它仍然回答“猫”——尽管这是错的。
研究人员发现,如果你给机器人一个全是相同答案的列表,它的准确率会暴跌至接近零(有时甚至低于 12%)。它不再思考图片内容,而是开始想:“我必须从你刚给我的列表中选择一个词。”
2. “无意义词汇”实验
为了证明机器人并非仅仅被“猫”这个词搞糊涂了,研究人员尝试了更奇怪的方法。他们给机器人展示了答案是无意义词汇(如"foo"、"bar"、"vex"、"nit"和"orb")的示例。
- 设置: 他们向机器人展示了 8 个包含这些无意义词汇的示例。然后,他们给它看一张真实的狗的照片,并要求给出答案。
- 结果: 尽管"foo"和"bar"对于狗来说毫无意义,机器人拒绝说“狗”。相反,它有 42% 到 67% 的概率从你给出的列表中选择一个无意义词汇。
- 教训: 机器人将你给出的词汇列表视为一个封闭菜单。如果“狗”不在你提供的菜单上,机器人宁愿挨饿也不要点单外的菜。无论菜单上的项目是否无意义,机器人都会从中抓取一个。
3. “双重思考”机制(内部运作原理)
研究人员通过一种称为“机制可解释性”的技术查看了机器人的“大脑”,以观察这是如何发生的。他们发现了一个两步过程,称为“先编码后覆盖”。
这就像一位作家在起草故事:
- 第一步(聪明部分): 机器人的底层网络读取狗的照片,正确地认为:“这是一只狗。”它已经准备好了正确答案。
- 第二步(漏洞): 机器人的上层网络查看你给出的示例列表。它们看到列表上写着“猫”(或"foo")。于是它们决定:“不,这次对话的规则规定我们只能使用列表中的词。”
- 覆盖: 上层网络抹去了正确答案(“狗”),并强制机器人输出列表中的一个词。
这就像一个学生知道数学题是 2+2=4,但老师说:“在这个班里,我们只使用 5、6 和 7 这几个数字。”学生知道真相,但“课堂规则”(示例)迫使他们写下"5"而不是正确答案。
4. 即使是大机器人也会发生
你可能会想:“也许这只会发生在又小又笨的机器人身上。”研究人员在从小型到大型(高达 80 亿参数)的模型上测试了这一点。
- 发现: 这个漏洞发生在所有模型上。即使是测试组中最聪明的机器人也掉进了这个陷阱。事实上,更大的机器人有时掉进陷阱的程度更严重,当示例具有误导性时,准确率会从 86% 暴跌至 0%。
5. “最后一个词”规则
研究人员还发现了一个关于机器人何时倾听的奇怪特性。
- 如果你给它 7 个“猫”的示例,并在最后放 1 个“狗”的示例,机器人会忽略前 7 个,只听从最后一个。
- 如果你把“狗”的示例放在开头,机器人会完全忽略它。
- 类比: 机器人的注意力非常短暂。它只关心它最近看到的答案列表,并将该列表视为当前问题的绝对法则。
总结
该论文得出结论:这些 AI 模型并不总是“学习”任务的概念。相反,它们通常只是检索你给它们的答案列表,并从中选择,而忽略了问题的实际含义。如果你给它们一个无意义的列表,它们就会用无意义的内容回答。如果你给它们一个全是“猫”的列表,它们就会把狗称为“猫”。
为什么这很重要(根据论文):
如果你使用这些模型来处理诸如分类电子邮件或基于数据库回答问题等任务,而你调取的示例碰巧都具有相同的标签(即使是偶然),模型就会停止思考,直接复制该标签,从而导致巨大的错误。解决方法是?确保你展示给机器人的示例是多样化的,并且也许在列表的末尾放一个正确的示例,以“重置”它的大脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。