想象一下你正在玩一种叫做“禁忌语”(Taboo)的派对游戏。你手里有一张卡片,顶端是一个秘密词汇(比如“披萨”),下面是一组你不能说的五个词(比如“奶酪”、“意大利”、“面团”、“切片”或“外送”)。你的目标是向你的朋友描述“披萨”,以便他们猜出答案,同时不能使用那些被禁止的词。
这篇论文就像是一个科学实验,研究人员教了两个不同的 AI“玩家”如何玩这个游戏。他们想看看:
- AI 能否遵守规则(不说出那些禁忌词)?
- AI 是否仍能很好地描述这个词,以便让别人猜出来?
- AI 与人类玩家相比表现如何?
以下是他们所做的工作以及他们的发现,我使用了简单的比喻来进行说明。
三种试图阻止 AI 作弊的方法
研究人员尝试了三种不同的方法来强迫 AI 遵守规则,这有点像三种阻止孩子在晚饭前吃饼干的方法:
“礼貌请求”法(提示词工程/Prompting):
他们只是告诉 AI:“请描述这个词,但不要使用这些特定的词。”这就像告诉一个孩子:“请不要吃饼干。”
- 结果: AI 听话程度还可以,但有时还是会失误,使用了一个禁忌词或者听起来非常相似的词(比如当“奶酪”被禁止时,它说了“芝士味的”)。
“数字手铐”法(约束生成/Constrained Generation):
他们编写程序,让 AI 在试图输入任何禁忌字母或单词的瞬间,系统就会物理性地拦截它。这就像给饼干罐加了一把锁,让孩子从物理上无法打开它。
- 结果: 这几乎完美地奏效了。AI 从未说过那些禁忌词。然而,由于它太害怕违反规则,它有时会变得过于笼统,导致猜谜的人很难猜出答案。
“脑部手术”法(SAEs/内部操控):
这是最复杂的一种。他们不是拦截单词,而是尝试调整 AI 的内部“想法”(其神经网络),使其在思考时,禁忌词的概念从它的脑海中消失。这就像试图说服那个孩子:“其实现在根本不存在饼干,”这样他们就不会去想它了。
- 结果: 结果好坏参半。AI 仍然会说出一些禁忌词(“手术”并不完美),但它给出的描述实际上非常有创意且易于猜测!看来当你仅仅是屏蔽单词时,AI 会变得笨拙;但当你调整它的“大脑”时,它会找到巧妙的替代方案。
大惊喜:AI 极其不擅长“猜词”
研究人员还反转了游戏。他们让 AI 根据人类或其他 AI 写的描述来猜词。
- 人类优势: 当人类玩游戏时,他们非常擅长猜词。他们看到“它是圆的、红色的,你可以把它放在意面上”这样的描述,会立刻想到“西红柿!”
- AI 的挣扎: AI 的表现却令人惊讶地糟糕。即使面对完美的描述,AI 也经常猜不出词。这就像有一个学生,虽然能完美背诵教科书,但在别人讲故事时却完全无法理解。
- 论文指出,AI 需要进行 5 到 10 次猜测,才能达到人类在第一次尝试就能猜中的水平。
核心结论
论文总结道,对于 AI 来说,遵守规则和成为优秀的沟通者是两种经常相互冲突的不同技能。
- 如果你强迫 AI 严格遵守规则,它就会变成一个乏味、含糊的描述者。
- 如果你让它发挥创意,它可能会不小心违反规则。
- 而且,无论它多擅长描述,它在“猜词”这一部分仍然非常糟糕。
研究人员认为,这是因为人类的大脑中有一种特殊的、直觉性的连接方式(类似于一种联想网络),而目前的 AI 模型还没有具备这种能力。AI 可以遵循指令,但它尚未完全学会玩好“禁忌语”所需的“人类直觉”。
技术摘要:“别说出来!”:语言模型进行“禁忌语”游戏时的约束、合规与沟通
1. 问题陈述
禁忌语(Taboo) 游戏要求玩家在不使用一组特定的禁用词的情况下描述一个目标词,依靠语义关联让猜词者识别出目标。这项任务对大语言模型(LLM)提出了独特的挑战,因为它要求同时满足两个相互竞争的目标:
- 严格的词汇约束: 模型必须抑制具有词汇和概念显著性的词汇(禁用列表)及其形态变体。
- 沟通有效性: 模型必须生成足够丰富的信息,以激发人类或机器猜词者对目标概念的联想。
目前的基准测试通常孤立地测试指令遵循能力。本文研究了 LLM 是否能在需要“约束下的词汇落地(lexical grounding under constraint)”的场景中,权衡规则合规性与沟通效用。作者特别质疑:在约束条件下生成的描述是否足够详细且有用,以及模型的采用策略是否与人类在游戏中的认知过程一致。
2. 研究方法
2.1. 数据与模型
- 数据集: 本研究使用了从实体版面手动转录的 194 张意大利语禁忌语卡片。每张卡片包含一个目标词和五个禁用词。
- 模型: 评估了两个开源权重模型:
- google/gemma-3-4b-it: 一款轻量级指令微调模型,因其通用性能以及与预训练稀疏自编码器(SAEs)的兼容性(用于可解释性实验)而被选中。
- openai/gpt-oss-20b: 一款通过思维链(CoT)强化学习进行后训练的混合专家(MoE)推理模型。研究通过对比有无显式推理的情况,来评估思考过程对约束遵循的作用。
2.2. 实验条件(干预层级)
作者研究了三种不同的干预层级来强制执行约束:
- 提示词(指令层级): 通过用户提示词指示模型避免使用目标词和禁用列表(包括形态派生词)。提示词明确要求生成 30 字以内的描述,且不含周围文本。
- 生成时约束(解码层级):
- 先验词干审查(A Priori Stems Censorship): 在生成前,基于禁用词的词干计算出一组静态的禁用 Token 集。在每个解码步骤中,这些 Token 的 Logits 被掩码为 −∞。
- 推理时约束生成(Inference-Time Constrained Generation): 一种动态方法,模型自由生成,直到检测到匹配禁用词词干的完整单词。随后,生成过程会回溯到冲突单词的起始处,该位置被加入持久的位置级掩码,并带着被抑制的 Token 继续生成。
- 模型操控(表示层级):
- SAE 转向(SAE Steering): 利用稀疏自编码器(SAEs),作者识别了模型残差流(第 29 层)中与每个禁用词关联最强的特征。在生成过程中,应用激活范数缩放干预,使残差流远离这些特征方向,从而在不修改模型权重或在提示词中明确提及禁用词的情况下,抑制底层的概念。
2.3. 评估指标
- 合规性:
- 准确率: 无违规输出(包括逐字违规或形态违规)的百分比。
- 违规类型: 逐字违规、形态违规以及“目标泄露”(意外使用目标词)的占比。
- 无 : GPT 模型中推理预算耗尽的速率。
- 沟通有效性:
- LLM 作为评判者(LLM-as-a-Judge): 两个模型(Gemma 和 GPT)充当评判者,阅读描述并猜测目标。有效性通过 Pass@k(目标的第一个 Token 是否在预测的前 k 个中)和 原始 Token 似然度 来衡量。
- 人类评估: 8 名标注者参与了两个阶段:
- 猜词: 标注者根据模型生成的描述猜测目标。
- 描述:* 标注者在“自发式”(口语风格)和“刻意式”(书面风格)条件下生成描述,作为模型表现的基准。
3. 关键结果
3.1. 约束合规性
- 提示词: 相比于无约束的基准,提示词显著提高了合规性。Gemma-3-4b-it 的准确率达到 91.2%;带有推理能力的 GPT-oss-20b 达到了 97.4%。推理有助于 GPT 抑制逐字违规,但在应对形态变体方面效果较弱。
- 约束生成: 实现了近乎完美的合规。Gemma-3-4b-it 的准确率分别为 98.5%(先验)和 96.4%(在线)。GPT-oss-20b 带有推理时为 92.3%(先验),但在线生成时降至 87.1%,且目标词泄露率更高。
- SAE 转向: 在合规性方面表现较差(55.7%),显著低于提示词和约束生成。这表明仅靠表示层级的转向无法可靠地强制执行表层词汇约束。
3.2. 沟通有效性(信息量)
- 权衡: 约束实施的方法塑造了描述的质量。
- 提示词 倾向于产生过于谨慎、信息贫乏的描述。
- 约束生成 迫使模型转向更具语义精确性的释义,导致其在评判者的 Pass@10 得分高于提示词。
- SAE 转向 展示了惊人的脱节现象:尽管合规性低,但它产生的描述具有竞争性的信息量(Pass@10 高达 21.1%),这表明阻断表层 Token 会带来描述成本,而表示层级的干预则可以规避这一成本。
- 评判者敏感度: 两个评判模型表现出显著差异。GPT-oss-20b 在大多数条件下对目标分配的概率接近于零,而 Gemma-3-4b-it 则更为宽容,尽管两者在方法的相对排序上达成了一致。
3.3. 模型 vs. 人类表现
- 猜词的不对称性: 模型作为猜词者时表现明显逊于人类。
- 人类标注者从模型描述中猜中目标的准确率为 30.77%。
- 模型评判者(即使是 Gemma-3-4b-it)需要 5 到 10 次尝试(Pass@5 到 Pass@10)才能接近人类在处理人类编写的描述时仅需 1 次尝试(Pass@1)所达到的准确度。
- 作为评判者的 GPT-oss-20b 在几乎所有情况下都对正确目标分配了接近零的概率。
- 描述的不对称性:
- 对于模型,推理(CoT)显著提高了合规性(GPT 为 72.2% vs 97.4%)。
- 对于人类,自发式口语描述产生的猜词准确率(95%)高于刻意式书面描述(85%),这可能是由于口语交流中存在实时的、交互式的精炼过程,而静态文本生成缺乏这种特性。
4. 贡献与意义
核心贡献
- 多层级约束框架: 本文系统地比较了跨越三个层级的生成过程中的约束实施策略:提示词、解码时掩码以及内部表示操纵(SAEs)。
- 双向人机评估: 不同于以往依赖自动指标的研究,本工作通过角色互换将评估落实到实际游戏场景中:人类猜模型的描述,模型猜人类的描述。
- 特征化权衡: 研究表明,规则合规性与沟通有效性并非独立可控。实施约束的机制(指令 vs. 解码 vs. 表示)从根本上改变了输出的性质,在安全性(避免禁用词)与实用性(唤起目标)之间创造了截然不同的权衡。
意义与主张
作者声称,约束下的词汇落地仍是当前语言模型面临的开放性挑战。
- “猜词差距”: 模型无法像人类一样高效地从间接描述中猜出目标,这表明 LLM 缺乏人类那种直觉性的、由显著词汇关联构成的网络。作者认为,这指向了人类使用的快速、联想式的“系统 1”处理过程与模型使用的刻意、“系统 2”推理过程之间的差异。
- 局限性: 作者谦虚地指出,目前的基准测试仅限意大利语,共享评估集规模较小(10 个词),且 SAE 转向仅在一种架构上进行了测试。他们还强调,本研究是在单轮对话设置下进行的,而原始游戏本质上是交互式的。
- 未来方向: 本文认为,像“禁忌语”这样的游戏构成了一个天然且尚未被充分探索的测试场,专门用于探测语言模型的语用适应能力以及在多轮、多智能体配置下的协作落地能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。