← 最新论文
💬 NLP

Do LLMs Adhere to Label Definitions? Examining Their Receptivity to External Label Definitions

该研究通过多组受控实验发现,尽管外部标签定义能提升大语言模型的准确率与可解释性,但其整合效果并不稳定,模型在通用任务中更倾向于依赖内部参数知识,而在特定领域任务中则更能受益于显式定义。

原作者: Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

发布于 2026-02-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在做一场**“大侦探游戏”,目的是搞清楚:当我们要教大语言模型(LLM,比如 ChatGPT 或 LLaMA)做任务时,如果我们给它一本“操作说明书”(标签定义)**,它到底会乖乖照着做,还是根本不听,只凭自己脑子里的“老经验”瞎猜?

研究人员把这个问题拆解成了几个有趣的场景,用生动的比喻来解释他们的发现:

1. 核心问题:是听指挥,还是凭直觉?

想象一下,你雇了一个超级聪明的厨师(大模型)

  • 内部知识:这个厨师在进你厨房前,已经看过全世界所有的食谱,脑子里有无数道菜的做法。
  • 外部定义(说明书):你给他一张纸条,上面写着:“今天我们要做的‘红烧肉’,定义是‘把肉煮成蓝色的’"。

实验发现:

  • 如果这道菜是家常菜(比如“红烧肉”),厨师可能会想:“等等,我脑子里的红烧肉明明是红色的,你让我做蓝色的?这不对劲。”于是,他要么无视你的纸条,按老规矩做;要么完全听你的,把肉煮蓝了(虽然很难吃)。
  • 如果这道菜是极冷门的专业菜(比如“某种特定的精神健康分类”),厨师脑子里根本没这道菜。这时候,你给他的说明书就是救命稻草,他会100% 照着做

2. 实验一:把说明书“打乱”会怎样?(排列组合测试)

研究人员玩了一个游戏:把“标签”和“定义”打乱配对。

  • 正常情况:标签叫“中立”,定义是“既不支持也不反对”。
  • 打乱情况:标签叫“中立”,定义却变成了“完全矛盾”。

结果像变魔术:

  • 通用任务(如判断一句话是否合理)中,模型经常**“装傻”**。哪怕你给它错误的定义,它有时候还是会按自己脑子里的正确逻辑去猜,因为它太自信了。
  • 但在专业领域(如仇恨言论检测),模型就像个**“听话的学生”**。你给它什么定义,它就信什么。如果你把定义写错了,它也会跟着错,因为它没有自己的“专业背景知识”来反驳你。

3. 实验二:说明书的质量重要吗?(正确 vs. 错误)

研究人员故意给了模型三种说明书:

  1. 完全错误的(比如把“矛盾”定义为“完全一致”)。
  2. 有点小错误的(定义模糊不清)。
  3. 完全正确的

有趣的发现:

  • 小模型(如 Phi-3, Mistral):它们像**“白纸”**。如果说明书错了,它们就跟着错;如果说明书对了,它们就突飞猛进。它们非常依赖你给的信息。
  • 大模型(如 GPT-4):它们像**“老教授”。如果你给的说明书太离谱,它甚至会拒绝回答**,说:“这定义不对,我不能乱猜。”这种“拒绝”其实是一种高级的智慧,说明它在检查逻辑冲突。

4. 最大的反转:解释得好,不代表做得对!

这是论文最让人惊讶的地方。

  • 研究人员发现,当给模型加上详细的“说明书”后,模型写出来的**“解题思路”(解释)变得非常漂亮、逻辑通顺,就像个“辩论冠军”**。
  • 但是,它最后选出来的**“答案”(分类结果)**却不一定是对的!

比喻:
这就好比一个**“嘴强王者”**。你问他:“为什么选 A?”他能引经据典、逻辑严密地给你解释一大通(解释质量高)。但当你让他真的把 A 圈出来时,他可能还是凭直觉选了 B(分类准确率没变)。
这说明:模型“会说话”和模型“会做事”是两码事。 外部定义能让它“说得更好听”,但不一定能让它“做对”。

5. 总结与建议:怎么用好大模型?

这篇论文给咱们普通人或开发者提了几个**“避坑指南”**:

  1. 看人下菜碟

    • 如果是日常闲聊或通用任务,别给太多复杂的定义,模型自己心里有数,给多了反而干扰它。
    • 如果是专业领域(如医疗、法律、心理),必须给清晰、准确的定义。这时候模型就像个空杯,你倒什么它就装什么。
  2. 小模型需要“手把手教”

    • 如果你用的是小一点的模型(为了省钱或跑在手机上),一定要把定义写得特别清楚,甚至要给它举几个例子(Few-shot),它才能听懂。
  3. 大模型会“挑刺”

    • 如果你用 GPT-4 这种大模型,发现它突然不回答你的问题了,别慌,可能是因为它发现你给的指令和常识冲突了,它在保护你不出错。
  4. 别被“漂亮的解释”骗了

    • 如果你看到模型解释得头头是道,别以为它一定做对了。在关键任务(如医疗诊断)中,要同时检查它的最终答案解释,因为这两者可能脱节。

一句话总结:
大语言模型既不是全知全能的上帝,也不是只会复读的机器。它们像是一个**“有主见但也会听劝的实习生”**:在熟悉的领域,它有自己的想法,不太听你的;在陌生的领域,它完全依赖你的指导。而我们的任务,就是学会在什么时候该“放手让它发挥”,什么时候该“手把手教它定义”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →