← 最新论文
💬 NLP

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

本文通过区分具有可变且任务失配的采样概率的“D型模型”与具有稳定且任务对齐的概率的“E型模型”,识别了大语言模型中一个根本性的多样性-稳定性权衡,为优化网络规模应用中的模型选择提供了关键见解。

原作者: Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在要求一群 AI 助手玩一场“猜数字”的游戏。你给出了一个特定的规则:“在 1 到 4 之间挑选数字,但要确保你大约 70% 的时间选择数字 '2',而其他数字(1、3 和 4)各占大约 10%。”

这篇论文研究了不同的大型语言模型(LLMs)是如何处理这个游戏的。研究人员发现这些模型分为两种截然不同的性格类型,他们称之为 D-ModelE-Model

以下是他们的研究发现,使用了简单的类比:

1. 两种人格

“果断型”模型 (D-Model)

  • 示例: Qwen-2.5, Llama-3.1。
  • 类比: 想象一位观点非常强烈的严厉主厨。当被要求做一份沙拉时,这位主厨决定:“在第一个 99% 的碗里,我将只使用生菜,也许稍后会加一点点番茄。”
  • 运作方式: 每次他们选择一个词(或数字)时,都表现得极其自信。他们几乎总是以接近 100% 的确定性选择某一个特定选项,忽略其他选项。
  • 结果: 尽管他们在每一步都表现得非常自信,但他们有时难以匹配你给出的整体规则(比如那个 70% 的规则)。他们是“确定性的”,意味着他们坚持一种僵化的计划。

“探索型”模型 (E-Model)

  • 示例: Mistral-Small, GPT-4o。
  • 类比: 想象一位好奇的花匠。当被要求播种时,他们会观察土壤并思考:“好吧,我会主要种植郁金香,但我也会从一开始就撒入一些雏菊和玫瑰,以符合花园的规划。”
  • 运作方式: 这些模型更加灵活。当他们选择一个词时,他们会使不同选项的概率更接近你给出的规则。他们不会立即锁定一个选择;他们会更多地“探索”各种选项。
  • 结果: 他们的每一步选择能更好地符合你设定的规则。他们在遵循指令方面更加“稳定”。

2. 核心权衡:多样性 vs. 可靠性

研究发现,这两种类型都不是完美的;它们之间存在权衡,就像在选择走钢丝的人爵士乐手之间做抉择。

  • D-Models(走钢丝的人):

    • 擅长: 需要单一、稳固且正确答案的任务,例如编写代码或解决数学问题。因为他们如此果断,所以可以反复精炼解决方案而不会产生混乱。
    • 不擅长: 需要从一个列表(如选项列表)中进行选择的任务(例如推荐电影)。因为他们如此僵化,他们可能会自信地选择一个甚至不在你列表中的电影,从而忽略了约束条件。
  • E-Models(爵士乐手):

    • 擅长: 需要遵循候选名单或平衡不同需求的任务,例如搜索结果或推荐系统。他们能更好地遵循你提供的“菜单”。
    • 不擅长: 有时他们可能过于“灵活”。在编程任务中,他们不断的“探索”可能会导致他们过度修改代码,从而在原本使用简单、僵化方法就能奏效的地方引入错误。

3. 机器内部发生了什么?

研究人员通过“拆解内部结构”来观察为什么这些模型的行为会有所不同:

  • 温度控制 (Temperature Control): 将“温度”想象成一个控制随机性的音量旋钮。

    • E-Models 就像一个灵敏的麦克风;转动旋钮会显著改变它们的行为。你可以轻松地让它们变得更随机或更严格。
    • D-Models 就像一块沉重的石头;转动旋钮几乎不会改变它们。无论你如何调整设置,它们始终保持极高的自信度和僵化感。
  • “配额”谬误: 研究人员想知道 D-Models 是否在暗中记着账本(例如:“我已经选了太多次 '2' 了,所以下次我应该选 '1' 来平衡一下”)。他们进行了测试,发现没有任何证据表明存在这种情况。D-Models 并不是在平衡账本,它们只是在遵循一条僵化的、预先计划好的路径。

总结

该论文得出结论,当你使用 AI 时,你需要知道你面对的是哪种“人格”:

  • 如果你需要可靠性和对列表的严格遵守(例如从产品菜单中挑选产品),请选择 E-Model
  • 如果你需要强大的、一致的推理能力来处理复杂的任务(如编程),那么 D-Model 可能会更好,即使它缺乏灵活性。

目标并不是要说哪一个“更好”,而是要理解它们在遵循概率规则方面具有不同的优势和劣势。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →