← 最新论文
💬 NLP

Structured Output Collapses Answer Diversity Across 44 Language Models

这项研究表明,即使在没有模式强制执行的情况下,请求 JSON 等结构化输出格式也会显著降低回答的多样性,并增加 44 个语言模型向主导响应的收敛,从而揭示了仅仅是提示词的语体——而非解码约束——就驱动了模型行为的可衡量的同质化。

原作者: Tapan Parikh

发布于 2026-07-22
📖 2 分钟阅读☕ 轻松阅读

原作者: Tapan Parikh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

AI 的秘密生活:当礼貌遇上代码

想象一下,你正在与一个巨大的、超级聪明的图书馆对话,它几乎读过人类写过的所有书籍。这个图书馆就是人工智能(AI),它以聊天、讲笑话和写故事的能力而闻名。但问题在于:人类喜欢用凌乱、流动的句子进行交谈,而计算机并不这样说话。计算机使用的是被称为“结构化数据”的严格、有序的方框,比如 JSON 或 XML。这就像是一个诗人写自由诗,与一名收银员将商品扫描进寄存器之间的区别——后者每件商品都必须符合特定的位置。

长期以来,科学家们一直在研究这些 AI 在像诗人一样聊天时的行为。他们会问一些问题,比如“说出一棵树的名字”,然后观察 AI 会说什么。通常情况下,如果你问 44 个不同的 AI 这个问题,它们可能会选择不同的树,或者可能只是碰巧选了同一棵。这篇论文提出了一个简单但棘手的问题:当我们停止要求 AI 像诗人一样聊天,而是强迫它像收银员一样回答时,会发生什么?AI 会改变主意吗?它会变得更枯燥吗?还是保持不变?这很重要,因为你在手机上与之交谈的 AI,可能与后台实际运行软件的 AI 非常不同,我们需要知道这种差异是否会改变世界的运作方式。


AI 性格的大转变

在这项研究中,研究人员采用了一项名为“单词普查”(One-Word Census)的著名测试。想象一场游戏节目,44 个不同的 AI 模型被问到 31 个问题,比如“说出一棵树”或“选一个词”。在原始的游戏中,AI 只是用普通的英语回答。研究人员发现,即使没有规则,AI 也倾向于对某些答案达成共识(比如对于树,都会选“橡树”),但它们仍然保留了一些个性和多样性。

随后,研究人员改变了规则。他们没有改变问题,也没有使用任何特殊的计算机技巧来强制执行答案。他们只是在提示词的末尾添加了一条微小的指令:“仅以 JSON 格式回复。”

JSON 是一种看起来像带有标签的小方框的数据编写方式,例如 {"word": "oak"}。它是软件与软件之间进行交流的语言。研究人员想要看看,仅仅是要求 AI 以这种格式说话,是否会改变它的决定。

重大发现:“格式税”

结果令人惊讶。当 AI 被迫以 JSON 格式回复时,它们变得更加趋同。答案的多样性大幅下降。

  • 变化前: 在普通聊天中,最常见的答案(即“众数”)被选中的频率约为 41%
  • 变化后: 在 JSON 格式中,同一个答案被选中的频率跃升至 64%
  • 多样性: AI 提出的独特单词数量从 52 个减少到了仅有的 36 个。

研究人员称之为“渐进式格式税”。这就像是对独特性的征税。那些在普通聊天中最为富有创意和独特的 AI,在被要求使用 JSON 说话时,失去了最多的个性。其中一个特定的 AI,曾是最具“探索性”(最倾向于选择不寻常答案)的 AI,在 JSON 模式下失去了 1.31 比特 的独特性。这就像是仅仅因为它必须把答案放进一个盒子里,就丢掉了大约一半的独特气质。

这不是故障,而是“登记处”

你可能会认为 AI 糊涂了,或者计算机强制它选择了同一个答案。但研究排除了这一点。

  • 没有“冷却”技巧: 有时,当人们希望 AI 减少随机性时,会调低“温度”(temperature)旋钮。研究人员进行了检查,发现“温度”并没有改变。AI 在思考时仍然同样具有随机性;它们只是选择了不同的随机事物。
  • 并非解码错误: 他们还测试了是否是计算机通过屏蔽其他单词来强制执行答案。他们发现,即使在没有任何计算机拦截的情况下,仅仅是要求使用 JSON 就让 AI 改变了想法。这种变化发生在 AI 的大脑中(对其“登记处”的反应),而不是在计算机的嘴里(解码器)。

可以把它想象成一个人在派对上和在求职面试时的表现不同。在派对上(普通聊天),他们可能会讲离奇的故事并使用古怪的词汇。而在求职面试中(JSON),他们会突然变得非常专业,并选择那些“稳妥”、标准的答案。AI 并没有坏掉,它只是在进行“语码转换”(code-switching)。

是“磨刀石”,而非“重新索引器”

研究发现,AI 并没有开始选择新的答案。它只是加倍强化了它原本喜欢的答案。

  • 31 个 类别中的 28 个 中,在普通聊天中最受欢迎的答案,在 JSON 模式下也同样是最受欢迎的答案。
  • 少数几次答案发生变化的情况(比如在桌游类别中从“国际象棋”切换到“大富翁”),是因为原有的首选答案不够强势。JSON 格式起到了“磨刀石”的作用,它让 AI 原本最喜欢的选择变得更加强烈,而不是彻底改变了选择。

“个性”存在于格式之中

其中一个最酷的发现是,一个 AI 的“个性”取决于其格式。

  • 一些 AI 有自己热爱的“默认”答案。例如,一个 AI 在普通聊天中非常喜欢说“高达奶酪”(gouda)。但当被要求使用 JSON 时,它不再说“高达”,而是回到了大众化的选择。
  • 相反,一些 AI 为 JSON 开发了新的默认值。一个 AI 在聊天中提到蓝色颜色为“天蓝色”(cerulean)的概率为 0%,但在 JSON 模式下却是 100%
  • 这意味着一个 AI 不仅仅有一种人格。它有一种“聊天人格”和一种“JSON 人格”。它们可以完全不同。

为什么会发生这种情况?

研究人员测试了不同的格式,以找出导致这种变化的原因。

  • JSON 和 XML: 这些用于工具和软件的格式,导致了 AI 答案的坍缩(趋同)。
  • YAML 和 CSV: 这些也是数据格式,但 AI 的答案并没有发生那么大的改变。
  • 方括号: 当被要求仅将答案放在方括号 [answer] 中时,AI 实际上变得更加多样化了。

这表明这种变化不仅仅是关于“结构”。它是关于特定格式——即 AI 被训练用来使用工具的格式。由于 AI 被训练使用 JSON 来与软件工具对话,要求使用 JSON 会触发一种“工具模式”,使它们变得更加保守且统一。

这对你意味着什么

论文的结论给出了一个实际的警告。我们通常通过 AI 与我们进行普通英语对话的方式来评判模型。我们认为“最好的” AI 是指在聊天窗口中能给出最有趣、最多样化答案的 AI。但这项研究表明,当同一个 AI 真正被软件使用时(这几乎总是需要 JSON),它会变得更加枯燥和单一。

如果你正在开发一个使用 AI 来推荐电影、挑选树木或构思创意的应用,你在聊天窗口中看到的那个 AI,可能比实际运行你应用的那个 AI 要更有创意得多。“JSON 版本”的 AI 在可测量程度上是缺乏多样性的。我们在与 AI 交谈的 AI 与实际执行工作的 AI 之间的差距,是格式带来的固定成本,而非罕见的意外。

简而言之:如果你想知道一个 AI 真正的想法,不要只是让它聊天。要求它填写一份表格。你可能会惊讶地发现,它变得多么枯燥。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →