在计算机科学的世界里,这个“印章”被称为 JSON Schema。它是一本规则书,告诉计算机程序一段数据应该是什么样子的。当我们要求人工智能(AI)编写代码或组织信息时,我们通常会把这本规则书作为一组指令交给它。现在的大问题是,如果我们打乱纸上指令的顺序——在没有改变实际规则或那个“完美”印章的前提下——AI 是否仍然能做出完全相同的三明治?或者,AI 会因为指令顺序的变化而感到困惑,即便它依然能通过印章的检查,却端出了一个略有不同的成品?这之所以重要,是因为如果 AI 仅仅因为我们重新排列了词语的顺序就改变了想法,那么它在处理医疗记录或财务报告等重要工作时就会变得不可靠。
这篇论文就像是一个侦探故事,作者沈圣耀(Shengyao Sun)通过这个故事调查了 AI 的“大脑”是否对这些规则书中词语的顺序敏感。这项研究通过让不同的 AI 模型使用相同的规则书来解决相同的谜题,但通过以不同的顺序编写指令来进行测试。他们不仅仅只问了一次;他们针对每个版本都询问了五次,以确保任何变化都不是偶然的运气。他们发现,对于某些 AI 系统,词语的顺序确实很重要。当属性(比如“姓名”或“年龄”)的顺序被交换时,AI 开始给出不同的答案,尽管这些答案根据规则书的要求来看在技术上仍然是“正确”的。
然而,并非每个 AI 的故事都是一样的。作者发现这种“顺序敏感性”完全取决于你使用的是哪种特定的 AI 系统。对于“Sonnet”和“Qwen”系统,打乱顺序会导致答案发生明显的改变——比平时多出约 5% 到 12% 的分歧。但对于“GPT”和“DeepSeek”系统,打乱顺序几乎不会产生任何影响。研究还检查了一种特殊的“JSON 模式”(一种告诉 AI 要格外注意格式设置的模式)是否能解决这个问题。令人惊讶的是,它并没有奏效;即使在这种严格模式下,AI 仍然会被词语的顺序搞混。
最重要的启示是,仅仅因为一个计算机程序说一套指令集是“有效的”或“正确的”,并不意味着 AI 在你微调格式时仍会表现得一样。作者建议,我们不应再仅仅信任那个“印章”。相反,我们需要像对待软件代码一样对待这些指令集:我们应该将它们锁定在一个标准的顺序中(比如始终按字母顺序排列配料),并在让它们在现实世界中运行之前进行仔细测试。这项研究证明,仅靠验证是不够的;我们需要检查当指令被重新排列时,AI 的行为是否保持稳定,因为对于某些 AI 来说,词语的顺序其实是配方中隐秘的一部分。