← 最新论文
💻 computer science

Testing JSON Schema Instruction Artifacts: Distributional Robustness under Validation-Equivalent Serialization and JSON Mode

本研究表明,验证等效的 JSON Schema 序列化可能会引起语言模型输出分布在统计学上显著且在实际应用中具有意义的变化,从而揭示了仅凭验证等效性不足以作为确保部署系统中分布鲁棒性的回归判据。

原作者: Shengyao Sun

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengyao Sun

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在给一个非常聪明但有点过于死板、按字面意思理解指令的机器人提供一套制作特定类型三明治的指令。你在纸上写下了这些指令。现在,想象你有一个神奇的印章,上面写着:“这个三明治食谱是完美的。”这个印章会检查你是否拥有所有正确的配料(面包、奶酪、火腿),并且检查你是否不小心漏掉了芥末酱。但问题的关键在于,这个印章并不关心你写步骤的顺序。无论你说“把火腿放在面包上,然后放奶酪”,还是说“把奶酪放在面包上,然后放火腿”,印章都会给出同样的“完美”赞许,因为最终的三明治包含的部件是相同的。

在计算机科学的世界里,这个“印章”被称为 JSON Schema。它是一本规则书,告诉计算机程序一段数据应该是什么样子的。当我们要求人工智能(AI)编写代码或组织信息时,我们通常会把这本规则书作为一组指令交给它。现在的大问题是,如果我们打乱纸上指令的顺序——在没有改变实际规则或那个“完美”印章的前提下——AI 是否仍然能做出完全相同的三明治?或者,AI 会因为指令顺序的变化而感到困惑,即便它依然能通过印章的检查,却端出了一个略有不同的成品?这之所以重要,是因为如果 AI 仅仅因为我们重新排列了词语的顺序就改变了想法,那么它在处理医疗记录或财务报告等重要工作时就会变得不可靠。

这篇论文就像是一个侦探故事,作者沈圣耀(Shengyao Sun)通过这个故事调查了 AI 的“大脑”是否对这些规则书中词语的顺序敏感。这项研究通过让不同的 AI 模型使用相同的规则书来解决相同的谜题,但通过以不同的顺序编写指令来进行测试。他们不仅仅只问了一次;他们针对每个版本都询问了五次,以确保任何变化都不是偶然的运气。他们发现,对于某些 AI 系统,词语的顺序确实很重要。当属性(比如“姓名”或“年龄”)的顺序被交换时,AI 开始给出不同的答案,尽管这些答案根据规则书的要求来看在技术上仍然是“正确”的。

然而,并非每个 AI 的故事都是一样的。作者发现这种“顺序敏感性”完全取决于你使用的是哪种特定的 AI 系统。对于“Sonnet”和“Qwen”系统,打乱顺序会导致答案发生明显的改变——比平时多出约 5% 到 12% 的分歧。但对于“GPT”和“DeepSeek”系统,打乱顺序几乎不会产生任何影响。研究还检查了一种特殊的“JSON 模式”(一种告诉 AI 要格外注意格式设置的模式)是否能解决这个问题。令人惊讶的是,它并没有奏效;即使在这种严格模式下,AI 仍然会被词语的顺序搞混。

最重要的启示是,仅仅因为一个计算机程序说一套指令集是“有效的”或“正确的”,并不意味着 AI 在你微调格式时仍会表现得一样。作者建议,我们不应再仅仅信任那个“印章”。相反,我们需要像对待软件代码一样对待这些指令集:我们应该将它们锁定在一个标准的顺序中(比如始终按字母顺序排列配料),并在让它们在现实世界中运行之前进行仔细测试。这项研究证明,仅靠验证是不够的;我们需要检查当指令被重新排列时,AI 的行为是否保持稳定,因为对于某些 AI 来说,词语的顺序其实是配方中隐秘的一部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →