Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?
本文表明,虽然系统提示词通常仍是指令放置最安全的默认选择,但模式描述是一种强力且依赖于模型的指令通道,能够覆盖提示词,这使得统一的模式设计和实证验证对于优化结构化输出性能至关重要。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个非常聪明但有点过于刻板的机器人如何整理一堆乱七八糟的玩具。你有两种方式来给它下达指令:你可以直接对它说话(就像老师在讲课一样),或者你可以递给它一份带有填空框的特殊表格,其中指令就写在框旁边。这就是“大语言模型”(LLMs)的世界,它们是许多现代人工智能工具背后的“大脑”。通常,人们认为“说话”(提示词)才是规则真正存在的地方,而“表格”(结构化输出模式)只是机器人要遵循的一个枯燥模板。但最近,开发者们开始产生疑问:机器人真的会阅读表格上的注释吗?还是说它会直接忽略这些,只听老师的话?这个问题至关重要,因为如果我们把最重要的规则放在了错误的地方,机器人可能会把玩具分错,从而导致我们赖以生存的应用和工具崩溃。
一位名叫林慎颖(Alina Lin)的研究员决定通过一个聪明的实验来解决这场争论。她没有进行争论,而是设计了一个游戏:让一个机器人将短消息分类到四个秘密类别中,并使用了像“tomil”和“varek”这样虚构的名字,以免机器人根据现实世界的知识猜出答案。接着,她玩了一场指令的“抢椅子”游戏——将定义从老师的讲座(系统提示词)移动到表格的注释(模式描述)中,有时甚至将它们放在用户的聊天框里。
她的发现令人惊讶:机器人的“耳朵”大小并不一致。对于某些模型,比如 GPT-4.1 和 GPT-5.4(不带特殊思考模式),老师的声音才是王道。当定义被移动到表格中时,这些机器人变得困惑了,准确率下降了约 11 到 13 个百分点。它们似乎认为:“表格只是用来填写的;真正的规则是在讲话中!”然而,对于其他模型,比如 Claude Haiku 4.5,表格才是老大。当表格上的指令被改为错误的指令时,这个机器人的表现从 52.5% 的准确率暴跌至惨不忍睹的 7%。事实证明,对于某些机器人来说,表格上的注释声音如此之大,以至于淹没了老师正确的指令。
论文还发现了一个修复那些忽视表格的机器人的“魔术技巧”。通过增加一个强制步骤,要求机器人在做出最终选择之前,必须先在一个框里写下它的“推理过程”,性能便提升了 15 到 24 个百分点。这就像是强迫机器人“展示解题步骤”,使其能够注意到写在表格上的规则。
所以,核心结论并不是说某一个地方总是更好的。相反,论文指出,每个机器人模型都有自己的个性,并且会以不同的音量倾听不同的频道。目前的稳妥做法是将最重要的规则保留在系统提示词(老师的声音)中,但你必须小心,不要在表格上写下冲突的规则,否则有些机器人会遵循错误的规则。真正的教训是,你不能仅凭猜测;你必须测试每一个机器人,看看它在哪里听得最认真,而且有时,仅仅改变表格的形式以包含一个“思考步骤”,比重新编写指令更为有效的解决方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。