← 最新论文
💬 NLP

Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models

本文通过使用合成语料库“维拉之书”(Book of Veyra)对五种模型进行受控评估,揭示了当规则数量超过80条时,无论采用何种格式,指令遵循能力都会发生崩溃,同时长文本性能的特征表现为召回率的剧烈下降和拒绝率的上升,而非幻觉,且 Markdown 格式相对于纯文本并无一致性的优势。

原作者: Netanel Eliav

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Netanel Eliav

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何完成一项工作。你可以通过拉动几个杠杆来让它工作得更好。其中一个杠杆是格式(format):你可以将你的指令写成整齐的列表、枯燥的段落、华丽的表格,或者仅仅是纯文本。另一个杠杆是规模(scale):你一次给出多少条指令,以及在工作时要求它记住多少背景信息(比如一本巨著)。长期以来,人们一直在争论哪种写作风格最好,并假设无论你添加多少规则或书有多厚,机器人都能完美地理解它们。但在人工智能领域,特别是对于那些能写故事和回答问题的语言大模型(LLMs)而言,人们越来越怀疑这些杠杆并不是孤立起作用的。如果你给机器人的规则太多,或者要求它记住的东西太多,你写作的风格可能会突然变得不再重要,甚至更糟,它可能会以奇怪的方式崩溃。这篇论文提出了一个简单但棘手的问题:你格式化指令的方式是真的有帮助,还是在任务变得庞大时仅仅迷失在了噪音之中?

这项研究背后的研究人员——来自机器人类智能实验室(Machine Human Intelligence Lab)的 Netanel Elavu ——决定停止猜测,开始测试。他们构建了一个巨大的、虚构的宇宙,叫做“维拉之书”(Book of Veyra)。把它想象成一本包含 8,780 个独特虚构事物(如太阳系、公会和奇异生物)的宏大虚构百科全书,每个事物都有特定的事实。因为这本书是由计算机程序生成的,而不是通过阅读互联网生成的,所以 AI 不可能预先背诵它;它必须实际阅读提供的页面才能找到答案。他们用同样的方法编写了这本书的四种不同形式:Markdown 列表(带有加粗标题和项目符号)、纯文本(仅单词)、流式散文(像故事一样)以及表格。然后,他们将这本书放在五个不同的 AI 模型面前,并进行了两项大规模实验。

首先,他们测试了指令遵循能力(Instruction Following)。他们给 AI 一系列规则,让它在写一篇短文时遵循这些规则。他们从 10 条规则开始,并不断增加,直到同时处理 160 条规则。他们想看看随着列表变长,AI 是否仍能完美遵循所有规则,以及将规则写成华丽的列表是否比写成段落更有帮助。结果是一次惨烈的崩溃。无论规则是如何编写的,一旦列表达到大约 80 条,AI 能够完美遵循每一条规则的能力就降到了零。无论规则是在表格中还是在列表中,都无济于事;AI 直接放弃了做到完美。令人惊讶的是,规则放在哪里比它们看起来如何更重要。将规则放在“系统提示词”(机器人的隐藏大脑指令)中与放在“用户轮次”(聊天消息)中,结果显著不同,且对不同的机器人有着不同的影响。对于某些模型,将规则放在聊天中会有所帮助;对于另一些模型,则会产生负面影响。没有一个通用的“最佳”位置。

其次,他们利用“维拉之书”测试了记忆力与诚实度(Memory and Honesty)。他们向 AI 输入了从 2,000 字到庞大的 512,000 字不等的书籍片段。他们要求 AI 回忆特定事实,检查 AI 是否会为了迎合错误陈述而撒谎(谄媚性),或者编造不存在的事实(幻觉)。结果非常有趣。在 64,000 到 128,000 字左右的范围内,无论格式如何,AI 都能完美记住所有内容。但一旦超过这个阈值,情况就变得混乱了。准确率并不仅仅是缓慢衰减,而是直接崩溃,而且这种崩溃方式完全取决于格式和特定的 AI 模型。对于一个模型来说,在 128k 字时纯文本表现很差,而列表和表格表现得很好。对于另一个模型,情况则完全相反。没有单一的“最佳”格式。

这里有一个最大的惊喜:随着书的内容变长,AI 并没有更频繁地编造谎言或同意错误的陈述。事实上,编造事实的比例为零,而同意谎言的比例也保持在极低水平。相反,AI 开始做另一件事:拒绝回答。当书的内容接近模型的记忆极限时,AI 就会直接说“我不知道”或“我无法回答那个问题”,有时拒绝回答的比例高达 90%。它不是因为困惑而撒谎,而是因为不堪重负而选择了关机。

论文还研究了成本。某些格式(如表格)比纯文本占用更多的“Token”(AI 用来衡量文本长度的货币)。当研究人员调整得分,以观察哪个格式在“每消耗一个 Token 的准确度”方面表现最好时,赢家又发生了变化。有时,一个看起来准确度略低的格式实际上是更好的选择,因为它阅读起来更便宜。

核心结论是,你不能仅仅选择一个像 Markdown 或表格这样的“最佳”格式,并假设它永远有效。论文证明,如果你不同时考虑规模,格式就是徒劳的。如果你有太多的指令(大约 80 条或更多),格式就不再重要,因为 AI 会撞到天花板。如果你有巨大的上下文(超过 128k 字),格式就变得非常重要,但“最佳”格式取决于你正在使用的 AI 模型。作者得出结论,我们应该担心的失败模式不是 AI 撒谎,而是当任务变得太大时,AI 选择放弃并拒绝回答。他们发布了所有的工具和虚构的“维拉之书”,以便任何人都可以亲自测试这些极限,因为规则似乎会随着你遇到的每一个新机器人而改变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →