CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression
“穴居人”研究表明,虽然压缩模型的输出可以显著降低推理成本,但压缩用户输入却会适得其反,因为这会迫使模型生成更长的响应,从而增加净成本并降低准确性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位非常聪明但价格昂贵的私人助理来为你解决问题。你支付给他们的报酬是基于他们阅读(输入)和书写(输出)的内容。通常情况下,书写的成本要比阅读高得多。
这篇名为“CAVEWOMAN”的论文研究了一个流行的想法:如果我们强迫助手像原始人一样说话会怎样?(例如:“说话短。丢掉语法。节省 Token。”)其目标是通过缩短对话来省钱。
研究人员设计了一个巧妙的实验,通过五种不同类型的谜题,测试了两种不同的使用“原始人语言”的方法,并将其应用于八个不同的 AI 模型。
以下是他们发现的研究结果,已进行简化说明:
1. 两种“原始人”说话方式
研究人员测试了两个不同的通道,就像是两种不同的指令传递方式:
通道 A(“破碎的提示词”): 你给 AI 一个被剥离了所有“粘合词”(如“the”、“is”、“and”、“to”)的问题。
- 例子: 与其输入“What is the capital of France?”(法国的首都是哪里?),你输入“Capital France?”(首都 法国?)。
- 结果: 这是一个陷阱。 这实际上会让成本更高。为什么?因为当 AI 接收到一个破碎、令人困惑的问题时,它会感到恐慌,并试图通过写出更长、更详细的回答来理解你的意思。由于书写是非常昂贵的,这种额外的长度所带来的成本远超你在问题上节省下来的那几个词。这是一个“双输”局面。
通道 B(“原始人指令”): 你给 AI 一个完整的、正常的问题,但你告诉它:“像原始人一样回答我。不要语法,只要关键词。”
- 例子: 你问“What is the capital of France?”,但 AI 回复“Paris.”(巴黎)。
- 结果: 这能省钱。 因为 AI 被迫保持简洁,它书写的词汇更少。由于书写是昂贵的部分,这实际上大幅削减了账单(有时甚至能减少一半或三分之二)。
2. “机器中的幽灵”问题
这是最令人惊讶的发现。当 AI 被迫以“原始人”的方式回答时(通道 B),它通常能得到正确的答案,但它使用的词汇与它平时解释问题的表达方式完全不同。
- 类比: 想象一位厨师通常会写出一份精美的 10 页蛋糕食谱。你告诉他:“只需给我一份配料表。”于是他递给你一张写着“面粉、糖、鸡蛋”的清单。
- 这份清单是正确的(你可以用它烤出蛋糕)。
- 但这份清单与如果你没有强迫他保持简洁时,他原本会写的精美食谱是不一样的。
- 论文的观点: 大约有 52% 的情况下,AI 得到了正确答案,但其“原始人”版本的答案与它原本的“完整句子”版本差异巨大,以至于计算机无法判断它们是在表达同一件事。
- 为什么这很重要: 如果你只关心最终答案(比如“Paris”),这并不重要。但如果你需要阅读 AI 的推理过程,或者需要保留其思考过程的记录,那么“原始人”版本已经失去了原有的韵味和逻辑。
3. 并非所有 AI 都一样
研究人员发现,某些 AI 在处理这些“原始人”规则时表现得比其他模型更出色。
- 一些模型(如开源的“Gemma-4”)非常稳健;即使被要求保持简洁,它们仍能给出良好的答案。
- 其他模型(如极其聪明的“GPT-5.4”)虽然在处理常规任务时表现极佳,但在被迫保持简洁时,表现反而变差了许多。
- 教训: 你不能仅仅选择“最聪明”的 AI。你必须测试哪款 AI 在你计划使用的特定“原始人”规则下表现最好。
总结
- 不要破坏问题: 如果你从提问中删减词汇,AI 会感到困惑,从而写得更多,导致你支付更多费用。
- 要破坏回答: 如果你要求 AI 提供简短的回答,你就能节省大量资金。
- 警惕“幽灵”: 短小的回答可能是正确的,但它们看起来往往与 AI 原本的思维方式截然不同。如果你需要了解答案背后的“为什么”,那么简短的版本可能会产生误导。
论文得出结论:为了省钱并获得良好的结果,你应该压缩输出(答案),而不是输入(问题),并且你必须检查 AI 是否仍在进行正确的“思考”,而不仅仅是看它是否得到了正确的数字。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。