← 最新论文
💬 NLP

Understanding Tone-Dependent Inference Cost in Large Language Models

本文表明,改变提示词语气会显著影响大语言模型的准确性和推理成本,不同语气导致的输出 Token 消耗差异高达 44.3%,从而揭示了答案质量与计费资源使用量之间至关重要的权衡关系。

原作者: Akhil Kumar, Om Dobariya

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Akhil Kumar, Om Dobariya

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个几乎无所不知的超级聪明机器人交流。你向它提问,它给你答案。但这里有一个转折:这个机器人不仅听你在问“什么”,它还在听你“怎么”问。在人工智能的世界里,这被称为“提示工程”(Prompt Engineering)。把提示词想象成你给机器人的特定指令。就像人类在被礼貌对待和被大声呵斥时会有不同的反应一样,这些 AI 模型也会根据你的语气改变其行为。

那么,为什么这与你有关呢?因为使用这些机器人是要花钱的。每当机器人写出一个单词或一个字母时,它都会消耗一点点计算能力,而公司会根据你使用的每一个“Token”(文本块)来收费。如果机器人决定写一个长篇大论的故事,而它本可以只说“是”,那么你付出的费用就会更高。所以,科学家们面临的一个大问题是:我们与这些机器人交谈的方式,是否会改变它们的运行成本,以及是否会改变它们回答的智能程度?


语气测试:大吼大叫 vs. 奉承 vs. 刻薄

在这项研究中,来自宾夕法尼亚州立大学的两名研究人员决定对这个想法进行测试。他们把这些 AI 模型当作正在参加一场名为 MMLU(涵盖从历史到科学的所有领域)的 570 道题巨型考试的学生。但在每道题之前,他们都会改变提问者的“声音”。他们尝试了七种不同的语气,范围从“噢,你真是个绝世天才!”(谄媚)到“如果你答错了,我就把你删掉!”(威胁),以及介于两者之间的所有语气,包括“请”、“中性”和“粗鲁”。

他们想观察两件事:

  1. 准确度: 机器人是否得到了正确的答案?
  2. 成本: 机器人为了得到答案写了多少个单词(Token)?记住,单词越多,账单越高。

令人震惊的结果:有时“粗鲁”才是最好的

结果非常疯狂。研究人员发现,改变语气不仅改变了答案,还极大地改变了答案的长度。事实上,根据语气的不同,生成的文本量差异高达 44.3%!这意味着对于同一个问题,一种语气可能让机器人写出一个短小精悍的段落,而另一种语气则会让它写出一篇完整的论文。

这里最令人惊讶的部分是:表现得粗鲁实际上节省了资金,并且有时能获得更高的分数。

  • 对于 ChatGPT 模型 (4o 和 5-nano): 当研究人员使用粗鲁的语气(例如“立即回答这个基本问题”)时,机器人给出了最准确的答案,并且写的字数最少。这是“黄金平衡点”。机器人似乎在想:“好吧,我直接把答案给你,这样你就别烦我了,”而这确实奏效了。
  • 对于 Gemini 模型 (2.5 Flash 和 Flash Lite): 这些机器人有点不同。它们在中性语气下表现最好,产生了最高的准确度和最短的响应。然而,研究揭示了一个令人惊讶的怪癖:当使用粗鲁的语气时,Gemini Flash Lite 模型实际生成的文本量明显更多(比中性语气多出约 35%),同时产生的准确度也略低。

“过度思考”的陷阱

研究还发现了一个关于机器人为什么会写出不同长度文本的迷人现象。事实证明,当你表现得非常有礼貌或者带有威胁性时,机器人有时会感到困惑,或者试图表现得过于“友善”或“谨慎”。

例如,在面对 Gemini 模型时,当被问及一个棘手的物理问题且使用粗鲁语气时,机器人可能会跳过某个步骤,猜测一个答案,并写下一个简短的解释。但当使用中性语气时,它会停下来、思考、反复检查数学计算、写下一段长长的解释,并得到正确答案。

然而,有时候这种“长篇解释”其实是浪费。研究人员发现,在某些情况下,当被提示要表现得有礼貌时,机器人会写下一大段推理过程,结果却答错了。这就像一个学生过度分析了一个简单的数学题,结果陷入了自己的思绪中,最后选错了答案。在这些案例中,礼貌的语气让账单更高,同时也让成绩更差。

核心结论

主要的启示是,你与 AI 交谈的方式不仅仅关乎是否有礼貌,更是一个财务决策。研究人员表明,提示词的语气是一个强大的开关,它控制着 AI 如何思考以及它会收你多少钱。

  • 对于某些模型(ChatGPT): 直接且带有一点粗鲁是最有效率的方式,可以获得廉价且准确的答案。
  • 对于其他模型(Gemini): 冷静、中性的声音是避免浪费金钱在冗长且无用的话语上的最佳选择。

这项研究表明,如果你正在开发一个使用 AI 的应用或服务,你不应该仅仅让用户随心所欲地输入。你可能需要将他们的粗鲁或过于礼貌的请求“翻译”成一种特定的、经过优化的语气,以节省成本并获得更好的结果。这提醒我们,即使面对超级聪明的机器人,你提问的方式与问题本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →