← 最新论文
💬 NLP

Chinese Language Is Not More Efficient Than English in Vibe Coding: A Preliminary Study on Token Cost and Problem-Solving Rate

这项针对 SWE-bench Lite 基准的实证研究表明,中文提示在 LLM 编程任务中并未展现出预期的 Token 成本优势,且其任务解决成功率普遍低于英文,因此开发者不应仅为了节省成本或提升性能而切换至中文提示。

原作者: Simiao Ren (Tsang), Xingyu Shen (Tsang), Yuchen Zhou (Tsang), Dennis (Tsang), Ng, Ankit Raj

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Simiao Ren (Tsang), Xingyu Shen (Tsang), Yuchen Zhou (Tsang), Dennis (Tsang), Ng, Ankit Raj

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一场**“语言效率大揭秘”**,专门为了打破一个在程序员圈子里流传很广的“谣言”:

谣言: “用中文写提示词(Prompt)比用英文更省 Token(计费单位),能帮公司省下 40% 的 API 费用,所以‘氛围编程’(Vibe Coding)应该全转中文!”

作者们(来自 Scam.ai 的研究团队)决定不靠猜,而是像**“科学侦探”**一样,亲自下场做实验,看看这个说法到底是真是假。

以下是用大白话和生动的比喻为你解读的核心发现:

1. 核心结论:谣言 busted(被粉碎了)

简单说:用中文写代码提示词,并没有你想象中那么省钱,甚至可能更贵、效果更差。

这就好比你听说“用方言点菜比普通话点菜更便宜”,结果去饭店一试,发现不仅没便宜,老板还因为听不懂方言多收了你服务费,甚至因为沟通不畅,菜还做错了。

2. 实验是怎么做的?(侦探的办案过程)

  • 任务: 他们找了一个叫 SWE-bench 的“考场”,里面有 50 道真实的软件修复题(比如:这个 Python 代码有个 Bug,请修好它)。
  • 选手: 他们找了 3 个不同的 AI 模型(MiniMax、GPT、GLM),让它们分别用英文中文去解题。
  • 计分: 不仅看谁做对了(成功率),还看谁花的钱少(Token 消耗量)。

3. 三大惊人发现

发现一:中文并没有“天生省字”

比喻: 想象 Token 是**“快递包裹”**。

  • 谣言逻辑: 中文一个字顶英文一个词,所以中文写的信更短,快递费更便宜。
  • 现实情况: AI 的“打包员”(Tokenizer)并不懂中文的“字义”,它只懂怎么切分。
    • 对于某些 AI(比如 GPT 系列),它的打包员是**“英语特供版”**。你给它一个中文“猫”,它可能得拆成 3 个碎片(3 个包裹)才能装下;而英文"cat"直接就是一个包裹。结果:中文反而更费包裹(Token)!
    • 对于另一些 AI(比如 GLM),它的打包员是**“中文特供版”**,这时候中文确实能省点包裹。
    • 结论: 省不省钱,全看 AI 的“打包员”是哪种,跟语言本身没关系。

发现二:成功率才是“隐形杀手”

比喻: 想象你在**“抓娃娃机”**前。

  • 假设用中文抓,每次只花 1 块钱(Token 少),但成功率只有 20%。
  • 假设用英文抓,每次花 1.1 块钱(Token 多一点点),但成功率有 40%。
  • 算笔账: 为了抓到 1 个娃娃,用中文你可能要投币 5 次(5 块钱),用英文只要投币 2.5 次(2.75 块钱)。
  • 结论: 虽然中文单次看起来便宜,但因为**“做不对”(成功率低),导致你需要反复重试,最后总花费反而更高**。论文发现,用中文提示词时,AI 修好 Bug 的概率普遍比英文低。

发现三:选对模型比选对语言重要一万倍

比喻: 这就像**“选赛车手”比“选赛车颜色”重要**。

  • 不管你是开红色车(英文)还是蓝色车(中文),如果车手是个新手(模型能力差),你跑不过职业车手。
  • 论文发现,不同 AI 模型之间的能力差距(30% 的成功率差距),远远大于语言带来的那点微小差异。
  • 建议: 别纠结是用中文还是英文,换个更强的 AI 模型,省下的钱和效果提升才是实实在在的。

4. 为什么会有这个谣言?(三个误区)

作者指出,大家把三个概念搞混了:

  1. 信息密度(字面意思): 中文确实字少意赅(比如“你好”vs"Hello"),但这只是**“字符”**层面的。
  2. 分词机制(实际打包): AI 不是按“字”算的,是按“词块”算的。很多英文优化的 AI,把中文切碎,反而更费钱。
  3. 啰嗦程度(输出长度): 有人觉得中文思考过程短,但代码生成需要精准,中文不一定短,而且如果因为语言不通导致代码写错,重试的成本才是大头。

5. 给开发者的“避坑指南”

如果你正在考虑为了省钱把提示词全改成中文,请听作者一句劝:

  • 别为了省 Token 改语言: 这就像为了省几块钱油费,把车开进泥坑里,最后修车的钱更多。
  • 关注模型选择: 选一个对中文支持好、能力强的模型(比如专门优化过中文的 GLM 或 MiniMax),比单纯改语言有用得多。
  • 看总账: 真正的成本是 (单次 Token 成本 × 重试次数)。如果中文导致 AI 经常“翻车”,那总成本绝对不低。

一句话总结:
“中文提示词更省钱”是个美丽的误会。在 AI 编程的世界里,选对“大脑”(模型)比选对“嘴巴”(语言)重要得多。别为了省那点 Token,把代码修好的机会给弄丢了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →