Chinese Language Is Not More Efficient Than English in Vibe Coding: A Preliminary Study on Token Cost and Problem-Solving Rate
这项针对 SWE-bench Lite 基准的实证研究表明,中文提示在 LLM 编程任务中并未展现出预期的 Token 成本优势,且其任务解决成功率普遍低于英文,因此开发者不应仅为了节省成本或提升性能而切换至中文提示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一场**“语言效率大揭秘”**,专门为了打破一个在程序员圈子里流传很广的“谣言”:
谣言: “用中文写提示词(Prompt)比用英文更省 Token(计费单位),能帮公司省下 40% 的 API 费用,所以‘氛围编程’(Vibe Coding)应该全转中文!”
作者们(来自 Scam.ai 的研究团队)决定不靠猜,而是像**“科学侦探”**一样,亲自下场做实验,看看这个说法到底是真是假。
以下是用大白话和生动的比喻为你解读的核心发现:
1. 核心结论:谣言 busted(被粉碎了)
简单说:用中文写代码提示词,并没有你想象中那么省钱,甚至可能更贵、效果更差。
这就好比你听说“用方言点菜比普通话点菜更便宜”,结果去饭店一试,发现不仅没便宜,老板还因为听不懂方言多收了你服务费,甚至因为沟通不畅,菜还做错了。
2. 实验是怎么做的?(侦探的办案过程)
- 任务: 他们找了一个叫 SWE-bench 的“考场”,里面有 50 道真实的软件修复题(比如:这个 Python 代码有个 Bug,请修好它)。
- 选手: 他们找了 3 个不同的 AI 模型(MiniMax、GPT、GLM),让它们分别用英文和中文去解题。
- 计分: 不仅看谁做对了(成功率),还看谁花的钱少(Token 消耗量)。
3. 三大惊人发现
发现一:中文并没有“天生省字”
比喻: 想象 Token 是**“快递包裹”**。
- 谣言逻辑: 中文一个字顶英文一个词,所以中文写的信更短,快递费更便宜。
- 现实情况: AI 的“打包员”(Tokenizer)并不懂中文的“字义”,它只懂怎么切分。
- 对于某些 AI(比如 GPT 系列),它的打包员是**“英语特供版”**。你给它一个中文“猫”,它可能得拆成 3 个碎片(3 个包裹)才能装下;而英文"cat"直接就是一个包裹。结果:中文反而更费包裹(Token)!
- 对于另一些 AI(比如 GLM),它的打包员是**“中文特供版”**,这时候中文确实能省点包裹。
- 结论: 省不省钱,全看 AI 的“打包员”是哪种,跟语言本身没关系。
发现二:成功率才是“隐形杀手”
比喻: 想象你在**“抓娃娃机”**前。
- 假设用中文抓,每次只花 1 块钱(Token 少),但成功率只有 20%。
- 假设用英文抓,每次花 1.1 块钱(Token 多一点点),但成功率有 40%。
- 算笔账: 为了抓到 1 个娃娃,用中文你可能要投币 5 次(5 块钱),用英文只要投币 2.5 次(2.75 块钱)。
- 结论: 虽然中文单次看起来便宜,但因为**“做不对”(成功率低),导致你需要反复重试,最后总花费反而更高**。论文发现,用中文提示词时,AI 修好 Bug 的概率普遍比英文低。
发现三:选对模型比选对语言重要一万倍
比喻: 这就像**“选赛车手”比“选赛车颜色”重要**。
- 不管你是开红色车(英文)还是蓝色车(中文),如果车手是个新手(模型能力差),你跑不过职业车手。
- 论文发现,不同 AI 模型之间的能力差距(30% 的成功率差距),远远大于语言带来的那点微小差异。
- 建议: 别纠结是用中文还是英文,换个更强的 AI 模型,省下的钱和效果提升才是实实在在的。
4. 为什么会有这个谣言?(三个误区)
作者指出,大家把三个概念搞混了:
- 信息密度(字面意思): 中文确实字少意赅(比如“你好”vs"Hello"),但这只是**“字符”**层面的。
- 分词机制(实际打包): AI 不是按“字”算的,是按“词块”算的。很多英文优化的 AI,把中文切碎,反而更费钱。
- 啰嗦程度(输出长度): 有人觉得中文思考过程短,但代码生成需要精准,中文不一定短,而且如果因为语言不通导致代码写错,重试的成本才是大头。
5. 给开发者的“避坑指南”
如果你正在考虑为了省钱把提示词全改成中文,请听作者一句劝:
- 别为了省 Token 改语言: 这就像为了省几块钱油费,把车开进泥坑里,最后修车的钱更多。
- 关注模型选择: 选一个对中文支持好、能力强的模型(比如专门优化过中文的 GLM 或 MiniMax),比单纯改语言有用得多。
- 看总账: 真正的成本是
(单次 Token 成本 × 重试次数)。如果中文导致 AI 经常“翻车”,那总成本绝对不低。
一句话总结:
“中文提示词更省钱”是个美丽的误会。在 AI 编程的世界里,选对“大脑”(模型)比选对“嘴巴”(语言)重要得多。别为了省那点 Token,把代码修好的机会给弄丢了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。