Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference
TokenArena 引入了一个连续基准测试,在五个核心维度上对 AI 推理进行细粒度端点级评估,综合性能、成本和能耗指标,揭示出传统模型级基准测试所忽视的准确性、延迟和效率方面的显著差异。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在买车。目前,你读到的汽车评测只告诉你车型名称(例如"2026 款超级轿车”)和品牌(例如“福特”)。它们告诉你引擎很强劲,网站上列出了价格。
但在现实世界中,买车不仅仅关乎车型名称。它关乎具体的经销商、具体的配置等级、当地天气以及你使用的确切燃料混合比。从一条阴暗后巷的 shady 经销商那里买到的“超级轿车”,可能引擎生锈、油耗差、GPS 损坏;而来自认证经销商的完全相同车型却运行完美。
Token Arena 是一个全新的 AI“消费者报告”,但它测试的不是汽车,而是AI 端点。
以下是用简单术语解释的论文,辅以类比使其清晰明了。
1. 问题:“车型名称”的谎言
现在,如果你问"Llama 3.3 有多好?”或"GPT-4 有多快?”,你会得到一个单一的答案。论文认为,这就像说“所有 2026 款超级轿车每加仑都能行驶 30 英里”。这是错误的。
在 AI 世界中,相同的模型名称可以由数十家不同的公司(提供商)使用不同的硬件设置来提供服务。
- 类比:想象两个人都在卖“新鲜面包”。一个人从高端烤箱里刚出炉地卖(高质量,高价格)。另一个人从一台运行了 10 年的微波炉里卖(较低质量,低价格)。如果你只看“面包”这个标签,你就无法区分它们。
- 现实:论文发现,对于完全相同的 AI 模型,不同的提供商之间的速度可能相差12 倍,或者能效可能相差6 倍。有些提供商为了省钱进行了过度的“量化”(压缩),导致它们在数学和编程上的错误率比原始版本更高。
2. 解决方案:测量“端点”
Token Arena 改变了测量单位。它不再对模型进行排名,而是对端点进行排名。
- 类比:他们不再对“丰田”进行排名,而是对“芝加哥特定经销商出售的、安装了 V6 发动机和特定轮胎的那辆丰田”进行排名。
- 什么是端点? 它是以下要素的具体组合:谁在销售?什么模型?什么具体版本(Turbo 版还是标准版)?服务器位于何处?
3. 三大分数(“头条新闻”)
Token Arena 不只给出一个分数;它为你提供三个主要数字来帮助你做决定,就像汽车评测给你油耗、价格和安全评级一样。
- 每个正确答案的焦耳数(能源账单):
- 类比:让 AI 正确解决问题需要消耗多少电力?
- 为什么重要:有些 AI 端点非常浪费。它们可能比竞争对手多消耗 6 倍的能源才能获得同样的正确答案。随着世界电力日益短缺,这正成为一笔巨大的成本。
- 每个正确答案的美元数(钱包账单):
- 类比:为了得到一个正确答案,你需要花多少钱?
- 为什么重要:便宜的 AI 可能太慢或错误太多,导致你必须问它 10 次才能得到一次正确答案。Token Arena 计算的是实际成本,而不仅仅是网站上列出的“每 token 价格”。
- 端点保真度(“它是真品吗?”测试):
- 类比:想象你买了一双“耐克”鞋。它是真正的耐克,还是看起来相似但容易散架的仿冒品?
- 为什么重要:有些提供商为了省钱,将强大的模型重度压缩,然后作为“原版”出售而不告诉你。Token Arena 拥有一个“指纹扫描仪”,可以监听 AI 的输出。如果 AI 的“声音”与原始创建者的版本略有不同,它就会将其标记为“漂移”或“量化”。
4. “工作负载”的转折:一种尺寸并不适合所有情况
论文表明,"最佳"AI 完全取决于你在做什么。
- 类比:一级方程式赛车最适合比赛,但送孩子去足球训练则糟糕透顶。小型货车很适合送孩子去足球训练,但用来比赛则糟糕透顶。
- 发现:
- 如果你在进行聊天(短问题,短回答),快速且便宜的模型胜出。
- 如果你在进行推理(复杂数学,长思考),昂贵且高质量的模型胜出,因为它们能第一次就给出正确答案。
- 如果你在进行RAG(阅读海量文档),在“读取”(输入)成本上便宜的模型胜出。
- 令人震惊的是:论文发现,“聊天”的前 10 名榜单与“推理”的前 10 名榜单几乎完全不同。如果你根据通用的“最佳 AI"榜单选择 AI,你可能会为你的工作挑选错误的工具。
5. 他们是如何做到的(“持续基准测试”)
Token Arena 不是一次性测试。这是一场实时的、持续的比赛。
- 类比:与其让汽车杂志在车库里测试一次汽车,不如让 Token Arena 的机器人 24/7 在真实道路上驾驶这些 AI 汽车。
- 过程:
- 他们每天向 78 个不同的 AI 端点发送数千个测试问题(探针)。
- 他们测量速度、成本、能源使用和准确性。
- 他们通过将其答案与原始创建者的答案进行比较,检查 AI 是否在“撒谎”关于其质量。
- 他们每晚更新排行榜。
6. 主要结论
论文得出结论:仅凭“模型名称”已经不够了。
如果你是一家试图构建 AI 应用程序的企业或开发者,你不能只说“我们将使用 Llama 3"。你必须问:“哪个提供商?哪个具体版本?用于什么具体任务?”
Token Arena 提供了一张地图,帮助你在这个混乱的格局中导航,向你展示:
- 差异巨大:同一模型的表现可能因销售者的不同而天差地别。
- 能源至关重要:有些端点是巨大的能源浪费者。
- 情境至关重要:无论你是聊天、编程还是推理,“最佳”AI 都会随之改变。
简而言之:Token Arena 是一个工具,它能阻止你仅仅因为盒子上有个花哨的名字就买下一个“柠檬”AI。它会打开引擎盖,查看它消耗多少能源,获得一个正确答案的实际成本是多少,以及它是否真的是真品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。