The Token Efficiency Index: A Peer-Benchmarked Composite Indicator for AI Token Efficiency
本文介绍了令牌效率指数(Token Efficiency Index, TEI),这是一种经过同行基准测试的综合指标,它将缓存性能和模型使用指标聚合为一个标准化的 0–100 分值,旨在使组织能够透明地基准测试 AI 令牌效率并识别成本优化机会。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营一家柠檬水摊,但你卖的不是柠檬和糖,而是卖给机器人的“脑力”。在人工智能的世界里,公司并不按小时或按员工人数付费,而是按“Token(令牌/字符)”付费。你可以把 Token 想象成一粒微小的沙子。有些任务需要一把沙子,而有些任务则需要一整桶。问题在于,沙子的颜色和大小各不相同。有些颗粒既便宜又容易找到,而有些则稀有、昂贵,且需要特殊处理。
长期以来,大公司和初创公司一直在购买这些沙子桶,却没有任何清晰的方法来判断自己是否买得划算。他们知道自己花了多少钱,但不知道自己是否在浪费。这就像你知道自己花了 50 美元买柠檬水原料,但完全不知道自己是做了 100 杯还是仅仅 10 杯。为了解决这个问题,我们需要一种衡量“效率”的方法——不仅仅是看你花了多少钱,而是看你多聪明地使用了你买到的东西。这就是一个名为 Token 效率指数(Token Efficiency Index, TEI) 的新工具。它就像一份成绩单,展示了一家公司如何使用其 AI 沙子,将复杂的支出习惯转化为一个 0 到 100 之间的简单分数。
伟大的 AI 柠檬水摊审计
那么,如何根据 AI 使用情况给一家公司评分呢?本文的作者 Caden Wong、Vikram Das 和 Himanshu Dhami 意识到,仅仅看总账单并不能说明全部问题。一家公司可能因为规模巨大而花费巨资,而不是因为浪费。为了解决这个问题,他们发明了 Token 效率指数(TEI)。
把 TEI 想象成 AI 支出的“智能镜子”。它不仅仅显示总成本,还会观察三种特定的习惯,以查看你是否成为了资源的良好管理者:
- “复用”习惯(缓存命中率/Cache Hit Rate): 想象你在写故事。如果你每次用到一个词都要去查一次定义,那会很慢且令人烦恼。但如果你把定义写下来,以后只需指向它即可,你就节省了时间。在 AI 中,这被称为“缓存(caching)”。TEI 会检查一家公司是多么频繁地复用已经请求过的信息,而不是要求 AI 从头开始重新计算。
- “回报”习惯(缓存摊销/Cache Amortization): 这关乎物有所值。如果你写下了定义(一次“缓存写入”),你希望在忘记它之前多次使用它(多次“读取”)。TEI 衡量的是公司是否真的在使用他们保存的内容,还是仅仅在囤积那些从不查看的笔记。
- “昂贵选择”习惯(高级模型占比/Premium Model Share): 并非每个问题都需要超级天才级别的 AI。有时普通的 AI 就足够了。但有些公司会对所有事情都使用最昂贵、最强大的 AI,甚至包括像“今天天气如何?”这样简单的任务。TEI 会检查一家公司是否在去超市买菜时都开着“法拉利”,而原本用“自行车”就能完成。
评分系统:从混乱到 0-100 分的等级
论文解释说,他们从 39 个不同的组织(从个人开发者到研究机构不等)中获取了数据,并将其输入到一个特殊的计算器中。他们并没有简单地取平均值,因为平均值可能会产生误导。相反,他们使用了一种巧妙的方法,称为**“疑点利益法”(Benefit of the Doubt, BoD)**。
用通俗易懂的话来说,它是这样运作的:想象一个数学很好但美术很差的学生。如果取他们的平均分,他们看起来可能表现平平。但如果你说,“好吧,我们暂时不考虑美术,看看如果只关注数学,他们表现如何”,他们可能会脱颖而出。TEI 对公司也这样做。它会问:“怎样看待这家公司的数据,才能让他们看起来尽可能好?”如果一家公司即使在你给予了这种“疑点利益”的情况下表现依然糟糕,那么他们确实效率低下。
为了确保得分不会被一个偶然出现的异常值(比如一个不小心买了一百万个柠檬的柠檬水摊)所干扰,他们增加了一个“稳健性(robust)”的转折。他们运行了 500 次计算,每次都随机挑选一组同行进行对比。这平滑了波动,并给出了更公平的分数。
数据说明了什么
当他们对这 39 个组织进行测试时,发现了一些有趣的情况:
- 分数范围: 分数范围从低至 34.7 到高至 100。
- “超高效”俱乐部: 出人意料的是,有相当数量的公司——39 家中的 13 家——其效率极高,甚至得分超过了完美的 100 分(技术上讲,它们的原始得分超过了 1.0)。这意味着它们的表现优于作者设定的“最佳实践”前沿。
- 大赢家: 得分最高的公司是那些能够复用信息(高缓存命中率)并且不会为简单任务浪费钱在昂贵模型上的公司。
- 大输家: 得分最低的公司(组织 33)得分为 34.7。分析显示,他们将 90.8% 的任务用于昂贵的“高级”模型,而表现最好的同行仅将约 14.3% 的任务用于此类模型。论文指出,如果这家公司改进这一习惯,预计可以节省 72,150 美元。
这篇论文 没有 在说什么
重要的是要了解这篇论文并未声称什么。作者非常谨慎地表示,这只是一个 模拟和基准测试,而不是能瞬间解决一切的魔杖。
- 它不是“一刀切”的规则: 论文明确排除了存在一种单一“完美”AI 支出方式的观点。TEI 会根据每家公司的擅长领域改变其权重。
- 它还不完美: 作者承认其数据有限。他们只观察了 39 个组织,并且无法看到“外部”世界(例如客户如何使用 AI 产品)。他们也无法判断一家公司是由于处理难题而 需要 强大的模型,还是仅仅在性能与成本之间优先考虑了性能。因此,“高级模型占比”这一指标有时可能会惩罚那些表现聪明的公司,而非浪费的。
- 它不是预言球: 节省金额(如 72,150 美元)是“方向性估计”。它们是基于平均值的合理推测,而非精确的预测。
总结
Token 效率指数是一种看待 AI 支出(超越“我们花了多少钱”)的新方式,即转向“我们多聪明地使用了钱”。通过将复杂的数据转化为简单的 0-100 分数,它能帮助公司识别他们在哪里浪费资金,以及在哪里做得出色。
作者建议,虽然这个工具是一个很好的开始,但它需要更多数据才能变得更好。他们希望未来会有更多公司分享数据(匿名形式),从而让“同行群体”变得更大,使分数更加准确。目前,它就像是在黑暗房间里的一把强力手电筒,告诉我们通过一些微小的改变——比如复用信息和选择合适的工具——公司可以在不损失任何脑力的前提下节省大量资金。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。