Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models
该研究通过实证表明,在 PayPal 商务代理中结合微调后的 Nemotron 模型使用 EAGLE3 进行投机解码,能在零额外硬件成本下显著提升吞吐量并降低延迟,同时保持输出质量不变,甚至实现单卡性能超越双卡方案从而降低 50% 的 GPU 成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲述了一个关于如何让 AI 助手(PayPal 的购物助手)跑得更快、更省钱的故事。
想象一下,PayPal 的购物助手是一个超级聪明的“购物顾问”。当你在网上搜索“适合夏天的红色连衣裙”时,这个顾问需要瞬间理解你的意思,并在数据库里找到最合适的商品推荐给你。
以前,为了让它反应够快,团队已经给它做了“特训”(微调模型),让它变得很专业。但团队发现,即使经过特训,它还是有点慢,而且需要很贵的显卡(GPU)来运行。
于是,他们尝试了一种叫**“投机解码”(Speculative Decoding)**的新技巧。
核心比喻:老教授与年轻助手
为了让你理解这项技术,我们可以打个比方:
- 目标模型(老教授):这是那个经过特训的、非常聪明但反应稍慢的 AI 模型。它负责最终确认答案,保证质量绝对没问题。
- 草稿模型(年轻助手):这是一个非常轻快、反应极快但经验稍浅的小模型(在这个研究中叫 EAGLE3)。
没有“投机解码”时(传统模式):
老教授每次只能一个字一个字地写答案。
老教授:“我……想……到……了……"(写一个字,停一下,思考一下,再写下一个)。
结果:很慢,因为老教授每写一个字都要停下来思考。
有了“投机解码”后(新模式):
老教授不再独自苦思冥想。他旁边站着一个年轻助手。
- 年轻助手飞快地猜出老教授接下来可能想写的3 到 5 个字,并一次性把它们写出来。
- 老教授只需要快速扫一眼这 3 到 5 个字,说:“嗯,这几个字写得对!”
- 如果猜对了,老教授就直接把这 3 到 5 个字全部采纳,省去了中间反复思考的时间。
- 如果猜错了,老教授就只保留对的部分,重新思考。
关键点:虽然年轻助手偶尔会猜错,但只要猜对了一部分,老教授就能“批量”输出,速度自然就飞起来了。
论文里的主要发现(用大白话讲)
研究人员在 PayPal 的真实购物场景下,做了大量的测试(就像在实验室里跑了 40 种不同的实验组合),得出了以下结论:
速度大提升:
使用“年轻助手”(γ=3,即每次猜 3 个字)的方案,让系统的处理速度提升了 22% 到 49%。- 比喻:就像把原本需要 2 秒才能回给你的消息,缩短到了 1.5 秒甚至更短。
猜得准不准?
年轻助手猜对的概率(接受率)非常稳定,大约在 35.5% 左右。- 有趣的现象:不管是一起处理 1 个请求还是 32 个请求,也不管是让它“保守回答”还是“发散思维”,这个猜对的概率都差不多。这意味着这个技术非常稳定,不用担心突然失效。
猜太多反而不好:
如果让年轻助手一次猜 5 个字(γ=5),效果反而变差了。- 原因:猜得越多,猜错的概率就越大。一旦猜错,老教授就要花更多时间去纠正,反而拖累了速度。所以,一次猜 3 个字是“黄金比例”。
质量没打折:
有人担心“走捷径”会不会让答案变傻?研究人员找了一个 AI 法官来对比,发现答案的质量完全一样,没有任何下降。省钱大妙招(最酷的一点!):
以前,为了跑得快,他们用了 2 张 昂贵的 H100 显卡。
现在,用了这个“投机解码”技术后,只用 1 张 H100 显卡,速度就能赶上甚至超过原来用 2 张显卡的效果!- 这意味着:PayPal 可以直接省下一半的硬件成本,或者用同样的钱处理两倍的业务量。
总结
这篇论文告诉我们,在 AI 领域,有时候不需要换更聪明的“大脑”(更大的模型),只需要给聪明的“大脑”配一个反应快的“小跟班”(草稿模型),就能让整体工作效率翻倍,同时还能省下巨额的钱。
对于 PayPal 的购物助手来说,这意味着以后你搜索商品时,它能更快、更准地给你推荐,而公司也能更省钱地提供服务。这是一个双赢的局面。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。