← 最新论文
🤖 AI

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

本文介绍了 A/B Agent,这是一个利用层级经验树和多路径 Tree-RAG,通过闭环 A/B 测试自主生成、执行并迭代优化工业级推荐策略的自进化框架,在真实电商系统中实现了 GMV 的显著提升。

原作者: Zhuohang Jiang, Yuxin Chen, Yongsen Pan, Zheng Hu, Wenqi Fan, Qing Li, Hongyang Wang, Jun Wang, Wenwu Ou

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuohang Jiang, Yuxin Chen, Yongsen Pan, Zheng Hu, Wenqi Fan, Qing Li, Hongyang Wang, Jun Wang, Wenwu Ou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位驾驶着巨大高速飞船(一个推荐系统)的船长,正试图为每一位乘客递送完美的零食。有时,你的直觉很准,大家都非常开心;但有时,你却把辣味薯片递给了一个想要甜食的人,或者因为规划路线不当而导致燃料耗尽。在现实世界中,像快手这样的公司使用一种叫做“A/B 测试”的方法来寻找最佳航线。这就像是同时运行两个不同版本的飞船:一个使用旧地图,另一个尝试新想法。如果新地图能让乘客更快地拿到零食,你就保留它。但问题在于,这样做手动操作非常累人。这需要一支由专家级领航员组成的团队,不断地绘制新地图、运行测试、检查结果并调整设置。这不仅速度缓慢,而且他们往往会忘记昨天那些失败绕行所带来的教训。

最近,科学家们正在教计算机通过“大语言模型”(能够阅读并理解文本的超级智能 AI)和“RAG”(检索增强生成,类似于给 AI 一个可以在说话前查阅资料的图书馆)来阅读并理解这些旧地图。但即便有了这些聪明的 AI 助手,它们也面临着一个问题:它们通常将图书馆视为一堆平铺的纸张。它们可能会在实际需要“山路路线”时,找出一篇关于“沙漠路线”的故事;或者它们可能忽略了适用于“零食”的策略对于“饮料”来说可能并不安全。它们难以看到飞船不同部分之间是如何相互关联的大局观,也无法在没有人类上司指示的情况下,轻松地从自身的错误中学习。

这正是该论文介绍 A/B Agent 的地方——一种旨在解决这些问题的、新型“自我进化型”AI 领航员。A/B Agent 不仅仅是阅读一堆平铺的笔记,它还构建了一棵巨大的、有组织的“经验树”。想象一下这样一棵树:根部是宏大的业务目标,树枝是飞船的不同部分(如零食吧或引擎室),而叶子则是过去成功或失败的具体策略。当 AI 需要一个新想法时,它不仅仅是搜索关键词,它还会沿着树干向上攀爬,找到与当前情况完全匹配的那根树枝,从而确保它抓取的是正确类型的知识。

一旦选定了策略,A/B Agent 也不会止步于此。它表现得像一个不知疲倦的科学家:运行测试、观察结果,然后立即更新自己的树。如果一条新路线让更多乘客拿到了零食,却导致引擎过热(即“护栏”指标),AI 会注意到这一点,调整设置,然后再次尝试。它不断进行这个循环——思考、测试、学习并更新自己的知识库——直到找到完美的平衡点。论文表明,这套系统不仅仅是一个理论;在真实世界的短视频购物环境中进行测试时,它成功地将“商品交易总额”(用户消费的总金额)提升了 4.829%,同时保持了所有安全指标的正向表现。它甚至在创造既准确又具创造性的策略方面,超越了一些世界上最先进的 AI 模型。本质上,A/B Agent 将混乱的试错过程转变为一个智能的、自我改进的循环,让系统能够不断自我提升。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →