AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization
本文介绍了 AIGB-R1,这是一种层级化的自进化自动竞价框架,它利用具有规划者-执行者架构的大语言模型以及一种新颖的解耦组相对策略优化(D-GRPO)算法,通过经验驱动的闭环来增强策略推理、数值精度和自主优化能力,从而克服现有 AI 生成竞价方法的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:每当你滑动手机时,一场无声的高速拍卖正在发生。广告商们正在为争夺你的注意力而激战,向屏幕投掷数字货币以展示他们的广告。这是在线广告的狂野边疆,无数机会在眨眼之间闪过。为了赢得这些战斗,公司过去依赖人工手动调整出价,但这就像试图用一个由意面组成的网去捕捉一颗飞行的子弹——既太慢又太混乱。于是,他们转向了计算机。首先出现了“自动出价”(Auto-bidding),即通过算法自动调整价格以获取最佳交易;随后出现了“生成式人工智能”(Generative AI),它试图通过学习过去的拍卖来预测完美的举措。但问题在于:这些 AI 模型就像是只读过一本过时教科书的学生。当现实世界发生变化时,它们会感到困惑,并且经常在数学方面挣扎,有时会产生“幻觉”(编造)一些毫无意义的数字。
由此,新的明星登场了:大语言模型(LLMs)。你可能知道它们是那些可以写诗或解谜的聊天机器人。它们在理解上下文和规划未来方面极其聪明,但在进行快速、精确的数学计算方面却表现糟糕,而且对于实时拍卖来说反应太慢。科学家们提出的重大问题是:我们能否将一个聪明规划者的脑力与一个快速计算器的速度结合起来,从而赢得这些数字拍卖?这正是研究人员致力于解决的问题,旨在构建一种不仅仅是在猜测,而是真正通过“思考”来赢得胜利的 AI。
大脑与肌肉:AIGB-R1
研究人员提出了一种名为 AIGB-R1 的新系统。你可以把它想象成一个高风险的交易团队,其中的角色被完美地划分开来。过去,人们尝试使用一个巨大的 AI 来完成所有事情——思考、计算并行动。但作者认为这是一个坏主意,因为 AI 不擅长处理精确数字,且反应迟缓。相反,AIGB-R1 采用了一种层级化的方法,将工作分为两个截然不同的部分:规划者(Planner)和执行者(Executor)。
规划者是“大脑袋”。它是一个强大的大语言模型,扮演着资深将军或国际象棋特级大师的角色。在拍卖开始之前,这位将军就会审视广告主的预算、目标以及过往的表现。它不关心下一秒的微小细节;相反,它会制定一个宏观层面的策略。它可能会说:“今天,我们要采取激进策略,快速花钱,”或者“我们需要保持保守,节省资金。”它会将这一策略写成一段清晰、结构化的提示词(prompt)。
执行者是“肌肉”。这是一个轻量级、超快速的 AI 模型(具体来说是一个提示决策 Transformer),负责实际的出价工作。它接收将军的策略提示词,然后迅速聚焦于当下时刻。它观察当前拍卖的状态、剩余预算以及竞争对手,并瞬间计算出精确的出价金额。由于执行者是一个专门的数学模型,它不会产生数字幻觉,并且能在毫秒内做出反应。规划者提供“做什么”和“为什么”,而执行者处理“如何做”和“何时做”。
从经验中学习,而非仅仅从书中学习
该论文还介绍了一种让系统随时间变得更聪明的巧妙方法,他们称之为自我进化循环(self-evolving loop)。大多数 AI 系统都是基于陈旧、静态的数据进行训练的——就像是用十年前的教科书来准备考试。如果市场发生了变化,AI 就会感到困惑。然而,AIGB-R1 构建了一个名为 AuctionNetEnv 的模拟环境。想象一个电子游戏,AI 可以在其中与成千上万个其他机器人对战,一遍又一遍地尝试不同的策略。
这里非常酷的地方在于:系统并不仅仅是随机猜测。它保留了一个记录其最佳过往动作的记忆库。如果某种策略在昨天效果很好,规划者会记住它并在今天对其进行优化。如果某种策略失败了,它会从错误中吸取教训。这就是“自我进化”的部分:系统从自己积累的经验中学习,不断微调其方法,以趋近于完美的出价。
秘诀所在:D-GRPO
在这种设定下,最大的挑战之一是确定当团队获胜或失败时,谁该承担责任(或受罚)。是将军(规划者)给出了错误的指令,还是士兵(执行者)没能执行到位?为了解决这个问题,作者发明了一种新的数学技巧,称为解耦组相对策略优化(Decoupled Group Relative Policy Optimization,简称 D-GRPO)。
想象一位教练正在观看一场接力赛。如果团队输了,教练需要知道是第一位跑者太慢了,还是第二位跑者掉棒了。D-GRPO 就像一位超级聪明的教练,能够将规划者的表现与执行者的表现区分开来。它观察结果并判断:“策略是好的,但执行出了问题,”或者“执行很完美,但策略错了。”通过分离这两个信号,系统可以同时训练这两个部分而不会产生混淆,从而实现更稳定、更有效的学习过程。
研究发现
研究人员在来自阿里巴巴的大规模真实数据集上测试了 AIGB-R1,该数据集包含约 480,000 条竞价轨迹。他们将自己的系统与许多其他顶尖的 AI 方法进行了对比,包括基于强化学习和其他生成式模型的方法。
结果显而易见:AIGB-R1 赢了。 它始终优于其他所有方法,在标准场景和具有挑战性的“稀疏”拍卖场景中都取得了最高分。论文指出,仅仅使用大语言模型作为决策者是不够的,因为其存在数学局限性;但将其作为战略规划者,同时让专门的模型处理数字,则是一个改变游戏规则的举措。
研究还表明,系统的每一个部分都是必不可少的。当移除“自我进化”训练(即让 AI 从自身的模拟中学习)时,性能会下降。当移除规划者并仅让执行者进行猜测时,表现会变差。而当冻结规划者使其无法从新经验中学习时,系统的表现也不如能适应变化的时期。这证明了结合智能规划者、快速执行者以及一个从经验中学习的循环,才是解锁下一代自动出价的关键。
简而言之,AIGB-R1 表明,自动化广告的未来不在于构建一个巨大的、全知全能的机器人。而在于构建一个团队:一位规划路线的睿智战略家,以及一位驾驶车辆的灵巧司机,两者在行驶的每一英里中共同成长。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。