Multi-Agent Reinforcement Learning from Delayed Marketplace Feedback for Objective-Weight Adaptation in Three-Sided Dispatch
本文介绍了一个在 DoorDash 部署的多智能体强化学习系统,该系统通过从延迟的操作反馈中学习,在不损害客户体验的前提下,安全地调整三方市场中的调度目标权重,以优化拼单效率与配送质量之间的权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个像 DoorDash 那样规模庞大、繁忙的食品配送平台。这是一场由三方参与的“三方舞”:等待热腾腾食物的顾客、试图在不被订单压垮的情况下完成烹饪的餐厅,以及试图通过高效取送订单来赚钱的骑手(司机)。
这篇论文描述了 DoorDash 构建的一个全新的“智能管理者”系统,旨在帮助骑手和系统更好地协同工作。以下是其运作方式的简单解释:
问题所在:“静态”规则手册
目前,决定哪个骑手接哪个订单的系统使用的是一套带有固定设置的规则手册。把这本规则手册想象成一个设定在“中等”档位的恒温器。
- 两难境地: 系统必须平衡两个相互竞争的目标:
- 速度: 尽可能快地将食物送到顾客手中。
- 效率: 将订单进行组合(拼单),这样骑手可以一次行程取三个餐,而不是来回跑三次。
- 问题在于: 一个固定的“中等”设置并不适用于所有场景。
- 如果非常繁忙(拥堵),过度追求效率(拼单)可能会导致食物送达变慢。
- 如果很闲,过度追求速度则意味着骑手可能会空驶,或者进行过多单独的行程,从而浪费时间和燃油。
- 目前,需要人工手动调整这些规则,这在周五晚上的晚餐高峰期显得反应太慢了。
解决方案:“智能调谐器”
研究人员并没有试图抛弃现有的规则手册并尝试教机器人从头学习如何驾驶整个系统(这既有风险又复杂),而是构建了一个**“智能调谐器” (Smart Tuner)**。
- 它是如何工作的: 想象现有的规则手册是一台收音机。这个“智能调谐器”就像是一个放在它前面的微型旋钮。
- 动作: 在系统分配订单之前,这个 AI “调谐器”会观察当前的情况(是在下雨吗?订单太多了吗?还是骑手在餐厅等待时间过长了?)。基于此,它会稍微转动一下旋钮。
- 向左转: “让我们优先考虑效率。” 系统会将更多订单组合在一起,即使这会多花几分钟时间。
- 向右转: “让我们优先考虑速度。” 系统会派骑手走直线路线来快速送达食物,即使这意味着行程次数较少。
- 居中: “保持正常状态。”
从过去中学习(“延迟反馈”技巧)
困难之处在于,AI 无法立即知道自己是否做出了正确的决策。
- 类比: 想象你是一名厨师。在顾客吃完并退回食物之前,你无法知道你的汤是否太咸了。在这个系统中,“反馈”(顾客是否准时收到食物?骑手是否浪费了时间?)在订单分配后的 30 到 60 分钟才会到达。
- 方法: AI 通过研究过去的日志来进行学习。它研究数百万天的历史数据,将它选择的“旋钮设置”与“延迟结果”(骑手是否节省了时间?顾客是否等待太久?)联系起来。
- 安全第一: 因为 AI 是从旧数据中学习(离线学习),所以存在猜错的风险。为了防止这种情况,研究人员添加了一个“保守护栏”。AI 被教导要保持谨慎,不要尝试那些疯狂、未经测试的设置。它只会对旋钮进行细微、安全的调整。
结果:一场更好的舞蹈
团队通过“回溯实验”(switchback experiment,类似于每两小时掷一次硬币,决定哪些街区使用新 AI,哪些街区沿用旧规则)在现实世界中测试了该系统。
发生了什么?
- 骑手: 他们在餐厅等待的时间减少了,行驶效率也提高了。他们获得了更多的拼单机会,这意味着他们每小时能赚更多的钱。
- 顾客: 他们的食物送达速度与之前一样快。“智能调谐器”知道在什么情况下不应该进行拼单,以免影响食物品质。
- 餐厅: 由于订单流更加顺畅,餐厅的拥堵情况得到了缓解。
核心结论
这篇论文并不是关于取代复杂的订单分配数学模型,而是关于在这些数学模型之上添加一个智能、自适应的层。通过让 AI 根据实时情况并利用延迟反馈进行学习,从而对系统的优先级进行细微调整,DoorDash 成功地提高了骑手的效率并降低了系统运行成本,同时并未让顾客等待更长时间。这是利用 AI 管理大规模、混乱的物流网络的一种安全且实用的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。