想象一下你是一位飞船舰长,但你航行的不是星辰大海,而是一个繁忙的城市,目标是规划一场完美的假期。这就是旅行规划的世界,一个处于两个截然不同的科学领域交汇处的谜题。一方面,你拥有组合优化(combinatorial optimization),它就像一位严厉的数学老师,确保你不会违反规则:博物馆下午5点关门,火车6点出发,而且你不能重复访问同一个地方。另一方面,你拥有偏好学习(preference learning),它就像一位试图猜测你内心真实渴望的通灵者——你是想要轻松的一天,还是充实的一场冒险?棘手之处在于,这两个世界经常发生冲突。一个在数学上完美的行程可能会让人感到枯燥,而一个梦幻且有趣的行程在实际执行中可能根本无法实现。对于每一个曾尝试规划旅行的人来说,核心问题在于:我们如何构建一个既在法律逻辑上可行、又能带来纯粹愉悦体验,同时还能在手机上运行且无需联网的旅行指南?
本文介绍了一个名为 PLA(计划、学习、适配) 的巧妙新系统,旨在解决这个难题。作者在与一款名为 FlyEnjoy 的旅游应用合作时发现,现有的方法在两个特定方面失效了。一些传统的规划器非常擅长遵守规则,但在理解人类品味方面表现糟糕,创造出的行程往往显得机械化。与此同时,那些最新潮、最华丽的 AI 工具(比如大家都在谈论的巨型语言模型)听起来非常有帮助,但在基础的旅行数学计算上却彻底失败了;在测试中,这些 AI 模型生成的行程是严格不可行的(成功率为 0%),统计上限表明其有效率可能低于 4%,即违反了营业时间和交通时间的要求。
为了解决这个问题,团队构建了一个完全在你的手机上运行的三步走“工厂”:
- 计划(构思工厂): 他们并没有仅仅依赖一种方式来制定计划,而是构建了一个由五种不同“规划器”组成的团队(比如一位贪婪的厨师、一位谨慎的会计师和一位富有创造力的艺术家)。每位规划器都尝试从头开始构建一个有效的行程。由于他们的思考方式各异,他们会产生非常不同的游览地点列表,从而确保拥有一个多样化的“可行”(遵守规则)选项池。
- 学习(品味测试员): 团队并没有仅仅靠猜测人们的喜好,而是让真人对成对的全天行程进行比较。他们收集了超过 2,500 次此类比较数据。利用这些数据,他们训练出了一个微型且极速的“奖励模型”(一个数字化的品味测试员),该模型学会了识别一段伟大旅行中的隐性品质,例如良好的节奏感和活动的平衡感,而不仅仅是统计参观了多少家博物馆。
- 适配(本地精炼师): 一旦选定最佳行程,这个阶段会对它进行细微且安全的调整。这就像一位厨师在品尝汤品后加了一撮盐,但有一个严格的规则:每一次改动都必须保持配方的有效性。 如果一次调整破坏了进度(比如让你到达一家已关门的店铺),它会被立即丢弃。这个过程运行得极快,平均仅需 109.9 毫秒,这意味着即使你在没有 Wi-Fi 的飞机上,也能瞬间获得一份完美且个性化的计划,因为该系统是为“离线优先”的使用场景设计的。
结果令人印象深刻。当他们用这套“计划、学习、适配”团队与单一的最佳规划器进行对比测试时,该系统在面对人类评委时胜率达到了 67.8%。相比之下,当他们要求三款最先进的 AI 模型(GPT-5、Claude Opus 4.5 和 Gemini 3 Pro)在同样的严格规则下创建行程时,**没有任何一个模型(0%)**能生成一个有效的行程。该系统也展现了良好的泛化能力,在从未见过的 100 多个美国城市中都能准确运行。
在现实世界中,当他们将此系统部署到 FlyEnjoy 应用中时,结果是切实的。用户开始进行旅行规划的频率提升了 83%,且有 91% 的更多用户最终完成了他们的行程。该系统不仅制作了计划,还让整个体验变得更加顺畅,证明了你可以拥有一份既在数学上完美无瑕、又在体验上妙趣横生的旅行指南,而且它就活生生地存在于你的口袋之中。
技术摘要:从可行性到期望性:计划、学习、适配(PLA)框架
1. 问题陈述
本文探讨了在移动设备上生成个性化多日旅行行程单所面临的挑战。这一任务的核心矛盾在于**硬组合可行性(hard combinatorial feasibility)与软潜在期望性(soft latent desirability)**之间的基本张力:
- 可行性: 行程单必须严格遵守时空约束,包括兴趣点(POI)的营业时间、旅行时间、每日时间预算以及成本限制。
- 期望性: 行程单必须满足用户关于节奏、地理连贯性和类别多样性的主观偏好,而这些偏好难以通过静态、手工设计的目标函数来捕捉。
- 可行性(Viability/落地能力): 解决方案必须能够部署在终端设备上(特别是针对离线优先的 iOS 环境),并满足严格的延迟要求(交互式速度)和隐私约束,这排除了依赖云端的大型语言模型(LLM)。
现有方法无法同时满足这三个要求:经典的优化算法能确保可行性,但缺乏细致的偏好建模;基于学习的方法能捕捉偏好,但往往违反硬约束;而 LLM 虽然擅长自然语言生成,但经常产生无效的日程表(在作者的基准测试中可行性为 0%),且不兼容离线、低延迟的移动端部署。
2. 方法论:PLA 框架
作者提出了 Plan, Learn, Adapt (PLA) 框架,旨在共同解决可行性、期望性和落地能力问题。
第一阶段:PLAN(多样化可行性生成)
Plan 阶段使用由五种轻量级规划算法组成的**异构集成(heterogeneous ensemble)**来生成结构多样且可行的候选行程单,所有算法共享一个统一的可行性层:
- 算法: 贪心算法(构造式)、动态规划(DP)、束搜索(Beam Search)、A* 搜索和模拟退火(SA)。
- 可行性层: 一个共享的逻辑模块,用于强制执行硬约束(访问时间、旅行时间一致性、时间/成本预算、无重复访问)并计算最早可行到达时间。
- 目标: 尽管所有规划器都优化一个共享的复合评分(平衡旅行效率、等待时间、紧迫性、类别多样性和 POI 流行度),但它们截然不同的搜索范式产生了结构迥异的行程单。这种多样性至关重要,因为没有任何一种算法能在所有旅行场景下都占据主导地位。
第二阶段:LEARN(人类偏好建模)
Learn 阶段拟合一个紧凑的奖励模型,以捕捉行程层面的潜在用户满意度,而非依赖于单个 POI 的评分。
- 数据收集: 收集了涵盖 100 多个美国城市的 2,519 组成对的人类行程单比较数据。标注者在不知道来源的情况下,在不同规划器生成的行程单之间进行选择。
- 模型架构: 在约 20 个可解释的行程层特征(如总旅行时间、类别熵、每日负载平衡、日程松弛度)上训练了一个 Bradley-Terry 奖励模型。
- 模型使用基于差异的公式:P(xa≻xb)=σ(Rθ(xa)−Rθ(xb))。
- 单调性约束: 模型在优化过程中直接强制执行领域知识(例如,增加旅行时间不应提高奖励)。
- 选择: 奖励模型充当选择器,从 Plan 阶段生成的多样化池中选出得分最高的行程单。
第三阶段:ADAPT(设备端精炼)
Adapt 阶段在严格的设备感知计算预算内,对选定的种子行程单进行奖励引导的局部精炼。
- 保持可行性的编辑: 系统对行程单应用原子算子(删除、插入、替换、交换、重新定位、移动天数)。至关重要的是,每一次编辑后都会进行**增量重新计时(incremental re-timing)*程序以验证约束。如果某次编辑违反了约束,则会被丢弃。这保证了每一个*中间状态都是可行的,不同于事后修复方法。
- 搜索策略: 采用带有随机邻域采样的爬山法(hill-climbing)来选择能提高奖励得分的移动操作。
- 资源感知: 精炼过程受动态时间预算(通常为 ~200–500 毫秒)限制,该预算根据设备信号(核心数、内存、电源模式)进行调整,以确保交互式延迟。
3. 核心贡献
- 异构规划器集成: 作者通过实验证明,没有单一的规划算法具有绝对优势。通过结合五种不同的算法,他们在成对比较中实现了 67.8% 的胜率,比表现最好的单一规划器(DP)高出 11.2 个百分点。
- 行程层级偏好建模: 本文超越了单 POI 评分,引入了一个基于完整行程比较的紧凑型 Bradley-Terry 模型。该模型能捕捉涌现属性(如节奏、每日平衡),并在留一城市交叉验证中达到了 67.6% 的准确率。
- 设备端保持可行性的精炼: Adapt 阶段通过构建机制保证了 100% 的可行性,同时提升了期望性。它实现了平均 109.9 毫秒 的设备端延迟,支持完全离线的交互式执行。
4. 实验结果
- 可行性 vs. LLM: 在针对三种前沿 LLM(GPT-5, Claude Opus 4.5, Gemini 3 Pro)进行的 294 个行程单基准测试中,LLM 的严格可行性为 0%,违反了旅行时间和访问时间等约束。相比之下,PLA 保持了 100% 的可行性。
- 集成性能: 经奖励引导的集成方案比表现最好的单一规划器高出 11.2 个百分点(67.8% 对比 56.6% 的胜率)。选择分布显示出高熵(达到最大值的 97.6%),证实了不同的算法根据上下文贡献了独特的内容。
- 精炼提升: Adapt 阶段在所有种子算法上都带来了显著的得分提升。例如,A* 种子看到了 11.7% 的提升,而原本得分已经很高的集成种子提升了 3.9%。
- 生产影响: 在 FlyEnjoy iOS 应用中部署后,与单一启发式基准相比,PLA 将行程单的完成率提高了 91%,启动率提高了 83%,同时将用户的平均单次会话时间减少了 38%。
5. 重要性与主张
本文声称 PLA 为现实世界部署约束下的对齐人类偏好规划提供了一个可行的蓝图。其重要性在于解决了无需依赖云端 AI 即可实现可行性与期望性权衡的问题:
- 鲁棒性: 通过将可行性(Plan)与偏好学习(Learn)分离,并使用保持可行性的精炼(Adapt),该系统避免了学习型和生成式 AI 中常见的“无效日程”问题。
- 便携性: 使用紧凑、可解释的奖励模型和轻量级搜索算子,使得系统可以完全在设备端运行,支持在云端 API 不可用或成本过高的离线场景(如机场、机上)中使用。
- 实用性: 该框架证明了复杂的、多日的规划可以在交互式延迟(<300 毫秒)内完成,同时严格遵守硬约束,这是目前前沿 LLM 在该特定领域所缺乏的能力。
作者总结道,虽然 LLM 在处理硬约束方面表现挣扎,但结合了经典优化、偏好学习和受限局部搜索的结构化混合方法,可以为个性化行程单生成提供更优越、具备生产就绪能力的方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。