← 最新论文
🤖 AI

A Better Spur Should Start From Each Objective

本文提出了多边际偏好优化(Multi-Marginal Preference Optimization, MMPO),这是一个细粒度的框架,通过在数据、梯度和约束层面进行干预,旨在解决现实世界多目标强化学习中的稀疏奖励和优化冲突问题,从而在多样化任务中实现稳定且高性能的对齐。

原作者: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Shanwen Mao, Hao Zhang, Guangtao nie, Zhiheng Li, Huimu Wang, Sulong Xu, Gu Simiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字市场中,产品页面往往是密集的文字墙,充满了技术规格和营销术语,这可能会让购物者感到不知所措。为了弥合复杂信息与人类理解之间的鸿沟,人工智能正越来越多地承担着一项双重任务:识别产品描述中最重要的词汇,然后为它们编写简短、清晰的解释。这不仅仅是一个文本编辑的过程;这是一场平衡的艺术。系统必须满足严格的离线规则(例如确保提取的词汇准确且涵盖完整的产品功能范围),同时又要追求在线目标(如最大化用户点击量并最小化负面反馈)。这些目标往往相互冲突。一个能产生大量点击的功能可能过于笼统而不够准确,而一个高度准确的技术术语可能又过于晦涩,无法吸引普通浏览者。当计算机程序试图同时优化所有这些相互冲突的目标时,它们经常会出错,出现剧烈波动,或者陷入一种循环,即提高一个指标会导致另一个指标崩溃。

哈尔滨工业大学、京东和中国科学院的研究人员开发了一种新方法来解决这一特定的目标冲突问题。他们将这种方法称为多边际偏好优化(Multi-Marginal Preference Optimization),这是一个旨在防止计算机将所有目标视为一堆混乱指令的系统。该框架并非强迫模型寻找一个在所有方面都妥协的单一“最佳”答案,而是将每个目标视为高速公路上的独立车道。它首先清理接收到的数据,平滑处理来自真实用户行为(如点击和点赞)的噪声和稀疏信号,因为如果仅凭表面数据,这些信号可能会产生误导。通过调整计算机感知这些奖励的方式,该系统确保了那些虽然出现频率较低但具有价值的信息不会仅仅因为其出现次数少于常见术语而被忽略。

其核心创新在于系统如何处理学习过程本身。当计算机尝试提高性能时,它会根据其目标生成数学更新。在旧的方法中,这些更新只是简单地相加,这往往导致一个目标的指令抵消或扭曲了另一个目标的指令。新方法在应用这些更新之前先将它们分离。它识别哪些学习信号对于基础准确性至关重要,哪些信号是针对用户偏好的,然后将偏好信号投影到一个不会干扰核心规则的空间中。这使得模型能够学习如何对用户更有趣,而不会在无意中忘记如何保持准确。

此外,研究人员还增加了一个安全机制,以防止系统在训练后期变得过于激进。随着模型的改进,它们有时会过度专注于某个目标,从而忽视了其他目标,导致整体质量突然下降。新系统利用模型自身遵循指令的能力来设定一个边界。它要求模型生成理想条件下完美行为的示例,并利用这些示例来定义未来更新的安全区域。如果模型试图在一个方向上推得过头,这个内部指南会轻轻将其拉回,确保进度在所有指标上保持稳定且平衡。

该方法的成果在一组涉及 65,232 个训练产品和 8,879 个评估产品的真实电商产品数据集上进行了测试,并结合了过去三个月收集的用户行为数据。该系统与几种其他先进方法进行了对比,结果显示其更加稳定且有效。在离线测试中,它实现了 94.11% 的完整度和 73.43% 的准确度,大幅领先于以往的方法。至关重要的是,它成功达到了 22.82% 的目标覆盖率,这几近完美,而其他方法要么达不到,要么超出了目标。这些提升不仅仅是理论上的;在与真实购物者进行的在线实测中,与之前的标准相比,由这种新方法驱动的系统使下单量增加了 3.14%,订单总额增加了 5.07%。

这一框架的成功不仅限于在线购物。研究人员还将它应用于涉及工具使用和计算机代码生成的任务,在这些领域中,必须同时满足多个约束条件。在这些测试中,该方法始终比标准方法产生更好的结果,特别是在避免“模式崩溃”(即模型找到一个简单的解决方案并不断重复)方面。相反,新系统在遵守严格规则的同时,保持了多样化的高质量输出。通过解耦冲突的目标并提供一种平衡它们的结构化方式,这项工作为使人工智能在面对多个竞争目标的复杂现实环境中变得更加可靠,提供了一个切实可行的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →