← 最新论文
💬 NLP

Vector Policy Optimization: Training for Diversity Improves Test-Time Search

本文介绍了向量策略优化(VPO),这是一种强化学习算法,它利用向量奖励训练语言模型生成多样化的解决方案,从而相较于标准的标量奖励优化,显著提升了其在测试时搜索过程中的性能。

原作者: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Ryan Bahlous-Boldi, Isha Puri, Idan Shenfeld, Akarsh Kumar, Mehul Damani, Sebastian Risi, Omar Khattab, Zhang-Wei Hong, Pulkit Agrawal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位厨师,正在训练一名新学徒,为一名极其挑剔的美食评论家烹饪。这位评论家想要的不仅仅是“一顿美餐”;他们拥有一份复杂的菜单,包含各种具体的需求:也许他们想要牛排三分熟、酱汁辛辣、蔬菜爽脆,且摆盘富有艺术感。

旧方法:“一刀切”的厨师

过去,在训练人工智能(如大型语言模型)时,我们使用了一种称为标量奖励优化(Scalar Reward Optimization)的方法(在论文中由 GRPO 代表)。

这就像告诉学徒:“你的目标是根据一个单一数值获得最高分数:50% 的牛排质量 + 50% 的酱汁质量。”

学徒很快意识到,为了获得最高分数,他们应该停止尝试。他们会一遍又一遍地烹饪完全相同的“完美”牛排与酱汁组合。他们成为了一道特定菜肴的大师。

  • 问题所在:当评论家真正出现时,他们可能会说:“其实,今天我想要牛排五分熟,酱汁要甜味的。”由于学徒只练习过一种特定的食谱,他们完全不知道该怎么办。他们只有一个答案,而这个答案并不符合今天特定的心情。

新方法:向量策略优化(VPO)

论文提出了一种新的训练方法,称为向量策略优化(Vector Policy Optimization, VPO)。

培训师不再给学徒一个单一分数,而是说:“我会给你一份不同的目标清单。有时我希望你专注于牛排,有时专注于酱汁,有时专注于蔬菜。我希望你能一次性烹饪出一盘不同的菜肴,其中每一道菜都是不同组合的杰作。”

学徒学会了创造多样化的解决方案集

  1. 菜肴 A:完美的牛排,简单的酱汁。
  2. 菜肴 B:温和的牛排,复杂的辛辣酱汁。
  3. 菜肴 C:酥脆的蔬菜,富有艺术感的摆盘。

他们并不是试图找到唯一最好的那道菜。他们试图覆盖所有可能的美味组合的整个“地图”(论文中称之为帕累托前沿)。

“测试时搜索”(评论家登场)

奇迹就发生在这里。论文认为,在现代人工智能系统中,人工智能不仅仅是吐出答案并听天由命。相反,系统在使用的时刻(推理阶段)表现得像一个搜索引擎

当评论家带着他们具体、独特的请求出现时(例如,“我想要牛排三分熟但酱汁要甜的”),系统不会要求人工智能从头开始烹饪一道菜。相反,它会查看学徒在训练期间准备的多样化菜肴盘

  • 旧厨师(GRPO):评论家看着这盘菜。里面装满了 100 份完全相同的“牛排 - 酱汁 #1"。评论家找不到他们想要的东西。
  • VPO 厨师:评论家看着这盘菜。有一道菜是三分熟牛排配甜酱汁!系统选中了那一盘。

为什么这很重要

论文在四个不同的“厨房”(如解决逻辑谜题、导航迷宫和编写代码等任务)上测试了这一点。

  1. 更多候选者 = 更好的结果:随着系统被允许查看更多的菜肴(更大的“搜索预算”),VPO 厨师在寻找完美匹配方面变得越来越出色。旧厨师的表现撞上了墙,因为他们只有一种类型的菜肴可以提供。
  2. 解决不可能的问题:在一个非常困难的编程挑战(LiveCodeBench)中,旧厨师无论如何尝试都无法解决问题。然而,VPO 厨师拥有一组多样化的“尝试”,当与搜索工具结合时,成功破解了该问题。
  3. “多样性陷阱”:论文指出,如果目标本质上都是相同的(例如,“把它做成红色”和“把它做成蓝色”,而红色和蓝色其实是同一回事),VPO 就无济于事。只有当目标真正不同且需要权衡取舍时,它才会发光。

结论

论文声称,如果你计划在一个通过搜索众多选项来寻找最佳方案的人工智能系统中使用它,你不应该将人工智能训练成单一完美答案的“专家”。相反,你应该将其训练成一位能够产生多样化高质量选项通才

通过在训练期间让人工智能探索不同“风味”的解决方案,你为测试时的搜索系统提供了一个更丰富的菜单供其选择,从而带来更智能、更具适应性的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →