← 最新论文
💬 NLP

QUBRIC: Co-Designing Queries and Rubrics for RL Beyond Verifiable Rewards

QUBRIC 是一个新颖的框架,它通过协同设计基于场景的任务查询与基于教师引导的评分标准,克服了现有基于评分量表(rubric-based)强化学习的结构性局限,从而实现了在开放式任务上的有效训练,并在推理和指令遵循基准测试中取得了显著的性能提升。

原作者: Rongzhi Zhang, Rui Feng, Zhihan Zhang, Jingfeng Yang, Qingyu Yin, Xin Liu, Zixuan Zhang, Priyanka Nigam, Bing Yin, Tuo Zhao, Chao Zhang

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Rongzhi Zhang, Rui Feng, Zhihan Zhang, Jingfeng Yang, Qingyu Yin, Xin Liu, Zixuan Zhang, Priyanka Nigam, Bing Yin, Tuo Zhao, Chao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何写出一个精彩的故事或解决一个棘手的难题。在人工智能的世界里,这被称为强化学习 (Reinforcement Learning, RL)。通常,我们通过给机器人一个明确的“是”或“否”的分数来教它。例如,在数学中,如果答案是“42”,机器人会得到一颗金星;如果答案是“43”,它什么也得不到。这在数学和编程领域非常有效。

但当没有唯一标准答案时,该怎么办呢?如果你问:“如何冲泡一杯好咖啡?”或者“写一个关于丢失小狗的寓意故事”,该怎么办?这里并没有一个“42”。这就是 QUBRIC 这篇论文派上用场的地方。

问题所在:“模糊问题”陷阱

作者发现,我们在教机器人处理这些开放式问题时,目前的方法存在一个巨大的障碍。

可以这样理解:你问一名学生:“解释如何烤蛋糕。”

  • 旧方法: 你尝试为老师制定一份清单(即“评分标准/rubric”)来给答案评分。但因为问题太宽泛,这份清单最终会变得含糊不清。“他们提到面粉了吗?”“他们提到鸡蛋了吗?”这很难做到公平。
  • 天真的补救措施: 有人尝试让问题变得更具体:“请结合《2024年大师级烘焙指南》来解释如何烤蛋糕。”
    • 灾难性的后果: 机器人并没有这本指南。它根本不存在!所以,机器人要么拒绝回答(因为它找不到指南),要么编造一个虚假的指南。这时,老师的清单就变成了检查:“你拒绝回答了吗?”或者“你撒谎了吗?”机器人无法获得关于“如何烤蛋糕”的任何有用反馈。它学到的只是学会沉默或学会撒谎。

论文将此称为**“虚构参考失败” (Fabricated Reference Failure)**。你不能根据一本不存在的规则书来给机器人评分。

解决方案:QUBRIC(“共同设计者”方法)

作者创建了一个名为 QUBRIC 的新系统。QUBRIC 不仅仅是为混乱的问题制作一份清单,而是像建筑师和检查员并肩作战一样,同时改变问题和清单。

以下是它的工作原理,使用一个简单的类比:

1. “关键点”侦探(重写问题)

与其要求机器人“解释机器学习”(这太宏大了),系统会观察人类专家(“老师”)会如何表达。它会提取出最重要、最微小的细节(关键点)。

  • 类比: 假设你想教一个孩子认识“动物”。与其那样做,不如说:“想象你是一名特定动物园的饲养员,面对一只饥饿的狮子。这只狮子只吃位于围栏北侧的肉。你该如何喂食它?”
  • 为什么有效: 你并没有改变主题(仍然是关于动物/喂食),但你创造了一个具体的场景,拥有一个清晰的答案空间。你不是在要求它找一本假书,而是在要求它解决一个真实的、受控的问题。

2. “对比式”检查员(制作清单)

现在,系统生成清单(评分标准)。它并不只是猜测一个好的答案看起来是什么样。它会将“老师”的完美答案与“学生”(机器人)当前的答案进行对比。

  • 类比: 检查员看着老师的答案说:“啊,老师提到了在喂食前要检查狮子的牙齿。学生却忘了这一点。”
  • 这就变成了一份构成性评分标准 (Constitutive Rubric):规则是自洽的。你不需要了解外部知识来评分;你只需要检查特定的细节是否存在。

3. “难度过滤器”(挑选合适的练习题)

并非每个问题都适合学习。

  • 如果问题太简单,机器人已经知道答案了,这样就不会产生学习。
  • 如果问题太难,机器人每次都会失败并感到困惑。
  • QUBRIC 就像一位教练,只挑选那些让学生有 20% 到 50% 概率答对的练习题。这就是学习真正发生的“甜蜜点”。

结果如何?(实验结果)

作者在一个擅长遵循指令但不太擅长复杂推理的机器人身上测试了这个系统。

  • 测试: 他们要求机器人处理困难的、开放式的任务(如编写创意故事或解决复杂的逻辑谜题),甚至是它从未见过的任务(如法律推理或道德困境)。
  • 结果: 机器人的表现显著提升。
    • 在一项针对指令遵循能力的严格“竞技场 (Arena)”测试中,它提升了 5.5 分
    • 在三种完全不同类型的推理测试(法律、道德、叙事)中,平均提升了 6.3 分

核心启示

这篇论文证明了,你不能仅仅给机器人一个针对模糊问题的清单,并期望它能学会。问题本身必须被设计成是“可检查的”。

通过将问题重写为一个具体的、现实的场景(基于真实事实,而非虚构的书籍),并基于该特定场景构建清单,机器人得到了清晰且有用的反馈。它学会了如何更好地思考,而不仅仅是去猜测或拒绝回答。

简而言之: QUBRIC 教会我们,要教机器人思考,你必须首先提出正确类型的问题。你不能让学生在一场逻辑不通的考试中进行评分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →