PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis
该论文介绍了 PRISM,这是一个四阶段数据合成框架,它使多模态模型能够作为具有优先级意识的准则执行者而非简单的生成器,通过仅使用 1 万个合成样本和确定性评估指标,证明了在多种架构上实现多规则指令遵循能力的显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
细则的艺术
想象一下,你正在教一个机器人理解这个世界。长期以来,我们一直通过一种简单的“问答”游戏来教这些机器人。你给它们看一张猫的照片,然后问:“这是猫吗?”如果它们回答“是”,它们就会得到一颗金星。这就是大多数 AI 模型学习视觉的方式:它们擅长识别事物并回答关于事物的直接问题。
但现实生活不仅仅是一系列简单的提问。它是一捆带有隐藏规则的复杂指令。想象一下,你告诉一个人:“为这张海报写一句标语。”你可能还有一个秘密的要求清单:“必须提到品牌”、“不能对产品进行虚假陈述”以及“听起来要令人兴奋”。如果标语很令人兴奋但对产品进行了虚假陈述,人类知道这是一个失败的作品。但对于 AI 来说,这种“规则捆绑”往往过于令人困惑。它们往往倾向于关注主要请求,而忽略了细则。这篇论文针对的就是这个特定问题:教导 AI 模型不仅要回答问题,还要像一个严格的编辑一样,在给出最终裁定之前检查每一条规则。
论文:PRISM
这项研究背后的研究人员(与字节跳动和北京大学的模型合作)注意到,目前的 AI 模型就像那些只为期末考试复习却忽略了平时作业指令的学生。它们非常擅长回答“这是什么?”,但在处理复杂的、多步骤且某些规则比其他规则更重要的指令时表现得很糟糕。为了解决这个问题,他们创建了一种名为 PRism(通过结构化多模态数据合成实现的优先级感知准则内化)的新型训练方法。
把 PRISM 想象成一个“规则制造工厂”。研究人员并没有仅仅向 AI 展示一张图片并提出一个问题,而是构建了一个系统,为每张图片生成一个结构化的“准则”(rubric)——即一份规则清单。他们不仅仅是让 AI 去猜测规则;他们教它扮演一个执行者(executor)。模型必须观察图像,阅读一份规则列表(例如“检查鞋子是否为红色”或“确保文本语气礼貌”),然后逐一验证每一项,最后给出“通过”或“失败”的判定。
团队使用了一个巧妙的四步流程来创建这些训练数据。首先,他们为 AI 发明了一个“人格(persona)”,比如“品牌海报评审员”或“数学测试检查员”。然后,他们引导 AI 根据该人格生成一份规则列表。他们过滤掉了坏规则(那些令人困惑或自相矛盾的规则),只保留高质量的规则。最后,他们教会模型如何编写一份报告,逐一检查每条规则,并将这些检查结果汇总成最终的决定。
结果表明,这种方法效果极佳。当他们使用仅 10,000 个这类合成示例来训练名为 Qwen3-VL-4B 的模型时,其遵循这些复杂规则的能力从微不足道的 9.5% 大幅跃升至 30.1%。这是一个了不起的成就,因为即使在这些训练之前,世界上最强大的 AI 模型也难以突破 30% 的门槛。论文指出,问题不在于 AI 不够“聪明”,而在于它尚未被教授“检查优先级规则列表”这一特定技能。
为什么这很重要
最有趣的发现是,这种训练并没有让 AI 在其他任务上变得“更笨”。通常情况下,当你教模型一个新的特定技巧时,它可能会忘记原有的旧技巧。但在本研究中,模型在提高遵循规则能力的同时,并没有失去其理解图像和文本的通用能力。
作者还测试了是否可以通过在测试阶段提供一些示例(类似于参考表)来“引导”模型完成这项工作。他们发现,虽然提供示例会有所帮助,但远不如通过实际训练让模型内化这一过程有效。这就像是给学生一张考试时的参考表,与教导他们如何学习从而真正理解材料之间的区别。
简而言之,这篇论文表明,要让 AI 在现实世界中真正发挥作用——在现实世界中,指令很少是简单的——我们需要停止将它们视为问答机器,而是开始将它们训练成尊重细则的严谨编辑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。