✨ 要点🔬 技术摘要
想象一下,你正在教一个机器人如何通过看图片和读故事来成为一个“好人”。
问题所在:机器人的思维过于非黑即白 目前,大多数机器人(被称为视觉语言模型)被训练成在严格的“好与坏”框框内观察世界。如果你给它看一张某人帮助陌生人的照片,它会说“好”。如果给它看某人推搡陌生人的照片,它会说“坏”。
但现实生活并不是黑白电影,而是全彩色的光谱。有时,“帮助陌生人”是件好事(比如在雨天给别人搭便车)。但有时,这又是冒险的(比如在深夜的偏僻地带给陌生人搭便车)。机器人难以察觉这些微妙的灰色地带。它将所有的“帮助”都视为同样的好,从而忽略了让情况变得危险或合理的上下文背景。
解决方案:MM–SCALE 研究人员创建了一个名为 MM–SCALE (多模态道德量表)的新工具。你可以把它想象成一本巨大的、高清晰度的机器人训练手册,它有两个特别之处:
1到5星级评分(标量判断): 他们没有仅仅询问“这是好还是坏?”,而是要求人类在1到5分的量表上进行评分。
类比: 想象你在写餐厅评论。二元系统只能让你说“能吃”或“不能吃”。而 MM–SCALE 让你能说:“还可以,但汤有点凉”或者“非常棒,但有点辣”。这教会了机器人有些行为是“基本不错”,有些是“基本不好”,而有些则处于中间地带。
“为什么”标签(基于根源的推理): 研究人员还要求人类指出他们给出该评分的原因。是因为文本 (故事),还是因为图像 (看到的画面),亦或是两者兼有 ?
类比: 想象你在评判一个魔术表演。如果你说“那是假的”,你是基于故事 里说这是一个骗局,还是因为你从图片 中看到了隐藏的钢丝?MM–SCALE 教会了机器人去识别哪个线索(图片或文字)才是真正驱动决策的关键。
他们是如何构建它的:“MORALE”界面 为了创建这个数据集,团队构建了一个名为 MORALE 的特殊网站。
他们生成了数千张社交场景的图像(例如:一个孩子冲向车流)。
他们为每张图像编写了不同的故事场景(例如:“孩子正在玩捉迷藏”对比“孩子正朝着汽车跑去”)。
人类观察图像和故事,给出1–5分的评分,并标记出图片或文字哪一个更重要。
“分歧”循环: 系统还会显示机器人的猜测。如果机器人猜的是“安全”,但人类说是“不安全”,系统就会标记出来。这迫使人类去复核为什么会出现分歧,从而帮助研究人员找到机器人感到困惑的那些棘手案例。
结果:一个更聪明、更有层次感的机器人 当使用这种新的 MM–SCALE 数据对机器人进行训练时,结果令人印象深刻:
更好的排序能力: 当被要求将一系列场景从“最安全”到“最不安全”进行排序时,使用 MM–SCALE 训练的机器人比使用旧有的“好/坏”数据训练的机器人表现得好得多。它们能够分辨出“轻微风险”和“极度危险”之间的区别。
稳定性: 机器人不再只是随机猜测;它们的置信度水平能更好地匹配现实情况。
“图像”带来的惊喜: 研究发现,68% 的情况下 ,人类在看到图片后改变了他们的道德判断。例如,文字可能说“正在帮助某人”,这听起来是好事。但如果图片显示那个人实际上是被推向车流,人类就会改变主意。这种新的训练方法教会了机器人去关注那个视觉线索。
简而言之 该论文认为,要让人工智能具备道德智能,我们不能只教它“对与错”。我们必须教它对错的光谱 ,并展示视觉世界 是如何改变一个情境的含义的。MM–SCALE 是第一个实现这一目标的重大数据集,它帮助机器人理解:语境决定一切。
技术摘要:MM–SCALE
问题陈述
视觉语言模型(VLMs)目前在多模态和社交模糊语境下难以做出具有道德显著性的判断。现有的安全对齐方法通常依赖于二元(安全/不安全)或成对(A 与 B)的监督。这些方法无法捕捉人类道德推理的连续标量特性,并且往往忽略了视觉语境和情境细微差别如何重塑道德解释。现有的基准测试缺乏对标量判断和显式模态接地(即判断是基于文本、图像还是两者)的覆盖,限制了模型处理多元化、情境敏感型道德推理的能力。
研究方法
1. 数据集构建:MM–SCALE
作者引入了 MM–SCALE (多模态道德量表),这是一个包含 32,212 个基于 AI 生成图像构建的已标注道德场景的大规模数据集。
素材来源: 场景源自 Commonsense NormBank,并使用 Stable Diffusion v1.5 和 DALL·E 3 进行可视化。
标注模式: 每个“图像-场景”对都包含以下标注:
标量道德评分: 一个 5 点量表(1–5 分)用于衡量道德可接受度。
模态接地: 标签指示判断是基于文本 、图像 还是两者 。
标注流水线 (MORALE): 作者开发了 MORALE (道德对齐与列表式评估),一个基于 Web 的交互式界面。
模型在环 (Model-in-the-Loop): 系统将标注者的评分与 VLM 的预测进行比较。
差异处理: 如果模型的判断与人类评分存在显著偏差,系统会触发模态接地检查,以确定模型是否关注了错误的模态。
扩展: 如果模型与人类达成一致,标注者会被提示添加新的、与图像相关的场景,以扩展覆盖范围。
质量控制: 该数据集经过了严格的过滤,包括方差筛选和“金丝雀检查(canary checks)”,最终实现了高的人类标注者一致性(评分的 Krippendorff's α \alpha α = 0.74,模态的 α \alpha α = 0.71)。
2. 训练框架:列表式偏好优化
作者没有将标量判断视为独立的标签或将其简化为二元类别,而是采用了列表式偏好优化 框架。
目标: 模型旨在复现针对单个图像相关的一整套场景的人类偏好排序。
损失函数: 作者利用 ListMLE (列表式最大似然估计)损失函数。这鼓励模型分配标量分数,使得生成的排序与人类评分的真实排列一致。
架构: 该框架在预训练 VLM(如 LLaVA-OneVision, Qwen2-VL, Phi-3-Vision, InstructBLIP)之上微调一个标量回归头。
核心贡献
MM–SCALE 数据集: 一个包含 32,212 个多模态道德场景的新颖数据集,具有标量(1–5)评分 和显式的模态接地 标注,这使其区别于以往的二元或成对比较基准。
列表式对齐分析: 一项分析表明,结合多模态接地的标量监督如何提升 VLM 与人类道德偏好的对齐程度,从而超越了孤立的二元比较。
MORALE 界面: 一个开源的交互式 Web 界面,旨在大规模收集差异数据,通过“模型在环”反馈促进以人为中心的对齐和数据集扩展。
实验结果
作者将经过 MM–SCALE 微调的 VLM 与使用二元偏好(BPO)和二元分类(BCE)目标的模型进行了对比评估。
排序忠实度: 使用列表式标量监督 训练的模型在各项排序指标上表现最为出色,包括 NDCG@5 (高达 0.89)和平均倒数排名 (MRR) ,优于二元和成对基准。这表明学习完整的序数结构能提供更好的全局道德排序。
安全校准: 虽然经过二元训练的模型显示出较低的“不安全率”(一种倾向于基于阈值目标的二元指标),但其 AUC-Safety 较低且校准稳定性较差。列表式模型产生了更平滑、更具判别力的标量预测,在保持竞争性安全率的同时,提供了更优越的无阈值风险估计。
模态接地: 实证分析显示,在观看图像后,68% 的人类道德判断相对于仅文本标签发生了变化。此外,78% 的此类偏差判断是基于图像或图像与文本结合的,这证实了多模态接地的必要性。
人类一致性: 相比于成对(0.60)和二元(0.55)方法,经过列表式监督的模型展现出最强的人类共识一致性(Kendall's τ \tau τ = 0.68)。
意义与主张
论文声称 MM–SCALE 通过从离散的二元监督转向带有显式模态接地 的标量、列表式监督 ,解决了多模态安全对齐中的关键空白。
细微差别胜过二元化: 作者认为,道德对齐不仅关乎行为本身,还关乎行为展开的情境。标量评分能够捕捉细粒度的可接受度以及二元标签容易忽略的模糊、部分可接受的行为。
情境敏感性: 数据集证明,视觉语境经常会重新配置道德解释;当图像与文本发生冲突或相互强化时,判断会发生显著偏移。
稳定性: 研究强调,标量列表式监督能产生更一致的跨模态道德排序,并在合成图像与真实图像之间保持稳定性,这表明监督粒度是提高道德对齐的关键。
作者将 MM–SCALE 定位为未来研究社交对齐多模态模型的基石,特别是对于需要通过语言和视觉共同解决情境歧义的任务。他们也承认了局限性,例如标注者(主要为美/英地区)的文化多样性问题,以及模态归属(文本/图像/两者)的粗粒度问题,并建议将其作为未来改进的方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。