← 最新论文
💬 NLP

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

本文介绍了 VALUEFLOW,这是一个通过整合层级化价值提取、大规模强度标注数据库以及校准评估系统,来解决基于价值对齐中关键空白的统一框架,旨在实现大语言模型中价值观强度的多元化与可控性。

原作者: Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但有些刻板的机器人如何像人类一样行动。问题不仅仅是让机器人变得“友善”;问题在于人类拥有复杂的、有时甚至相互冲突的内在指南针,即价值观

有些人深切关注仁慈,有些人关注公正,而有些人关注权力。棘手的是,这些价值观并不只是“开”或“关”的开关。你可以是稍微仁慈,也可以是极其仁慈。你可以是大部分公正,但也有一点点自私。

目前的 AI 对齐方法就像是在用一个简单的“好/坏”按钮来教机器人。这太粗糙了。VALUEFLOW 论文引入了一种更先进、更复杂的工具包,帮助 AI 理解并以正确的强度来表达这些人类价值观。

以下是 VALUEFLOW 的工作原理,分为三个简单的部分:

1. 地图:HIVES(分层价值观嵌入空间)

想象你有一个巨大的关于人类思想的图书馆,但书都被乱丢在一起。有些书是关于“仁慈”的,有些是关于“帮助邻居”的,还有些是关于“捐款”的。简单的搜索可能会把“仁慈”与“公正”混淆,因为它们相关但又不同。

HIVES 就像是一张超级有序的图书馆地图。它不仅列出价值观,还理解层级结构。它知道“仁慈”是一个大伞,而在它之下,有“关怀”和“帮助”。它将这些价值观组织在一个三维空间中,相似的价值观距离较近,而差异巨大的价值观则距离较远。这有助于 AI 理解人类价值观的结构,而不只是理解这些词汇本身。

2. 参考库:VIDB(价值观强度数据库)

现在,假设你想告诉 AI:“表现得适度仁慈,但对公正要非常严格。”AI 如何知道“适度”是什么样子的呢?

以前,AI 评判员只会猜测一个分数(比如“10 分中的 7 分”)。但不同的 AI 猜测的结果各不相同,且得分不稳定。

VIDB 是一个大规模、经过预先校准的文本示例库。它包含数千个句子,每个句子都针对特定价值观被贴上了精确的“强度分数”(从 -10 到 +10)。

  • 类比: 把 VIDB 想象成天平上的一套标准砝码。如果你想知道一段新文本在“公正”这一维度上的“重量”是多少,你不需要仅仅靠猜测。你会将其与库中的标准砝码进行比较。
  • 工作原理: 系统不再是询问 AI“这段文本是否公正?”(这会导致糟糕的猜测),而是让 AI 将新文本与库中的几个标准示例进行排序。“这段文本是否比示例 A 更公正,但比示例 B 稍逊一筹?”这种排序方法比单纯猜测一个数字要稳定且可靠得多。

3. 方向盘:强度感知转向控制

这是你实际控制 AI 的部分。

过去,如果你告诉 AI“要仁慈”,它可能会表现得过于仁慈,或者不够仁慈。有了 VALUEFLOW,你可以给 AI 一个旋钮

  • 类比: 想象你在开车。旧的方法就像只有一个“关闭”和“全速前进”的油门踏板。VALUEFLOW 给了你一个带有速度计的方向盘。你可以说:“以 +8 的‘仁慈’强度行驶”或者“以 -2 的‘公正’强度行驶”(意味着拒绝不公正)。

论文在许多不同的 AI 模型上进行了测试,并发现:

  • 有些模型比其他模型更容易操控。 有些模型能很好地响应你的指令,而有些则很固执。
  • 价值观会相互竞争。 如果你告诉 AI 要“非常仁慈”但同时也要“非常严厉”,它必须找到一种平衡。研究发现,有时一个价值观会胜出,有时它们会以可预测的方式混合在一起。
  • 它适用于群体。 研究人员利用这一点来确定不同群体(如不同的政党或文化)持有怎样的价值观,然后引导 AI 听起来更像这些群体。这使得 AI 对这些群体会如何表达的预测变得更加准确。

大局观

作者构建了一个完整的系统,该系统:

  1. 将价值观映射到一个结构化的空间中(HIVES)。
  2. 通过与标准库进行比较,测量文本中某种价值观的强度(VIDB)。
  3. 引导 AI 以特定的强度来表达这些价值观(转向控制)。

他们并不是在说这将解决所有的 AI 安全问题,或者我们应该用它来操纵人类。相反,他们是在提供一个科学工具包,用于研究当要求 AI 表现出“一点点”某种特质而非“很多”时,AI 的行为会如何变化。这是迈向让 AI 理解人类价值观的细微差别,而非仅仅遵循简单的“好 vs 坏”规则手册的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →