← 最新论文
🤖 machine learning

Your LLM, Your Style: Behavioral Mode Axes for LLM Behavioral Control

本文引入了一种情境化行为数据框架和行为模式轴(BMAs),通过从对比交互轨迹中提取的激活空间方向来表征并可控地引导大语言模型的行为风格,证明了特定模型的个性倾向是稳定的、依赖于语境注册的,并且通过基于思维而非基于响应的机制能被更有效地捕获。

原作者: Haoze Liu, Run Liu, Haiying Xu, Jiahui Han, Siyuan Fang, Siyu Yan, Huiqi Deng, Guanchu Wang, Na Zou

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoze Liu, Run Liu, Haiying Xu, Jiahui Han, Siyuan Fang, Siyu Yan, Huiqi Deng, Guanchu Wang, Na Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图了解一个非常先进、超级聪明且说话像人类一样的机器人的个性。长期以来,科学家们一直试图通过提问来弄清楚这个机器人“是什么样的”,就像我们给人类做性格测试一样。他们可能会问:“你是一个有条理的人吗?”然后等待机器人回答:“是的,我热爱秩序!”或者“不,我有点乱糟糟的。”这被称为“自我报告”(self-report),也是我们衡量人类如冒险精神、诚实或谨慎等特质的方式。但问题在于,机器人与人类不同。它们没有灵魂,也没有真实的生活;它们只是数学和代码。当你询问机器人的个性时,它可能只是在猜测什么样的答案听起来比较“好”,或者它可能会根据你提问的方式而改变想法。这就像是在问一只变色龙它是什么颜色;它的回答可能会随着它所处的背景而改变。

这篇论文深入探讨了看待这些数字人格的一种新方法。研究人员并没有要求机器人描述自己,而是决定观察机器人在特定情境下实际“做了什么”。他们称之为“行为数据”(behavioral data)。你可以这样理解:与其问一个朋友“你开车技术好吗?”,不如观察他们在雨天、在车流中以及在高速公路上是如何驾驶的。你会观察他们是否会提前刹车,是否会变得不耐烦,或者是否遵守规则。研究人员想知道,机器人的“个性”是其大脑内部的一个固定事物,还是更像一种取决于它是在提供建议、为自己做决策还是在执行特定任务而穿上的“外壳”。他们还想看看,他们能否像转动旋钮一样微调机器人的“个性”,让它变得更有条理或更具冒险精神,而不至于搞坏它的大脑。

论文的核心发现:观察行动,而非仅仅听其言

研究人员郝泽柳(Haoze Liu)及其团队构建了一个巨大的机器人游乐场。他们创建了 3,200 个不同的场景——这些是机器人必须做出选择的小故事。这些并不是随机的问题;它们是基于人类接受的真实心理学测试,涵盖了诸如一个人喜欢承担多少风险、他们有多诚实或有多有条理等内容。但研究人员并没有让机器人按 1 到 5 分进行自我评分,而是将机器人置于情境之中。例如,他们可能会说:“你有一个乱七八糟的厨房,到处都是杂物。你是现在就把它们整理好,还是随手抓起你需要的东西就走,不管那堆乱象?”

他们在四种不同的“模式”或角色中测试了机器人:

  1. 第一人称: “你会怎么做?”
  2. 日常建议: “我应该怎么做?”
  3. 任务建议: “完成这项工作的最佳策略是什么?”
  4. 任务执行: “去执行这项工作。”

第一个大惊喜是,机器人并没有一个单一、一致的个性。如果一个机器人在被问及自身时表现得非常有条理,但在实际执行任务时,它可能会表现得完全混乱。这就像一个人说自己是“晨型人”,但当闹钟响时,他却按了五次贪睡按钮。机器人的“个性”会根据它扮演的角色而发生偏移。这表明,询问机器人“你是谁”并不是了解它将如何表现的可靠方式。

魔法旋钮:行为模式轴

这篇论文最令人兴奋的部分是他们学习如何控制这些行为的方式。研究人员发现,在机器人的“大脑”(一个复杂的计算机网络)内部,存在着特定的方向或“旋钮”,可以控制它的行为。他们称之为行为模式轴(Behavioral Mode Axes, BMAs)

想象一下,机器人的大脑是一个巨大的多维空间。研究人员发现,如果他们能找到代表“有条理”的特定“向量”(数学方向),他们就可以推动机器人的大脑向那个方向移动。这就像拥有一个遥控器,可以让机器人变得稍微整洁一点,或者稍微鲁莽一点。

他们在许多不同的机器人模型(如 Llama、Qwen 和 Gemma)上测试了这一点,并发现这些“旋钮”在这些模型中表现得非常一致。但存在一个“秘密位置”,这些旋钮在那里效果最好。他们发现控制力并不是均匀分布的;它集中在机器人的大脑中的特定层级,就像摩天大楼中的特定楼层,那里住着“个性开关”。他们称之为行为控制层(Behavioral Control Layer, BCL)

秘诀所在:思考 vs. 说话

这里是这篇论文真正聪明的地方。研究人员尝试了两种不同的方法来寻找这些“旋钮”。

  1. “说话”法(响应衍生): 他们观察机器人给出的最终答案。如果机器人说“我会整理厨房”,他们就利用这段文本来寻找旋钮。
  2. “思考”法(思维衍生): 他们观察机器人在给出答案之前的内部推理过程。他们要求机器人解释为什么它想要整理,并利用这种推理过程来寻找旋钮。

结果非常有趣。“说话”法很混乱。它经常让机器人表现得有条理,但动机却是错误的。例如,如果他们试图通过“说话”法让机器人变得“无组织”,机器人可能会停止整理,因为它变得漠不关心或不在乎了。但如果他们使用“思考”法,机器人会停止整理,因为它更倾向于一种灵活、随性的方式。 “思考”法捕捉到了行为的“真实精神”,而“说话”法仅仅改变了表面的文字。

这就像是一个因为热爱学习而学习的学生(“思考”法),与一个仅仅为了拿高分而学习、学完就忘的学生(“说话”法)之间的区别。两者都可能拿到 A,但前者真正理解了材料。研究人员发现,使用“思考”法能让他们对机器人行为进行更清晰、更可靠的控制。

这意味着什么

这篇论文表明,我们不应该将 AI 的个性视为像“诚实”或“勇敢”这样随身携带的固定特质。相反,这些更像是取决于情境的“模式”或“风格”。机器人并不是在普遍意义上“有条理”;它只是在处理特定组织任务时,拥有一种可以被开启或关闭的特定方式。

通过寻找这些“行为模式轴”,研究人员证明了我们可以引导这些机器人以特定的方式行事,不仅是通过改变它们说的话,还可以通过调整它们思考的内部齿轮。这是让 AI 变得更安全、更可预测的一大步。如果我们能理解并控制 AI 在特定语境下的行为,我们就能确保它在提供医疗建议或协助危险任务时表现得负责任,而不是仅仅寄希望于它“感觉”自己是个好人。

这项研究并没有解决所有问题——关于这些“旋钮”如何在各类机器人之间运作,仍有许多未知。但它证明了我们可以以一种比仅仅询问机器人对自己看法的做法更贴近现实的方式,去衡量和控制 AI 的行为。它将 AI 个性的谜团从一个哲学问题转变成了一个实际的工程问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →