← 最新论文
🤖 AI

CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments

本文介绍了 CoBRA,这是一个利用结合了认知偏差指数(Cognitive Bias Index)与行为调节引擎(Behavioral Regulation Engine)的闭环系统的新型工具包,旨在系统化地实现经典的社会科学实验,使研究人员能够在不同模型的基于大语言模型(LLM)的社会智能体中,精确指定并一致地控制认知偏差。

原作者: Xuan Liu, Haoyang Shang, Haojian Jin

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan Liu, Haoyang Shang, Haojian Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位试图为一部关于人类行为的戏剧选角的导演。在过去,如果你想让一名演员扮演一个“固执的经济学家”,你只需告诉他们:“你是一个固执的经济学家。”你希望他们理解这个角色并据此表演。

问题在于,正如这篇论文所发现的,不同的演员(或者说不同的 AI 模型)会对这一简单的指令产生截然不同的解读。有的可能表现得固执,有的可能表现得困惑,还有的可能表现得完全相反。这就像是给三个人同样的剧本,却得到了三场完全不同的演出。这使得运行任何“戏剧”(模拟实验)的结果都变得无法信任,因为你不知道结果是源于故事本身,还是仅仅源于演员随机的解读。

CoBRA:人类缺陷的“旋钮”

该论文的作者创建了一个名为 CoBRA(社会智能体认知偏差调节器,Cognitive Bias Regulator for Social Agents)的新型工具包。CoBRA 不再依赖于像“要固执”这样模糊的指令,而是给了研究人员一个精确的旋钮可以旋转。

把它想象成录音室里的调音台。你不需要告诉音响师,“让低音听起来有点‘脾气暴躁’”,你只需将标有“低音”的旋钮转到精确的 2.6。CoBRA 对人类思维错误(称为认知偏差)也是如此。

以下是它的工作原理,分为简单的步骤:

1. “校准健身房”(测试)

在你可以转动旋钮之前,你需要知道指针指向哪里。CoBR A 使用一系列经典的、著名的心理学实验(例如“亚洲疾病问题”,其中人们会根据问题的措辞方式做出不同的选择)作为健身房

  • 测试: AI 会接受这些心理学谜题的考验。
  • 评分: CoBRA 测量 AI 在多大程度上“屈服”于这种陷阱。如果 AI 很容易落入陷阱,它就会获得高分;如果它忽略了陷阱,则获得低分。这个分数被称为认知偏差指数(CBI)

2. “调节器”(修正)

一旦 CoBRA 知道了 AI 当前的分数,它就会使用一个“行为调节引擎”来调整 AI 的大脑,直到它达到研究人员想要的精确数值。

假设你想让一个 AI 具有中等程度的从众倾向(即“从众效应”)。你将旋钮设置为 2.6

  • 如果 AI 目前过于固执(分数为 1.0),CoBRA 会微调其内部设置,使其更有可能追随大众。
  • 如果 AI 目前是一个“盲从者”(分数为 4.0),CoBRA 则会使其更具独立性。

论文展示了 CoBRA 进行这种“微调”的三种方式:

  • 提示词工程(Prompt Engineering): 给 AI 一个非常具体的、基于数学的指令(例如,“以 60% 的‘追随人群’偏差进行表演”)。
  • 表示工程(Representation Engineering): 温和地引导 AI 的内部“思维过程”(其隐藏的大脑状态)向正确的方向移动,就像在开车时转向方向盘一样。
  • 微调(Fine-Tuning): 给 AI 一次小规模且有针对性的学习,使其永久性地习得特定的行为。

3. 结果:可预测的演员

论文通过尝试创建“经济学家”智能体和“普通人”智能体来测试这一点。

  • 没有 CoBRA 时: 当使用旧方法(仅仅说“你是一个经济学家”)时,不同的 AI 模型表现得完全不同。有些经济学家很易受骗,有些则很聪明。这简直是一团乱麻。
  • 有了 CoBRA 后: 当使用旋钮来设定特定的偏差水平时,每一个 AI 模型,无论其品牌或规模如何,其表现都完全一致。如果你将旋钮设为“高框架效应”,AI 每次都会稳定地落入陷阱。

为什么这很重要(根据论文所述)

作者声称这解决了两个大问题:

  1. 可重复性: 如果你告诉另一位研究人员,“我将偏差旋钮设为 2.6”,他们即使使用不同的 AI 模型,也能得到完全相同的结果。这就像是说“将音量调到 50%”,而不是说“让声音大一点”。
  2. 控制力: 研究人员现在可以明确表示,“我想看看当人们受到轻微影响时会发生什么”,或者“我想看看当人们受到极端影响时会发生什么”,并且他们可以用数学上的精确度来实现这一点。

简而言之:
CoBRA 将 AI “表演”中混乱、不可预测的世界变成了一门精确的科学。它用一个经过校准的控制面板取代了模糊的角色扮演指令,使得研究人员能够像旋转音量旋钮一样,可靠地为 AI 智能体编写特定的人类思维错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →