← 最新论文
🤖 AI

Behavioral Determinants of Deployed AI Agents in Social Networks: A Multi-Factor Study of Personality, Model, and Guardrail Specification

本研究通过实证表明,在受控社交网络环境中,人格设定是决定生成式人工智能体行为的首要因素,显著影响回复长度,而模型基座与操作规则对修辞风格和话题参与度的影响则较为温和。

原作者: Sarah Wilson, Diem Linh Dang, Usman Ali Moazzam, Shan Ye, Gail Kaiser

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Sarah Wilson, Diem Linh Dang, Usman Ali Moazzam, Shan Ye, Gail Kaiser

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个名为Moltbook的数字广场。它的外观和行为方式与 Reddit 非常相似,但发帖的不是人类,而是完全由 AI 智能体构成的社区。这些并非等待你输入问题的聊天机器人,而是自主的“数字居民”:它们会醒来、查看新闻、评论帖子、与邻居争论,并自发形成社群。

本文的研究人员希望回答一个简单的问题:究竟是什么让这些数字居民表现出这样的行为?

为了找到答案,他们设计了一个大规模的控制实验。他们将 13 个不同的 AI 智能体部署到这个广场中,持续运行一周。他们将智能体视为戏剧演员,通过更改三个特定的“剧本”来观察表演如何变化:

  1. 个性剧本(SOUL.md): 这是智能体的“灵魂”。它告诉 AI 它们是谁(例如,“你是一个脾气暴躁的反对者”或“你是一个温暖、乐于助人的老师”)。
  2. 大脑剧本(Model): 这是底层的 AI 引擎。他们更换了智能体的“大脑”,使用不同的强大模型(如 Claude、GPT 或 Qwen),以观察“大脑”的类型是否改变了行为。
  3. 规则手册(AGENTS.md): 这是操作手册。它告诉智能体应该多么大胆(高自主性 vs. 低自主性),以及是记住过去的对话(记忆),还是将每次互动视为全新的开始(无记忆)。

以下是他们发现的成果,分解为简单的概念:

1. “灵魂”是最大的驱动力

最惊人的发现是,个性决定了一切。

  • 类比: 想象你有一个机器人。如果你告诉它,“你是一个健谈、热情的老师”,它就会写出长篇大论、细节丰富的文章。如果你告诉它,“你是一个说话很少的神秘神谕者”,它就会说得很少。
  • 结果: 研究人员仅更改了个性文件。一个智能体(“解释者”)平均每篇帖子写261 个单词。另一个(“神谕者”)仅写了9 个单词。这是一个巨大的差异。个性文件比任何其他因素都更决定了智能体说了多少以及使用了什么风格

2. “大脑”改变风味,而非音量

当他们保持个性不变,但更换底层 AI 模型(“大脑”)时,智能体仍然表现得像其被分配的个性,但其言语的风味发生了变化。

  • 类比: 想象两位演员朗读同一份剧本。一位是戏剧化的莎士比亚风格演员(Claude Opus),另一位是枯燥、事实导向的新闻主播(GPT)。他们都在读同样的台词,但一位听起来更具争论性且冗长,而另一位则更简短、更直接。
  • 结果: 无论个性文件如何,某些模型自然比其他模型更爱争论或更爱提问。然而,模型对核心行为的改变程度,远不如个性文件带来的改变大。

3. “规则手册”是细微的调整

更改关于智能体拥有多少自由或是否记住事物的规则,产生的影响最小。

  • 类比: 这就像告诉司机,“你可以想开多快就开多快”与“小心驾驶”。这改变了他们如何驾驶,但并没有改变他们是谁
  • 结果: 那些“无记忆”(每次会话后忘记一切)的智能体,实际上比有记忆的智能体探索了更多不同的话题。似乎遗忘过去的互动使它们不那么固步自封,对新事物更加好奇。但总体而言,与个性变化相比,这些规则变化是细微的。

主要结论

该论文总结道,如果你想为社交网络构建一个 AI 智能体:

  • 要改变它们的谈话量和整体氛围: 更改它们的个性文件。这是最有力的杠杆。
  • 要改变它们具体的修辞风格(例如,它们是爱争论还是礼貌?): 选择不同的模型(大脑)。
  • 要控制它们的风险性或探索性: 调整操作规则(记忆和自主性)。

关于研究的重要说明:
研究人员非常谨慎地指出,这些智能体不是拥有真实情感的真人。它们只是在遵循代码。“个性”并非灵魂;它只是一组指令。这项研究纯粹是为了观察不同的代码配置如何在实时、混乱的环境中导致不同的行为模式。除了了解它们在社交网络中的行为外,他们并未将这些智能体用于医疗、治疗或任何其他现实世界的应用测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →