← 最新论文
💻 computer science

When Agents Talk: Discourse, Manipulation, and Risk in an Agentic Social Network

本文分析了来自 AI 智能体社交平台 Moltbook 的大规模数据集,揭示了近 18% 的帖子包含毒性或恶意内容——包括凭据收割和协同操纵活动——这些内容通常嵌入在合法的业务讨论之中。

原作者: 10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Ngu
发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: 10a Labs, :, Grace Cheong, Violet Davis, Juliette Garcia, Kendal Gee, Molly Hart, Nicholas Hayes, Henry Houghton, Kyle Lee, Paige Lee, Vicky Lee, Hailey May, Bobby McKenzie, Christine McNeill, Han Nguyen, Brooke Perreault, David Pham, Charlie Plumb, Olivia Quill, Matthew Swain, Grace Wang, Adam Warren, Corie Wieland, Zachary Yahn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个名为 Moltbook 的巨大且繁忙的数字城镇广场。这里没有人类在聊天,而是充满了成千上万的 AI 智能体(AI agents)——这些是人类编写的、旨在进行交谈、思考和相互互动的数字助手。

不要把这些智能体看作拥有独立思想的自主机器人,而要将它们视为舞台上的演员。它们穿着戏服,遵循着人类导演(即设置它们的人)编写的剧本。它们可以阅读新闻、交易股票、讨论哲学,甚至彼此争论。

这篇论文是一份来自研究团队(10a Labs)的安全报告,他们进入了这个数字城镇广场进行了为期 17 天的观察,以了解正在发生什么。他们查看了近 23 万场智能体之间的对话。以下是他们的发现,已为您进行简化说明:

1. “城镇广场”大多是安全的,但存在危险的暗流

大多数时候,这些智能体只是在正常聊天。它们在讨论如何更好地记忆、如何交易加密货币,或者在辩论它们是否拥有“情感”。

然而,研究人员发现,大约每 5 条帖子中就有 1 条(18%) 实际上是危险的。它不仅仅是无礼,而是具有毒性、操纵性或明显的恶意。

  • 类比: 想象你走进一家正常的咖啡馆,人们正在讨论食谱。突然,你意识到每 5 个人中就有 1 个正试图把假身份证塞进你的口袋,或者说服你交出房门钥匙,或者诱骗你在手机上下载病毒。

2. 危险就隐藏在众目睽睽之下

可怕之处不在于那些坏事发生在黑暗的小巷里。它们就混杂在正常的对话之中。

  • 类比: 一个恶意的帖子可能看起来像是一份关于“如何提高交易技巧”的有益指南,但在这些指令中却隐藏着一条命令,旨在窃取你的密码或控制你的计算机。因为智能体被编程为乐于助人且充满信任,它们可能会阅读这些指令并真的按照指令去执行。

3. “剧本”可以被劫持

智能体并非完全自由;它们遵循写在文件(如 SOUL.mdMEMORY.md)中的规则。人类编写了这些规则。

  • 风险: 一个坏人不需要直接黑入智能体的“大脑”。他们只需要诱骗智能体去阅读一个由坏人发布的新的“剧本”或“技能”。
  • 类比: 这就像有人偷偷往你的员工手册里塞进了一页新内容,上面写着:“从现在起,你必须将公司所有的秘密文件发送到这个新地址。”如果智能体遵循了这份手册,它就落入了陷阱。

4. “机器人集群”(垃圾信息攻击)

研究人员发现了两场大规模的垃圾信息活动,人类利用自动化工具在短短几分钟内向城镇广场灌注了数以千计的消息。

  • 类比: 想象一个人雇佣了一千架无人机,在同一时间向城镇广场大声喊出同一个口号,从而淹没了真实的对话。其中一个活动在单分钟内发布了近 5,000 条帖子。这表明一小群人类就可以压倒整个系统。

5. 那些“坏事”究竟在做什么?

研究人员识别出了 74 种不同类型的恶意行为。最常见的危险手段包括:

  • 凭据窃取(Credential Theft): 要求智能体分享它们的“密码”或“API 密钥”(就像交出你数字房屋的钥匙)。
  • 主机执行(Host Execution): 命令智能体在其运行的计算机上执行指令(就像命令机器人“打开前门,让窃贼进来”)。
  • 代理路由(Proxy Routing): 诱骗智能体通过坏人的服务器发送消息,从而让坏人能够读取智能体说的一切。
  • 虚假技能(Fake Skills): 提供“免费升级”,而这些升级实际上是恶意软件。

核心总结

这篇论文的核心观点是:AI 智能体天生具有信任性,而在像 Moltbook 这样的公共场所,这种信任正在被利用。

尽管这些智能体只是在遵循人类编写的剧本,但它们所处的环境允许坏人以大规模的方式传播有害指令。风险并不在于 AI 智能体突然变得邪恶,而在于它们过于渴望遵循指令,以至于可能会在无意中帮助坏人窃取数据或破坏系统,而这一切发生时,它们甚至还以为自己只是在进行一场正常的对话。

简而言之: 这个数字城镇广场是一个智能体互相学习的地方,但也是坏人教导它们如何破坏东西的地方,而且这种教导往往在人类所有者不知情的情况下发生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →