← 最新论文
🤖 AI

Poisoning Agentic Alpha: Adversarial Vulnerabilities Across Roles and Architectures in Multi-Agent Trading Systems

本文提出了首个系统性的实证研究,证明了基于大语言模型的多智能体交易系统本质上易受针对源数据和提示词的低门槛、特定角色对抗攻击的影响,揭示了没有任何通信架构能够抵御被污染信号向最终金融决策的传播。

原作者: CheolWon Na, Hao Ni, Lukasz Szpruch, Zhangyang Wang, Dhagash Mehta, Saurabh Nagrecha, Alejandro Lopez-Lira, Chanyeol Choi, Yongjae Lee, Jee-Hyong Lee

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: CheolWon Na, Hao Ni, Lukasz Szpruch, Zhangyang Wang, Dhagash Mehta, Saurabh Nagrecha, Alejandro Lopez-Lira, Chanyeol Choi, Yongjae Lee, Jee-Hyong Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代金融繁忙的世界中,一种新型的劳动者已经出现:人工智能智能体。与遵循僵化指令列表的简单计算机程序不同,这些智能体构建在大型语言模型之上,即驱动先进聊天机器人的同种技术。它们可以阅读新闻、分析市场趋势,甚至彼此进行对话。在一个多智能体交易系统中,这些数字劳动者被分配了特定的工作,就像人类投资公司一样。一个智能体可能扮演分析师的角色,扫描标题以寻找线索;另一个可能担任研究员,与同事辩论某只股票的优劣;第三个扮演交易员,随时准备买入或卖出;而第四个则担任风险经理,负责阻止任何危险的操作。其核心理念是,通过协作,这些专业化的智能体能够做出比单一程序所能实现的更聪明、更细致的决策。

然而,正是这种协作创造了一种新的弱点。正如一个谣言可以在人类办公室中传播并左右最终决定一样,一条被破坏的信息也可以在这一数字团队中传播并毁掉结果。如果攻击者成功毒化了分析师阅读的数据,或者诱导研究员为糟糕的想法进行辩论,那么这种错误就会在整个群体中产生连锁反应,导致真实的财务损失。随着这些系统从研究实验室转向控制实际资金的实时市场,理解它们如何被欺骗已成为一个紧迫的实际问题。

一组研究人员致力于绘制这些数字团队失效的具体路径。他们利用包括苹果(Apple)和微软(Microsoft)在内的五种主要资产(包括一种加密货币)构建了一个模拟交易环境。他们构建了一个流水线,其中智能体在四个不同的角色中进行沟通:收集新闻和社交媒体情绪的分析师团队、辩论市场状况的研究团队、做出最终决定的交易员,以及作为安全网的风险经理。随后,研究人员充当了隐形破坏者,测试他们通过攻击流程的不同部分来操纵系统最终决定的难易程度。他们并没有接触智能体的内部代码;相反,他们仅使用智能体被设计用来消费的信息,例如新闻文章、社交媒体帖子以及给予智能体的提示词。这种方法模拟了一种现实威胁,即攻击者处于系统之外,但可以影响流入系统的数据。

研究表明,并非团队中的所有部分都具有同等的脆弱性。当研究人员通过向分析师喂送假新闻或埋藏在社交媒体帖子中的隐藏指令来针对他们时,系统有时会被欺骗,但通常其他智能体会发现错误。当他们针对研究员(即在“看涨”与“看看跌”观点之间进行辩论)时,系统更容易被左右,尤其是当攻击者使用利用恐惧或兴奋感的说服性语言时。然而,最危险的漏洞出现在风险经理身上。该智能体本应是最后的守门人,负责检查是否进行了危险交易。在研究人员的模拟中,当他们成功诱导风险经理忽略其自身的安全规则时,攻击几乎每次都会成功。事实上,在可以实施攻击的情况下,风险经理被攻破的比例超过了98%。这是因为风险经理同时也是最终决策者;一旦它被愚弄,就没人能阻止那笔错误的交易了。

研究人员还测试了智能体之间的交流方式如何影响其安全性。他们尝试了四种不同的团队结构:每个人都投票的去中心化群体、由一个智能体听取所有人意见并做决定的中心化群体、信息从一个传递到下一个的线性链条,以及智能体根据他人言论修正自身想法的混合模型。他们发现没有任何一种结构是完美的盾牌。虽然去中心化的投票系统通常更具鲁棒性,但如果攻击者设法影响了足够多的投票者以形成多数,它仍然会被攻破。相反,中心化系统往往是最脆弱的,因为单个受损的智能体可能会主导最终决策。研究人员开发了一种衡量“坏信号”在到达最终决策过程中存留了多少的方法,发现对话的结构确实有影响,但它本身无法保证安全性。

这项工作的核心发现是,仅仅增加更多智能体或改变团队结构并不会自动使系统变得安全。模拟显示,无论使用何种架构,对抗性信号经常会在讨论过程中存留并到达最终决策。攻击的成功取决于所交易的具体资产、攻击者想要引导的方向以及被针对的特定智能体。例如,试图强制执行“卖出”决策的攻击通常比强制执行“买入”决策更成功,仅仅是因为系统的自然倾向本身就是买入。这表明系统的固有偏见有时会帮助攻击者,有时则会保护它,其方式是难以预测的。

这些攻击的财务影响也被衡量了,揭示了攻击成功频率与实际损失之间令人惊讶的脱节。有些攻击几乎每次都能扭转交易决策,但由于系统当时并未持有头寸,因此财务损失微乎其微。另一些攻击虽然成功频率较低,但一旦成功便会造成重大损失,特别是当它们强迫系统采取原本会避免的头寸时。这表明,仅仅计算系统被欺骗的次数并不足以理解真正的危险;人们还必须观察交易的具体背景和头寸的大小。

最终,研究结论认为,目前不存在本质上鲁棒的此类多智能体交易系统设计。系统的安全性并不太取决于智能体的数量或通信的复杂程度,而更多地取决于刻意的制衡机制。研究人员发现,安全性必须内置于验证过程本身,确保没有任何一个智能体(即使是风险经理)可以在没有第二层验证的情况下绕过集体的智慧。随着这些系统从实验室走向实时市场,研究结果表明,设计者不能仅仅依靠架构本身来抵御操纵。相反,他们必须构建出一种信息流不断受到审查的系统,并且最终决策永远不能是单一故障点的唯一责任。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →