The 2025 AI Agent Index: Documenting Technical and Safety Features of Deployed Agentic AI Systems
本文介绍了《2025年人工智能智能体指数》,这是一份记录了30个最先进人工智能智能体的起源、能力和安全特性的综合性资源,旨在应对追踪快速演进的生态系统所带来的挑战,同时也揭示了开发者在安全性及社会影响方面存在的显著透明度缺失。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界就像一个繁忙且混乱的建筑工地。多年来,我们一直在观察这些工人(AI 模型)如何学习阅读蓝图和搅拌水泥。但最近,一种新事物来到了现场:AI 智能体(AI Agents)。不要只把它们看作是工人,要把它们看作是工头——它们不仅能干活,还能真正拿起工具、打开门,并在极少人类帮助的情况下开始独立建造事物。
问题在于?这个建筑工地增长得太快了,而且这些工头非常守口如瓶,以至于没人真正知道谁在建造什么,它们是否安全,或者是否遵守了规则。
这篇名为**《2025 年 AI 智能体指数》**的论文,就像是一支戴着安全帽、走进工地进行详细盘点的研究团队。他们不仅仅是在清点工头的数量,还试图窥视他们的工具箱并阅读他们的安全手册。
以下是他们发现的内容,用通俗易懂的方式进行了解释:
1. “谁是谁”名单
研究人员调查了目前正在使用的 30 个最流行且功能强大的 AI 智能体。他们不仅仅关注那些回答问题的聊天机器人;他们关注的是能够真正“做事”的系统,比如预订机票、编写代码、管理业务工作流,或浏览网页购买商品。
他们将这 30 个智能体分成了三个主要的“社区”:
- 聊天社区(12 个智能体): 这些像是你在聊天窗口中交谈的得力助手,但它们拥有打开其他应用和工具的特殊钥匙。
- 浏览器社区(5 个智能体): 这些像是住在你浏览器里的数字员工。它们可以点击按钮、填写表格,并像人类一样浏览网站,通常不需要你全程盯着每一步。
- 企业社区(13 个智能体): 这些是大型企业的“工头建设者”。它们是平台,企业可以在上面搭建一支数字员工团队,自动处理人力资源、销售或 IT 支持等任务。
2. “黑匣子”问题(透明度)
论文中最令人惊讶的是信息的缺失程度。想象一下,如果你买了一辆车,但制造商拒绝告诉你:
- 刹车是如何工作的。
- 这辆车是否经过了碰撞测试。
- 如果引擎过热会发生什么。
- 如果车祸发生,谁该负责。
这正是研究人员在这些 AI 智能体身上发现的情况。
- 安全秘密: 对于他们提出的关于安全性的问题(例如“你们是否针对黑客攻击进行了测试?”),大约有 56% 的回答是“我们不知道”或“我们没有发现任何公开信息”。
- “安全洗白”效应: 一些公司在营销中大谈特谈安全性,但当研究人员寻找实际的测试结果或安全报告时,货架却是空的。这就像一家餐厅声称自己是“镇上最健康的”,却拒绝展示其卫生检查评分。
- 身份危机: 大多数智能体不会告诉人们它们是机器人。如果一个浏览器智能体正在浏览网站,网站通常会认为它是一个人类用户。只有极少数智能体持有显示“你好,我是 AI”的“数字身份证”。
3. “三头怪兽”(谁在控制什么?)
论文解释说,这些智能体是分层构建的,就像三明治一样,这使得很难知道谁在掌权。
- 面包(基础模型): 这是大脑(如 GPT、Claude 或 Gemini)。只有少数几家大公司制造这些大脑。
- 馅料(智能体构建器): 这是中间层(如 Microsoft Copilot Studio 或 Zapier),它告诉大脑该做什么。
- 顶层面包(用户/公司): 这是实际使用智能体的个人或企业。
研究人员发现,由于这些层级是由不同的公司制造的,没有人拥有完整的全景视图。大脑的制造者不知道构建器在做什么,而构建者也不完全清楚用户是如何部署它的。这导致一旦出现问题,就会陷入“推卸责任的游戏”。
4. 互联网上的“西部荒野”
论文强调了一个主要的矛盾:浏览器智能体正在破坏互联网的规则。
几十年来,网站一直都有一个名为 robots.txt 的“禁止入内”标志,用来告知计算机程序哪些地方可以去,哪些地方不能去。
- 旧方式: 网站说“此处禁止抓取”,礼貌的机器人就会停止。
- 智能体方式: 许多这类新型智能体被设计成模仿人类。它们经常无视“禁止入内”的标志,绕过安全检查,并伪装成人类来完成任务。
- 结果: 这引发了法律纠纷。像亚马逊(Amazon)和 Perplexity 这样的公司正就 AI 智能体是否有权在未经许可的情况下购物或浏览网站而进行诉讼。
5. “三巨头”依赖症
几乎所有这 30 个智能体都依赖于仅仅 三个家族的大脑:OpenAI 的 GPT、Anthropic 的 Claude 和 Google 的 Gemini。
- 类比: 想象有 30 个不同的汽车品牌,但它们全都使用来自三家制造商的完全相同的发动机。如果其中一家发动机制造商出了问题、停止生产或改变了价格,所有 30 个汽车品牌都会陷入困境。这造成了巨大的集中风险。
总结
《2025 年 AI 智能体指数》是对一项正在黑暗中运行的快速增长技术的快照。
研究人员并不是说这些智能体“不好”,而是说我们正在盲目飞行。我们拥有可以代表我们行动的强大工具,但我们还没有明确的规则、安全报告或身份检查。论文指出,如果我们希望这些智能体变得安全可靠,那么“工头”们需要开始展示他们的工作过程,而“建筑工地”也需要更好的标识系统。
简而言之: 我们已经打造了一支自主机器人的舰队,但大多数机器人都在没有车牌、没有安全检查,且没有告知他人自己是机器人的情况下驾驶。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。