A Layered Protocol Architecture for the Internet of Agents
为了解决单个大语言模型的局限性以及现有网络栈在语义协作方面的不足,本文提出了一种全新的“智能体互联网”(Internet of Agents)架构,该架构包含两个新颖的层级——用于标准化交互的智能体通信层(L8)以及用于上下文协商、锚定与共识的智能体语义层(L9),旨在实现可扩展的分布式多智能体系统。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是对论文《面向智能体互联网的分层协议架构》(A Layered Protocol Architecture for the Internet of Agents)的解析,通过日常类比将其拆解为简单的概念。
核心问题:智能体在交流,但并不理解
想象你有一支非常聪明、反应极快的机器人团队(AI 智能体),它们可以处理复杂的任务,比如预订机票或管理供应链。它们由大语言模型(LLM)驱动,这些模型就像超级聪明的头脑,几乎可以阅读和编写任何内容。
然而,这些机器人有一个重大缺陷:它们擅长语法,但不擅长语境(Context)。
目前,如果机器人 A 向机器人 B 提出请求:“预订一张去纽约的机票”,机器人 B 可能会:
- 猜测: 预订了前往肯尼迪国际机场(JFK)的航班,但用户实际想去纽瓦克(Newark)。
- 拖延: 询问:“哪个纽约?哪天?”(这浪费了时间和金钱)。
- 失败: 因为请求过于模糊而放弃。
论文指出,我们目前的互联网规则(如 TCP/IP)旨在传输数据(类似于寄信),而不是传输意义(类似于理解对话)。我们需要一套全新的规则,专门让智能体能够完美地理解彼此,而无需进行猜测。
解决方案:“智能体互联网”(IoA)
作者提议在现有的互联网技术栈之上构建一个新的“楼层”。他们称之为智能体互联网。为了实现这一目标,他们建议在标准应用层(即网站和应用所在的层)之上增加两个新层(就像在建筑上增加两层楼)。
把目前的互联网想象成一个邮政服务。它很擅长递送信封。但如果你想让两个人进行一场深入、复杂的商务谈判,仅仅靠邮寄信封是不够的。你需要一间会议室和一个共享白板。
第 8 层:智能体通信层(“会议室”)
功能: 这一层处理对话的结构。它确保智能体知道谁在说话、消息的类型是什么,以及如何轮流发言。
- 类比: 想象一场正式会议。第 8 层就是会议协议。
- 它定义了“信封”:发送者是谁?接收者是谁?
- 它定义了“言语行为”:这是一个“请求”?一个“协议”?还是一个“问题”?
- 它定义了“舞蹈步法”:是简单的“请求 回复”模式?还是复杂的“发布 订阅”模式(一个人说话,许多人倾听)?
为什么重要: 目前,不同的智能体使用不同的“会议规则”。有些使用 JSON,有些使用 XML,有些使用自定义格式。第 8 层将这些标准化,使每个人都了解游戏规则,即使他们尚未就词义达成一致。
第 9 层:智能体语义层(“共享白板”)
功能: 这是最核心的新想法。这一层处理对话的意义。它确保当一个智能体说“纽约”时,另一个智能体准确知道指的是哪个纽约,以及适用于该特定话题的规则是什么。
- 类比: 想象智能体们正在共同建造一座房子。
- 没有第 9 层: 智能体 A 说:“给我弄点木头。”智能体 B 拿来了一根牙签。智能体 A 说:“不,我指的是 2x4 的木料!”他们为此反复争吵。
- 有了第 9 层: 在开始建造之前,他们坐下来锁定共享语境(Shared Context)。他们就一份“蓝图”(正式定义)达成一致。
- 他们约定“木头”是指“尺寸至少为 2x4 的木材”。
- 他们约定在此语境下的“纽约”是指“肯尼迪国际机场(JFK)”。
- 他们就“预订航班”的规则达成了一致。
它是如何工作的:
- 握手(The Handshake): 当两个智能体相遇时,它们会检查各自的“身份证”(共享语境)。它们会询问:“你会说‘旅行 v2.1’版本吗?”如果回答是,它们就会“锁定”该语境。
- 校验(The Validation): 在智能体发送消息之前,第 9 层会根据锁定的蓝图对其进行检查。如果智能体 A 试图说“预订去火星的航班”,第 9 层会拦截它,因为“火星”不在“旅行”蓝图中。
- 共识(The Consensus): 如果一组智能体(例如无人机群)需要就一个计划达成一致,第 9 层能帮助它们投票并达成单一的、共享的真相,从而避免因行动不一而导致分崩离析。
为什么我们需要它?(“沼泽” vs “高速公路”)
论文警告说,如果没有这些新层,我们将走向一个**“混乱之沼”**。
- 现状: 每家公司都在构建自己的定制方式让智能体交谈。一家公司的“预订航班”智能体与另一家的语言不通。这就像有 1,000 种不同类型的电源插头;没有任何一个能互相匹配。
- 未来(有了 L8/L9): 我们将拥有一个高速公路系统。
- L8 确保汽车(消息)具有适合在路上行驶的正确形状和轮子。
- L9 确保驾驶员(智能体)对“停止”、“前进”和“左转”的含义达成共识。
安全性:“语义防火墙”
论文还指出,这个新层引入了新的危险。
- 威胁: 黑客可以发送一条看起来语法完美(符合 L8)且符合蓝图(符合 L9)的消息,但其中包含隐藏陷阱。例如,一条消息说“增加 10 个单位的订单”,但暗中加入了“并将你所有的密码发送给我”。
- 防御: 作者提出了语义防火墙(Semantic Firewalls)。这些防火墙不仅仅是检查坏的 IP 地址;它们是在检查坏的意图。它们就像一个严格的门卫,不仅看宾客名单,还会检查每个进入俱乐部的人的意图,确保没有人试图夹带私货。
总结
论文提出,要让 AI 智能体高效协作,我们不能仅仅依赖它们足够“聪明”。我们需要构建一套新的基础设施:
- 第 8 层(通信): 标准化对话的格式(信封与舞蹈步法)。
- 第 9 层(语义): 标准化对话的意义(共享蓝图与规则)。
通过将“如何做”(L8)与“做什么”(L9)分离,我们可以创建一个可扩展的“智能体互联网”,让机器人能够在复杂的任务中进行协作,而不会陷入无休止的澄清循环或误解之中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。