← 最新论文
🤖 AI

An Inline Control Architecture for Language Models in Intelligent Transportation Systems

本文介绍了 Guarded-V2X,这是一种内联语义护栏架构,它集成了多层安全机制,旨在保护由大语言模型赋能的车联网系统免受提示词级攻击,同时维持实时性能约束。

原作者: Narendra Kumar Dewangan, Mounira Msahli

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Narendra Kumar Dewangan, Mounira Msahli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的汽车不仅能自动驾驶,还能与交通灯、其他车辆以及路边标志进行对话,以确保每个人的安全。这被称为“车联网”(V2X)通信。这就像是一个巨大的、高速运行的车辆群聊,大家在这里分享关于路面结冰、事故或施工区域的警告。为了让这些对话变得更聪明,工程师们开始使用“大语言模型”(LLM)——也就是那种可以写故事或回答问题的超强人工智能——来帮助总结这些信息并协助人类操作员。

然而,这里有一个陷阱。虽然这些 AI 大脑非常擅长理解语言,但它们也会被欺骗。就像人类会被巧妙的谎言所蒙蔽一样,AI 也可能被“提示词注入”(prompt injection)所误导——这是一种隐藏在消息中的隐蔽指令,旨在命令 AI 忽略安全规则或执行危险操作。传统的汽车安全机制就像是在门口检查身份证的保安;它负责确保消息来自真实的车辆,但并不检查消息的具体内容。如果一个坏人带着有效的身份证明,但在其中夹带了一个危险指令,旧的安全系统可能会放行。这篇论文提出了一个问题:我们如何构建一个更聪明的保安,能够实时检查对话的内容,同时又不会减慢交通速度?

这项研究背后的研究人员来自巴黎高等电信学院(Télécom Paris),他们开发了一套名为 Guarded-V2X 的新安全系统。你可以把它想象成一个为 AI 大脑设计的超快速、多层级的安全检查站。与其让 AI 自由聊天,Guarded-V2X 更像是一个严厉的编辑兼事实核查员,在消息到达以及车辆或交通系统采取行动之间的那极短的一瞬间内完成工作。

以下是他们的“护栏”是如何运作的,我们使用了一些创意比喻:

首先,将**基于规则的过滤器(Rule-Based Filter)**想象成俱乐部门口的保安,他会瞬间扫描明显的红旗信号,比如特定的禁用词或奇怪的代码。如果他看到了可疑内容,会直接拦截,甚至不需要唤醒 AI。

接下来,有一个轻量级安全分类器(Lightweight Safety Classifier)。这就像是一名反应敏捷的安保人员,他会扫一眼信息并给出一个“风险评分”。如果信息感觉有些危险,这位安保人员就会将其拦截。这一步极其迅速,旨在眨眼之间完成。

然后是受策略约束的 LLM(Policy-Constrained LLM)。这是 AI 本身,但它被关进了一个非常严格的笼子里。它不再被允许进行自由发挥的写作,而是被迫以一种特定的、僵化的格式输出答案(就像填写一份预印好的表格)。它只能在批准的动作范围内填空。如果它试图在界限之外进行创作,系统就会拒绝。这确保了 AI 不会意外地(或恶意地)决定做出疯狂的行为。

最后是一个评审小组(Judge Ensemble)。想象一下有三名裁判在观察 AI 的输出。他们会对答案是否安全进行投票。如果哪怕只有一名裁判说:“等等,这看起来很危险,”该行动就会被拦截。这种“多数票”制度使得攻击者很难通过这种方式进行渗透。

团队使用了一个模拟真实交通场景的环境对该系统进行了测试,其中包括一些复杂的攻击手段,即黑客尝试通过两轮对话来欺骗 AI(例如在第一条消息中埋下陷阱,并在第二条消息中触发陷阱)。他们发现,如果没有这些护栏,即使是先进的 AI 模型也有 0.6% 的概率会被诱导接受危险指令。但在使用了 Guarded-V2X 后,在他们的两轮对话测试(500 次试验)中,系统拦截了所有观察到的不安全尝试,使攻击者的入侵成功率达到了 0.0%。作者强调,这一零结果反映的是在有限测试集下的表现,并不代表该系统在理论上对未来所有攻击都具有免疫力。

至关重要的一点是,论文强调这种安全性并没有以牺牲速度为代价。在自动驾驶汽车的世界里,每一毫秒都至关重要。整个 Guarded-V2X 流程——从规则检查到评审投票——仅耗时 118 毫秒(p95 延迟),远低于这些系统要求的 150 毫秒 安全限制。这意味着 AI 可以在保持智能的同时确保安全,而不会让车辆等待。

研究人员还将他们的系统与其他安全方法进行了对比,例如仅仅告诉 AI “要小心”(安全提示词)或使用通用的过滤器。他们发现,仅仅告诉 AI 要表现得友好是不够的;AI 仍然会被欺骗。但他们这种层层递进的架构化方法——结合了规则、分类器和严格的格式化——是唯一能在保持足够快的同时,完全阻止攻击的方法。

简而言之,Guarded-V2X 表明,要让 AI 在我们的道路上安全运行,我们不能仅仅依赖 AI 自身的判断或简单的警告。我们需要一支专门的多层级安全团队,去检查每一个词汇,强制 AI 遵循严格的剧本,并对最终决策进行投票,同时还要保证交通能够全速前进。虽然这些结果是基于模拟和受控测试的,但研究结果有力地表明,这种“在线护栏”架构是让我们能够信任 AI 处理复杂且高风险的未来交通管理工作的必要步骤。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →