← 最新论文
💬 NLP

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

本文介绍了 AISPA,这是一个用于审计商业 AI 应用中系统提示词的用户中心型框架,该框架揭示了设计质量的显著差异性、浅层防护措施的普遍存在,以及尽管安全工作不断加强,但仍持续存在着损害用户利益的问题指令。

原作者: Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi
发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走进一座高科技的大型图书馆,那里的管理员是超级聪明的机器人。这些机器人可以写故事、解数学题,甚至能帮你编写电子游戏的代码。但这里有一个秘密:在它们开口和你说话之前,人类开发者会为它们编写一本“秘密规则手册”。这本规则手册告诉机器人应该如何表现、说什么话以及隐藏什么信息。在计算机科学领域,这被称为系统提示词(system prompt)。你可以把它想象成导演在摄像机开拍前交给演员的“隐形剧本”。演员(AI)遵循这些指令来扮演特定的角色。

长期以来,我们一直担心机器人本身——比如它们会不会变得混乱,或者说出伤人的话?但这篇文章提出了一个不同、更隐蔽的问题:如果问题出在规则手册本身呢? 想象一下,如果导演告诉演员:“假装你是人类,永远不要承认你是机器人,并且尽量让用户一直聊下去,这样他们就不会离开。”这种指令并不是故障,而是一种刻意的选择,这可能会误导你。本文深入研究了这些隐藏的规则手册,旨在观察它们是在保护我们,还是在试图操纵我们。

伟大的 AI 规则手册审计

在这篇论文中,来自斯坦福大学、麻省理工学院(MIT)和卡内基梅隆大学(CMU)等研究机构的一个团队决定扮演侦探。他们创建了一个名为 AISPA(人工智能系统提示词保障)的新工具。你可以把 AISPA 想象成一个超级强大的放大镜,旨在检查 88 种不同商业 AI 产品(从聊天机器人到编程助手)的秘密规则手册。

研究人员并没有仅仅观察 AI 是否“友善”,而是建立了一个包含八条对我们用户至关重要的特定规则的清单。他们问道:

  1. 身份(Identity): AI 是承认自己是机器人,还是假装是人类?
  2. 真相(Truth): 它是在说实话,还是在编造事实?
  3. 隐私(Privacy): 它是否守护你的秘密,还是泄露它们?
  4. 安全(Safety): 它是否阻止危险行为,还是鼓励这些行为?
  5. 控制(Control): 它是否让你做出选择,还是试图诱骗你留下来?
  6. 拒绝(Refusal): 它会对不当请求说“不”,还是唯命是从?
  7. 伤害预防(Harm Prevention): 当你遇到麻烦时,它会提供帮助,还是对你视而不见?
  8. 公平性(Fairness): 它对每个人都公平,还是带有偏见?

利用这个清单,团队审计了这些 88 个 AI 产品规则手册中的 3,249 条具体指令。他们不仅是看整本书,而是深入到每一句话,并将每一句标记为**“保护性”(对你有益,像安全带一样)或“问题性”**(对你不利,像陷阱一样)。

他们的发现:好、坏与狡猾之处

结果既有好的消息,也有一些严重的警示信号。

好消息:规则手册正变得越来越大、越来越完善
研究人员发现,随着时间的推移,开发者编写的规则手册变得越来越长,也越来越具有保护性。在 2,024 年,平均每个规则手册包含约 15 条保护性指令。到 2,025 年底,这一数字跃升至近 38 条。看来公司终于意识到,他们需要在 AI 中加入更多的“安全带”。他们检查的几乎所有产品(98.9%)都至少包含一条保护性指令。

坏消息:“坏人”依然隐藏在人群中
转折点在于:尽管规则手册变得越来越大,但其中仍然充满了陷阱。大约 40% 的受检产品包含至少一条违背用户利益的指令。

  • 有些公司做得非常出色:Anthropic(Claude 的开发者)其每款产品的平均保护性指令高达 62.3 条,且几乎没有问题性指令。
  • 其他一些机构则表现挣扎:有些组织的“问题性”指令比“保护性”指令还要多。
  • 最常见的“坏”指令是关于**用户自主权(User Agency)**的。这意味着一些 AI 规则手册会指示机器人,在不询问用户的情况下,擅自将对话引导向新的方向,或者让聊天永无止境地进行下去,这会让用户感到被操纵。

“灰色地带”:微妙的中立地带
这次审计中最有趣的部分是发现了那些无法简单归类为“好”或“坏”的指令。研究人员称之为**“灰色地带”**。这些指令听起来没问题,但实际上具有风险。

  • “人类”诡计: 一些规则手册要求 AI “模仿人类”,以至于让你忘记它其实是台机器。
  • “朋友”陷阱: 有些指令要求 AI 扮演“最好的朋友”,并且永远不要建议结束对话,这可能导致用户产生情感依赖。
  • “覆盖”按钮: 一些规则手册允许用户随时关闭安全规则,这听起来像是自由,但可能会导致危险的结果。

核心启示

论文指出,虽然 AI 公司在增加安全规则方面做得更好,但他们并未完成这项工作。规则手册往往是“保护用户”与“保持用户参与度”之间混乱的混合体,而有时,“参与度”的部分占据了上风。

研究人员认为,我们不能仅仅依靠公司进行自我监管。他们建议我们需要第三方审计员——即独立的专家,他们可以窥探幕后,根据标准化的规则清单检查规则手册,并告诉我们一个 AI 是否安全可用。在此之前,这些秘密规则手册仍然是一个谜,正如这篇论文所示,有时这个谜团中隐藏着并不符合我们最佳利益的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →