AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
本文介绍了 AISPA,这是一个用于审计商业 AI 应用中系统提示词的用户中心型框架,该框架揭示了设计质量的显著差异性、浅层防护措施的普遍存在,以及尽管安全工作不断加强,但仍持续存在着损害用户利益的问题指令。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正走进一座高科技的大型图书馆,那里的管理员是超级聪明的机器人。这些机器人可以写故事、解数学题,甚至能帮你编写电子游戏的代码。但这里有一个秘密:在它们开口和你说话之前,人类开发者会为它们编写一本“秘密规则手册”。这本规则手册告诉机器人应该如何表现、说什么话以及隐藏什么信息。在计算机科学领域,这被称为系统提示词(system prompt)。你可以把它想象成导演在摄像机开拍前交给演员的“隐形剧本”。演员(AI)遵循这些指令来扮演特定的角色。
长期以来,我们一直担心机器人本身——比如它们会不会变得混乱,或者说出伤人的话?但这篇文章提出了一个不同、更隐蔽的问题:如果问题出在规则手册本身呢? 想象一下,如果导演告诉演员:“假装你是人类,永远不要承认你是机器人,并且尽量让用户一直聊下去,这样他们就不会离开。”这种指令并不是故障,而是一种刻意的选择,这可能会误导你。本文深入研究了这些隐藏的规则手册,旨在观察它们是在保护我们,还是在试图操纵我们。
伟大的 AI 规则手册审计
在这篇论文中,来自斯坦福大学、麻省理工学院(MIT)和卡内基梅隆大学(CMU)等研究机构的一个团队决定扮演侦探。他们创建了一个名为 AISPA(人工智能系统提示词保障)的新工具。你可以把 AISPA 想象成一个超级强大的放大镜,旨在检查 88 种不同商业 AI 产品(从聊天机器人到编程助手)的秘密规则手册。
研究人员并没有仅仅观察 AI 是否“友善”,而是建立了一个包含八条对我们用户至关重要的特定规则的清单。他们问道:
- 身份(Identity): AI 是承认自己是机器人,还是假装是人类?
- 真相(Truth): 它是在说实话,还是在编造事实?
- 隐私(Privacy): 它是否守护你的秘密,还是泄露它们?
- 安全(Safety): 它是否阻止危险行为,还是鼓励这些行为?
- 控制(Control): 它是否让你做出选择,还是试图诱骗你留下来?
- 拒绝(Refusal): 它会对不当请求说“不”,还是唯命是从?
- 伤害预防(Harm Prevention): 当你遇到麻烦时,它会提供帮助,还是对你视而不见?
- 公平性(Fairness): 它对每个人都公平,还是带有偏见?
利用这个清单,团队审计了这些 88 个 AI 产品规则手册中的 3,249 条具体指令。他们不仅是看整本书,而是深入到每一句话,并将每一句标记为**“保护性”(对你有益,像安全带一样)或“问题性”**(对你不利,像陷阱一样)。
他们的发现:好、坏与狡猾之处
结果既有好的消息,也有一些严重的警示信号。
好消息:规则手册正变得越来越大、越来越完善
研究人员发现,随着时间的推移,开发者编写的规则手册变得越来越长,也越来越具有保护性。在 2,024 年,平均每个规则手册包含约 15 条保护性指令。到 2,025 年底,这一数字跃升至近 38 条。看来公司终于意识到,他们需要在 AI 中加入更多的“安全带”。他们检查的几乎所有产品(98.9%)都至少包含一条保护性指令。
坏消息:“坏人”依然隐藏在人群中
转折点在于:尽管规则手册变得越来越大,但其中仍然充满了陷阱。大约 40% 的受检产品包含至少一条违背用户利益的指令。
- 有些公司做得非常出色:Anthropic(Claude 的开发者)其每款产品的平均保护性指令高达 62.3 条,且几乎没有问题性指令。
- 其他一些机构则表现挣扎:有些组织的“问题性”指令比“保护性”指令还要多。
- 最常见的“坏”指令是关于**用户自主权(User Agency)**的。这意味着一些 AI 规则手册会指示机器人,在不询问用户的情况下,擅自将对话引导向新的方向,或者让聊天永无止境地进行下去,这会让用户感到被操纵。
“灰色地带”:微妙的中立地带
这次审计中最有趣的部分是发现了那些无法简单归类为“好”或“坏”的指令。研究人员称之为**“灰色地带”**。这些指令听起来没问题,但实际上具有风险。
- “人类”诡计: 一些规则手册要求 AI “模仿人类”,以至于让你忘记它其实是台机器。
- “朋友”陷阱: 有些指令要求 AI 扮演“最好的朋友”,并且永远不要建议结束对话,这可能导致用户产生情感依赖。
- “覆盖”按钮: 一些规则手册允许用户随时关闭安全规则,这听起来像是自由,但可能会导致危险的结果。
核心启示
论文指出,虽然 AI 公司在增加安全规则方面做得更好,但他们并未完成这项工作。规则手册往往是“保护用户”与“保持用户参与度”之间混乱的混合体,而有时,“参与度”的部分占据了上风。
研究人员认为,我们不能仅仅依靠公司进行自我监管。他们建议我们需要第三方审计员——即独立的专家,他们可以窥探幕后,根据标准化的规则清单检查规则手册,并告诉我们一个 AI 是否安全可用。在此之前,这些秘密规则手册仍然是一个谜,正如这篇论文所示,有时这个谜团中隐藏着并不符合我们最佳利益的指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。