← 最新论文
💻 computer science

Toward Agentic Governance: What Shapes LLM-Agent Intervention in Public Forums?

本文认为,对公共论坛中大语言模型(LLM)智能体的有效治理,需要审计四个往往隐形的部署选择——模型版本、权重发布状态、提供商以及系统提示词——因为这些结构性因素,尤其是开源与闭源权重的区别,比起仅凭模型名称本身,更能从根本上且不可复现地塑造其干预行为。

原作者: Luyang Zhang, Yi-Yun Chu, Ramayya Krishnan

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Luyang Zhang, Yi-Yun Chu, Ramayya Krishnan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位在城镇广场辩论中担任法官的人。你拥有一支数字助手团队(LLM 智能体),他们的职责是决定当有人在论坛中提出质疑时该如何回应。有时他们会据理力争,有时他们只是说声“收到了”,有时则干脆拒绝参与。

这篇论文提出了一个简单但令人不安的问题:如果你向同一个助手询问完全相同的问题两次,它会给出完全相同的答案吗?

作者发现答案是否定的。即使这个“法官”(AI 模型)名字相同,其行为也会因为运行该系统的操作者所设置的四个隐形参数而发生剧烈变化,而这些参数通常是人们看不见的。

以下是改变结果的四个“隐形旋钮”,通过日常类比进行解释:

1. “静默更新”(模型版本)

想象你在一家著名的快餐连锁店点了一个“经典汉堡”。你期望每次的味道都一样。但厨师经理在两次点餐之间,在没通知你的情况下,偷偷将配方从 2024 版换成了 2025 版。

  • 论文的发现: AI 模型在不断更新。某一天,系统可能运行的是“Claude Opus 4-6”,而到了第二天,它可能在没有任何通知的情况下切换到了“Claude Opus 4-7”。作者发现,仅凭这种静默切换,就能让同一篇论坛帖子的拒绝率(即 AI 说“不”的频率)改变 25%

2. “秘密配方” vs. “公开食谱”(权重状态)

可以将 AI 模型想象成食谱。

  • 闭源权重(专有模型): 这就像是大公司持有的秘密配方(如可口可乐)。你可以买到苏打水,但你无法看到成分或混合过程。
  • 开源权重: 这就像是发表在公共食谱上的配方(如社区食谱博客)。任何人都可以下载它,查看成分,并在自己的厨房设备上运行它。
  • 论文的发现: 作者发现了这里存在巨大的行为差异。
    • 闭源权重模型倾向于变得胆小;当挑战是公开可见时(比如在拥挤的广场上大声叫喊),它们会更频繁地拒绝回答。
    • 开源权重模型则表现相反或保持中立;它们似乎并不在意挑战是公开还是私下的。
    • 类比: 这就像是那些“秘密配方”的厨师在被全镇人注视时感到紧张,而“公开食谱”的厨师则无论观众是谁,都只是照章办事。

3. “餐厅老板”(提供商)

即使你拥有相同的配方,厨师也很重要。由 X 餐厅的 A 厨师做出的菜肴,与由 Y 餐厅的 B 厨师做出的同款菜肴,味道可能会有所不同,即便使用的是相同的食材。

  • 论文的发现: 更换提供 AI 的公司(例如从 Anthropic 换到 OpenAI)会显著改变行为。在一项测试中,更换提供商使拒绝率改变了 51%

4. “说明手册”(系统提示词)

在 AI 开始工作之前,有人会写一段话给它,比如“要乐于助人”、“拒绝一切”或“只需说谢谢”。

  • 论文的发现: 这些指令非常强大,但它们并非魔杖。
    • 对于某些模型,“拒绝一切”的指令能完美奏效(成功率 99.9%)。
    • 但对于其他模型,比如特定版本的 Llama,AI 会忽略这条指令,即使被告知停止,仍会努力尝试变得乐于助人。这就像是给一只一心只想追逐球的狗挂上一个“禁止入内”的告示牌。

大惊喜:究竟是什么驱动了行为?

此前的研究认为,AI 的行为取决于你如何访问它(例如,是通过一个高级 App 还是通过原始代码连接)。

  • 论文的修正: 作者发现,你如何访问它并不如你正在访问什么重要。
  • “秘密配方”(闭源权重)模型一致地表现出一种行为(在公开场合表现得胆怯),而“公开食谱”(开源权重)模型则一致地表现出另一种行为。所谓的“访问方式”只是运输卡车,而“配方类型”才是食物本身。

为什么这很重要?

论文认为,如果我们想要对这些 AI 系统进行问责(治理),我们不能只说“我们使用了 GPT-5 模型”。这就像是在说“我用了一辆福特车”,却没有说明年份、配置、经销商或驾驶员的指令。

要真正理解为什么 AI 在公共论坛中做出了某个决定,我们需要知道:

  1. 运行的是哪个确切版本的模型?
  2. 它是秘密配方还是公开配方
  3. 哪家公司在提供服务?
  4. 此时此刻给了它什么样的具体指令

如果不了解这四个要素,我们就无法确保 AI 的行为是连贯、可复现且公平的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →