← 最新论文
💻 computer science

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

本文介绍了一种用于多智能体大语言模型审议的预算化“行动或延迟”框架,该框架通过计算基于 k-最近邻置信度估计的局部可靠性边界,动态决定是执行行动还是升级至人工审查,从而在用户指定的错误行动预算内,针对多样化任务保证可审计的安全性。

原作者: Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一支由专家级 AI 侦探(大语言模型)组成的团队,他们正在通力合作解决一个棘手的谜题。他们会进行辩论、互相质疑对方的想法,试图找到正确答案。对于负责人(人类)来说,核心问题是:“什么时候这支团队的信心足够高,我可以让他们给出最终答案,而什么时候我应该介入并亲自检查他们的工作?”

如果你让他们过早回答,他们可能会出错;如果你等待太久,则会浪费时间和金钱。

这篇论文介绍了一种全新的“安全证书”系统来解决这个问题。其运作方式如下,通过简单的解释来呈现:

1. “信任分数” vs. “预算”

把人类管理者想象成拥有一个错误预算。假设他们愿意接受每 100 个自动化回答中可能出现 1 个错误。这就是他们的“预算”。

该论文的系统不仅仅是在猜测何时停止。它为每一个问题都计算了一个置信下界

  • 类比: 想象 AI 团队正在攀登一座山。系统在他们下方画了一条“安全线”。只要团队处于这条线上方,系统就知道他们可以安全行动。如果他们在下面,系统就会说:“停!我们还不确定。请呼叫人类。”

2. 系统如何“观察”辩论

AI 团队会进行多轮对话。系统并不会阅读转录文本中的每一个字。相反,它将整个对话压缩成一个简单的两个数字的分数(例如“共识强度”和“胜差”)。

  • 类比: 想象一位体育解说员在总结一场比赛。他们不会重放每一个回合,而只是说:“A 队领先 B 队 10 分,且观众欢呼声很大。”系统利用这个摘要来决定比赛是否结束。

3. “邻域”检查 (k-NN)

为了了解当前的得分是否可靠,系统会查看其记忆库中的过往辩论(校准数据)。

  • 类比: 这就像查看天气预报。如果今天看起来像过去下雨的日子,系统就会假设可能也会下雨。但这个系统更聪明:它会寻找与当前辩论极其相似的过去 128 或 512 场辩论。
  • 它会问:“在这些类似的过往辩论中,AI 团队实际答对的频率是多少?”
  • 然后,它会减去一个“安全余量”,以考虑到并非两次辩论都是完全相同的。这确保了系统是保守的(安全的),而不是过于乐观。

4. “三个风险桶”

论文将“错误预算”分成了三个不同的“桶”,以确保数学逻辑成立:

  1. 数学桶: 有时由于我们只参考了过去数据的样本,数学本身可能会有轻微偏差。
  2. “也许”桶: 即使数学显示我们有 95% 的把握,仍然存在极小的出错可能。
  3. “摘要”桶: 系统只观察两个数字构成的摘要。也许它忽略了完整对话中某个微妙的线索。

系统将这三种风险相加。如果总和仍在人类的“预算”之内,它就会说执行 (ACT)。如果不在,它就会说推迟 (DEFER)(呼叫人类)。

5. 结果:智能自动化

研究人员在六种不同类型的困难谜题(从逻辑谜题到科学问题)上测试了该系统。

  • 在“简单”或“中等”谜题上: 系统能够让 AI 团队在 70% 到 96% 的问题上自动执行,同时保持极低的实际错误率(仅使用了约 10% 的允许“错误预算”)。
  • 在“困难”谜题上: 当 AI 团队真正遇到困难时(例如非常难的科学问题),系统会拒绝执行。它会说:“我没有足够的证据来保证安全,”并将任务移交给人类。它不会为了追求速度而强行给出一个错误的答案。

核心结论

这篇论文不仅仅是在说“AI 正在变得更好”。它提供了一套保证性的规则手册,告诉你在何时该信任 AI,以及何时该保持警惕。

  • 旧方法: “让我们运行 4 轮 AI,然后祈祷它是对的,”或者“让我们猜一个置信度数字。”
  • 新方法: “我们有一个严格的错误预算。系统会根据该预算检查证据。如果证据通过了门槛,我们就执行。如果没有,我们就停止。”

它将“何时信任 AI?”的决策从一种猜测转变为一个在数学上可审计的过程,确保 AI 只有在口袋里装有“可靠性证书”时才会采取行动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →