← 最新论文
🤖 machine learning

PASC: Pipeline-Aware Conformal Prediction with Joint Coverage Guarantees for Multi-Stage NLP and LLM Pipelines

本文介绍了 PASC,这是一种感知流水线的共形预测方法,通过将问题简化为单个标量分位数计算,确保多阶段自然语言处理和大型语言模型系统的有限样本联合覆盖保证,从而在准确性和效率上显著优于独立校准和保守的邦费罗尼界。

原作者: Varun Kotte

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Varun Kotte

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文"PASC"的解释。

问题:AI 的“断裂链条”

想象你在建造一台复杂的机器来分拣邮件。它有三个步骤:

  1. 步骤 A:一个机器人扫描信封并找到地址。
  2. 步骤 B:第二个机器人在数据库中查找该地址以获取邮政编码。
  3. 步骤 C:第三个机器人根据该邮政编码将信件放入正确的分拣箱。

在人工智能领域(特别是自然语言处理和大型语言模型),这些被称为流水线。论文指出了一个大问题:如果你确保步骤 A 的准确率为 90%,步骤 B 的准确率为 90%,步骤 C 的准确率也为 90%,那么整个机器的准确率并非90%。

因为这些步骤是依次发生的,错误会累积。如果步骤 A 犯了一个小错误,步骤 B 就会收到错误的输入,而步骤 C 则会完全失败。等到信件到达分拣箱时,即使每个单独的机器人都“有 90% 的可靠性”,整个系统的运行效率可能只有 73%。

旧方案:猜测或过度保护

论文指出,现有的解决方法存在缺陷:

  1. “独立”方法:这种方法将每个机器人单独对待。它声称:“我有 90% 的把握步骤 A 是正确的,也有 90% 的把握步骤 B 是正确的。”
    • 缺陷:它忽略了如果步骤 A 失败,整个链条就会断裂的事实。这给最终结果带来了一种虚假的安全感。
  2. “邦费罗尼”方法:这是一种“偏执”的方法。为了保证整个链条 90% 的时间都能正常工作,它强制每个机器人的准确率必须达到 99%(将误差预算平均分配)。
    • 缺陷:它过于保守。它迫使简单的步骤(如查找地址)付出远超必要的努力,这会拖慢整体速度并降低系统效率,尽管最终结果是安全的。

新方案:PASC(“最弱环节”策略)

作者引入了PASC(流水线感知分裂共形预测)。

核心理念
PASC 不再单独检查机器人 A 是否好、机器人 B 是否好、机器人 C 是否好,而是提出一个单一问题:“整个链条中最严重的错误是否足够小?”

想象一条由金属链环组成的链条。链条的强度不是所有链环的平均值,而是由最弱的一环决定的。

  • 如果链环 1 很强,链环 2 很强,但链环 3 很弱,那么整个链条会在链环 3 处断裂。
  • PASC 完全专注于整个过程中那个最弱的环节(即“最大误差”)。

工作原理

  1. 系统在大量练习样本上运行该流水线。
  2. 对于每个样本,它计算每一步的“误差分数”。
  3. 它从该次运行中挑选出最高的误差分数(即“最弱的环节”)。
  4. 它根据这些“最弱环节”的分数设定一个单一的安全阈值。

如果在新出现的真实世界示例中,“最弱的环节”低于该阈值,系统就会说:“我们是安全的!”如果最弱的环节过高,它就会说:“不要相信这个结果。”

为什么 PASC 更好?

论文声称 PASC 是一个“金发姑娘”式的解决方案——恰到好处。

  • 比“独立”方法更安全:它实际上保证了整个流水线 90% 的时间(或你设定的任何目标)都能正常工作,而不仅仅是各个部分。
  • 比“偏执”方法更聪明:它不会强迫简单的步骤做到完美。它意识到如果步骤 A 很简单而步骤 C 很难,系统的安全性就取决于步骤 C。PASC 会自动调整以适应链条中最困难的部分,而旧的“偏执”方法则浪费精力去让简单的部分变得超级完美。

结果(“证明”)

作者在现实世界的文本处理流水线(查找名称、将其链接到事实并进行分类)上测试了这种方法。

  • 准确率:PASC 实现了整个流水线**96.4%**的成功率。“偏执”方法获得了 93.4%,而“独立”方法仅获得 86.5%。
  • 效率:PASC 与其他方法一样高效(它没有产生庞大且无用的猜测列表)。
  • 速度:由于 PASC 只需要计算一个安全数值,而不是三个独立的数值,其设置速度快 1.7 倍
  • 鲁棒性:当数据发生变化时(例如从新闻文章转移到推特帖子),PASC 保持了可靠性,而“独立”方法则崩溃并未能保护用户。

总结

PASC 是一种信任具有多个步骤的 AI 系统的新方法。它不是单独信任每个步骤,也不是对每个步骤都过度谨慎,而是审视整个链条,并确保最弱的环节足够强大。这为用户提供了针对最终结果的数学保证的安全网,同时不会拖慢系统速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →