← 最新论文
💻 computer science

Predicting Program Correctness By Ensemble Semantic Entropy

该论文提出了一种名为“集成语义熵”(ESE)的新方法,通过评估多模型生成样本的语义一致性来更准确地预测大语言模型生成代码的正确性,并基于此构建了计算效率更高的级联测试时扩展框架 Cas。

原作者: Yunxiang Wei, Tianlin Li, Yuwei Zheng, Yanni Dong, Aishan Liu, Qiang Hu, Xiaoyu Zhang, Mingfei Cheng, Jian Yang

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunxiang Wei, Tianlin Li, Yuwei Zheng, Yanni Dong, Aishan Liu, Qiang Hu, Xiaoyu Zhang, Mingfei Cheng, Jian Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文解决了一个非常有趣的问题:当人工智能(AI)写代码时,我们怎么知道它写的是对的,还是它“一本正经地胡说八道”?

为了让你轻松理解,我们可以把这篇论文的核心思想想象成**“招聘程序员”“团队面试”**的故事。

1. 核心痛点:AI 的“过度自信”

想象一下,你让一个 AI 程序员写一个程序。

  • 以前的方法(单模型不确定性): 你让同一个 AI 写 10 遍同样的代码。如果这 10 遍代码看起来都差不多(比如都用了同一种逻辑),以前的方法就会认为:“哇,这 AI 很自信,这代码肯定是对的!”
  • 现实问题: 有时候,AI 会犯一个共同的错误。比如,它可能都漏算了一个数字。虽然这 10 遍代码看起来高度一致(很自信),但它们全错了。这就好比一个学生做错了题,但他把答案抄了 10 遍,看起来非常“自信”,其实全是错的。

2. 核心创新: Ensemble Semantic Entropy (ESE) —— “团队会诊”

为了解决这个问题,作者提出了一个叫做 ESE(集成语义熵) 的新方法。

打个比方:

  • 以前的做法:只问一个专家(比如只问张医生)。如果张医生看了 10 次都说是“感冒”,你就觉得肯定是感冒。但如果张医生看错了呢?
  • 作者的新做法(ESE):你找了一个医生团队(比如张医生、李医生、王医生)。
    • 让张医生写 3 个方案,李医生写 3 个,王医生写 3 个。
    • 然后你把这些方案放在一起看。
    • 关键点:如果张医生、李医生和王医生虽然写法不同,但都指向了同一个错误的结论(比如都漏算了数字),那说明这个错误很隐蔽。
    • 但如果张医生说是“感冒”,李医生说是“流感”,王医生说是“过敏”,大家意见不一致(语义熵高),这就说明大家都不确定,或者问题很难。
    • 最妙的地方:如果三个医生意见高度一致,而且他们的思路完全不同(比如一个用中药,一个用西药,一个用针灸,但都治好了),那这个方案就非常靠谱

论文发现: 单个 AI 容易“固执己见”(在错误上达成一致),但不同的 AI 模型通常会有不同的错误模式。通过让多个 AI 模型“会诊”,如果它们能达成跨模型的共识,那代码正确的概率就极高;如果它们吵得不可开交,或者虽然一致但都在犯同样的错,系统就能敏锐地察觉到风险。

3. 实际应用:智能“阶梯式”测试 (Cas 框架)

有了这个“团队会诊”的能力,作者还设计了一个聪明的省钱策略,叫 Cas(级联测试时间扩展框架)

打个比方:
想象你在处理一个复杂的案件,你需要找侦探破案。

  • 传统做法(Best-of-N):不管案子多简单,每次都直接请最贵、最厉害的大侦探(比如 GPT-4 级别)来写 20 个方案,然后挑最好的。这很贵,而且有点浪费。
  • 作者的新做法 (Cas)
    1. 第一关(便宜组):先让几个年轻、便宜的侦探(小模型)试着破案。
    2. 团队会诊(ESE):让这几个年轻侦探互相“会诊”。
      • 如果年轻侦探们意见一致且看起来靠谱(低不确定性):好!案子结了,不用麻烦大侦探,省钱!
      • 如果年轻侦探们吵成一团,或者看起来很可疑(高不确定性):别急,把案子升级,交给最厉害的大侦探去处理。
    3. 结果:简单的问题用便宜方案解决,复杂的问题才用昂贵方案。

效果惊人:

  • 准确率:几乎和一直用大侦探一样高。
  • 成本:计算量(花钱/耗电)直接减少了 64.9%

4. 总结:这篇论文说了什么?

  1. 发现问题:单个 AI 写代码时,如果它“太自信”(多次生成结果一致),不代表它是对的,它可能只是在自信地犯错
  2. 提出方法:引入 ESE(团队会诊法)。通过让多个不同的 AI 模型一起生成代码并比较它们的“想法”,能更准确地判断代码是对是错。如果不同模型的 AI 都能达成一致,那大概率是对的。
  3. 落地应用:设计了一个**“先便宜后昂贵”**的智能流程。简单问题用便宜模型解决,只有难问题才动用大模型。
  4. 最终收益:在保持代码质量几乎不变的情况下,节省了超过 60% 的算力成本

一句话总结:
这就好比我们不再盲目相信“一个专家”的反复确认,而是通过“多方专家会诊”来去伪存真,并且聪明地只在必要时才请最贵的专家,既保证了质量,又省下了大笔钱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →