← 最新论文
🤖 machine learning

Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision

本文提出了“计算即教师”(CaT)框架,该框架通过伪参考聚合与自拟评分标准,将推理阶段的并行 rollout 转化为无需参考的监督信号,使模型在不依赖人工标注的情况下,在可验证与不可验证领域均能实现显著的性能提升。

原作者: Dulhan Jayalath, Shashwat Goel, Thomas Foster, Parag Jain, Suchin Gururangan, Cheng Zhang, Anirudh Goyal, Alan Schelten

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Dulhan Jayalath, Shashwat Goel, Thomas Foster, Parag Jain, Suchin Gururangan, Cheng Zhang, Anirudh Goyal, Alan Schelten

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一名学生(人工智能)如何撰写一封完美的医疗建议信,或解决一道棘手的数学难题。通常,你需要一位手握“标准答案”的老师来评分。但如果你身处一种无人知晓正确答案的情境中呢?也许这是一个复杂的医疗案例,连真正的医生都意见不一;或者是一项创意写作任务,根本不存在唯一的“正确”结局。

本文介绍了一种名为**计算即教师(Compute as Teacher, CaT)**的新方法。这是一种巧妙的方式,让 AI 在没有人类教师或标准答案的情况下自我教学。

以下是其工作原理,使用一个简单的类比来说明:

问题:“沉默的课堂”

通常,为了进步,学生需要反馈。

  • 在数学/编程中:老师可以运行程序来检查答案是对是错。这很容易。
  • 在医疗/创意写作中:没有程序可以检查答案。如果你问 AI:“我该如何治疗这种罕见症状?”,可能会有五种不同的有效回答方式。你怎么知道哪一种最好?通常,你需要人类专家来评分,但这既缓慢又昂贵。

解决方案:“小组学习会”

作者们意识到,如果你向 AI 提出同一个问题八次(生成八个不同的“推演”或尝试),AI 会在不同的地方出错。

  • 尝试 #1 可能有正确的诊断,但剂量错误。
  • 尝试 #2 可能有正确的剂量,但遗漏了关于过敏的警告。
  • 尝试 #3 可能在语气上完美,但遗漏了关键症状。

individually(单独来看),它们都有缺陷。但合在一起,它们包含了拼图的所有碎片。

两步魔法

CaT 框架通过两个步骤,将这次小组学习会转化为教学计划:

1. “综合”(智能编辑)

与其仅仅从八次尝试中挑选“最好”的一次(那可能仍有缺陷),不如让 AI 充当智能编辑。它审视所有八次尝试,并撰写一个新的、完美的“伪参考”答案

  • 类比:想象八名学生正在写文章。一位超级聪明的编辑阅读了所有八篇文章,从第一篇中选取最好的段落,从第二篇中选取最好的数据,从第三篇中选取最好的结论,并将它们拼接成一篇“大师级文章”。
  • 这篇“大师级文章”成为了 AI 试图从中学习的目标

2. “评分标准”(检查清单)

现在,我们如何根据这篇新的“大师级文章”来给原始的八次尝试评分呢?

  • 对于数学:这很容易。数字匹配了吗?是/否。
  • 对于医疗(困难部分):你不能简单地用“是/否”来评价整篇文章。因此,AI 会根据“大师级文章”生成一个检查清单(评分标准)
    • 示例:与其问“这条建议好吗?”,AI 会创建一个检查清单:"1. 是否提到了看医生?2. 是否建议了饮食改变?3. 是否避免了给出具体的诊断?”
    • 然后,一个独立的 AI“裁判”会根据这个检查清单,逐一检查原始的八次尝试。如果某次尝试正确完成了 5 项清单中的 4 项,它就获得 0.8 的分数。

结果:无需教师的自学

AI 利用这些分数来更新其自身的大脑(强化学习)。它学会了:“啊,下次我应该确保包含我遗漏的那些清单项目。”

为什么这很重要?

  1. 无需人类:它在医疗等没有“标准答案”且人类专家太忙而无法为每个答案评分的领域中发挥作用。
  2. 长期成本更低:通常,为了获得一个好的答案,你每次提问时都必须运行 AI 八次并挑选最好的那一次。这既慢又贵。
    • 有了 CaT,AI 在训练期间只需从这 8 次尝试中学习一次
    • 训练之后,AI 变得如此出色,以至于它只需一次尝试就能给出极好的答案。
    • 论文声称:他们发现,经过训练的 AI 在回答问题时,表现与"8 次尝试”方法一样好,但使用的计算资源减少了 9 倍

总结

计算即教师就像召集一群困惑的学生,让他们争论和辩论,然后让一位聪明的编辑从他们的辩论中创作出一篇“完美”的总结,再根据学生与总结的匹配程度来给他们评分。学生们从他们集体的错误中学习,最终变得如此出色,以至于不再需要这个小组。

该论文在HealthBench(医疗建议)和MATH-500(数学问题)上测试了这种方法。

  • 在数学方面,其效果与现有方法相当。
  • 在医疗建议方面(那里没有标准答案),与起点相比,它将 AI 的性能提高了高达30%,达到了专家医生撰写答案的质量,且整个过程无需任何人工标注。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →