← 最新论文
💬 NLP

SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment

该论文提出了 SAGE,一种语义答案引导的熵目标,并结合了组不确定性偏好优化(GUPO),旨在使大语言模型的语言不确定性表达与其真实的采样行为保持一致,从而在多种推理任务中提高校准度并降低过度自信。

原作者: Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:自信的骗子

想象一下,你正在问一个非常聪明但有点紧张的机器人问题。有时,机器人对答案了如指掌;有时,它在瞎猜,但它自己却没意识到自己在瞎猜。

问题不仅在于机器人会出错,更在于当它出错时,它听起来竟然和答对时一样自信。它可能会用极其流畅的语气说:“我百分之百确定法国的首都是伦敦。”这很危险,因为用户会因此信任机器人,从而做出错误的决策。

研究人员希望教会机器人:当它不确定时,应该说“我不确定”。但如何教会一个机器人去诚实地面对自己的困惑呢?

旧方法:让机器人去猜

以前,研究人员尝试通过向机器人展示一些“诚实”回答的例子来训练它。他们会说:“当你没把握时,要说‘我不确定’。”

缺陷: 这就像是通过只给学生看一道特定的测试题,来教学生如何说“我不知道”。如果学生遇到一个他们以为自己知道的问题,他们可能仍然会自信地瞎猜。旧方法并没有观察机器人行为的大局。它们只关注单个答案并试图修复它,却忽略了机器人内部可能正在“掷硬币”决定答案这一事实。

新思路:“群体展开”(Group Rollout)

作者意识到,要判断一个机器人是否真的不确定,你必须对同一个问题问 20 次,看看会发生什么。

  • 稳定群体(Stable Group): 如果你问 20 次,机器人给出的答案 20 次都一样,那么它是自信的。它应该说:“我很确定。”
  • 分散群体(Dispersed Group): 如果你问 20 次,它给出了 20 个不同的答案(或 10 个不同的答案),那么它很困惑。它应该说:“我不确定。”

这被称为群体展开(Group Rollout)。这就像是在询问一个由 20 人组成的委员会同一个问题。如果大家意见一致,这个群体就是自信的;如果大家在争论,这个群体就是不确定的。

陷阱:“糟糕的计分卡”

这里是这篇论文的高明之处。仅仅拥有 20 个答案是不够的。你需要一种计分方式来衡量这个群体有多不确定。作者发现现有的评分方法是有问题的:

  1. “精确匹配”评分 (MAF): 这种方法只计算出现了多少次完全相同的单词
    • 类比: 想象一个委员会在投票选颜色。如果 10 个人说“红色”,另外 10 个人说“深红”,这个计分卡会认为他们完全产生了分歧(50/50),因为单词不同。但实际上他们对颜色的看法是一致的!这个计分卡过于严苛,忽略了其中的细微差别。
  2. “语义聚类”评分 (SE): 它将含义相似的内容归为一类。
    • 类比: 这比上一个好一点,但它像是一个拿着死板名单的夜店保安。如果你稍微偏离了名单,你就会立刻被踢出“是”的组别,扔进“否”的组别。这个分数会像坏掉的电梯一样剧烈跳动,让机器人很难平滑地学习。
  3. “通用相似性”评分 (KLE): 它观察句子听起来有多像。
    • 类比: 这是最危险的一个。想象一个委员会在投票解决数学题。一个人说“52”,另一个人说“53”。在普通人听来,这两个数字非常接近。这个计分卡会认为:“哦,它们非常相似,所以这个群体很自信!”但在数学中,52 和 53 是完全不同的答案。这个计分卡会误导机器人,让它以为自己很自信,而实际上它错了。

解决方案:SAGE(智能计分卡)

作者创建了一种名为 SAGE(语义-答案引导熵)的新型评分系统。

把 SAGE 想象成一个智能计分卡,它能同时理解两件事:

  1. 氛围(The Vibe): 它观察句子的听感(语言相似性)。
  2. 真相(The Truth): 它检查实际答案是否兼容(答案等价性)。

它是如何工作的:

  • 如果委员会说“红色”和“深红”,SAGE 看到它们意思相同,就会给出较低的不确定性评分(好!)。
  • 如果委员会说“52”和“53”,SAGE 看到尽管它们听起来很像,但在数学上是不同的。它会给出较高的不确定性评分(好!)。
  • 它的变化是平滑的,因此机器人能获得清晰、稳定的信号来调整自己的信心,而不是接收到一个跳跃、混乱的信号。

训练方法:GUPO

一旦拥有了这个完美的计分卡(SAGE),他们就使用一种新的训练方法叫做 GUPO

与其试图修复机器人的整个回答(包括故事、推理过程和最终的事实),GUPO 只专注于信心部分

  • 类比: 想象一位老师在批改学生的作文。老师不是重写整个故事,而是仅仅圈出学生说“我百分之百确定”的那句话,然后说:“事实上,看看你的其他草稿。你当时是在瞎猜。请把这句话改为‘我不确定’。”
  • GUPO 正是这样做的。它保持机器人的推理和事实不变,只训练机器人根据群体的实际情况来改变其“不确定性陈述”。

实验结果

作者在三类任务上测试了该方法:

  1. 事实类:(例如:“谁写了这本书?”)
  2. 数学类:(例如:“52 + 3 等于多少?”)
  3. 选择题:(例如:“答案是 A、B、C 还是 D?”)

在所有案例中,使用 SAGE 和 GUPO 训练的机器人都能更好地识别自己何时不确定。它们不再是过度自信的骗子。当答案群体显得混乱时,它们学会了说“我不知道”;当群体达成一致时,它们学会了说“我知道”。

总结

这篇论文指出,要教会机器人诚实地对待自己的不确定性,你不能只看一个答案。你必须观察一组答案。但你也需要一个特殊的“计分卡”(SAGE),它既能理解“红色”和“深红”是同一种意思,也能理解“52”和“53”并不是。有了这个智能计分卡,机器人就能学会让自己的信心与实际能力相匹配,从而成为一个更可靠的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →