← 最新论文
💬 NLP

Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

本文介绍并评估了五种用于从机器翻译中的大语言模型中提取逐词置信度的语言化方法,发现尽管这些方法与内部信号的相关性较低,但在错误检测和校准方面的表现却与内部信号相当。

原作者: Ali Marashian, Alexis Palmer, Katharina von der Wense

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Marashian, Alexis Palmer, Katharina von der Wense

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个非常聪明、精通多种语言的机器人翻译官。你向它要求翻译一个句子,它瞬间完成了。但你如何知道它是否翻译对了?机器人知道自己是否犯了错吗?

这篇论文研究了一个特定的问题:我们能否询问机器人,“你对这个特定的词有多确定?”并信任它的回答?

研究人员比较了获取机器人“置信度”的两种方式:

  1. “内部”方式: 查看机器人的秘密数学逻辑(其内部概率)。这就像窥视机器人的大脑,看看在它挑选一个词之前,它曾考虑过多少种选择。
  2. “口头表达”方式: 直接询问机器人:“在 0 到 1 的范围内,你对这个词有多自信?”并让它打出答案。

以下是他们研究结果的简单类比拆解:

1. “窥视大脑”的问题

通常,当我们想知道翻译质量好坏时,我们会观察机器人的内部数学逻辑。如果机器人在挑选某个词时有 99% 的把握,我们就假设它是正确的。

然而,论文指出这种方法存在一个被称为**“表面形式竞争”(Surface Form Competition)**的缺陷。

  • 类比: 假设你正在翻译“The cat sat on the mat.” 你也可以说“The feline sat on the rug.” 这两种都是完美的翻译。
  • 问题: 如果机器人在“cat”和“feline”之间犹豫不决,它的内部数学逻辑可能会显示它对“cat”只有 50% 的把握,因为它也在考虑“feline”。但“cat”实际上是一个正确的翻译!
  • 结果: 机器人的内部数学逻辑显示:“我不确定”,但输出的结果实际上是完美的。内部信号具有误导性,因为它测量的是选项之间的混乱程度,而不是正确性

2. 新的想法:直接问它

既然机器人会说话,研究人员尝试了另一种方法:口头表达置信度(Verbalized Confidence)。与其窥视数学逻辑,不如提示机器人说:“我有 90% 的把握这个词是正确的。”

他们测试了五种提问方式:

  • 列表法: “告诉我句子的哪些部分是错误的。”
  • 词语数字法: “为每个词给出一个 0 到 1 之间的分数。”
  • 词语标签法: “给每个词一个标签,比如‘非常确定’或‘不确定’。”
  • Token 数字/词语法: 进行同样的操作,但针对的是单词的微小片段(token)而非整个单词。

3. 大大的惊喜:它们并不一致

研究人员原本预期,如果机器人的内部数学逻辑显示“我不确定”,而我们问机器人“你不确定吗?”,机器人会回答“是的”。

他们错了。

  • 类比: 这就像一位气象预报员看着他们复杂的雷达数据(内部),说:“有 50% 的降水概率”,但当你直接问他,“你觉得会下雨吗?”,他却说:“我 90% 确定不会下雨。”
  • 发现: 机器人的内部数学逻辑与它口头表达的内容之间几乎没有任何相关性。它们本质上是两种完全不同的策略,彼此之间并没有沟通。

4. 询问是否有帮助?

那么,如果它们不一致,哪种方法能更好地识别实际的翻译错误呢?

  • 结果: 出人意料的是,询问机器人(口头表达)的效果与窥视数学逻辑(内部)一样好,有时甚至更好。
  • 注意点: 这取决于你使用的是哪种机器人。
    • 对于一种模型(Llama3),要求它给出一个“李克特量表”(Likert score,例如“非常确定”)效果最好。
    • 对于另一种模型(Aya23),查看其内部数学逻辑(熵/Entropy)效果最好。
  • 现实检验: 即便是最好的方法也不是完美的。机器人识别自身错误的能力仍然处于中等水平。这就像一个正在参加考试的学生,虽然能较好地知道哪些答案是错的,但仍然会犯一些自己都没意识到的错误。

5. 为什么这很重要(根据论文结论)

论文得出结论,我们不需要成为“黑客”去窥探机器人的代码来获取置信度分数。我们可以直接问它。

  • 易用性: 你不需要接触机器人的内部“大脑”(这在闭源模型中通常是隐藏的)。你只需要能与它聊天即可。
  • 粒度: 研究人员发现,即使我们要求一个精确的数字(如 0.83),机器人也倾向于将其舍入为简单的步骤(如 0.8 或 0.9),这表明它们更像是在使用一个简单的清单,而不是高精度的计算器。

总结

这篇论文测试了我们能否信任大型语言模型对其自身置信度的描述。

  • 旧方法: 查看数学逻辑(内部)。
  • 新方法: 询问模型(口头表达)。
  • 结论: 它们是完全不同的东西,但询问模型在寻找翻译错误方面与查看数学逻辑一样有效。这是一种更简单、更易获取的方法,用于检查翻译是否可能出错,而无需看到模型的秘密代码。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →