← 最新论文
💬 NLP

Agreement in Representation Space for Open-Ended Self-Consistency

本文介绍了基于嵌入的一致性(Embedding-Based Agreement, EBA),这是一种无需训练的方法,它通过利用表示空间中的几何聚类来识别高质量输出,从而将自一致性扩展到开放式生成任务中,并证明了嵌入空间中的语义集中度是比精确符号匹配或近期的基于大语言模型的选择方法更具鲁棒性和可扩展性的可靠性信号。

原作者: Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:寻求第二意见

想象一下,你向一个非常聪明但有时有点唠叨的 AI 请教一个数学问题或一段代码。为了得到最好的答案,你把同一个问题问了它 100 次。这被称为“采样”(sampling)。

在有唯一正确答案的简单任务中(比如“2+2 等于几?”),你只需要统计投票数即可。如果 90 次它说“4”,10 次它说“5”,你就选“4”。这就是旧的做法,被称为自一致性(Self-Consistency)

但如果任务是开放式的呢?

  • 编程: 你要求编写一个用于对列表进行排序的函数。一个答案使用 Python,另一个使用 JavaScript,第三个使用不同的排序算法。它们都能运行,但看起来完全不同。你不能直接“统计投票”,因为没有两个答案在字面上是完全相同的。
  • 摘要生成: 你要求总结一篇新闻文章。一个摘要短小精悍;另一个则详尽细致。两者都很好,但并不匹配。

旧方法在这里失效了,因为它寻找的是精确匹配(就像寻找一模一样的双胞胎)。本文作者希望找到一种方法,即使答案在表面上看起来不同,也能衡量它们的共识程度。

新思路:“拥挤的房间”类比

作者提出了一种看待一致性的新方式。他们不再关注 AI 生成的文字,而是关注文字背后的含义

想象 AI 的“大脑”(其内部表示空间)是一个巨大的、隐形的房间。

  • 假设: 当 AI 生成许多虽然不同但含义正确且相似的答案时,它们不会随机散布。相反,它们倾向于聚集在房间中一个特定的、拥挤的角落。
  • 噪声: 当 AI 生成错误或奇怪的答案时,它们往往会游荡到房间中那些空旷、孤立的角落,远离人群。

因此,“一致性”并不是指每个人都说出完全相同的句子。而是指每个人都站在同一个几何邻域内。

解决方案:EBA(基于嵌入的协议)

为了测试这一点,作者创建了一个名为 EBA 的工具。其工作步骤如下:

  1. 询问 AI: 对同一个问题生成 100 个不同的答案。
  2. 映射答案: 将每一个答案转化为那个巨大隐形房间中的一个坐标点(使用一种叫做“嵌入/embedding”的技术)。
  3. 寻找人群: 寻找最大的点簇(cluster)。大多数答案聚集在哪里?
  4. 挑选领袖: 选择最靠近那个最大人群中心的那个答案。

类比: 想象你在参加一个派对,你想知道当前的“主要谈话话题”是什么。

  • 旧方法: 你在听人们是否在喊出完全相同的短语。如果没人喊出完全相同的短语,你就放弃了。
  • EBA 方法: 你观察房间。你看到一大群人围成一个圈,笑着聊天。即使他们说的词汇不同,他们的肢体语言和位置也表明他们都在就同一个话题达成共识。你选择站在那个圆圈中心的人作为“最佳”答案。

他们的发现

作者在三类任务上测试了该方法:数学、编程和摘要生成。

  1. 效果优于随机: 仅仅从生成的 100 个答案中随机抽取一个,就像是在整栋建筑里随机找一个人。EBA 挑选的是“聪明人群”中的人,它能持续获得更好的结果。
  2. 样本越多 = 结果越好: 你要求 AI 生成的答案越多,那个“人群”就变得越清晰。这就像如果你房间里只有 5 个人,很难判断群体在哪里;但如果你有 200 个人,人群就显而易见了。随着提供的数据增多,EBA 会变得越来越聪明。
  3. 稳定性高: 其他试图解决此问题的办法(例如让第二个 AI 来评判答案)往往会在请求过多答案时感到困惑或耗尽内存。而 EBA 即使面对海量样本,也能保持稳定可靠。
  4. “中心”至上: 他们发现了一个迷人的现象:位于几何簇中心附近的答案,几乎总是最好、最可靠的答案。而那些位于边缘(“外围”)的答案通常是糟糕或不准确的。

为什么这很重要

这篇论文改变了我们看待 AI 一致性的方式。

  • 以前: 我们认为一致性意味着“说同样的话”。
  • 现在: 我们知道一致性是一种几何属性。它意味着“站在意义的同一个邻域内”。

这使我们能够将“自一致性”这一技巧(通过提问多次并挑选最佳答案)应用于复杂的任务,如编写代码或总结书籍,而不局限于简单的数学问题。它证明了即使 AI 的答案在外部看起来各异,它们的“内在几何结构”也能揭示哪些答案才是真正达成共识的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →