← 最新论文
💻 computer science

Structured Inference with Large Language Gibbs

该论文提出了“大语言吉布斯”(Large Language Gibbs),这是一种迭代概率推理方法,它利用大语言模型的条件分布作为转移算子来对变量进行重采样,从而克服单次自回归生成中的顺序依赖偏差,以实现连贯的结构化推理。

原作者: Sanghyeok Choi, Henry Gouk, Esmeralda S. Whitammer

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Sanghyeok Choi, Henry Gouk, Esmeralda S. Whitammer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员(即大语言模型,LLM),他了解世界上海量的知识。你请这位图书管理员创建一个关于复杂情况的事实列表,比如同时描述一只猫的品种、毛发、年龄和睡眠习惯。

问题:“单次生成”(One-Shot)的错误
通常,当我们要求 LLM 执行此类任务时,我们会让它从左到右一次性写完整个列表。这篇论文指出,这样做就像是要求一位厨师在做一顿饭的过程中,直到最后才尝味道一样。因为厨师在决定第一道菜时还不知道最后一道菜是什么,所以他们可能会做出一些早期的选择,而这些选择为了强行契合后续内容,会导致整顿饭变得很奇怪。用论文中的术语来说,这产生了“顺序依赖偏差”(order-dependent biases)。如果你先让图书管理员列出猫的年龄,再列出品种,那么即使年龄和品种本身并不相关,品种的答案也可能会受到年龄写法的影响,从而产生微妙的偏差。

解决方案:“大语言吉布斯”(Large Language Gibbs,即“编辑与精炼”法)
作者提出了一种使用这位图书管理员的新方法,叫做 Large Language Gibbs。与其要求它一次性写出整个列表,不如把这个列表看作一群围坐在桌子旁的伙伴,我们轮流询问每个伙伴,让他们根据其他人的回答来重新思考自己的答案。

以下是其运作方式的简单类比:

  1. 设定阶段: 想象你有一组变量(比如猫的品种、毛发、年龄和睡眠)。你先为所有变量设定一个随机的猜测。
  2. 轮询阶段: 我们不再直接编写整个故事,而是随机挑选一个变量(比如“毛发”)。你告诉图书管理员:“其他人已经决定了这些数值(品种是‘短毛猫’,年龄是 3 岁,睡眠时间是 12 小时)。基于这些特定的事实,最可能的毛发特征是什么?”
  3. 洗牌阶段: 至关重要的一点是,你不会每次都以相同的顺序询问变量。有时你先问年龄,有时先问毛发。这可以防止模型陷入某种特定的“习惯性”回答。
  4. 循环阶段: 你重复这个过程多次。每当你更新一个变量时,都要利用新获得的信息去更新下一个变量。
  5. 结果阶段: 最终,整组答案会趋于一个状态,使得所有内容都能自洽。论文称之为“平稳分布”(stationary distribution)。这就像一群朋友在争论,直到他们达成一致,共同讲述一个逻辑完美自洽的故事,而不是一个仅仅因为起始句子的设定而凑巧成型的故事。

为什么这种方法更好?
论文表明,这种“编辑与精炼”的方法解决了两个大问题:

  • 偏差: 它阻止了模型仅仅因为某些答案出现在列表的前面就偏袒这些答案。
  • 不一致性: 它帮助模型意识到,如果“北极星”是北方的星辰,那么“天狼星”就不可能同时也是最亮的星。通过打乱提问顺序,模型可以纠正自己的错误。

论文中的现实世界测试
作者通过三种具体方式测试了这个想法:

  1. 随机数生成: 他们要求模型挑选随机数(比如掷骰子)。旧的方法(单次生成)在均匀选取数字方面表现较差。而新的“吉布斯”方法在选取看起来真正随机且相互独立的数字方面表现得好得多。
  2. 一致性推理: 他们给模型一组需要互相符合逻辑的问题(例如,“北极星是最亮的吗?”以及“天狼星是最亮的吗?”)。新方法帮助模型给出了不会自我矛盾的答案,其表现优于仅仅逐一询问问题。
  3. 从数据中学习: 他们利用该模型生成“伪造”数据,以帮助科学家了解不同事物之间的联系(例如,结核病治疗与患者年龄的关系)。通过使用“吉布斯”方法生成这些伪造数据,他们获得了比一次性要求模型编写整个伪造数据集更好的结果。

核心结论
这篇论文建议,我们不应仅仅将 LLM 视为一台从头到尾写故事的机器,而应将其视为一种迭代精炼的工具。通过让模型在随机的顺序下不断地检查并重新检查自己的答案之间的关系,我们可以得到一个更加可靠、一致且“符合概率正确性”的结果。这把模型从一个一次性的讲故事的人,变成了一个帮助寻找真相的协作编辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →