The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models
本文识别并分析了自回归语言建模中概率电路与大语言模型之间的表达能力差距,揭示出尽管对数空间参数化和可分解架构能够缓解特定瓶颈,但结构化可分解概率电路的固定路由结构从根本上限制了其相较于 Transformer 对异构依赖拓扑的建模能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教两种不同类型的机器人如何预测句子中的下一个词。其中一个机器人是大型语言模型(LLM),就像那些驱动现代聊天机器人的模型一样。另一个是概率电路(PC),这是一种以数学上“诚实”著称的模型,能够计算精确的概率而无需猜测。
很长一段时间以来,LLM 机器人在语言任务中一直胜出,而 PC 机器人则举步维艰。这篇论文问道:为什么 PC 机器人在语言方面如此逊色,尽管它在理论上非常强大?
作者发现,PC 机器人的失败并非因为它“愚蠢”。它的失败源于其思考和表达方式的两个特定瓶颈(交通堵塞)。
1. “输出瓶颈”:油漆搅拌机与激光打印机
将 LLM 想象成一台激光打印机。当它决定下一个词说什么时,它会为字典中的每一个可能单词输出一列“分数”(logits)。它不在乎这些分数是否是奇怪的数字;它只是将它们打印出来,然后一个最终的过滤器(Softmax)将它们转化为一个清晰、锐利的图像,其中一个词明亮突出,其余则逐渐淡出。这对于语言来说非常完美,因为上下文通常指向一个非常具体的词。
然而,PC 机器人表现得像一个油漆搅拌机。它试图通过混合几种预先制作好的“基础颜色”(概率分布)来生成下一个词。
- 问题:如果你需要一种非常锐利、具体的颜色(比如代表单个单词的亮红色),在桶中混合几种基础油漆通常会导致颜色变得浑浊、模糊。你无法仅仅通过平均其他分布来轻松制造出“锐利”的分布。
- 解决方案:论文表明,如果让 PC 机器人停止在桶中混合油漆,而是像激光打印机那样输出“分数”(在“logit 空间”而非“概率空间”中工作),它在语言方面的表现会突然大幅提升。这显著缩小了差距。
2. “上下文瓶颈”:固定铁轨与动态道路
这是更大的问题。想象一下,机器人需要回顾之前的单词来理解当前的单词。
- LLM(动态道路):LLM 使用一种称为“自注意力”的机制。想象一个 GPS,它可以瞬间在句子中的任意两点之间画出一条新路,无论它们相距多远。如果句子是“那只猫坐在垫子上”,LLM 甚至可以在中间有 50 个单词的情况下,瞬间在“猫”和“垫子”之间画出一条路。它会根据句子实际需要的内容调整其连接。
- PC(固定铁轨):PC 机器人建立在一个称为vtree(固定树状图)的刚性结构之上。想象一个火车系统,其轨道在火车运行之前就已经永久铺设好了。
- 如果句子结构与轨道匹配(例如,局部单词连接到其直接邻居),PC 运行顺畅,表现几乎与 LLM 一样好。
- 问题:如果句子需要一种轨道不支持的连接(例如,以特定方式连接第一个单词和最后一个单词),PC 就会卡住。它无法重新规划路线。这就像试图在方向错误的铁轨上开车。
论文证明,虽然 PC 理论上可以处理复杂的连接,但它只有在“铁轨”恰好为该特定句子完美铺设时才能做到这一点。由于真实语言是混乱的且结构不断变化,PC 的固定轨道是一个主要障碍。
“超级 PC"构想
作者还测试了“超级 PC"构想。如果我们让 PC 机器人拥有多套轨道,并为每个句子选择最佳的一套,会怎样?
- 理论:从数学上讲,这种“松散”版本的 PC 比刚性版本严格更强大。
- 现实:虽然它在简单的、人造的测试中表现更好,但在真实世界数据上训练这些灵活模型非常困难。论文得出结论,虽然我们知道如何让它们更强大,但尚未找到教它们有效学习的最佳方法。
总结
论文得出结论,概率电路并没有“坏掉”,它们只是与语言不匹配:
- 它们混合油漆而不是打印分数:改变它们输出预测的方式会有很大帮助。
- 它们被困在固定轨道上:它们无法像 LLM 那样动态地连接单词,这在句子结构变得复杂时会对它们造成伤害。
如果我们能解决“混合油漆”的问题,并找到一种方法来训练灵活的“换轨”模型,PC 或许最终能在语言任务中赶上 LLM,同时保持其进行精确数学计算的特殊能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。