想象你有一个非常聪明、快速的计算机助手(一种“Transformer"),它被设计为利用数据来解决问题,例如预测明天的天气或猜测客户接下来可能购买什么。通常,这个助手会查看数据,思考片刻,然后给出答案。它很快,但有时会犯错,因为它没有足够的时间真正“思考”这个问题。
这篇论文提出了一种新方法,帮助这个助手更深入地思考,而无需在传统意义上使其体积更大或速度更慢。他们将其称为“潜在思维链”(Latent Chain-of-Thought)。
以下是其工作原理,使用一个简单的类比:
“做笔记”类比
想象你正在参加数学考试。
- 旧方法(标准模型): 你阅读题目,在脑海中进行计算,并立即写下最终答案。如果你在第二步出错,可能在写下最终答案之前无法发现。
- 新方法(潜在思维链): 你阅读题目,完成数学计算的第一步,然后将你的中间思考过程写在一张草稿纸上。接着,你拿起这张草稿纸,将其反馈回你的大脑,并利用它进行下一步计算。你重复这个过程几次,每次迭代都 refining(优化)你的答案,最后才写下最终结果。
用论文中的技术术语来说:
- 模型查看数据并进行第一轮处理。
- 它不是直接输出答案,而是在需要做出预测的特定位置提取其“内部思考”(隐藏状态)。
- 它将这些思考压缩成特殊的“反馈令牌”(类似于草稿纸上的笔记)。
- 它将这些笔记附加到原始数据上,并再次运行模型。
- 它重复这个循环几次(2 次、4 次或 8 次),每次迭代都优化其答案,然后给出最终预测。
为什么这很特别?
研究人员在两种类型的数据上测试了这种方法:时间序列(如股票价格或天气模式)和表格数据(如包含客户信息的电子表格)。
他们将这种“做笔记”模型与另外三种竞争对手进行了比较:
- “同尺寸”模型: 一个大小相同但无法做笔记或循环的模型。它只思考一次。
- “巨型”模型: 一个更大、更深的模型,拥有更多“脑力”,但仍然只思考一次。
- “循环”模型: 一个像新方法一样自我循环的模型,但没有写下任何笔记(没有反馈令牌)。它只是反复阅读相同的数据。
结果
“做笔记”模型(潜在思维链)几乎每次都获胜。
- 在时间序列中: 它在 9 次测试中 8 次表现最佳,准确率提高了约11%。
- 在表格数据中: 它在 27 次测试中 22 次表现最佳,准确率提高了约5%。
关键在于,“巨型”模型(更多参数)的表现不如“做笔记”模型。事实上,在较小的数据集上,增大模型往往会使表现更差,因为它开始“死记硬背”数据(过拟合),而不是学习模式。“循环”模型(无笔记的重复阅读)的表现优于基础模型,但不如真正写下思考过程的模型。
结论
这篇论文证明,对于结构化数据(如电子表格和时间图表),让模型有机会“写下思考过程”并重新阅读这些思考,是一种提高准确率的强大方法。
这不仅仅是关于拥有更大的“大脑”(更多参数)或在循环中思考更长时间;而是关于拥有一种结构化的方式来存储中间想法并在此基础上构建。研究人员发现,即使只训练模型进行几次循环,它通常也能泛化,在实际解决问题时进行更多次循环,这表明它学会了“三思而后行”的有用习惯。
提到的局限性:
作者指出,他们是在特定数据集上从头开始训练这些模型的。他们尚不清楚这种技巧是否适用于那些已经在整个互联网上训练过的庞大预训练“基础模型”。他们还指出,该模型目前具有固定次数的循环(例如“思考 4 次”),而人类可能会决定对简单问题思考 2 次,对困难问题思考 10 次。
技术摘要:潜在思维链提升结构化数据 Transformer 性能
问题陈述
大型语言模型(LLM)的最新进展表明,扩展测试时计算量,特别是通过思维链(CoT)推理,可以显著增强推理能力,有时甚至优于简单的参数扩展。虽然“Coconut"(将隐藏状态反馈为嵌入)和循环深度(迭代应用共享的 Transformer 块)等机制已在自然语言领域得到探索,但这些优势是否适用于结构化数据领域尚不明确。目前,表格预测(如 TabPFN、TabICL)和时间序列预测(如 Chronos、TimesFM)的最先进模型均通过单次前向传播处理结构化观测值。本文研究了在结构化数据场景中引入潜在思维链(即预测前进行多轮潜在计算)是否能提升性能。
方法论
作者提出了一种用于结构化数据 Transformer 的循环方案,允许在生成最终预测前进行多轮计算。其核心机制如下:
- 初始前向传播:Transformer fθ 处理输入(上下文和查询令牌)以生成隐藏状态。
- 压缩:查询位置处的隐藏状态(Hq)通过一个小型多层感知机(MLP)ϕθ 压缩为“反馈令牌”(Z)。
- 循环:将这些反馈令牌附加到原始输入序列中。随后,Transformer 再次在该增强序列上运行。
- 迭代:此过程重复 R 次。最终预测从第 R 次传播后原始查询位置的隐藏状态中解码得出。
该研究在两个领域评估了此方法:
- 表格预测:利用 TabICL 的三阶段架构(列向、行向和上下文学习 Transformer)。循环具体应用于上下文学习阶段,即将反馈令牌附加到行嵌入序列中。
- 时间序列预测:使用基于补丁(patch-based)的预测 Transformer。未来查询的隐藏状态被压缩并附加到输入序列中,随后重新运行 Transformer 堆栈。
实验设计与基线
为了隔离潜在思维链的具体贡献,作者在各个数据集上从头训练模型,并与三个不同的基线进行比较:
- 同深度基线:无循环(R=0)且层数相同的标准 Transformer。此基线用于控制参数量。
- 更深层基线:层数加倍(2L)且无循环训练的 Transformer。此基线匹配具有 R=1 的思维链模型的有效前向传播深度和浮点运算量(FLOPs),但参数量加倍,从而将深度/容量带来的增益与循环带来的增益区分开来。
- 循环基线:跨次传播共享权重(循环深度)但不将反馈令牌附加到输入中的模型。这些包括权重绑定的单块循环和跨多块堆栈的 Universal-Transformer 风格循环。此基线用于隔离显式思维链令牌与单纯的权重绑定循环各自的贡献。
关键结果
该方法在 36 个数据集上进行了评估:9 个来自 LTSF-9 时间序列基准,27 个来自 TabPFN 评估中使用的 OpenML 子集。
- 性能提升:潜在思维链在 8/9 个时间序列数据集上优于同深度基线(分位数损失平均提升 +10.99%),在 22/27 个表格数据集上优于同深度基线(准确率平均提升 +5.31%)。
- 与更深层基线的比较:思维链模型平均优于更深层的非循环基线 21.01%(时间序列)和 4.75%(表格)。更深层基线在时间序列任务上往往表现不如原始同深度基线,表明在小数据集上存在过拟合。
- 与循环基线的比较:思维链模型优于缺乏反馈令牌的权重绑定循环模型,提升幅度分别为 7.74%(时间序列)和 3.82%(表格)。
- 深度扩展:
- 时间序列:在所有测试深度(R∈{1,2,4,8})上性能均有提升,虽无明显的单调趋势,但增益趋于平稳。值得注意的是,在 R=4 时训练的模型在评估时能泛化到 R=8。
- 表格:性能呈现非单调趋势;单次循环(R=1)略微降低了性能,但额外的循环(R=2,4)恢复了性能并超越了基线。
意义与主张
本文主张,思维链是扩展结构化数据测试时计算的一个有效维度,不同于单纯增加模型深度或参数量。结果表明:
- 改进机制:增益并非仅源于计算量的增加或权重绑定。将查询位置的隐藏状态压缩为反馈令牌并重新处理的具体机制至关重要。循环基线的表现不佳表明,其优势来自于能够“写入”中间计算到序列中供后续传播关注,而不仅仅是对隐藏状态进行迭代优化。
- 可迁移性:此前在语言建模中取得成功的潜在思维链范式,成功迁移到了表格和时间序列预测任务中。
- 局限性:作者指出,其发现基于从头训练的模型;潜在思维链在大规模预训练基础模型上的有效性仍是一个待验证的实证问题。此外,当前实现采用每模型固定的循环深度,而非针对每个输入的自适应机制,且其与分布偏移的交互尚未被探索。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。