← 最新论文
🤖 machine learning

Latent Chain-of-Thought Improves Structured-Data Transformers

本文表明,通过循环反馈机制引入潜在思维链,能够有效扩展测试时计算,从而显著提升结构化数据 Transformer 在时间序列和表格预测任务上的性能。

原作者: Carson Dudley, Samet Oymak

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Carson Dudley, Samet Oymak

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明、快速的计算机助手(一种“Transformer"),它被设计为利用数据来解决问题,例如预测明天的天气或猜测客户接下来可能购买什么。通常,这个助手会查看数据,思考片刻,然后给出答案。它很快,但有时会犯错,因为它没有足够的时间真正“思考”这个问题。

这篇论文提出了一种新方法,帮助这个助手更深入地思考,而无需在传统意义上使其体积更大或速度更慢。他们将其称为“潜在思维链”(Latent Chain-of-Thought)。

以下是其工作原理,使用一个简单的类比:

“做笔记”类比

想象你正在参加数学考试。

  • 旧方法(标准模型): 你阅读题目,在脑海中进行计算,并立即写下最终答案。如果你在第二步出错,可能在写下最终答案之前无法发现。
  • 新方法(潜在思维链): 你阅读题目,完成数学计算的第一步,然后将你的中间思考过程写在一张草稿纸上。接着,你拿起这张草稿纸,将其反馈回你的大脑,并利用它进行下一步计算。你重复这个过程几次,每次迭代都 refining(优化)你的答案,最后才写下最终结果。

用论文中的技术术语来说:

  1. 模型查看数据并进行第一轮处理。
  2. 它不是直接输出答案,而是在需要做出预测的特定位置提取其“内部思考”(隐藏状态)。
  3. 它将这些思考压缩成特殊的“反馈令牌”(类似于草稿纸上的笔记)。
  4. 它将这些笔记附加到原始数据上,并再次运行模型。
  5. 它重复这个循环几次(2 次、4 次或 8 次),每次迭代都优化其答案,然后给出最终预测。

为什么这很特别?

研究人员在两种类型的数据上测试了这种方法:时间序列(如股票价格或天气模式)和表格数据(如包含客户信息的电子表格)。

他们将这种“做笔记”模型与另外三种竞争对手进行了比较:

  1. “同尺寸”模型: 一个大小相同但无法做笔记或循环的模型。它只思考一次。
  2. “巨型”模型: 一个更大、更深的模型,拥有更多“脑力”,但仍然只思考一次。
  3. “循环”模型: 一个像新方法一样自我循环的模型,但没有写下任何笔记(没有反馈令牌)。它只是反复阅读相同的数据。

结果

“做笔记”模型(潜在思维链)几乎每次都获胜。

  • 在时间序列中: 它在 9 次测试中 8 次表现最佳,准确率提高了约11%
  • 在表格数据中: 它在 27 次测试中 22 次表现最佳,准确率提高了约5%

关键在于,“巨型”模型(更多参数)的表现不如“做笔记”模型。事实上,在较小的数据集上,增大模型往往会使表现更差,因为它开始“死记硬背”数据(过拟合),而不是学习模式。“循环”模型(无笔记的重复阅读)的表现优于基础模型,但不如真正写下思考过程的模型。

结论

这篇论文证明,对于结构化数据(如电子表格和时间图表),让模型有机会“写下思考过程”并重新阅读这些思考,是一种提高准确率的强大方法。

这不仅仅是关于拥有更大的“大脑”(更多参数)或在循环中思考更长时间;而是关于拥有一种结构化的方式来存储中间想法并在此基础上构建。研究人员发现,即使只训练模型进行几次循环,它通常也能泛化,在实际解决问题时进行更多次循环,这表明它学会了“三思而后行”的有用习惯。

提到的局限性:
作者指出,他们是在特定数据集上从头开始训练这些模型的。他们尚不清楚这种技巧是否适用于那些已经在整个互联网上训练过的庞大预训练“基础模型”。他们还指出,该模型目前具有固定次数的循环(例如“思考 4 次”),而人类可能会决定对简单问题思考 2 次,对困难问题思考 10 次。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →