← 最新论文
🤖 machine learning

Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models

本文介绍了 STARS,这是一个训练框架,它通过雅可比谱半径正则化将潜在状态约束为渐近稳定不动点,从而稳定循环语言模型中的循环动力学,进而实现可靠的测试时扩展并提升复杂推理任务的性能。

原作者: Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《在循环语言模型中通过稳定循环动力学实现测试时可扩展的潜在推理》的通俗解释,辅以生动的类比。

核心难题:陷入疯狂的“思考循环”

想象大型语言模型(LLM)是一位试图解决高难度数学题的优等生。通常,为了解题,这位学生会将一连串的思考过程写在纸上(这被称为“思维链”)。

最近,研究人员尝试了一种名为**循环语言模型(LoopLMs)**的新方法。这位学生不再写长长的思维链,而是只拿到一张纸,并被告知:“阅读你自己的答案,思考它,写一个新版本,再阅读那个版本,再次思考,如此重复 10 次。”

其理念在于,通过让同一个大脑反复“循环”,学生在每次迭代中都会变得更聪明,从而无需更多纸张或时间即可完善答案。

关键问题:
论文发现,这种循环往往会导致崩溃。

  • 巅峰期: 起初,学生表现更好,答案得到改善。
  • 崩溃期: 但如果你要求学生循环太多次(例如 8 次或 10 次,而不是 4 次),答案会突然变得糟糕。学生开始产生幻觉、陷入困惑,或者数值变得失控。

作者将这种现象称为**“不可靠的测试时扩展”**。你给了模型更多思考时间(更多循环次数),但它并没有变得更聪明,反而变得混乱。

诊断:循环为何会崩溃?

研究人员利用动力系统(数学的一个分支,研究事物如何随时间变化)的视角,审视了这些模型的“内部运作”。他们发现了一个根本性的权衡,就像跷跷板一样:

  1. “狂野”的学生(内部归一化): 某些模型被设计为让信息自由流动。这非常有利于深度思考(有效性),但学生的“想法”(内部数值)会随着每次循环变得越来越大,直到爆炸。这就像麦克风离扬声器太近——声音越来越大,直到刺耳到无声。
  2. “僵住”的学生(外部归一化): 其他模型则强力压制,以保持数值小且安全(稳定性)。但这让学生变得过于谨慎。他们停止深度思考,只是重复浅层的想法。他们虽然安全,却永远无法解决难题。

结论: 现有模型要么太狂野(不稳定),要么太谨慎(无效)。它们无法兼得。

解决方案:STARS(“稳定思考”框架)

作者提出了一种名为STARS(STAbility-driven Recurrent Scaling,稳定性驱动的循环扩展)的新训练方法。

将模型的思考过程想象成一颗球滚下山坡。

  • 目标: 你希望球滚下山坡到达底部(正确答案)并停在那里。
  • 问题: 在现有模型中,球要么滚出世界边缘(爆炸),要么在半山腰的平坦处卡住(浅层思考)。

STARS 如何修复它:
STARS 使用一种名为雅可比谱半径正则化的数学工具。这个名字很长,但简单来说:

  1. “限速”标志: 研究人员教导模型在每一步检查自己的“速度”。他们确保推动球向前的“力”不会太强。
  2. “收敛”效应: 他们强制模型学习,每次循环时,它都应该更接近最终答案,而不是远离。从数学上讲,他们确保山坡的“坡度”始终指向一个稳定的休息点(不动点)。
  3. 随机练习: 他们还让模型在训练期间使用不同数量的循环进行练习(有时 2 次,有时 10 次)。这防止模型死记硬背特定的循环次数,并迫使它学会无论思考多久都能自我稳定。

结果:一个可靠的思考者

论文在两项任务上测试了该方法:

  1. 简单数学: 大数加法。
  2. 困难数学: 复杂推理问题(如 GSM8K 数据集)。

发生了什么?

  • 旧模型: 当被要求思考 8 次循环时,它们的准确率急剧下降。它们崩溃了。
  • STARS 模型:
    • 它达到了更高的峰值性能(它变得更快更聪明)。
    • 关键在于,当他们强制它进行更多循环(8 次、10 次等)时,它没有崩溃。它保持了稳定。准确率仅轻微下降,而非彻底崩塌。

核心启示

论文认为,为了让计算机通过循环其自身输出来“思考”,必须训练其具备稳定性。就像一位优秀的思考者需要在完善想法的同时不失理智一样,STARS 教导人工智能如何保持内部思维的有序,并无论思考多久都能收敛于真理。

简而言之: STARS 阻止了人工智能在获得更多思考时间时陷入疯狂,使其能够可靠地扩展其推理能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →