← 最新论文
🤖 machine learning

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

LongStraw 是一种架构感知型执行栈,它通过在不使用自动求导的情况下实现共享提示词评估以及顺序响应重放来优化内存使用,从而在固定的 GPU 预算下实现了百万级 Token 的强化学习后训练,并成功在 Qwen3.6-27B 和 GLM-5.2 等上下文长度超过 200 万 Token 的模型上展示了执行能力。

原作者: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Che
发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个超级聪明的机器人去破解一个宏大的、多步骤的谜题。为了做到这一点,机器人在开始猜测答案之前,需要阅读相当于一整个图书馆规模的线索(即“上下文”)。在人工智能的世界里,这被称为“长文本训练”(long-context training)。通常,当我们训练这些机器人时,我们会喂给它们一本包含大量线索的书,然后让它们写下一个简短的答案。问题在于,机器人的大脑(它的计算机内存)会被书中的细节填得满满当当,以至于在它还没写完答案之前,内存就耗尽了。这就像是在试图一边解谜,一边试图把整座图书馆都捧在手里;最终,你的手臂会因为太累而无法动弹。

为了解决这个问题,科学家们一直在构建越来越大的芯片库(GPU)来容纳所有信息。但如果你没有一台超级计算机怎么办?如果你只有固定数量的芯片,比如标准的 8 个或 32 个呢?这就是名为《LongStraw》的论文所要解决的谜题。它在问:我们能否教一个机器人阅读一个两百万字的篇章,并用仅有的固定数量的计算机芯片写出解决方案,而不需要购买更多芯片?答案不是“是的,我们把芯片做大了”,而是“是的,我们改变了拿书的方式”。

研究人员构建了一个精巧的系统,叫做 LongStraw。把它想象成一位组织极其严密的图书管理员。与其试图在机器人写答案时将整本两百万字的篇章都摊开在桌子上(这会导致桌面崩溃),这位图书管理员会先完整地阅读一遍故事,记住故事的核心“神韵”或“状态”,然后把沉重的书收起来。现在,机器人只需要看着那张写着微小“神韵”的便签就能写出简短的答案。如果机器人需要核对某个特定细节,图书管理员会迅速抽出那一页,展示给机器人看,然后立即将其放回原处。这样一来,即使故事再大,桌面也永远不会变得杂乱无章。

该论文在两种不同类型的机器人大脑上测试了这个想法:一个叫作 Qwen,另一个叫作 GLM。他们尝试让这些机器人阅读一个长度为 2,097,152 个 token(大约是两百万个单词或字符)的提示词(即故事),然后写出响应。他们是在严格的预算下完成的:使用 8 块 H20 GPU 来运行 Qwen 机器人,以及使用 32 块 H20 GPU 来运行 GLM 机器人。

以下是他们的发现:

  • 在“阅读”部分是有效的: 他们成功处理了整个两百万 token 的故事,而没有导致计算机内存崩溃。他们证明了通过聪明地处理何时保留信息以及何时释放信息,你可以将这项庞大的任务放在固定数量的芯片上完成。
  • 节省了空间,但牺牲了时间: 通过把沉重的书收起来,只在需要时才抽出页面,他们节省了大量的内存。例如,当他们将机器人“猜测”的数量(组大小)从 2 增加到 8 时,内存占用几乎没有变化(仅增加了约 0.21 GB),但完成任务所需的时间变长了,因为他们必须一页一页地抽出页面,而不是一次性全部取出。
  • 这是一个“概念验证”,而非完美的终点: 论文非常诚实地说明了它没有做到的事情。虽然该系统成功运行了模拟,并展示了机器人能够阅读长篇故事并写出答案,但它并未完全证明机器人学会了更新大脑的完美方式。连接机器人不同“大脑部分”(梯度)的一些数学运算,并没有在所有芯片之间实现像完美训练过程那样的完全同步。这就像是展示了一台汽车引擎可以在极少的燃料下运转,但尚未证明它能在整个赛道上行驶而不熄火。

研究人员将他们的结果称为“执行收据”(execution receipt)。这张收据证明了:“是的,我们成功地在特定的硬件上运行了这个庞大的任务,且没有崩溃。”他们并没有声称自己赢得了比赛或造出了最快的车;他们只是证明了这辆车确实可以在这条特定的赛道上,用这么多的油开起来。

简而言之,LongStraw 表明你不需要超级计算机来训练处理宏大故事的 AI。你只需要一种更聪明的内存管理方式,用一点点额外的时间来换取大量的空间节省。它为那些预算有限的小型团队和研究人员打开了大门,让他们可以实验这些巨型 AI 模型,证明只要你足够聪明,使用固定的、较小的工具包也能成就伟大的事业。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →