← 最新论文
💬 NLP

ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

ThreadWeaver 是一个新颖的框架,它通过结合两阶段轨迹生成器、一种与标准推理引擎兼容的基于前缀树(trie)的展开设计,以及一种并行感知强化学习策略,实现了大型语言模型中最先进的并行推理性能,从而在匹配序列准确度的同时显著降低了推理延迟。

原作者: Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Victoria Lin

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Victoria Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但思考非常缓慢的助手(一个大语言模型),他通过逐字逐句地写出每一个思考步骤来解决复杂的数学问题。这就是当今大多数 AI 模型的工作方式:它们进行线性思考。如果一个问题需要 10,000 个步骤,这个助手就需要花费很长时间来按顺序写完这 10,000 个词。即使你给他们配备了更快的计算机,他们也无法加速,因为他们被严格限制在必须写完一个词后才能写下一个词。

ThreadWeaver 是一个全新的框架,它教会了这个助手如何在不损失智能的前提下进行“多任务处理”。这就像是雇佣了一个专家团队,而不是依靠单个人独自完成所有工作。

以下是它的工作原理,分为几个简单的概念:

1. 问题所在:“流水线”瓶颈

把标准的 AI 模型想象成流水线上的一个单一工人。他们拿起一个零件,加工它,传送到下一个工位,然后重复此过程。如果工作量巨大,流水线就会变得很长,等待时间也会变得非常漫长。你不能仅仅通过在同一条流水线上增加更多工人来让它变快;因为工人仍然必须按顺序执行步骤。

2. 解决方案:ThreadWeaver 团队

ThreadWeaver 教会了 AI 识别何时可以将问题拆分。与其让一个工人做所有的事,不如让 AI 意识到:“嘿,我可以同时做这三部分工作!”

  • 分叉 (Forking - 拆分工作): 当 AI 遇到问题的某个部分,且不同的路径之间互不依赖时(例如同时检查两个不同的数学公式),它就会拆分工作。它会创建多个“线程”(微型团队)来同时处理这些部分。
  • 合并 (Joining - 回归整体): 一旦微型团队完成了各自特定的任务,他们都会向主工人汇报。主工人随后整合他们的发现,并继续解决剩余的问题。

3. 他们是如何学会这一点的(三个神奇技巧)

研究人员不仅仅是告诉 AI 去做多任务处理,他们还构建了一个特殊的训练系统,来教它如何正确地这样做而不产生混乱。

  • 技巧 1:“蓝图”生成器(两阶段数据创建)
    在教 AI 进行多任务处理之前,研究人员需要提供如何操作的示例。他们提取了现有的“单人模式”解决方案,并使用一个更聪明的 AI 将其重写为“团队协作”蓝图。他们精确地标记了哪些地方可以拆分工作,以及在哪里应该重新合并。这为 AI 提供了一份高质量的“说明书”供其学习。

  • 技巧 2:“交通控制器”(基于 Trie 树的设计)
    通常情况下,让 AI 进行并行计算需要昂贵的、定制化的计算机系统。ThreadWeaver 非常聪明,因为它可以在标准的、现成的计算机系统上运行。

    • 类比: 想象一个图书馆,书通常是逐本阅读的。ThreadWeaver 就像一位聪明的图书管理员,将书籍组织成一棵“树”状结构。当读者索要一本书时,图书管理员能立即知道将哪些分支发送给不同的读者同时进行,然后收集结果。这使得 AI 可以在标准服务器上运行,而无需进行全面的硬件改造。
  • 技巧 3:“教练”(智能强化学习)
    AI 使用一种奖励机制(类似于视频游戏得分)进行训练。

    • 目标: 得到正确答案(准确度)。
    • 奖励: 通过拆分工作来完成得更快(速度)。
    • 约束: 如果 AI 拆分了工作但得到了错误答案,它将得不到任何分数。如果它得到了正确答案但耗时太长,它得到的积分会减少。这个“教练”(一种被称为 P-GRPO 的算法)教会了 AI 如何找到完美的平衡点:只有在有助于提高效率时才拆分工作,并且始终确保最终答案是正确的。

4. 结果:更强,而非更笨

论文在极其困难的数学问题(如国家级竞赛中的题目)上测试了该模型。

  • 准确度: ThreadWeaver AI 的智能程度与最优秀的“单人模式”模型不相上下。它并没有因为尝试多任务处理而损失任何智能。
  • 速度: 由于它可以同时处理问题的多个部分,它完成任务的速度显著提升。在某些情况下,它比标准模型快了 1.5 倍

总结

可以将 ThreadWeaver 想象成教会了一个天才从“单打独斗”转变为“项目经理”。它不再亲自完成每一项计算,而是学会了识别哪些部分可以交给团队处理。它协调团队,等待结果,然后完成任务。其结果是一个既拥有单人天才般的准确性,又能以极短的时间完成工作的系统,而且这一切都不需要特殊的、昂贵的硬件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →