← 最新论文
💬 NLP

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

本文介绍了一种将结构化科学论文转化为多轮生成轨迹的流水线,用于持续预训练和基准测试,证明了该方法在显著增强学术写作能力的同时,能够保留通用推理和长文档理解能力。

原作者: Qiankai Xu, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Qiankai Xu, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型——这些能够编写故事、解决问题并回答问题的强大计算机程序——已经达到了一个临界点,即它们正在耗尽可以用来学习的新鲜、高质量人类文本。多年来,研究人员向这些系统喂送了大量的书籍、网站和文章。现在,随着最优质的人类写作变得稀缺,科学家们正转向合成数据——由计算机自身创建的文本。一种常见的方法是将现有的短篇网络文章改写成更整洁、更像教科书的形式。然而,这种方法改变了原始内容,并将文档视为简单的词流,忽略了人类作者实际上是如何规划和构建一篇作品的。一个较新的想法建议,与其仅仅重写最终文本,不如尝试重建导致该文本产生的隐藏思维过程。挑战在于,大多数现有文本过于短小,缺乏复杂的结构,难以恢复作者最初的计划。

一支研究团队现在将这一概念应用于科学论文,因为科学论文具有清晰、统一的结构以及密集且压缩的思想。他们开发了一种方法,将一篇完成的科学论文“展开”回其创作的多步历程。想象一下建成的一座房子;这个过程不仅仅是观察墙壁,而是重建建筑师的初始草图、材料清单、在铺设每一块砖之前的笔记,以及导致蓝图最终成型的最终检查。研究人员构建了一个系统,该系统可以获取一篇真实的科学论文,并向后推导,生成启动该论文的写作请求、各章节的全局计划,以及作者在撰写每个段落之前会产生的具体想法。至关重要的是,论文的实际文本与原作者撰写的完全一致;系统只是发明了解释该文本如何产生的周围思维过程。

该团队将这种“展开”过程应用于来自 arXiv 仓库(一个大规模预印本研究集合)的 180 万篇科学论文。通过对 2006 年至 2026 年初的论文进行这种重建,他们将 300 亿词的原始论文文本转化为包含约 600 亿词“轨迹”的新训练数据集。每个轨迹都是一段长期的、多轮的对话,其中计算机扮演老师的角色,首先请求一篇论文,然后概述计划,然后在产出真实文本之前,对如何编写每个章节进行审议。这个过程有效地使训练数据的规模增加了一倍,同时也拉长了模型必须处理的文档长度,将平均训练文档从约 11,000 词扩展到了近 29,000 词。研究人员发现,使用这种重建的思维过程有助于模型学习到更好的写作能力,比仅仅将同样的论文作为纯文本喂给它们效果更好。

结果显示,这种方法提高了模型在学术和工程背景下的写作能力,且没有损害其推理或解决逻辑难题的能力。即使模型随后在其他公开写作数据集上进行微调,那些首先从这些“展开”轨迹中学习的模型,其表现仍然优于那些没有经过此类学习的模型。这项研究还证明,这种逆向工程技术可以用于创建新型的指令数据,甚至是一个全新的学术写作测试场。通过获取模型从未见过的论文,系统可以针对该论文生成一个特定的问题,并附带一份详细的检查清单和评分指南来评估答案。这创造了一个名为 PAW-Bench 的基准测试,其中包含近 3,000 个锚定在真实研究论文中的任务。

一个最令人惊讶的发现是,用于生成思维过程的计算机模型的大小并不如方法本身重要。研究人员使用了三种不同的模型来创建思维数据:小型、中型和大型模型。与直觉相反——即认为更聪明、更大的模型会产生更好的训练数据——实际上,最小的模型产生的效果最好。大型模型生成的数据过于统一且重复,而小型模型生成的数据则包含了更多的多样性和“惊喜”,迫使学习模型更加努力并学到更多。这表明,价值在于重建的结构——即展开写作过程的行为——而非执行展开工作的机器本身的智能。

研究人员还观察到,这种方法有助于模型更好地理解长文档。由于重建的轨迹明显比原始论文更长,模型变得更擅长同时阅读和推理数千词的内容。这种长上下文能力的提升,在那些仅将相同论文作为纯文本进行训练的模型中并未出现。研究结论指出,通过将真实的写作视为最终答案并重建通往该答案的步骤,研究人员可以创造出一种强大的新形式的训练数据。这种方法让人工智能不仅能学习“写什么”,还能学习“如何思考写作”,从而弥合了原始信息与人类创作的结构化、深思熟虑的过程之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →