✨ 要点🔬 技术摘要
想象一下,写研究论文并不像是在 A 到 B 之间画一条直线。相反,它更像是厨师在混乱的厨房里烹饪一道复杂的菜肴。他们切开洋葱,品尝酱汁,意识到需要加盐,于是回到切菜板去切胡萝卜,检查烤箱,然后突然想起忘了记录食谱步骤。他们在规划、烹饪、品尝和清理之间不断地跳跃。
长期以来,旨在帮助写作的计算机程序(例如 AI 写作助手)只看到了盘中最后的成品。它们并不知道那个混乱的厨房、烤焦的面包,或者厨师在把食谱写对之前改变了五次主意。
迎来“ScholaWrite”:厨房监控摄像头
这篇论文介绍了一个名为 ScholaWrite 的新数据集。你可以把它想象成放在一名计算机科学研究者大脑中的高清、慢动作摄像机。研究人员不仅观察最终的论文,还记录了五名研究生在撰写论文的四个月时间里,每一次按键、退格和停顿。
他们不仅记录了用户输入了什么 ,还标注了学生为什么要输入这些内容。他们创建了一个包含 15 种不同写作原因的“菜单”,例如:
构思生成 (Idea Generation): “我有一个新想法!”
文本产出 (Text Production): “让我把这句话写下来。”
流畅度 (Fluency): “哎呀,我拼错单词了。”
清晰度 (Clarity): “这个句子很晦涩,让我把它简化一下。”
结构 (Structural): “这个段落应该挪到那里去。”
他们发现了什么?
通过观察这段“厨房监控”画面,研究人员发现了三个重要发现:
写作是一场混乱的舞蹈,而非直线: 大多数人认为写作的过程是:计划 → 写作 → 完成。但 ScholaWrite 显示,真正的作者是在不断切换档位。事实上,在作者写作的大部分时间里,他们同时在处理三个或更多目标。他们可能在输入一个句子(文本产出)的同时,还在修正拼写错误(流畅度),并思考要把图表放在哪里(对象插入)。这是一场混乱且非线性的舞蹈。
目前的 AI 是一个“不懂混乱”的机器人厨师: 研究人员测试了大型 AI 模型(如 GPT-5),看它们能否扮演一名得力的副厨。他们问 AI:“作者接下来要做什么?” AI 表现得很吃力。它擅长修复拼写错误或让句子读起来更通顺,但它很难预测作者的意图 。它无法判断作者是准备开始一个新章节,还是打算删除整个段落,或者只是想改一下字体。它就像一个只知道搅拌锅里的汤,却不理解为什么厨师会突然停下来品尝汤的味道的机器人。
教 AI “像人类一样思考”: 研究人员将一个标准的 AI 模型进行训练,并向其“喂入”了 ScholaWrite 数据(包括 62,000 次按键及其背后的原因)。他们对模型进行了微调,使其理解过程 ,而不仅仅是结果 。 结果是,这个新的 AI 开始表现得更像人类。它开始以一种看起来更自然的方式在规划、写作和修改之间切换。它不再只是吐出完美的文本,而是开始模仿人类作者的节奏 ,即使它生成的文本还不完美。
核心结论
这篇论文认为,要构建一个真正有用的写作助手,我们不能仅仅教 AI 如何写出完美的句子。我们必须教它理解人类如何进行思考和写作的那种混乱、反复且多任务并行的旅程。
重要的局限性(论文中没有 提及的内容) 论文非常严谨地仅限于阐述其发现:
仅针对计算机科学领域: 数据来源于使用 LaTeX(一种用于数学和科学论文的编程语言)的研究人员。作者承认,这可能与小说家或历史学家的写作方式不尽相同。
关注的是 过程*,而非*结果 :** 经过微调的 AI 在“表现得像人类作者”(切换任务、规划、修改)方面有所进步,但论文承认,它生成的实际文本在语法和逻辑上仍存在问题。它学会了舞步 ,但仍在学习如何成为一名优秀的舞者。
无医疗或临床声明: 这纯粹是关于研究论文写作的研究。作者并未声称这有助于治疗、教育或医疗诊断。
简而言之,ScholaWrite 是关于写作这条曲折、混乱道路的一张地图。它告诉我们,要构建一个优秀的 AI 伴侣,我们需要理解过程中的绕路、掉头和停顿,而不仅仅是终点。
技术摘要:SCHOLAWRITE:一个端到端学术写作过程的数据集
问题描述
科学写作是一个认知负荷极高的、非线性的过程,其特征是规划、起草和修订的递归循环。尽管大语言模型(LLMs)已集成到研究工作流中,但目前的写作助手主要以自回归方式运行,即线性地生成文本,而无法理解作者潜在的认知转变。现有的数据集通常仅捕捉最终的手稿版本或短期修订日志,未能体现学术写作具有长期性和意图驱动性的本质。因此,缺乏用于模拟人类科学家实际写作方式的经验数据,这限制了开发能够真正对齐并支持人类认知写作过程的 AI 助手的进展。
方法论
为了填补这一空白,作者提出了 SCHOLAWRITE ,这是第一个捕捉从初始草稿到最终手稿的端到端学术写作过程的数据集。
数据收集
参与者: 十名来自美国一所 R1 研究型大学的计算机科学专业研究生。
持续时间: 四个月(2023 年 11 月 – 2024 年 2 月)。
工具: 开发了一个定制的 Chrome 扩展程序,用于在不干扰的情况下记录 Overleaf LaTeX 编辑器中的实时按键(keystrokes)。该系统捕获每一次按键,使用 diff 算法比较文本版本,并记录元数据(时间戳、文件名、作者 ID),同时过滤掉未授权的项目以确保隐私。
范围: 该数据集涵盖了五个最终形成 arXiv 预印本的 Overleaf 项目,包含约 62,000 次基于按键的写作动作以及超过 118,000 个增加或删除的单词。
注释与分类法
流程: 两名具有 NLP 专业知识的研究生使用专门的交互式界面审查了按键数据。他们应用了基于写作过程理论(Flower & Hayes, 1981)和先前经验研究的认知分类法。
分类法: 开发了一个包含 15 个类别的写作意图分类法,并将其分为三个高层类别:
规划 (Planning): 构思生成、构思组织、章节规划。
执行 (Implementation): 文本生成、对象插入、引用集成、交叉引用、宏插入。
修订 (Revision): 流畅度、连贯性、清晰度、结构、语言风格、科学准确性、视觉格式。
可靠性: 在一个包含 1,000 个按键的子集上,注释过程实现了 0.71 的加权 F1 分数(inter-annotator agreement)。
分析与评估
作者将 SCHOLAWRITE 用于三个主要目的:
行为分析: 检查写作意图的分布、持续时间和转换,以刻画学术写作的非线性特征。
基准测试: 评估最先进的 LLM(GPT-5, Qwen2.5-14B)在下一意图预测和输出对齐任务上的表现。
模型训练: 在该数据集上微调模型(BERT, RoBERa, Llama-3.1-8B),以评估在对齐人类写作工作流方面的改进。
核心贡献
SCHOLAWRITE 数据集: 一个公开可用的细粒度语料库,将每一次按键与认知写作意图相联系,覆盖了五个学术手稿的完整生命周期。
关于写作行为的经验见解:
学术写作具有高度的非线性和多意图性;超过 57% 的写作会话涉及三个或更多不同的意图。
写作过程由文本生成 (57.4%)和修订 (特别是清晰度和连贯性)主导,而规划活动虽然占据的时间份额较小,但通常涉及更长时间、更专注的阶段。
写作模式随阶段变化:早期阶段侧重于结构化和构思生成,而后期阶段则由修订和格式化主导。
基准测试与训练结果:
当前 LLM 的局限性: 零样本模型在预测下一意图方面表现不佳(加权 F1 < 0.5),并且无法维持复杂的认知修订,尤其是在规划和执行阶段。
微调的影响: 在 SCHOLAWRITE 上微调的模型(如 BERT, RoBERTa, Llama-8B)在下一意图预测和输出对齐方面表现出显著提升。
迭代写作: 微调后的模型采用了更具人类特征的迭代模式,频繁地在规划、执行和修订之间切换,而基准模型往往倾向于停留在单一阶段。
结果
行为分析: 数据显示,“快速、迭代的起草”与“较长、专注的规划/视觉构图”是互补的认知模式。意图之间的转换是密集且双向的,其中修订意图(清晰度、流畅度、连贯性)形成了强烈的递归循环。
预测性能: 微调后的 BERT 和 RoBERTa 在下一意图预测方面达到了 0.64 的加权 F1 分数,相比基准模型(0.04–0.12)有了实质性的提升。
对齐性: 与零样本基准模型相比,微调后的 Llama-8B 模型展现出更高的语义相似度(BERTScore-F1)和操作相似度(Levenshtein 距离)。
迭代生成: 在 100 次迭代的自我写作任务中,微调后的模型比基准模型覆盖了更广泛的写作意图,并产生了更具词汇多样性和主题一致性的输出,尽管它们在表面流畅度和逻辑连贯性方面仍显不足。
重要性
本文认为,捕捉写作的认知动态对于构建能够支持而非替代人类认知的写作助手至关重要。SCHOLAWRITE 为以下方面提供了基础资源:
研究 学术写作的细粒度认知模式。
评估 LLM 与人类写作意图及工作流的对齐程度。
训练 能够适应不断变化的、多意图写作行为的模型。
作者总结道,虽然目前的模型在文本质量方面仍面临挑战,但通过 SCHOLAWRITE 进行过程级监督,使模型能够更好地模拟人类学术写作的过程 。他们也承认了局限性,包括数据集侧重于计算机科学领域(LaTeX)、由于隐私问题导致样本量较小,以及排除了编辑器之外的预写作构思,并建议未来的工作应扩展到更广泛的学科和多模态协作。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。