← 最新论文
💬 NLP

Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring

本文介绍了 Step-Tagging,这是一个利用一种新颖的推理步骤分类法(ReasonType)来实现在数学和非数学基准测试中,在保持相当准确度的同时,实现语言推理模型实时监控与提前停止的轻量级框架,从而减少了 20%–50% 的 Token 生成量。

原作者: Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察一名才华横溢但过于话痨的学生在做数学考试。这个学生是一个“语言推理模型”,它非常聪明,能够解决复杂的难题,但它有一个坏习惯:它总是喜欢自言自语。在写下最终答案之前,它可能会把题目重读五遍,检查三次自己的计算过程,担心自己是否犯了错,然后为了保险起见再检查一遍。虽然这种“自言自语”有助于它得到正确答案,但也让它完成考试的时间变得极长,并且消耗了大量的能量(或者在计算机世界里,是消耗了大量的“Token”,即文本的构建块)。

科学家们一直试图研究如何让这些聪明的模型运行得更快、更便宜,同时又不损失其智能。有人尝试直接告诉模型:“说够500个词就停。”但这就像是告诉一名跑步者在达到特定距离时必须停止,而不顾及他是在刚起步还是即将冲过终点线。这是一个生硬的工具,要么过早地切断答案,要么让模型漫无目的地闲聊太久。核心问题在于:我们能否通过倾听模型在思考时说了什么,并根据它正在进行的思考类型,而不是仅仅通过计算它说了多少个词,来在完美的时刻让它停下来?

这正是论文《步骤标记提前停止》(Step-Tagging Early-Stopping)所探讨的内容。作者雅尼斯·贝尔基特(Yannis Belkhiter)及其团队引入了一种巧妙的新系统,称为步骤标记提前停止(ST-ES)。你可以把这个系统想象成一个站在模型旁边、动作极快且沉默的裁判。这个裁判不只是在数单词,它会倾听模型说的每一句话,并立即为其贴上标签,例如“重述问题”、“进行计算”、“双重检查”或“自言自语”。

研究人员发现,并非所有的思考步骤都是平等的。某些步骤,比如“验证”(检查工作)或“自言自语”(担心出错),往往是那些最容易拖泥带水且无法增加太多实际价值的部分。通过利用这个轻量级的“裁判”来统计模型进行了多少次这类特定的步骤,他们可以设定一条规则:“一旦你检查了三次工作,就立即停止生成。”

研究结果非常令人振奋。当他们在三个不同的智能模型以及五个不同的挑战性数据集(包括难题数学题和复杂的知识问答)上测试这种方法时,他们发现可以减少模型生成的文本量达 20% 到 50%。这是一个巨大的节省!在时间成本和计算能力方面!更棒的是,模型并没有损失多少准确性;在许多情况下,它们得到正确答案的频率与被允许漫无目的闲聊时一样高。

该论文反对那种认为我们需要观察模型内部大脑(即“白盒”设置)才能高效停止模型的观点。相反,ST-ES 是一个“黑盒”工具,这意味着它只观察模型产生的文本,就像人类读者一样。这使得它无需特殊访问代码即可轻松应用于任何模型。作者建议,通过理解模型正在进行的推理类型,我们可以为这些人工智能系统构建一种更聪明、更高效的工作方式,确保它们在真正思考完毕时停止说话,而不是在计时器到时时被迫停止。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →