← 最新论文
🤖 machine learning

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

本文提出了一种具有成本效益的方法,通过首先将经典的指令微调应用于人工编写的解答,随后将由此产生的模型与原始推理模型进行合并以恢复特定领域的推理能力,从而在可验证和不可验证领域中增强推理语言模型。

原作者: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一位聪明过头、喜欢过度思考的学生去解决一种新型谜题。这位学生是一个“推理语言模型”,它是一种特殊的计算机程序,经过训练能够展示其解题过程。在给出数学题或编程挑战的最终答案之前,它会写出一段长长的、循序渐进的思考过程,就像侦探破解谜案一样。这种“大声思考”的习惯正是它擅长处理棘手任务的原因。

然而,这里有一个陷阱。要教给这类学生新技能,你通常需要一种能瞬间检查其答案是否正确的方法(比如数学题的答案解析),或者一位超级聪明的老师来演示正确的思考方式。但如果我想教它一些没有标准答案的任务呢?比如写一段幽默的故事摘要,或者修复一个没有测试用例的特定程序漏洞。你手里有很多人类编写的“正确答案”示例,但这些示例都没有展示其中的“思考”过程。如果你只是强迫这个学生死记硬背这些答案,他们可能会学会针对特定谜题给出正确答案,但会忘记如何进行通用的思考。他们会变成只会重复答案的鹦鹉,而不是解决问题的侦探。

苏黎世联邦理工学院(ETH Zurich)的研究人员在这篇新论文中解决了这个谜题。他们发现了一个巧妙的两步走策略,可以在不让这些“思考型”模型忘记如何思考的前提下,教它们新的技能。首先,他们让模型从简单的“仅含答案”的示例中学习,就像学生为了应付考试而临时抱佛脚一样。这使得模型在处理特定任务时表现得更好,但它也开始失去展示思考过程的习惯。接着,他们进行了一次神奇的“合并”。他们将这个新训练的模型与原始的、具备强大思考能力的模型进行融合。这就像是将一杯新鲜的、针对特定任务调制的咖啡与一杯原有的、浓郁的浓缩咖啡混合在一起。通过仔细调整混合比例,他们找到了一个“甜点位”(sweet spot),在这个位置上,模型既能保留新学到的技能,又能重新记起如何通过逻辑推理来解决问题。

研究人员在四种不同的智能模型以及两个截然不同的任务上测试了这一方法:编写 Rust 编程语言的代码以及总结长篇新闻文章。他们发现该方法效果惊人。模型在特定任务上的表现大幅提升(编程得分提高高达 12 分,摘要得分略有提高),同时几乎完全恢复了其推理能力——而这种能力在标准训练中通常会被破坏。更棒的是,整个过程极其廉价且快速。研究人员计算出,他们可以用不到 3 美元的成本并在不到一小时内完成模型的适配,而其他试图解决同样问题的方案则需要高得多的成本和更长的时间。

简而言之,这篇论文表明,你并不需要一个超级昂贵的“答案检查”系统或一位天才老师来升级这些推理模型。你可以利用现有的海量简单“问答型”数据,并通过一点数学上的融合,就能在不破坏模型“大脑”的情况下赋予它们新的技能。这是一种低成本、高回报的方式,能让我们的 AI 侦探即使在学习那些没有显而易见解决方案的谜团时,依然保持敏锐的洞察力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →