← 最新论文
💬 NLP

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks

本文提出了一项实证研究,揭示了“指令微调税”(Instruction-Tuning Tax),即一种关键的权衡关系:指令微调虽然增强了大语言模型遵循自然语言指令的能力,但同时降低了其在代码补全(code infilling)任务中的性能,因此有必要采取平衡的方法来开发有效的 AI 编程助手。

原作者: Shi Ying Chang, Chiok Yew Ho, Yichen Li, Yintong Huo

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Shi Ying Chang, Chiok Yew Ho, Yichen Li, Yintong Huo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在学习开车。你有两种截然不同的驾驶方式:

  1. “流(Flow)”模式: 你在高速公路上巡航,双手握着方向盘,目光注视着前方。你不想停下来问路,你只想让汽车自动处理接下来的弯道、换道和转弯。你需要汽车能够根据你前方的路况来“预判”你的动作。
  2. “指令(Command)”模式: 你正停着车。你拿出一张地图,指着一个目的地说:“带我去海滩。”你给出了一个具体的指令,并期望汽车能规划好路线并开过去。

长期以来,AI 编程助手(为开发者编写代码的工具)在指令模式方面变得越来越出色。它们非常擅长听从人类说“写一个对这个列表进行排序的函数”之类的指令,并精准地完成任务。这被称为指令微调(Instruction Tuning)。这就像是在教一个机器人如何遵循食谱。

然而,这篇论文指出,教导一个编程 AI 成为一个优秀的“食谱执行者”是有隐藏代价的。作者们称之为**“指令微调税(Instruction-Tuning Tax)”**。

核心问题:“免费午餐”的迷思

研究人员发现,指令微调并非免费的午餐。你不能只教模型如何遵循指令而不让它失去其他技能。

  • 训练前(基础模型/Base Model): 想象一位读过数百万本代码书的天才学徒。如果你展示一段代码并停在中间,他能凭直觉把句子补全,因为他知道故事通常是如何发展的。他们非常擅长**“流模式”**(填补空白)。
  • 训练后(指令模型/Instruct Model): 现在,想象你把同一个学徒送进了一所严格的学校,在那里他们只学习如何回答特定的问题,比如“2+2等于几?”他们变成了回答问题的专家(指令模式)。但当你回到向他们展示如何补全句子的场景时,他们会感到困惑。他们开始对着句子“评头论足”,而不是仅仅完成它。他们可能会加入不必要的解释、重复自己,或者陷入“这是您要求的代码……”这样的循环中。

“税”的表现

论文通过对比“基础”模型(原始学徒)与“指令”模型(经过训练的模型)在两类任务上的表现进行了测试:

  1. 填补中间内容(流模式): 你给 AI 一段带有中间空缺的代码,就像缺失了一块拼图一样。
    • 结果: 经过训练的模型表现变差了。它们开始添加额外的、无用的代码或喋喋不絮,使得计算机难以理解这些代码。这就像一个机械师,当你只是让他拧紧一个螺栓时,他却开始给你讲关于扳手的历史。
  2. 遵循指令(指令模式): 你要求 AI“写一个计算税率的函数”。
    • 结果: 经过训练的模型表现变好了。它们理解了请求并很好地遵守了规则。

“冗长(Verbose)”问题

论文中一个非常有意思的发现是,训练后的模型是如何失败的。当它们出错时,它们不仅仅是写错代码,而是写得太多了

  • 基础模型可能会通过写出一个简短、破碎的句子来失败。
  • 指令模型则经常通过写出一段混合了聊天式解释的长篇代码来失败(例如:“这是您请求的解决方案……”)。

研究人员将这种现象称为“冗长性(Verbosity)”。这就像一名服务员,他不仅没把咖啡端上来,反而先介绍了咖啡豆的起源,又聊了聊天气,最后却忘了在桌上放糖。在编程环境中,这种“闲聊”会破坏代码,使其无法使用。

并非所有模型都一样

论文还发现,这种“税”对不同的 AI 并不相同。

  • 一些 AI 家族(如 Qwen)像是坚韧的学生;它们学习了指令,但仍然能很好地完成句子补全。
  • 其他 AI 家族(如 DeepSeek)则像是那些一旦开始听从指令,就会完全忘记如何自主完成句子的学生。对于它们来说,“税”的负担要重得多。

“训练过程”之谜

研究人员还以“慢动作”观察了训练的过程。他们不仅看了开始和结束,还观察了中间阶段。

  • 他们发现,AI 并不会同时在所有方面都变得更好。
  • 起初,AI 能够非常迅速地变得擅长遵循指令。
  • 但随着训练的持续,它开始失去填补空白的能力(流模式)。
  • 这是一种权衡:指令模式的收益 = 流模式的损失。

总结

论文得出结论,我们不能简单地假设“更多的训练”等于“更好的 AI”适用于所有工作。

  • 如果你需要一个能与你聊天并从头构建新功能的 AI(指令模式),那么训练后的模型非常出色。
  • 如果你需要一个能坐在你身边、在你工作时输入下一行代码的 AI(流模式),那么原始的、未经训练的模型可能实际上更好,因为它们不会被“说话”分心,并且能专注于仅仅完成代码。

作者建议,开发者和工具制作者需要保持谨慎。他们不应该仅仅选择“最聪明”的模型,而是需要根据开发者所处的特定“情绪”(流模式 vs 指令模式)来选择合适的模型。有时候,那个只会补全句子的“笨”学徒,比那个不停解释的“聪明”学徒更有用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →