← 最新论文
💬 NLP

Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs

该论文提出了“反向传播编程”(PBB)训练范式,通过分离指令映射与行为内化机制,使大语言模型能够仅凭少量指令(最高可达 100 个示例的效率)从声明性数据中习得可复用的程序性知识,从而显著提升了数据利用效率并优化了数据策展与安全策略。

原作者: Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

发布于 2026-02-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 “反向传播编程”(Programming by Backprop,简称 PBB) 的新方法。简单来说,它让大语言模型(LLM)能够像人类一样,只通过“读说明书”就学会做一件事,而不需要看几百遍“操作演示”

为了让你更容易理解,我们可以用几个生活中的比喻来拆解这个概念:

1. 核心问题:只有“说明书”,没有“演示视频”

通常,我们教 AI 做新任务(比如写代码或解数学题)有两种方式:

  • 演示法(Demonstration): 给 AI 看几百个“输入 - 输出”的例子。就像教小孩骑车,你得扶着车带他骑几百次,他才能学会。
  • 说明书法(Instruction): 给 AI 看一段文字描述或规则。就像给小孩一本《骑车指南》,告诉他“脚踩踏板,手扶车把,身体保持平衡”。

现状是: 现在的 AI 很擅长看“演示视频”(例子),但如果你只给它看“说明书”(规则),它往往学不会,或者学得很慢。这就好比给了你一本《如何修汽车》的书,但你从来没看过别人怎么修,你很难直接上手。

2. 解决方案:PBB(反向传播编程)

这篇论文说:“一条指令的价值,抵得上 100 个例子!”

PBB 的核心思想是:既然 AI 在训练时看到了“说明书”(指令),我们就利用一种特殊的训练方法,把这条“说明书”直接编译进 AI 的大脑(模型参数)里。这样,以后只要提到这个任务的名字,AI 就能直接调用脑子里的“程序”去执行,而不需要再看着说明书一步步想。

3. 两种“学习课程”: proactive(主动)vs. retroactive(回溯)

为了让 AI 真正学会这种“看说明书就干活”的能力,作者设计了两种训练“课程表”:

🟢 主动式 PBB (Proactive PBB)

  • 比喻: 就像先上理论课,再上实践课
  • 步骤:
    1. 第一阶段: 先给 AI 看很多“任务 + 例子”的组合,让它明白“指令”和“操作”之间是有联系的(建立映射关系)。
    2. 第二阶段: 再给 AI 看一些全新的“任务说明书”(没有例子),只让它读说明书。
  • 效果: 因为第一阶段已经建立了“说明书=操作”的直觉,第二阶段 AI 就能迅速把新说明书“编译”进大脑。
  • 结果: 只需要1 条指令,就能达到看100 个例子的学习效果。

🔵 回溯式 PBB (Retroactive PBB)

  • 比喻: 就像先背字典,再学造句
  • 步骤:
    1. 第一阶段: 先让 AI 把一大堆“任务说明书”全部背下来(只读文字,不学怎么做)。这时候它像个只会背书的学者,懂理论但不会动手。
    2. 第二阶段: 再给 AI 看其中一部分任务的“操作例子”。
  • 效果: 这些例子像一把钥匙,瞬间“激活”了它脑子里之前背过的理论。它突然明白了:“哦!原来之前背的那段话,就是让我这么干的!”
  • 结果: 即使它之前没看过某些任务的例子,只要背过说明书,现在也能举一反三,学会做那些新任务。

4. 实验成果:真的有用吗?

作者用两个领域做了测试:

  1. 写代码(Python): 给 AI 一段从未见过的代码逻辑描述,PBB 训练后的模型能直接写出正确的代码,而不需要看任何示例。
  2. 造句子(语法): 给 AI 一套复杂的语法规则,它能直接生成符合规则的句子。

关键发现:

  • 效率极高: 1 条指令 ≈ 100 个例子。
  • 代码比人话好使: 用编程语言(代码)写的指令,比用自然语言(人话)写的指令,AI 学得更快、更准。因为代码结构更清晰,像“乐高积木”一样好拆解。
  • 不仅仅是模仿: AI 真的把规则“内化”了。即使没有让它一步步思考(Chain-of-Thought),它也能在瞬间输出结果,就像肌肉记忆一样。

5. 这意味着什么?(对未来的影响)

  • 对开发者: 以后训练 AI 不需要再疯狂收集几千个“操作演示”数据了。只要把规则、算法、说明书整理好,就能用极少的数据训练出强大的模型。
  • 对安全(非常重要): 这是一个双刃剑。
    • 好消息: 我们可以更高效地教 AI 新技能。
    • 坏消息: 如果训练数据里混入了恶意的“指令”(比如“如何制造毒药”的说明书),AI 可能会在没有看到任何具体操作演示的情况下,仅仅因为“读过”这条指令,就学会并执行危险行为。这提醒我们在整理训练数据时要格外小心,因为“读一遍说明书”可能比“看一百遍演示”更危险。

总结

这篇论文告诉我们,大语言模型不仅仅是“模仿者”,它们也能成为“学习者”。通过 PBB 这种特殊的训练方式,我们可以把抽象的规则直接变成具体的技能,让 AI 像人类一样,通过“理解原理”来掌握新技能,而不是死记硬背。

一句话总结: 以前教 AI 要“手把手教 100 次”,现在有了 PBB,只要“给张说明书”它就能学会,而且学得更像专家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →