← 最新论文
💬 NLP

Unlocking Prompt Infilling Capability for Diffusion Language Models

该论文指出,通过在全序列监督微调中采用提示词与回复联合掩码的策略,可以解锁扩散语言模型原本被锁定的提示词补全能力,使其生成的提示模板在效果上媲美甚至超越人工设计,并证明当前训练惯例而非架构限制才是阻碍该能力发挥的主要瓶颈。

原作者: Yoshinari Fujinuma, Keisuke Sakaguchi

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yoshinari Fujinuma, Keisuke Sakaguchi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲了一个关于人工智能(AI)如何“写提示词”的有趣发现。简单来说,作者发现了一个被锁住的“超能力”,并找到了一把简单的钥匙把它打开了。

我们可以用**“填字游戏”“厨师做菜”**的比喻来理解这篇论文。

1. 背景:AI 原本是个“单向”的填字高手

现在的很多高级 AI(叫“扩散语言模型”),它们写文章的方式很像玩填字游戏

  • 传统 AI(自回归模型):像是一个只能从左往右写字的人。它写第一个字,再写第二个,不能回头改前面的。
  • 扩散模型(本文主角):像是一个可以双向填字的高手。它可以在一段话的开头、中间或结尾同时挖空几个格子,然后看着周围的字,把挖空的部分补全。理论上,它既能补全“答案”,也能补全“问题”。

2. 问题:为什么它不会“补全问题”?

虽然这种 AI 理论上能补全任何问题,但作者发现,目前的 AI 实际上只会补全“答案”,不会补全“问题”

比喻:只教了“做菜”,没教“定菜单”
想象一下,你雇佣了一位天才厨师(AI 模型)。

  • 过去的训练方法(Response-only Masking):你给厨师一张写好的菜单(Prompt/提示词),然后让他把(Response/回答)做出来。
    • 你总是把菜单给他看,只让他练习怎么把空着的菜名填上。
    • 结果:厨师成了做菜的专家,但他完全没学过怎么根据客人想吃的菜,去反推菜单该怎么写
  • 后果:当你想让他根据几个例子,自己“猜”出一个完美的菜单(提示词)时,他完全懵了,或者乱填一通(比如填了一堆乱码或结束符号)。

论文的核心发现:这不是厨师(模型架构)笨,而是**训练方法(SFT)**太保守了。因为训练时只让他练“做菜”,没让他练“定菜单”,所以他不会。

3. 解决方案:解锁“全序列填字”

作者提出了一个非常简单的修改:在训练时,把“菜单”和“菜”一起挖空,让厨师一起猜。

  • 新方法(Full-Sequence Masking)
    • 你给厨师看几个例子,把菜单(提示词)和(回答)都挖掉一部分。
    • 让他看着剩下的部分,同时把菜单和菜都补全。
    • 效果:厨师突然开窍了!他学会了不仅知道怎么做菜,还能根据想做的菜,反推出最完美的菜单该怎么写

4. 这个能力有什么用?(自动优化提示词)

一旦解锁了这个能力,AI 就能做一件很酷的事:自动写提示词(Prompt Infilling)

  • 场景:你想让 AI 当裁判,给文章打分。你只需要给它几个“好文章 + 高分”和“差文章 + 低分”的例子。
  • 传统做法:你需要人工绞尽脑汁写一个复杂的打分规则(提示词),这很费时间,而且不一定写得最好。
  • 新做法:你把这几个例子扔给 AI,让它把提示词里挖空的部分(比如具体的打分标准、语气)自动补全。
  • 结果:AI 自己生成的提示词,往往比人类专家手写的还要好,甚至能发现人类没想到的细节(比如把打分从整数变成更精确的小数,让评分更细腻)。

5. 实验结果:真的有效吗?

作者做了很多测试,发现:

  1. 解锁后更强:用了新训练方法的 AI,在自动写提示词的任务上,表现远超旧方法。
  2. 举一反三:用这个 AI 生成的提示词,去指挥其他不同的 AI(哪怕是没经过这种训练的 AI),效果也变好了。就像是一个优秀的“教练”写了一套训练手册,其他运动员照着练也能变强。
  3. 互补性:它还能和现有的自动优化方法结合,让效果更上一层楼。

总结

这篇论文告诉我们一个重要的道理:很多时候,AI 做不到某件事,不是因为它的“大脑结构”不行,而是因为“训练方式”没给对信号。

就像你教孩子学数学,如果只让他做“已知条件求结果”的题,他永远学不会“根据结果反推条件”的题。只要稍微调整一下训练方法(把题目和答案都挖空让他猜),他就能瞬间掌握这项新技能。

一句话概括:作者通过改变训练方式,让 AI 学会了“倒推提示词”,从而能自动生成比人类写得更好的指令,让 AI 变得更聪明、更听话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →