← 最新论文
🤖 machine learning

DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance

该论文提出了 DUET,一种基于 Token 选择性的在策略蒸馏方法,该方法利用两个权重相同的教师模型(一个包含禁止上下文,另一个不包含)之间的逐 Token 分歧,来生成清晰的监督信号,从而训练模型在遵守动态且特定于请求的禁止指令的同时,保持通用效用。

原作者: Zihan Li, Feifei Li, Wenhui Que

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihan Li, Feifei Li, Wenhui Que

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是许多现代数字助手背后的引擎,能够生成类人文本、解决问题并回答问题。然而在现实世界中,这些模型通常在严格且不断变化的规则下运行,这些规则并非硬编码在它们的“大脑”中,而是在使用瞬间注入到它们的指令中的。一家公司可能会告诉模型绝不要泄露其内部工具,而一家医院可能会要求它绝不提及患者姓名。这些规则会根据提问者是谁以及所处情境的不同而改变。开发者的挑战在于,如何教会模型遵守这些特定的、临时的禁令,同时又不至于让它变得过于谨慎而拒绝回答无害的问题,或者过于自信而意外违反规则。如果模型未能遵循这些指令,可能会导致数据泄露或品牌安全事故;如果它变得过于胆小不敢说话,则会变得毫无用处。

腾讯的研究人员开发了一种名为 DUET 的新方法,旨在解决教导模型遵循运行时规则(runtime rules)这一特定问题。他们并没有尝试从头开始重新训练模型,或者仅仅向模型展示好答案与坏答案的示例,而是创建了一个类似于一对双胞胎兄弟的系统。其中一个“孪生兄弟”在其指令中看到了被禁止的规则,而另一个拥有完全相同知识和能力的“孪生兄弟”则没有看到该规则。因为这两个“老师”在其他方面是完全相同的,所以它们言论上的任何差异必然仅是由该特定规则的存在或缺失所导致的。研究人员利用这种分歧来精准定位模型可能出错的地方。

该过程的工作原理是:由学生模型生成一个回答,同时由两名“老师”进行观察。当两名老师对下一个词应该是什么达成一致时,系统会忽略那部分对话,认为它是安全且不重要的。然而,当老师们产生分歧时——例如一个建议使用一个会泄露秘密的词,而另一个建议使用一个安全的替代词——系统就会将那个特定的时刻标记为一个关键的学习机会。这使得学生模型能够将注意力集中在规则真正起作用的那几个词上,而不是在成千上万个完全没问题的词上浪费精力。随后,学生会被轻轻地推离那个忽视规则的老师,并被拉向那个遵守规则的老师,从而有效地学会如何在提供帮助与遵守合规之间寻找平衡。

这种方法解决了旧方法中的一个缺陷,即旧方法是在整个对话的基础上对模型进行训练。在那些旧系统中,如果模型在一个长回答中犯了一个错误,整个回答往往会被视为错误的,这会让模型对哪些词出了问题感到困惑。通过将分歧隔离到发生违规的精确标记(token,即词单位)处,这种新方法提供了更加清晰的信号。研究人员在多种任务上对其进行了测试,包括保护个人信息、遵循安全准则以及遵循业务工具定义。他们发现,使用这种双老师方法训练的模型在拒绝违规请求方面表现得更为出色,同时仍能保持极高的有用性。

结果显示,这种新方法在不同规模的模型(从 15 亿参数的小型模型到 80 亿参数的模型)上都表现优于现有技术。在测试中,这些模型在面对违规请求时的合规率达到了 72% 到 85%,这意味着它们成功地拒绝了破坏规则的要求,同时仍保持了极高的可用性,保留了 88% 到 93% 的正确回答能力。至关重要的是,这些模型并未丧失其通用智能;它们在数学和逻辑谜题方面的表现与之前一样出色。这项研究表明,通过使用两个相同的模型来寻找规则生效的确切位置,开发者可以创造出既安全又实用的 AI 助手,使其能够在无需大量新数据或不损失核心能力的情况下,应对复杂且多变的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →