← 最新论文
🤖 machine learning

Towards Reliable, Generalizable, and Specific In-Context Knowledge Editing via Multi-Objective Reinforcement Learning

本文提出了多目标上下文内知识编辑(MO-IKE),这是一种多目标强化学习算法,它将提示词构建建模为一个约束马尔可夫决策过程,以同时优化可靠性、泛化性和特异性,从而在更新大语言模型知识方面实现比以往方法更优越的性能。

原作者: Xuzhong Wang, Maiqi Jiang, Tejal Nair, Girija Bhusal, Yanfu Zhang, Haipeng Chen

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuzhong Wang, Maiqi Jiang, Tejal Nair, Girija Bhusal, Yanfu Zhang, Haipeng Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是新一代人工智能背后的引擎,它们能够创作故事、解决问题并回答问题,其流利程度往往能模拟人类的思维。然而,这些系统有一个根本性的局限:它们的知识在时间中是冻结的。一旦模型完成了初始训练,它所持有的事实就会变得静态。如果一个模型是在2026年冬奥会之前训练完成的,那么无论你问多少次,它都不会知道最终的奖牌统计情况。更新这些知识通常需要一个庞大且昂贵的重新训练过程,这对大多数用户来说是不切实际的。为了解决这个问题,研究人员开发了一种称为“上下文知识编辑”(in-context knowledge editing)的技术。这种方法不是改变模型的内部代码,而是在对话提示词中为模型提供一组示例,从而有效地在特定交互期间教给它一个新的事实。挑战在于构建完美的示例集:它必须足够强大,以迫使模型接受新事实;必须足够灵活,即使问题的措辞发生变化也能奏效;并且必须足够精确,以确保模型不会意外地忘记或改变它已经掌握的无关事实。

现在,一个研究小组推出了一种名为 MO-IKE 的新系统,显著改进了这些提示词的构建方式。以往自动化这一过程的尝试依赖于强化学习,这是一种计算机程序通过试错来学习的方法。虽然早期的系统可以成功地教给模型一个新事实,但它们往往以高昂的代价来实现。为了确保新事实被接受,这些系统会剥离掉那些保护模型现有知识所需的示例。这造成了一种脆弱的平衡,即修复一个错误会导致其他错误出现。新方法并不将提示词的构建视为简单的项目列表,而是将其视为一个序列决策过程。该系统学习逐一选择是添加一个陈述新事实的示例、一个重述问题的示例,还是一个强化应保持不变的事实之示例。只有当它判定提示词已完整时,才会停止添加示例。

研究人员使用多目标奖励结构来训练这个系统,这意味着计算机同时在三个领域获得奖励:正确获取新事实、处理不同的提问方式,以及保护无关事实的安全。通过平衡这些相互竞争的目标,新方法防止了系统变得过于激进。在标准事实集上的测试显示,该系统将编辑成功率从 87.1% 提高到了 91.1%。更重要的是,它显著提高了对无关知识的保留能力,将保留率从 41.0% 提升至 63.4%。这意味着模型在学习新事实的同时,更有可能不会“忘记”不需要更改的事实。该系统还证明了其高度的适应性;一个在特定语言模型上训练的版本,在无需任何额外训练的情况下,应用到完全不同的模型上也同样有效。

这项研究表明,示例的组织方式与示例本身同样重要。早期的研究方法通常使用固定的模板或仅关注单一类型的示例,这会导致提示词失去平衡。新系统动态地混合了不同类型的示例,创造了一个稳健且具有针对性的上下文。在针对五种不同的冻结语言模型和四个不同数据集(包括一个包含超过 30 万个示例的海量基准测试)进行的测试中,该方法始终优于以往的技术。研究人员发现,通过仔细管理教学新信息与保护旧信息之间的权衡,他们可以实现以前无法达到的可靠性和特异性水平。这项工作表明,更新人工智能的未来可能不在于大规模的重新训练,而在于通过对话更聪明、更平衡地引导模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →