Beyond Factual Knowledge: Benchmarking and Learning Step-Level Procedural Rule Reasoning in Large Language Models
本文介绍了 RuleWorld,一个用于评估步骤级程序化规则推理的大规模基准测试,并提出了 DynaRule,这是一个通过在 KV 缓存中动态注入并重新关注规则,从而显著提升大语言模型在复杂多步推理任务上性能的端到端框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是新一代人工智能背后的引擎,它们能够以惊人的流利度编写故事、解决数学问题以及翻译语言。它们通过吸收海量文本进行工作,学习单词如何组合成意义的统计模式。多年来,研究人员一直在测试这些模型回忆事实的能力,例如知道巴黎是法国的首都。但还有一种不同类型的知识对于现实世界的思考同样至关重要:程序性知识(procedural knowledge)。这不在于知道“什么是”真实的,而在于知道如何根据一套指令去行动或推理。想象一位律师必须将一套特定且复杂的法律应用于一个新案例,或者一位医生遵循详细的方案来诊断一种罕见的疾病。在这些情况下,答案并不是存储在记忆中的;它必须从一本庞大的外部规则书中被找到、选取并逐步应用。该领域面临的问题是,这些强大的模型是真的学会了这样做,还是仅仅在假装理解规则,而实际上依赖于其内部的猜测。
为了回答这个问题,一组研究人员创建了一个名为 RuleWorld 的大规模测试场。研究人员并没有给模型几个规则来解决单个谜题,而是构建了一个包含近五百万条抽象规则的库。这些规则被刻意设计得非常奇怪且与日常生活无关,例如“如果一个生物进入森林,它就会着火”,以确保模型无法利用自身的内部知识。这些规则有两种书写方式:作为形式逻辑陈述和作为纯英文句子。随后,研究人员设计了三种类型的挑战来测试模型。第一种很简单:寻找一条规则来回答一个问题。第二种更复杂:同时回答多个问题,每个问题都需要不同的规则。第三种是最难的:解决一系列连锁问题,其中第一步的答案成为下一步的起点,这要求模型在长序列的逻辑步骤中追踪其进度。
当他们在这一新基准测试上对现有模型进行测试时,结果非常悬殊。即使是最先进的模型,在可用规则数量增加时也会感到吃力。当被迫从数千条规则的池中进行选择时,它们经常抓错规则,或者在多步链条的中途迷失方向。试图通过在回答前搜索相关文本来辅助模型的标准方法被证明是脆弱的;它们能找到第一步的正确规则,但在第二步时无法更新其搜索,从而导致连锁错误。这些模型本质上是在尝试将整本规则书一次性装进脑海,这一任务压垮了它们在特定时刻专注于重要信息的能力。
为了解决这个问题,研究人员开发了一种名为 DynaRule 的新系统。DynaRule 不再将规则视为需要阅读一次的静态列表,而是教导模型将规则视为一种动态资源,它可以随着思考过程不断深入并进行更新。该系统通过将规则直接嵌入到模型的内部记忆结构中来工作,这一过程允许模型在不减慢速度的情况下访问这些规则。至关重要的是,模型被训练去识别何时需要切换状态。它学习在完成一步推理并需要寻找下一条规则时,发出一个特殊的内部信号,即一个心理上的“搜索”命令。当这个信号触发时,模型会立即重新评估整个规则库,丢弃之前使用的规则,并将注意力集中在当前步骤所需的全新规则集上。这使得寻找规则的过程从一次性的搜索转变为一个持续的、可学习的过程,并随着推理链条的变化而演进。
这种方法的成果是显著的。在 RuleWorld 基准测试中,DynaRule 的表现始终优于所有其他方法,包括那些使用强大外部搜索工具的方法。当面对一万条规则的池时,新系统保持了极高的准确度,在第一次尝试时正确识别出正确规则的概率超过了 85%,而其他方法的效果则出现了崩塌。在需要多个步骤的任务中,DynaRule 比现有的最佳替代方案在平均准确度上提升了近 20 个百分点。该系统证明,通过教导模型主动管理其对大量指令的注意力,它就可以可靠地在复杂的逻辑景观中导航。研究人员发现,模型并非仅仅记住了规则,而是学习了一种定位并应用规则的通用方法,即使在测试从未见过的规则时也是如此。这表明,只要模型能够随着任务的展开动态更新其焦点,就可以弥合模型庞大的内部知识与其遵循外部指令能力之间的差距。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。