Restoring the Neural-Symbolic Bridge via Execution-Grounded Reward Shaping in Large Language Models
本文提出了 ReinKBQA,这是一个强化学习框架,通过利用基于执行反馈的多维奖励(通过 GRPO),旨在修复大语言模型在知识库问答中缺失的神经-符号桥梁,以克服在缺乏丰富预训练先验的正式语言上进行监督微调的局限性,从而在复杂推理基准测试中达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人,它读过了互联网上几乎所有的书籍、网站和文章。它是对话大师,能够创作诗歌、解释历史,并和你聊聊你的日常生活。但有一个问题:这个机器人从未真正学会说“机器人代码”。这就像一个才华横溢的人类,能写出优美的散文,却从未学习过像 Lisp 这样具有严格、不容置疑规则的编程语言——在 Lisp 中,每一个括号都必须完美平衡,每一个命令都必须遵循严密的结构。
这就是科学家们在**神经符号推理(Neural-Symbolic Reasoning)**领域所应对的问题。“神经”指的是机器人的大脑(大型语言模型),它通过从文本中学习模式来进行学习。“符号”指的是计算机系统执行任务时所需的严格逻辑规则,比如从海量数据库中回答一个问题。挑战在于如何让机器人将人类的问题转化为完美的、可执行的代码指令。如果机器人把代码写错了一点点——比如漏掉了一个闭合括号——整个系统就会崩溃,答案也会随之丢失。我们之所以关注这一点,是因为如果我们希望人工智能可靠地解决复杂问题,它就必须停止“猜测”,开始遵循它所交流的机器规则。
你即将阅读的这篇论文题为**《通过基于执行反馈的奖励塑造来修复大型语言模型的神经符号桥梁》(Restoring the Neural-Symbolic Bridge via Execution-Grounded Reward Shaping in Large Language Models)**。该论文探讨的正是不折不扣的这种脱节。作者 Zhengyu Lyu 和 Aziguli Wulamu 发现,机器人的大脑缺少一块关键的拼图:它在训练数据中看到的“机器人代码”(特别是被称为 S-Expressions 的一种风格)还不够多,以至于不知道如何正确构建它。他们发现,仅仅教机器人模仿示例(一种称为监督微调的方法)是不够的;机器人学会了听起来很有说服力,但往往生成的代码看起来是对的,一旦尝试运行就会出错。
为了解决这个问题,研究人员构建了一个新的训练系统,名为 ReinKBQA。该系统不再只是向机器人展示正确答案,而是让机器人尝试编写代码,然后立即在数据库中“运行”它。如果代码运行成功并找到了正确答案,机器人会得到一个“击掌”(奖励);如果代码崩溃了,它会得到一次温和的纠正。论文对比了两种做法:一种是让机器人获得一份详细的评分表,分解说明它哪里做对了(例如“实体正确”、“骨架错误”、“关系正确”),另一种是让机器人只看到一个“好”与“坏”答案的列表。
结果非常引人入胜。使用详细评分表的方法(使用一种称为 GRPO 的算法)成为了明显的赢家。这表明,当一个机器人在学习一种它几乎不了解的语言时,它需要具体的、细粒度的反馈,而不是仅仅得到一个简单的“对或错”的判断。作者发现,这种方法使他们规模更小、效率更高的机器人模型,表现优于那些依赖缓慢、逐步猜测的更大、更昂贵的系统。简而言之,这篇论文表明,通过让机器人从其代码的“后果”中学习,而不是仅仅通过记忆示例,我们可以重建人类语言与机器逻辑之间的桥梁,使人工智能在解决复杂谜题时变得更加聪明且可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。