Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning
本文介绍了 Search-on-Graph-R1,这是一个拥有 80 亿参数的模型,它通过监督微调和强化学习将图导航内化,从而在知识图谱问答领域实现了最先进的性能,在无需辅助模块或在推理过程中使用 LLM 裁判的情况下,超越了规模更大的前沿大语言模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解开一个庞大的、多步骤的谜题,比如要找出某个城市的市长是谁,但前提是这个城市必须生长着某种特定类型的稀有树木。为了解决这个问题,你不能仅仅依靠自己的记忆;你的大脑可能会忘记那棵树的名字或城市的名称,或者它可能会把旧电影里的事实搞混。相反,你需要一张地图。在人工智能的世界里,这张地图被称为知识图谱(Knowledge Graph)。它是一个巨大的数字网络,其中的每一个事实都是一个点(实体),并通过线(关系)连接在一起。如果你想寻找答案,你必须在点与点之间进行“跳跃”,沿着线一直走,直到落在正确的那一点上。
长期以来,那些最聪明的计算机大脑(被称为大语言模型或 LLM)就像是读遍了图书馆所有书籍的才华横溢的侦探,但却不会看地图。它们必须根据记忆来猜测答案,这往往会导致错误。新的方法教会了这些模型停止猜测,转而使用一种“搜索工具”在地图上跳跃,但进行搜索的模型就像是造价昂贵、功能极其强大、运行成本极高的机器人,对于实际应用场景来说太慢且太贵了。科学家们面临的一个重大问题变成了:我们能否教会一个更小、更便宜、更快速的机器人,也能像那个昂贵的机器人一样出色地完成这种地图跳跃式的侦探工作,而不需要昂贵机器人的帮助?
这正是论文 Search-on-Graph-R1 (SOG-R1) 试图解决的问题。研究人员构建了一个巧妙的训练系统,旨在教会一个紧凑的、拥有 80 亿参数的 AI 模型(“学生”)如何独立地在这些知识地图中导航。他们并没有只是让学生去瞎猜,而是创造了一个已经知道答案路径的“老师”机器人。但诀窍在于:老师并不仅仅是低声耳语答案,它还被赋予了地图的蓝图(一个特殊的查询语句,即 SPARQL),并被要求使用与学生相同的搜索工具,一步步地行走。当老师行走时,它记录下了每一次移动、每一个避开的死胡同以及它从实时数据库中找到的每一个事实。
随后,学生通过两个阶段学习了这些记录下来的旅程。首先,它通过模仿老师的脚步进行练习(监督微调),学习如何提出正确的问题以及如何阅读地图。第二,它玩了一个游戏,尝试自己寻找答案,通过正确性获得积分,并通过速度快获得额外积分(强化学习)。结果如何?这个 80 亿参数的小型学生变成了一名大师级的侦探。在三个主要的测试场(WebQSP、CWQ 和 GrailQA)上,它的表现超越了研究人员对比过的每一个“冻结”状态下的超级机器人系统,包括那些由最先进、最昂贵的模型驱动的系统。
更令人印象深刻的是,这个学生不仅变得更擅长寻找答案,它在“如何搜索”方面也变得更加聪明了。虽然老师的路径是完美的,但学生学会了寻找捷径。它发现可以通过比单纯模仿老师时更少的搜索调用次数来达到相同的答案。研究人员发现,即使将学生更换为另一种类型的模型,这种方法仍然有效,这证明了这种训练技术本身才是“秘密配方”。至关重要的是,该论文排除了模型需要背诵整张地图或依赖第二个“裁判”机器人来在训练期间为其评分的可能性。相反,模型学会了信任实时搜索工具以及路径本身的逻辑。到训练结束时,这个小型且高效的 AI 能够比其规模大得多、昂贵得多的对手更快、更准确地在复杂的知识网络中导航,而且在实际搜索过程中完全不需要任何额外的助手或昂贵的硬件。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。