Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling
本文提出了 Explore-on-Graph (EoG) 框架,通过引入结合路径信息的奖励建模机制来激励大语言模型在知识图谱上进行自主探索,从而有效缓解幻觉问题并在多个基准测试中实现了超越开源及闭源模型的领先性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一种名为 EoG (Explore-on-Graph,图上的探索者) 的新方法,旨在让大型语言模型(LLM)在回答复杂问题时,变得更聪明、更诚实,不再“瞎编乱造”。
为了让你轻松理解,我们可以把整个过程想象成在一个巨大的、错综复杂的迷宫里找宝藏。
1. 以前的方法:只会走“老路”的导游
想象一下,以前的 AI 就像一个背熟了导游手册的导游。
- 规则派(Rule-based): 导游手里拿着一本死板的规则书,只允许走书上画好的线。如果迷宫里有一条新的小路能更快到达宝藏,但书上没写,导游就绝对不敢走。
- 模仿派(Imitation-based): 导游看着以前优秀导游的录像带,模仿他们的走法。如果录像带里没走过某条路,新导游也学不会。
问题出在哪?
当遇到一个从未见过的迷宫(也就是分布外数据,Out-of-Distribution),或者迷宫里有一条从未被记录过的捷径时,这些“导游”就会卡住,或者因为找不到路而开始胡编乱造(幻觉),假装自己知道路,结果把你带进死胡同。
2. EoG 的解决方案:培养一个“探险家”
这篇论文提出的 EoG,不再把 AI 当成死记硬背的导游,而是把它训练成一个充满好奇心的探险家。
它的训练过程分为两个阶段,就像培养一个探险家的两个步骤:
第一阶段:教它“怎么思考” (SFT - 监督微调)
- 比喻: 就像给探险家一本《高级探险指南》。
- 做法: 研究人员先让一个超级聪明的模型(比如 Gemini)在知识图谱上走一遍,把它是如何一步步推理、如何连接线索的“思考过程”写下来。然后,让 AI 学习这些高质量的“思考日记”。
- 目的: 让 AI 学会基本的逻辑,知道在迷宫里不能乱跑,要顺着线索走。但这还不够,因为它还是只会在“指南”教过的范围内思考。
第二阶段:奖励“发现新大陆” (RL - 强化学习)
这是这篇论文最核心的创新,也是让 AI 变强的关键。
比喻: 探险家现在被扔进迷宫,手里没有地图,只有两个奖励机制:
- 终点奖励(Outcome Reward): 如果你找到了宝藏(答案正确),给你发奖金。
- 路径奖励(Path-refined Reward): 这是 EoG 的独门秘籍! 仅仅找到宝藏还不够,如果你走的路线是逻辑清晰、步骤合理的(比如你不仅找到了宝藏,还顺便探索了沿途的风景,没有走冤枉路),你会得到额外的超级大奖。
为什么需要“路径奖励”?
如果只奖励“找到宝藏”,AI 可能会为了赢而走捷径、甚至作弊(比如直接猜答案,或者走一条虽然通但逻辑不通的歪路)。
加上“路径奖励”后,AI 被鼓励去主动探索那些它以前没走过的、看起来有点奇怪但可能通向宝藏的新路径。它学会了:“哦,原来除了那条大路,旁边那条小路虽然绕一点,但也能通到宝藏,而且逻辑是通的!”
3. 核心比喻:从“背地图”到“画地图”
- 以前的 AI: 像是在背地图。地图上没有的地方,它就不敢去,或者强行把没路的地方说成有路(幻觉)。
- EoG 的 AI: 像是在边探险边画地图。它被鼓励去尝试那些“看起来不像路”的地方。如果它发现了一条新路(比如通过“同事”关系找到“同事的同事”住在伦敦,而不是直接找“员工”),并且逻辑通顺,它就会受到奖励。
4. 结果如何?
论文在五个著名的“迷宫测试题”(知识图谱问答数据集)上进行了测试。
- 战绩: EoG 的表现击败了目前市面上最强大的开源模型,甚至超过了像 GPT-5 和 Gemini Pro 这样的闭源商业巨头模型。
- 特别之处: 在面对那些“从未见过”的复杂迷宫(分布外数据)时,EoG 依然能保持很高的准确率,因为它学会了自主探索,而不是死记硬背。
总结
这篇论文的核心思想就是:不要只教 AI 怎么背答案,要教它怎么在未知的知识迷宫里,通过逻辑推理去“探险”,并奖励它那些既正确又逻辑严密的“探险路线”。
通过这种“路径精炼奖励”机制,AI 不再是一个只会复述旧知识的复读机,而变成了一个能举一反三、解决新问题的智慧探险家。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。