SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs
本文提出了 SPARK,这是一个自博弈框架,它利用从多文档科学文献构建的统一知识图谱来生成关系推理问题并提供可验证的奖励,从而使小型视觉 - 语言模型在多跳推理任务中超越基于扁平语料的基线方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位才华横溢但略显天真的学生如何成为一名侦探大师。这位学生擅长阅读,但当被要求连接隐藏在不同书籍中的线索,或挖掘复杂图表和图形内部的线索时,他们就会感到吃力。
本文介绍了一种名为SPARK的新训练方法,旨在解决这一确切问题。以下是其工作原理,分解为简单概念:
问题所在:“扁平文本”陷阱
通常,当我们训练人工智能理解科学时,只是将一堆文本(如巨量的论文堆)喂给它。人工智能像读小说一样阅读它们。但科学知识不仅仅是一个故事;它是一个网络。一张图表支持第三段中的某个主张;论文 A 中的一张表格与论文 B 中的一种方法相矛盾。
当你将这些论文转化为简单的单词列表时,你就丢失了事物之间如何连接的“地图”。
- 结果:人工智能可以回答简单的问题(“法国的首都是什么?”),但在复杂的侦探工作(“论文 A 中的方法如何解释论文 B 中的结果?”)中却会失败。
- 旧方法:以往的人工智能训练方法试图通过让人工智能基于这种“扁平文本”自问自答来进行练习。但如果没有地图,人工智能往往只是猜测出听起来正确但实际上错误的答案,因为无法验证逻辑。
解决方案:构建“知识城市”(知识图谱)
SPARK 通过首先构建**知识图谱(KG)**来改变游戏规则。不要将其视为图书馆的藏书,而要将其视为一张巨大、鲜活的城市地图。
- 节点:地图上的“建筑”不仅仅是单词,还包括文本、图形、表格和方程式。
- 道路:地图上的“道路”不仅仅是句子,而是连接这些建筑的通道。有些道路表示“这张图表支持那个主张”;另一些则表示“这张表格反驳那个实验”。
- 魔力:SPARK 自动从科学论文中构建这张地图,将不同文档中的概念连接起来。它将杂乱无章的论文堆转变为一个结构化的城市,你可以在其中从一个概念“走”到另一个概念。
训练游戏:“提议者”与“求解者”
一旦地图构建完成,SPARK 就会与单个人工智能模型玩一场“捉迷藏”游戏。该模型戴着两顶不同的帽子:
- 提议者(地图守护者):这个版本的人工智能可以看到整个知识图谱。它在地图上选择一条路径(例如,“从方法 A 开始 -> 前往结果 B -> 结束于结论 C"),并基于该路径创建一个棘手的问题。因为它构建了这条路径,所以它知道答案。
- 求解者(侦探):这个版本的人工智能只得到问题。它对地图一无所知。它必须用自己的大脑找出答案。
秘密武器(不对称性):
提议者知道秘密路径;求解者不知道。这创造了一个“学习差距”。求解者必须努力寻找答案。如果它猜错了,系统会根据地图而不是仅仅根据人类的意见来检查答案。
记分牌:三种获胜方式
在正常的人工智能训练中,你只检查:“你答对了吗?”SPARK 更聪明。它检查三件事:
- 你答对了吗?(显而易见的一点)。
- 你遵循了正确的路径吗?(你是在地图上以有意义的方式连接了这些点,还是仅仅在猜测?)。
- 你保持一致了吗?(你使用的是文档中实际存在的事实,还是凭空捏造的?)。
如果求解者正确地遵循了地图上的“道路”,它就会获得高分。如果它产生幻觉(凭空捏造),即使最终答案听起来合理,它也会受到惩罚。
结果:为何重要
研究人员在需要“多跳”推理(连接 1、2 或 3 个不同信息片段)的科学问题上测试了这种方法。
- 简单问题:SPARK 表现良好,与其他智能模型相当。
- 复杂问题:随着问题变得更难(需要更多步骤或连接不同论文),SPARK 远远领先。
- 类比:如果其他模型像是死记硬背闪卡的学生,那么 SPARK 就像是学会了如何导航地铁地图的学生。当目的地很远时,拥有地图的学生每次都会获胜。
总结
SPARK 将科学论文杂乱无章、非结构化的世界转化为一张结构化的地图。然后,它利用这张地图训练人工智能向自己提出难题,并根据地图的逻辑检查自己的答案。这使得人工智能能够学习如何连接不同文档中的复杂概念,而这是它仅阅读“扁平”文本时无法做到的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。