Harness-G: A Graph-Structured Harness for Search Agents
Harness-G 通过引入一种将自由形式查询生成重构为有限动作选择的图结构接口,并结合一种显著优于现有基准测试在多个问答基准测试中的结构化非近视信用机制,解决了强化学习搜索智能体中的检索等价性崩溃问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个棘手的谜题,比如弄清楚是谁偷走了饼干罐里的最后一块饼干。你有一个超级聪明的侦探(人工智能),它可以阅读数百万本书籍来寻找答案。但问题在于,这个侦探不知道如何向图书管理员求助。它没有说“请给我看关于饼干罐的那本书”,而是开始大喊一些随机且华丽的句子,比如:“我需要那段关于酥脆碎屑的故事!”或者“揭示那个糖分窃贼的传说!”
这就是目前大多数 AI 搜索智能体的工作方式。它们使用一种叫做**强化学习(Reinforcement Learning)**的技术,这基本上是一种类似电子游戏式的训练:当 AI 得到正确答案时,它会得到一个“击掌”(奖励);当它失败时,则会得到一个“大拇指朝下”(惩罚)。问题在于,AI 非常擅长编造各种听起来不同的句子,以至于它经常用十种不同的方式请求完全相同的信息。这就像是同时大喊“饼干!”、“甜点!”和“美味零食!”。图书管理员(搜索引擎)会为所有这些请求带回同一堆书,但 AI 却认为自己在探索新的领域。这造成了一种混乱的局面:AI 以为自己在学习,但实际上它只是在原地打转,穿着不同的外衣重复问同样的问题。
国防科技大学的研究人员注意到了这种混乱,并决定修复 AI 与图书管理员交流的方式。他们意识到,让 AI 大喊随机句子就是问题所在。与其让 AI 自行发明问题,不如建立一个特殊的菜单,就像视频游戏界面一样,要求 AI 从一组特定的、经过预先批准的操作中进行选择。它不能只是“询问”;它必须“选择”一个特定的句子、“查找”一个特定的人或“回答”问题。通过迫使 AI 从清晰的列表中进行选择,他们阻止了 AI 陷入那种词藻堆砌的混乱之中。他们还发明了一种新的授信方式:如果 AI 找对了要查找的人,但答案直到三步之后才出现,他们会确保 AI 能够为这第一步聪明的举动获得荣誉,而不仅仅是为最终的结果。
新的游戏:Harness-G
这篇论文介绍了一个名为 Harness-G 的新系统。把它想象成给了你的 AI 侦探一张全新的、超级有序的地图和一本严格的规则手册。
问题:探索的“幻觉”
作者发现,当 AI 智能体使用旧有的“自由形式”(即大喊随机句子)时,它们会遭受所谓的**“检索等价坍缩”(ret retrieval-equivalence collapse)**。想象你在玩一个寻找隐藏宝藏的游戏。旧的 AI 会尝试在十个不同的地方挖掘,但由于它喊出的指令很模糊,游戏引擎会在所有十个地方都带回完全相同的同一堆土。AI 认为:“哇,我尝试了十种不同的方法!”但实际上,它只是挖了十次同一个洞。这使得 AI 无法学习哪些动作是真正有效的,因为每一个动作看起来都一模一样。
解决方案:动作菜单
Harness-G 改变了游戏的规则。系统不再让 AI 编写自己的问题,而是构建了一个图(Graph)——一个连接了所有书籍中段落、句子和实体(名称)的巨大网络。当 AI 想要寻找信息时,它不再编写句子,而是查看系统提供的菜单选项。
该菜单只提供三种类型的动作:
- 选择 (Select): “我选择这一特定的句子作为我的证据。”
- 查找 (Lookup): “我想了解更多关于这个特定名字(如‘Caroline Leaf’)的信息。”
- 回答 (Answer): “我完成了,这是我的答案。”
系统随后会自动将该选择转化为完美的搜索查询。这阻止了 AI 编造令人困惑的同义词。如果 AI 想查找“Caroline Leaf”,它会从列表中选择“查找 Caroline Leaf”。它不会意外地选择“查找这部电影的导演”并得到不同的结果,因为系统知道它们是同一件事,并会自动处理。这使得每一个动作都清晰且具有辨识度。
智能授信系统:SNC
论文还引入了一种名为**结构化非近视授信(Structured Non-myopic Credit, SNC)**的新型“击掌”方式。在旧游戏中,如果 AI 在早期做出了聪明的举动(比如找到了两个想法之间的桥梁),但直到很久之后才得到最终答案,它往往得不到早期举动的任何荣誉。这就像一名足球运动员完美地把球传给了队友,但只有最后把球踢进球门的人才获得了进球荣誉。
Harness-G 通过观察整个事件链来解决这个问题。它会问:“这个早期的举动是否促成了后来的成功?”如果 AI 选择了正确的桥梁句子,即使最终答案在三步之后才出现,系统也会给予它荣誉。它还会将 AI 的选择与当时可用的其他选项进行比较。如果 AI 选择了菜单中的最佳选项,它会得到巨大的奖励;如果它选了一个平庸的选项,得到的奖励就会较少。这教会了 AI 如何进行战略性思考,而不仅仅是靠运气。
结果
研究人员在六个不同的问答挑战上测试了这个新系统,涵盖了从简单的常识到复杂的跨步解谜。他们将 Harness-G 与包括名为 Graph-R1 的系统在内的现有最佳方法进行了对比。
结果非常明确:
- Harness-G 获胜了。 它在所有测试中都取得了最高平均分。
- 它对“小脑容量”的帮助最大。 当他们使用较小的 AI 模型(15 亿参数)时,Harness-G 比次优方法提高了 10.74 分。即使使用较大的模型(30 亿参数),它仍然领先竞争对手 3.98 分。
- 它更高效。 AI 不需要询问那么多问题就能找到答案,也不会浪费时间阅读无关信息。
他们排除了什么
论文明确反驳了这样一种观点,即仅仅通过给 AI 提供更“密集”的奖励(更频繁的击掌)来解决其随机大喊的问题。他们证明了,即使有了更好的评分机制,如果允许 AI 进行随机句子的喊叫,它仍然会陷入那种“探索的幻觉”中——即它认为自己在做新尝试,但实际上并非如此。解决办法不仅仅是更好的评分,而是改变交互界面本身。
他们有多确定?
作者对他们的发现非常有信心,因为他们在六个不同的数据集和两种不同规模的 AI 模型上进行了测试。他们不仅仅是在模拟,而是实际训练了 AI 并观察其学习过程。他们还进行了“消融实验”(ablation studies),这意味着他们拆解了自己的系统,以证明菜单和智能授信系统都是必要的。当他们移除菜单时,性能下降了;当他们移除智能授信时,性能也下降了。这两个部分都是必不可少的。
简而言之,Harness-G 展示了有时让 AI 变得更聪明的方法,并不是让它在提问时更有创造力,而是给它一个更清晰、更具结构化的方式来选择它的下一步行动。它将一场混乱的喊叫战变成了一场精准的、充满策略的国际象棋比赛。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。