← 最新论文
🤖 AI

Optimizing Agentic Reasoning with Retrieval via Synthetic Semantic Information Gain Reward

本文介绍了 InfoReasoner,这是一个统一的框架,它通过采用一种源自输出分布、具有理论依据的合成语义信息增益奖励,在无需人工标注的情况下引导策略训练,从而优化了结合检索的智能体推理,并在多个基准测试中实现了显著的准确率提升。

原作者: Senkang Hu, Yong Dai, Yuzhi Zhao, Yihang Tao, Yu Guo, Zhengru Fang, Sam Tak Wu Kwong, Yuguang Fang

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Senkang Hu, Yong Dai, Yuzhi Zhao, Yihang Tao, Yu Guo, Zhengru Fang, Sam Tak Wu Kwong, Yuguang Fang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解开一个非常棘手的谜题。你有一个超级聪明的伙伴(AI),它知识渊博,但有时会因为缺乏事实而陷入困境或做出错误的猜测。通常情况下,当这个朋友请求帮助(检索信息)时,我们只有在谜题被解开后,才会给它一个“做得好!”或“再试一次”的反馈。这就像是在玩一场游戏,只有在终点线时才得到评分,这使得它很难在过程中学习如何玩得更好。

这篇论文介绍了一种新的方法,教这些 AI 伙伴如何更好地寻求帮助。他们将这种新系统称为 InfoReasoner

以下是它的工作原理,使用简单的类比:

1. 问题所在:“沉默”的搜索

在旧的方法中,如果 AI 向搜索引擎提问并得到了一个没用的答案,它直到最终测试失败时才会意识到自己犯了错。这就像是一个侦探在观察线索,虽然感到困惑,但在案件结案前都意识不到自己正处于困惑之中。AI 需要一种方式来知道:“嘿,刚才那条信息确实帮我理清了思路,”或者“不,那只会让我更困惑。”

2. 解决方案:衡量“困惑度”

作者意识到,一次好的搜索不仅仅是找到正确答案,更重要的是减少困惑

想象一下你的大脑是一个充满雾气的房间。

  • 高不确定性: 房间里雾气很浓,你什么也看不清。
  • 低不确定性: 雾气消散了,你可以清晰地看到答案。

InfoReasoner 的目标是教 AI 选择能够拨开迷雾的搜索查询。如果一个搜索查询驱散了迷雾,AI 就会获得奖励。如果一个搜索查询让迷雾变得更厚(或没有变化),AI 则会受到惩罚。

3. 魔法技巧:“合成”奖励

这里是最巧妙的部分:如果你还不知道答案,你怎么知道雾气是否消散了呢?

通常,你需要一个人类老师来说:“是的,这次搜索很有帮助。”但作者并不想雇佣人类来为每一次搜索打分。相反,他们构建了一个自我检查系统

  • 模拟: AI 生成许多关于这个谜题的不同可能答案。
  • 分组: 它将这些答案组合在一起。如果它说“这个乐队是 Buzzcocks”和“它是来自博尔顿的朋克乐队”,系统会识别出它们是同一个想法,只是表达方式不同。它会将它们放入同一个“桶”中。
  • 迷雾计: 它计算 AI 正在考虑多少个不同的“桶”(想法)。
    • 如果 AI 正在考虑 10 个不同的、相互冲突的想法,那么“雾气”就很厚(高不确定性)。
    • 如果 AI 基本上确定是某一个特定的想法,那么“雾气”就很薄(低不确定性)。

奖励: 当 AI 搜索信息时,系统会检查:这次搜索是否让 AI 的“桶”变得更少、更集中了?

  • 是的? AI 会获得一个“合成语义信息增益”奖励(一个通过减少困惑而获得的金星)。
  • 不是? AI 会得到较低的分数。

4. 为什么这更好

把它想象成训练一只狗。

  • 旧方法: 你只有在狗最终抓到飞盘时才给它零食。如果它跑错了方向长达 10 分钟,它直到最后才知道自己错了。
  • InfoReasoner 方法: 你每当它迈出一步并指向飞盘的方向时,都会给它一点奖励,即使它还没有抓到飞盘。这教会了狗如何高效且聪明地移动,而不仅仅是关注最终的捕捉。

5. 结果

论文在七种不同类型的谜题(问题)和数学问题上测试了它。

  • 结果: 使用这种“拨开迷雾”奖励进行训练的 AI,在回答问题方面比其他 AI 表现得显著更好。
  • 效率: 它还学会了更加简洁。它不再漫无目的地搜索和喋喋不休,而是学会了提出能快速拨开迷雾的“正确问题”。

总结

InfoReasoner 是一种新的训练方法,它教导 AI 智能体根据信息在多大程度上消除了它们的困惑来衡量信息的价值,而不是仅仅等待最终答案是否正确。它使用一种巧妙的“自我评分”系统,为 AI 提供持续的反馈,告知其搜索是否有助于理清思路,从而实现更聪明、更快速、更准确的推理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →