SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search
本文介绍了 SAAS,这是一种自感知强化学习框架,它通过动态建模知识边界并应用分阶段优化,在代理搜索系统中缓解过度搜索问题,从而在不牺牲准确性的前提下降低计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位天才侦探(即人工智能),正试图解开一个谜团。你有两种寻找答案的方式:1. 你的记忆:你使用脑海中已有的知识。2. 图书馆:你走出去,请图书管理员为你查找书籍。当前的人工智能侦探存在一个问题:它们是强迫性的图书馆常客。即使它们已经从记忆中知道了答案,仍然会跑去图书馆。而且,即便图书管理员已经递给它们所需的准确书籍,它们仍会要求更多的书籍,以防万一。这被称为“过度搜索”。它浪费时间、耗费大量资金(计算能力),并拖慢一切进程。本文介绍了一种名为SAAS(智能体搜索的自我感知强化学习)的新训练方法。将 SAAS 想象为一位聪明的教练,它教导侦探识别自身的局限,并在无需前往图书馆时停止奔跑。以下是教练如何运用三个简单技巧进行工作:### 1. “影子侦探”测试(搜索边界建模)在侦探前往图书馆之前,教练会运行一次模拟。* 测试:教练要求侦探不借助图书馆(仅使用记忆)解决谜团。然后,教练要求它们借助图书馆解决。* 洞察:如果侦探在不借助图书馆的情况下完美解决了问题,教练就会明白:“啊,这位侦探已经知道答案了!无需前往图书馆。”* 转变:随着侦探通过练习变得更为聪明,教练会更新这一规则。过去需要前往图书馆才能解决的问题,现在可能仅凭记忆即可解决。教练会动态追踪这一不断变化的知识“边界”。### 2. “智能罚款”系统(边界感知奖励)过去,如果侦探过于频繁地前往图书馆,教练只会大喊“停下!”或给予通用的罚款。这过于生硬;有时侦探确实需要图书馆,但罚款让它们因害怕而完全不敢前往。SAAS 采用了一种细致的罚款系统:* 如果你已经知道答案:每次你跑向图书馆,都会受到重罚。这阻止了“不必要的搜索”。* 如果你需要图书馆:你被允许前往。然而,教练会计算你实际为解决案件所需的书籍数量。如果你在第 3 本书已解决问题时却索要第 4 本,你将为这次多余的行程受到罚款。这阻止了“冗余搜索”。* 结果:侦探学会了在拥有足够证据时停止,而不是在感到无聊或焦虑时停止。### 3. “两阶段”训练营(分阶段优化)如果你试图在新手侦探学会如何破案之前教导它们提高效率,它们会感到困惑,并开始为了逃避罚款而懒惰地猜测。SAAS 将训练分为两个阶段:* 第一阶段(学习破案):教练说:“去吧!想使用图书馆就随意使用。只需学会如何解开谜团。”目标是建立信心和技能。* 第二阶段(学习效率):一旦侦探擅长破案,教练就会启动“智能罚款”系统。现在,侦探学习如何高效行事,仅在真正必要时才使用图书馆。### 结果论文表明,通过这种训练,人工智能侦探能够:* 在已知答案时停止跑向图书馆。* 在获得正确书籍后停止索要额外书籍。* 依然准确解决谜团(准确率保持高位)。* 节省大量时间和金钱,因为它们不再进行不必要的行程。简而言之,SAAS 教导人工智能具备自我感知能力:它知道何时自己足够聪明,可以凭记忆作答,以及何时应停止收集信息。它将一个 frantic、过度热情的搜索者转变为一位冷静、高效的解决问题者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。