From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation
本文识别并量化了“惯性偏差”(inertia bias)现象,即基于大语言模型的智能研究体在评估其自身先前的行为时客观性下降的现象,并提出了具有噪声隔离机制的 NIS-Agent 框架以缓解该偏差,在实现深度研究基准测试中具有竞争力的性能的同时,显著降低了 Token 成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字时代,我们已经构建了能够像研究人员一样工作的人工智能。这些程序通常被称为“智能体”(agents),它们可以浏览互联网、阅读成千上万篇文章,并将复杂的答案拼凑起来,而这些问题如果由人类来解决可能需要耗费数小时。它们的工作原理是将一个大问题分解为若干个小步骤,寻找信息,然后根据所发现的信息决定下一步该做什么。这个过程依赖于计算机不断检查自己的工作,询问:“我找到我想要的东西了吗?”以及“我应该继续还是停止?”为了使这些系统真正有用,它们必须能够承认错误并改变方向。如果一次搜索导致了死胡同,智能体需要具备客观性,能够放弃那条路径并尝试新路径。
然而,研究人员发现这些智能系统在思考方式上存在一个隐藏的缺陷。当一个智能体生成一个搜索查询或一个计划时,它会对那个想法产生一种奇特的依恋。即使它发现的结果显然是不相关的或错误的,智能体也会难以放弃最初的选择。就好像这个系统过度投入到了自己之前的行动中,以至于无法公平地评价它们。研究人员将这种现象称为“惯性偏差”(inertia bias),它导致智能体浪费时间在无意义的路径上,并忽略那些与其初始计划相矛盾的证据。问题不在于计算机缺乏信息,而在于计算机失去了对刚刚做出的选择保持客观的能力。
来自浙江大学和阿里巴巴集团的一个研究小组致力于测量这一问题并寻找解决方法。他们首先创建了一个特定的测试,以观察这种偏差在多大程度上影响决策。他们设计了一个场景:一个计算机智能体必须决定是继续搜索还是停止,其依据是一组搜索结果。在测试的一个版本中,智能体看到的搜索结果被视为其近期搜索行为的结果。而在另一个版本中,完全相同的结果被呈现为来自外部来源的中立信息。两者的差异是惊人的。当智能体认为这些结果源于自己的行为时,它极不容易拒绝错误的信息。即使证据表明它错了,它仍然固守最初的查询。而当结果被呈现为外部事实时,同一个计算机则能更好地识别出死胡同并改变航向。实验证明,仅仅是“拥有”一段先前行动的事实,就会降低系统的客观性。
研究人员发现,这种偏差产生了两种特定类型的“噪声”,破坏了深度研究的质量。第一种发生在“执行者”(worker)层面,即系统中实际进行网络搜索的部分。由于惯性偏差,执行者会继续点击那些看起来略有相关但实际上毫无用处的链接,仅仅是因为它生成了找到这些链接的搜索词。这浪费了时间,并让系统的内存充满了垃圾信息。第二种噪声发生在“管理者”(manager)层面,即规划整体策略的部分。如果管理者在早期犯了一个小错误,它往往会忽略随后出现的与该错误相矛盾的证据。它不会重新评估全局,而是选择性地挑选出支持其原始错误计划的信息,从而导致错误的最终答案。
为了解决这个问题,该团队构建了一个名为 NIS-Agent 的新系统。其核心思想简单而有效:将决策过程与可能模糊判断的行动历史隔离开来。他们引入了两个具体的工具来实现这一点。首先,针对执行者,他们创建了一个过滤器,该过滤器可以在不考虑发现结果的搜索查询背景的情况下查看搜索结果。这使得系统能够纯粹基于内容而非与其先前错误之间的联系来判断网页的相关性。如果页面没有用处,系统可以立即将其丢弃并尝试新的搜索。其次,针对管理者,他们建立了一个验证步骤,将最终的推理分解为细小的、独立的片段。每个片段都会被独立检查,以查看逻辑是否成立,而不受整个对话历史压力对判断的影响。
这一新方法的成果非常显著。在困难的研究基准测试中,新系统的表现优于现有方法,同时消耗的计算资源更少。事实上,它减少了大约三分之一的计算数据处理量,因为它不再把时间浪费在无关页面上。研究人员还训练了一个较小的开源模型,使其天生具有抵抗这种偏差的能力。这个较小的模型在使用他们的框架时,在深度研究任务上的表现可以媲美规模更大、成本更高的商业模型。
这项研究证实,具备客观性的能力不仅仅在于拥有更多的数据或更聪明的头脑,而在于系统的结构如何看待自身的历史。通过退后一步并孤立地观察决策,研究人员展示了人工智能可以通过设计来克服自身的固执。这并不意味着问题已完全解决,因为系统仍可能犯错,但它提供了一条清晰的前进道路。这项工作表明,要使人工智能成为复杂研究中真正可靠的伙伴,必须在设计中加入允许其忘却自身偏差并基于事实本身进行判断的机制。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。