ICA: Information-Aware Credit Assignment for Visually Grounded Long-Horizon Information-Seeking Agents
本文提出了信息感知信用分配(Information-Aware Credit Assignment, ICA),这是一个以证据为中心的框架,该框架利用稳定的网页快照来识别高价值信息单元并为中间步骤分配稠密奖励,从而显著提升了长程视觉基元信息寻求智能体在多个基准测试中的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在浩瀚且不断变化的互联网景观中,寻找一个单一且特定的事实,感觉就像是在一个不断被重新排列的干草堆中寻找一根针。对于人工智能而言,这项任务已成为一个核心挑战。现代计算机程序(被称为“智能体”)被设计成数字研究员的角色。它们可以阅读问题、搜索网络、点击链接,并将信息拼凑起来以形成答案。当这些任务较为简单时,这些程序表现良好。但当搜索需要许多步骤,需要深入挖掘多层信息以连接遥远的线索时,这些程序往往会感到吃力。核心难点在于计算机如何从错误中学习。如果一个程序搜索了数小时并最终得到了正确答案,它知道自己成功了。但它并不知道哪次具体的搜索或哪个具体的网页是这次成功的关键。这就像一名学生在期末考试中取得了满分,却无法说明哪次学习阶段或哪本教科书章节对他的帮助最大。如果不知道什么起到了作用,程序就无法为下一次改进其策略。
一组研究人员通过改变这些数字智能体观察网络的方式以及它们学习旅程的方式,解决了这个问题。他们意识到,计算机通常处理网页的方式——即剥离视觉布局并将一切简化为纯文本——会导致它们丢失关键线索。当一个网页被转换为简单的单词列表时,那些通常承载答案的结构、表格和视觉语境就消失了。为了解决这个问题,研究人员教会了他们的智能体将网页视为完整的视觉快照,就像拍摄屏幕照片一样。这保留了布局和视觉线索,使得信息在不同的搜索中更加稳定且易于识别。
基于这种更清晰的视野,该团队引入了一种新的教学方法,称之为“信息感知信用分配”。这种方法不再等待漫长搜索结束时才给出单一的成功或失败评分,而是观察过程中的每一步。它提出了一个简单的问题:这次特定的行动是否带来了有用的信息片段?通过比较数千次不同的搜索尝试,系统可以识别出当智能体找到正确答案时,哪些特定的网页或搜索结果是一致存在的。随后,它会对发现这些有用信息片段的具体时刻给予“奖励”。这把一个模糊的、全或无的教训,变成了一张关于什么有效、什么无效的详细地图。
该方法的成果在了一系列需要深度、多步推理的困难信息寻求挑战中得到了测试。研究人员将他们的新系统与包括一些依赖大量计算能力和专有数据的领先程序进行了对比。即使模型规模较小,他们的系统也始终表现优于其他系统。在一个涉及复杂浏览的困难基准测试中,新方法实现了 25% 的成功率,显著高于排名第二的开源系统所达到的 15%。在另一个旨在衡量通用 AI 助手能力的测试中,它达到了近 70% 的准确率,超越了规模是其三倍的系统。这种提升不仅在于获得更多正确答案,还在于效率。因为视觉快照保留了页面的结构,系统需要处理的词汇量也大大减少,从而避免了试图阅读无尽原始文本时常有的困惑。
研究人员还通过观察智能体收集的具体信息片段,研究了为什么这种方法如此有效。他们发现,该系统在识别最有价值的线索方面表现得非常出色。当他们仅提取系统标记为有用的顶级证据片段时,智能体回答正确问题的频率远高于使用随机信息或最无用信息时的频率。无论搜索持续了多久,这一结果都成立,证明了该系统正在学习如何在噪声中识别信号。这项研究表明,通过将人工智能植根于网络的视觉现实中,并教会它在正确的时间识别正确的信息片段,我们可以创造出不仅更快,而且在知识探索中更聪明、更可靠的智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。