Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests
本文分析了来自 DeepResearchGym 的 1444 万次真实世界智能体搜索请求,以揭示关键行为模式,例如会话长度分布、依赖意图的探索策略以及查询改写与检索证据之间强烈的词汇可追溯性,最终为优化搜索智能体设计提供可操作的信号。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一座庞大而繁忙的图书馆,其中工作的不是人类读者,而是成千上万名机器人图书管理员。这些机器人由先进的人工智能驱动。它们的工作不仅仅是查找一本书;它们被赋予的任务是解决复杂的谜题。为此,它们不会只询问一次。它们会提问、阅读答案、根据刚读到的内容提出后续问题、再次阅读,并持续进行,直到它们认为自己掌握了全貌。
本文是对这些机器人图书管理员的一项大规模观察研究。研究人员分析了来自公共系统DeepResearchGym的超过1400 万次搜索请求(约 400 万次“对话”或会话)。他们旨在了解:这些机器人试图做什么,以及它们如何在过程中调整自己的问题?
以下是他们研究发现的简要概述,采用简单的类比:
1. “购物清单”与“侦探”(意图)
研究人员发现,机器人主要分为三种“人格类型”,或称“意图”,这些类型决定了它们搜索的方式:
- 事实寻求者(陈述型):这种机器人只想要一个具体的事实,例如“这家零食公司归谁所有?”
- 行为:它容易陷入循环。如果它没有立即找到答案,就会不断重复相同的问题或稍作修改的变体(就像一个人反复敲门并重复喊同一个问题)。
- 操作指南(程序型):这种机器人想知道如何做某事,例如“如何修理漏水的水龙头?”
- 行为:它会提出更长、更详细的问题,并深入挖掘“图书馆书架”(检索更多文档),以获取完整的操作说明。
- 侦探(推理型):这种机器人面对的是复杂的谜题,例如“为什么汽油很贵?”
- 行为:它最为大胆。它不会局限于单一角度,而是会在不同主题(侧面)之间跳跃,以串联线索。它倾向于广泛探索,而非仅仅在一点上深挖。
2. “深入挖掘”的习惯
最大的发现之一是,这些机器人有一种强烈的向内聚焦而非向外扩展的习惯。
想象你在查看一张地图。大多数时候,这些机器人先采取宏观视角,然后立即放大到一条小街以寻找细节。它们很少退一步思考:“等等,也许我完全看错了城市。”
- “深入挖掘”偏差:约 36% 至 48% 的时间里,它们只是在同一主题上稍微转换角度。
- “向外扩展”的罕见性:只有约 9% 的时间里,它们真正拓宽搜索范围以审视全局。当它们确实向外扩展时,几乎会立即再次向内聚焦。这就像快速扫视整张地图,然后立刻再次聚焦于某一条街道。
3. “回声室”效应(重复)
研究发现,90% 的这些机器人对话都很短(10 步或更少),且发生得非常快(问题之间通常不到一分钟)。
然而,对于事实寻求者来说,存在一个问题。随着对话的进行,它们越来越倾向于重复自己。到了第 9 步,近一半的问题与之前的问题几乎完全相同。这就像一个忘记自己已经问过问题的人,或者陷入循环,试图从不同角度获得相同答案却屡试屡败的人。
4. “术语采纳”测试(它们真的阅读了吗?)
研究人员想知道:当机器人提出一个新问题时,它是否真的使用了刚刚找到的信息?
由于无法窥探机器人内部的“大脑”(记忆),他们发明了一个巧妙的测试,称为CTAR(上下文驱动的术语采纳率)。
- 类比:想象一位侦探读到一条线索,上面写着“嫌疑人戴着一顶红帽子"。如果侦探的下一个问题是“谁戴着一顶红帽子?”,那么他就是在“采纳”该术语。
- 结果:研究人员发现,机器人在下一个问题中使用的新词中,有**54%**直接来自它们刚刚阅读的文本。
- 局限性:这并不意味着机器人完全理解了文本,只是说明这些词汇确实存在。这就像鹦鹉重复它听到的词语,而不是人类深入思考它们。但这证明了机器人至少在查看它们检索到的证据。
5. “固定预算”问题
机器人被分配了一个“预算”,规定每个问题可以阅读多少文档(例如,阅读 5 页或 10 页)。
- 发现:大多数机器人将此预算视为硬编码设置。它们不会根据任务进行调整。无论它们是在寻找简单事实还是解决复杂谜题,它们大多坚持阅读相同数量的页面。它们似乎没有意识到,复杂的谜题可能需要比简单事实更多的阅读量。
总结
本文就像一份针对 AI 搜索代理的交通报告。它告诉我们:
- 大多数搜索既短又快。
- 机器人在寻找简单事实时容易陷入循环。
- 它们倾向于聚焦细节,而非退后一步审视全局。
- 它们确实会从阅读内容中汲取词汇,但无论任务难度如何,它们往往固守僵化的“阅读预算”。
作者发布了这些数据,以便其他研究人员能够构建更好的“交通控制器”,帮助这些机器人跳出循环、进行更多探索,并更明智地使用它们的阅读预算。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。