Revisiting Text Ranking in Deep Research
本文通过在 BrowseComp-Plus 数据集上分析检索单元、流水线配置和查询特征,研究了文本排序方法在深度研究中的有效性,揭示了特定检索器类型和段落级单元表现出色,并提出了一种查询到问题的转换方法以缓解查询不匹配问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一名超级聪明的研究助理(一个 AI 智能体)来寻找一个非常棘手的问题的答案,比如:“2020 年哪场足球比赛的观众人数恰好是 61,880 人?”
为了解决这个问题,你的助理不能靠瞎猜;它必须去互联网上搜索、阅读文章、思考所发现的内容,然后再次搜索。这个过程被称为深度研究(Deep Research)。
这篇论文就像是一个正在检查研究助理引擎的机械师。具体来说,作者想要了解“文本排序(text ranking)”部分是如何运作的。文本排序是该助理用来决定哪些搜索结果最值得阅读的工具。
以下是他们研究结果的拆解,使用了简单的类比:
1. 问题所在:“黑盒”之谜
此前,大多数研究人员让这些 AI 助理使用一个“黑盒”搜索引擎(比如标准的 Google API)。他们并不知道这个引擎是如何挑选结果的。作者想要揭开这层帘幕,亲自测试不同的搜索引擎,看看哪些真正对这些 AI 智能体有效。
2. 第一项发现:“章节”对比“整本书”
作者测试了给 AI 提供信息的两种方式:
- 文档级(Document Level): 把整个网页给 AI(整本书)。
- 段落级(Passage Level): 只把相关的特定段落或部分给 AI(特定的章节)。
研究发现: 给 AI 提供段落(章节)的效果要好得多。
- 原因: AI 助理的“记忆力”(称为上下文窗口)是有限的。如果你喂给它们整本书,它们会很快耗尽记忆,从而不得不停止搜索。如果你只喂给它们相关的段落,它们就能在记忆中容纳更多信息,提出更多问题,并更准确地找到答案。
- 类比: 这就像是在解一个拼图。如果你把 1,000 块碎片全部倒在桌子上,你会感到不知所措;但如果你只给 AI 那些真正能拼在一起的 10 块碎片,它就能更快地解开拼图。
3. 第二项发现:“关键词”与“文章”的不匹配
作者注意到 AI 智能体进行搜索时的一些有趣现象。
- 人类如何搜索: 我们通常输入自然语言问题,如:“哪场比赛的观众人数是 61,880 人?”
- AI 智能体如何搜索: 这些智能体表现得像老派的搜索引擎。它们输入简短的、以关键词为主的字符串,例如:
"61,880" "football" "attendance"。
研究发现:
- 老派工具胜出: 因为 AI 智能体使用关键词进行搜索,所以被称为 BM25 的老派搜索工具(它非常擅长匹配精确词汇)在大多数情况下竟然击败了先进的、基于 AI 的现代搜索工具。
- 不匹配之处: 那些高级 AI 搜索工具是针对自然语言问题(文章)进行训练的。当智能体给出关键词字符串时,这些 AI 工具就会感到困惑并表现不佳。这就像是要求一位诗人去写一份购物清单;他们虽然文采斐然,但这种格式并不适合这项任务。
4. 第三项发现:“编辑”(重排序)
在搜索工具找到一组结果后,第二个被称为**重排序器(Re-ranker)**的工具会充当编辑的角色。它查看这份名单并说:“实际上,这一个才是最重要的,把它挪到最前面。”
研究发现:
- 编辑至关重要: 使用重排序器显著提高了结果质量。它帮助 AI 更快、用更少的搜索尝试找到正确答案。
- 深度编辑更有帮助: 编辑查看的结果越多(在挑选出最顶部的结果之前检查更多结果),效果就越好。
- “推理型”编辑并无帮助: 有一种特定的编辑旨在通过“思考”和“推理”来判断一个结果为何优秀。然而,由于搜索查询非常简短且充满了关键词,这种“推理型”编辑经常会产生困惑并犯错。这就像是一个侦探试图在没有任何线索的情况下破案;由于输入的信息太乱,额外的思考并无用处。
5. 解决方案:“翻译官”(Q2Q)
为了解决 AI 的关键词搜索导致高级 AI 工具感到困惑的问题,作者构建了一个翻译官(Translator)。
- 工作原理: 在搜索工具寻找答案之前,翻译官会将 AI 的关键词字符串(例如
"61,880" "football")转化为一个自然语言问题(例如“哪场足球比赛的观众人数为 61,880 人?”)。 - 结果: 这种简单的翻译让高级 AI 搜索工具重新焕发了活力。它弥合了智能体“提问方式”与工具“学习方式”之间的鸿沟。
“机械师”报告总结
- 不要给 AI 喂整本书; 给它具体的段落(passage),这样它才不会感到不知所措。
- 老派的关键词匹配(BM25) 对这些智能体来说出奇地强大,因为它们的搜索行为就像关键词机器。
- 一个“编辑”(重排序器) 对于挑选最佳结果至关重要。
- 如果你使用高级 AI 搜索工具, 你必须先将智能体的关键词搜索转化为自然语言问题,否则这些工具会感到困惑。
论文得出结论:虽然 AI 智能体功能强大,但它们仍然高度依赖这些成熟的、有时甚至是“老派”的信息检索方法来高效工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。