← 最新论文
🤖 AI

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services

本文介绍了 LocalSearchBench,这是首个用于评估在复杂且模糊的本地生活服务领域中智能体搜索能力的综合基准测试和统一环境,并揭示了即使是目前最先进的大型推理模型,在处理真实场景中的多跳推理、完备性和忠实度方面也存在困难。

原作者: Hang He, Chuhuai Yue, Chengqi Dong, Mingxue Tian, Hao Chen, Zhenfeng Liu, Jiajun Chai, Xiaohan Wang, Yufei Zhang, Qun Liao, Guojun Yin, Wei Lin, Chengcheng Wan, Haiying Sun, Ting Su

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Hang He, Chuhuai Yue, Chengqi Dong, Mingxue Tian, Hao Chen, Zhenfeng Liu, Jiajun Chai, Xiaohan Wang, Yufei Zhang, Qun Liao, Guojun Yin, Wei Lin, Chengcheng Wan, Haiying Sun, Ting Su

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一位非常聪明、博学多才的图书管理员寻求帮助,希望他能为你规划完美的一天。你不仅仅想要一份书单,你想要一个复杂的行程:“帮我找一个可以玩桌游的地方,然后找一家附近的餐厅吃晚饭,最后找一个卡拉OK场所,且这三个地方在上海都要在步行距离之内。”

这正是 LocalSearchBench 这篇论文所解决的挑战。以下是研究人员的工作内容,我们使用日常类比来进行简单拆解。

1. 问题所在:“聪明的”图书管理员迷路了

近年来,我们构建了许多 AI “智能体”(就像超级聪明的图书管理员),它们可以搜索互联网、阅读多个网站并连接信息点来回答难题。例如,它们可以算出在某枚火箭发射的同年,哪部电影获得了奥斯卡奖。

然而,这些 AI 智能体擅长常识性问答,但在本地生活服务方面表现得很糟糕。如果你问它们寻找一个位于特定地铁站附近、且在特定时间营业的特定类型咖啡馆,它们往往会感到困惑。它们难以处理以下问题:

  • 理解“附近”意味着步行距离,而不仅仅是在“同一个城市”。
  • 将多个步骤串联起来(例如:寻找博物馆 \rightarrow 寻找博物馆附近的咖啡馆 \rightarrow 寻找咖啡馆附近的便利店)。
  • 处理现实世界中琐碎的细节(价格、营业时间、评分等)。

2. 解决方案:构建一个“训练场”(LocalSearchBench)

为了解决这个问题,来自美团及多所大学的研究人员构建了一个庞大的训练场,名为 LocalSearchBench。你可以把它想象成一个巨大的、真实的视频游戏关卡,专门设计用来测试 AI 智能体在城市中导航的能力。

  • 数据库(城市地图): 他们创建了一张数字地图,其中包含中国 9 个主要城市中超过 130 万家真实商家(餐厅、酒店、商店等)。他们对这些数据进行了清洗,补充了缺失的细节(如营业时间),并剔除了隐私信息以确保安全。
  • 测试问题(任务): 他们并没有只问像“哪里有披萨店?”这样简单的问题。相反,他们创建了 900 个复杂的任务
    • 简单任务: “寻找人民广场附近评分最高的咖啡馆。”
    • 复杂任务: “我正在上海看一个埃及展。看完之后,我需要一个安静的咖啡馆来放松,以及一家便利店买零食。请帮我找一条路线,让这两个地方都在同一个地铁站内。”

3. 游乐场:一个“模拟竞技场”(LocalPlayground)

为了测试 AI,他们构建了一个名为 LocalPlayground 的模拟竞技场。

  • 想象 AI 是一个侦探。它有两个工具:一个 Local RAG(一个包含 130 万家本地商家的超快速索引)和一个 Web Search(用于检查实时新闻或活动)。
  • AI 必须循序渐步地使用这些工具。它不能仅仅靠猜测;它必须“思考”、搜索、发现线索、基于该线索再次搜索,最后拼凑出答案。

4. 结果:AI 还只是个新手

研究人员在模拟器中测试了 16 个全球最顶尖的 AI 模型(包括 DeepSeek、GPT 和 Gemini 等知名模型)。结果令人惊讶:

  • 得分: 即便是最好的 AI 模型也只答对了 35.6% 的问题。这就像考试只得了 D+ 的成绩。
  • 难点:
    • 完整性(Completeness): AI 经常遗漏请求中的部分内容(例如,它找到了咖啡馆,却忘了便利店)。
    • 忠实度(Faithfulness): AI 有时会“幻觉”(编造事实),或者声称某个商家拥有它实际上并不具备的评分。
    • 推理能力(Reasoning): AI 经常在中间环节迷失方向。如果第一步错了,整个计划就会崩塌。

5. 为什么这很重要

论文得出结论:虽然 AI 在通用知识方面变得越来越聪明,但在处理现实世界中琐碎的本地服务时仍然非常笨拙。

  • 核心启示: 你不能仅仅依靠一个通用的 AI,就期望它能成为完美的旅行代理或本地向导。它需要专门的训练和更好的基准测试(比如他们构建的这个)来学习如何处理现实生活的复杂性——在现实生活中,地理位置、时间节点以及多种约束条件是同时起作用的。

简而言之: 这篇论文在说:“我们为 AI 智能体设计了一场高难度的考试,看看它们能否处理现实中的城市规划。它们没能通过考试,这证明在 AI 真正成为可靠的本地向导之前,我们还有很长的路要走。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →