← 最新论文
💬 NLP

MARCA: A Checklist-Based Benchmark for Multilingual Web Search

本文提出了名为 MARCA 的双语(英语和葡萄牙语)基准测试,该基准通过人工编写的多实体问题及验证清单,评估了大型语言模型在不同交互设置下进行网络信息检索、证据选择及答案合成的能力,并揭示了模型在葡萄牙语环境下的表现差异与不确定性。

原作者: Thales Sales Almeida, Giovana Kerche Bonás, Ramon Pires, Celio Larcher, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Rodrigo Nogueira, Thiago Laitz

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Thales Sales Almeida, Giovana Kerche Bonás, Ramon Pires, Celio Larcher, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Rodrigo Nogueira, Thiago Laitz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 MARCA 的新工具,它就像是一个专门用来“考试”的双语(英语和葡萄牙语)搜索引擎能力测试

想象一下,现在的超级人工智能(大语言模型)就像是一个无所不知的超级学霸。以前,我们只考它“背下来的知识”(比如历史年代、数学公式)。但现在,我们更想知道:当它遇到不知道的问题时,它能不能像侦探一样上网查资料,把找到的碎片信息拼凑起来,给你一个既准确又完整的答案?

这篇论文就是为了解决这个问题而诞生的。以下是用大白话和比喻对论文核心内容的解读:

1. 为什么要搞这个考试?(背景)

现在的 AI 很火,大家喜欢让它查新闻、做对比、写报告。但是,目前的考试大多是用英语出的。
这就好比:你让一个只会说英语的侦探去巴西破案,他可能因为语言不通、找不到当地报纸,或者看不懂当地的网站而抓瞎。
虽然葡萄牙语是世界上使用人数非常多的语言(超过 2.5 亿人),但专门针对“用葡萄牙语上网查资料”的考试却很少。这篇论文就是为了填补这个空白,看看 AI 在英语葡萄牙语两种环境下,查资料的能力到底有没有“水土不服”。

2. MARCA 是怎么考试的?(核心设计)

MARCA 不像传统的考试只问“谁赢了比赛”,它问的是更复杂的问题,比如:

“请列出第 82 届金球奖电影类的所有获奖者,并说明他们分别得了什么奖。”

这种问题需要 AI 同时处理多个实体(很多部电影、很多人)。

  • 出题方式:人工编写了 52 道难题,涵盖 9 个领域(如电影、体育、政治等)。
  • 评分标准(核心亮点):这是最聪明的地方。每道题都配了一张**“检查清单”(Checklist)**。
    • 这就好比老师批改作文时,手里拿着一张单子:
      • 提到了电影《The Brutalist》吗?
      • 提到了演员 Adrien Brody 吗?
      • 导演名字对了吗?
    • AI 的回答必须清单上的每一项都打勾,才算满分。如果漏了一个人,或者编造了一个人(幻觉),分数就会扣光。这比单纯看“像不像”要精准得多。

3. 两种“解题模式”的比拼(实验设置)

为了看看 AI 怎么思考,研究者设计了两种“考试模式”:

  • 模式一:单兵作战(Basic)

    • 比喻:就像让一个侦探独自去查案。他既要负责上网搜索,又要负责打开网页看内容,还要在脑子里把所有信息记下来,最后自己写报告。
    • 特点:所有活儿一个人干,容易顾此失彼,特别是任务复杂时,容易漏掉细节。
  • 模式二:团队指挥(Orchestrator)

    • 比喻:就像有一个总指挥(大脑),他手下有几个小侦探(子代理)。
    • 过程:总指挥把大任务拆成小任务(比如:“你去找电影名单”,“你去找演员名单”),分派给小侦探。小侦探查完回来汇报,总指挥再把大家的成果拼成一份完整的报告。
    • 特点:分工明确,不容易漏掉细节,但沟通成本可能变高。

4. 考试结果告诉我们什么?(主要发现)

  • 结果差异巨大
    有的 AI 学霸(如 Gemini-3-pro, GPT-5.2)能拿到 90% 的分数,几乎完美;而有的“学渣”(如 Gemini-2.5-Flash-Lite)只能拿到 26% 的分数,漏掉了一大半信息。这说明现在的 AI 在“查资料”这项技能上,水平参差不齐。

  • “团队作战”通常更好
    对于大多数 AI 来说,模式二(团队指挥) 的成绩比模式一(单兵作战)要好。

    • 比喻:就像让一个人同时背 10 个电话号码很难,但让 10 个人每人背 1 个,最后拼起来就容易多了。把复杂问题拆碎了,AI 就不容易“脑子打结”或漏掉信息。
    • 例外:有些特别强的 AI,单兵作战也能拿高分,强行拆分工反而可能因为沟通不畅导致分数微降。
  • 语言转换的“坑”
    这是论文最有趣的部分。很多 AI 在英语里表现很好,一切换到葡萄牙语,成绩就“跳水”了。

    • 比喻:就像有些侦探在英语报纸上找线索很厉害,但到了巴西,他可能因为看不懂当地的小字报,或者习惯性地用英语去搜巴西的本地新闻,结果搜不到关键信息。
    • 有些模型(如 GPT-4.1)在两种语言下表现都很稳;但有些模型(如 Qwen-3-235B)在葡萄牙语下表现明显变差。这说明多语言能力不仅仅是翻译问题,还涉及到“怎么在当地网络上找东西”的策略问题
  • 花钱与能力的权衡
    论文还画了一张图,显示“成绩”和“成本”的关系。

    • 比喻:就像买车,有的车(便宜模型)只能跑 60 码,有的车(昂贵模型)能跑 200 码。但有趣的是,有些中间档次的车,性价比很高,花稍微多一点钱,性能提升很大。这给企业选择 AI 模型提供了参考:不需要盲目追求最贵的,要看你的需求。

总结

这篇论文就像给 AI 界发了一张**“双语侦探能力体检报告”**。它告诉我们:

  1. 现在的 AI 查资料能力参差不齐,有的很稳,有的容易漏题。
  2. 把大任务拆成小任务(团队指挥)通常能让 AI 表现更好。
  3. 语言环境很重要,很多 AI 在英语世界是“神”,到了葡萄牙语世界可能就“晕”了,这提醒开发者不能只盯着英语数据训练。
  4. 未来用 AI 查资料,不仅要选聪明的模型,还要选适合你预算懂当地语言的模型。

这个测试(MARCA)现在已经开源了,就像把考卷和答案都公开了,让全球的开发者都能来检验和提升自己的 AI“侦探”能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →