← 最新论文
💬 NLP

Searching the Internet for Challenging Benchmarks at Scale

本文介绍了一个全自动且成本高效的框架,该框架将互联网建模为一个庞大的主题空间,并利用多臂老虎机策略动态地发现并构建具有挑战性的基准测试,从而避免静态测试集所面临的饱和问题。

原作者: Wenda Xu, Vilém Zouhar, Parker Riley, Mara Finkelstein, Markus Freitag, Daniel Deutsch

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenda Xu, Vilém Zouhar, Parker Riley, Mara Finkelstein, Markus Freitag, Daniel Deutsch

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位老师,正在试图给一位进步神速、变得极其聪明的学生打分。你手头有一叠旧的数学试卷(基准测试)。起初,学生面对这些试卷很吃力,因此你能轻易看出他们需要帮助的地方。但现在,学生已经能完美解答这些旧试卷上的每一道题。他们在所有题目上都得了满分。

问题出在哪里?你无法判断他们究竟是真正的天才,还是仅仅死记硬背了这些特定试卷的答案。你需要一份新的、更难的试卷,来看清他们究竟在哪里真正感到吃力。但手工制作新试卷既缓慢又昂贵,而且专家可能会基于自身的偏见,无意中让新试卷变得太容易或太难。

本文提出了一种巧妙、完全自动化的方法,无需人工编写,即可从整个世界(互联网)中找出“最难的问题”。

核心构想:互联网作为巨型自助餐厅

将互联网想象成一个拥有成千上万个不同餐台(主题)的庞大、无尽的自助餐厅。有些餐台提供简单的零食(例如“如何烤面包”),而另一些则提供极其复杂、辛辣的菜肴(例如“国际税法中的法律漏洞”)。

作者希望找到那些“最辣”的菜肴——即连最聪明的人工智能模型都会卡壳的主题。但他们无法品尝自助餐厅里的每一道菜;那将耗时无穷且代价高昂。

策略:“智能品尝者”(多臂老虎机)

作者没有尝试品尝所有菜肴,而是将此视为一种老虎机游戏,或采用一种称为**多臂老虎机(Multi-Armed Bandit)**策略的“智能品尝者”。

  • 老虎机: 互联网上的每个主题(例如“巴洛克音乐”、“混凝土砌块”、“气焊”)就像一台老虎机。
  • 成本: 拉动拉杆(从该主题采样文本并测试 AI)需要花费金钱和时间。
  • 目标: 用最少的拉动次数,找到那台能支付最多“难度”(即 AI 失败最多)的老虎机。

本文使用了一种特定的策略,称为ϵ\epsilon-贪婪(ϵ\epsilon-greedy)。想象你身处赌场:

  1. 探索(万能牌): 有时,你会尝试一台从未触碰过的机器,只是为了看看它有什么表现。
  2. 利用(赢家): 大多数时候,你会继续拉动那台迄今为止支付“难度”最多的机器。

通过平衡这两者,系统能以极快的速度找到最难的主题。本文声称,该方法只需检查可用主题的6%即可找到最难的那些,相比检查所有内容,节省了100 倍的成本。

他们的发现

他们在两个方面测试了这种方法:

  1. 机器翻译: 要求 AI 将文本从英语翻译成其他语言。
  2. 知识问答: 向 AI 提出事实性问题。

结果:

  • 旧试卷与新发现: 该系统找到的主题比当今专家使用的标准测试(如 WMT 或 FLORES)要困难得多。
  • 短小精悍: 有趣的是,他们发现的最难文本往往比现有基准测试中的难文本更短。这证明长度并非造成困难的原因;真正让 AI 栽跟头的是那些具体、棘手的概念(如法律术语或冷门事实)。
  • 真实弱点: AI 在这些新测试中犯的错误并非仅仅是“愚蠢的错误”。它们涉及术语(在特定领域使用了错误的词汇)和准确性(事实错误)方面的深层问题。这表明这些测试确实发现了真实的弱点,而不仅仅是用长句子让 AI 感到困惑。

“黑客”检查

一位聪明的读者可能会问:“难道 AI 只是找到了一些对其他AI 评分困难、但对现实世界来说却很简单的问题吗?”

作者通过使用两个互不知晓的“裁判”(评分系统)对此进行了检查。他们发现,当系统找到一个困难主题时,两个裁判都一致认为它很难。这证明该系统并没有在“黑客攻击”评分系统;它找到的是真正困难的内容。

结论

本文介绍了一种工具,能够自动在 AI 世界中猎取“最终 Boss"级别的难度。与其让人类手动策划困难测试,不如让系统搜索互联网,了解 AI 在哪里失败,并构建新的、更严峻的基准测试。这使得研究人员能够在 AI 模型变得更聪明时,看清其真正的极限,确保我们不会仅仅因为它们通过了旧有的、简单的测试就认为它们完美无缺。

关键要点: 互联网是困难问题的金矿。本文为我们提供了一张地图,让我们能够快速、廉价地找到这些问题,从而确保我们是在用现实世界而非旧教科书来持续测试 AI 模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →