← 最新论文
💻 computer science

On the missing benchmarks layer and a potential solution

本文指出缺乏区域性基准层是阻碍拉丁美洲本土人工智能发展的关键障碍,并提出了“EvalsHub”(及其首个实例 LatamBoard)作为一个开放且由激励驱动的基础设施,旨在实现针对当地社会与经济需求的 AI 系统独立审计与优化。

原作者: Francis F Daniel, Mauro Ibañez, Francis Perelman, Marian Basti

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Francis F Daniel, Mauro Ibañez, Francis Perelman, Marian Basti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

无形的计分板:为什么人工智能需要本地化测试

想象一下,人工智能的世界就像一个巨大的、高科技的厨房,厨师们(AI 模型)正在为每个人烹饪美食。长期以来,最著名的厨师们一直只在几个特定的厨房里工作,使用来自自己社区的食谱和食材。他们才华横溢,但并不总是知道如何烹饪出一道让生活在世界另一端家庭感到完美的菜肴。这就是人工智能的世界:在某处构建的强大工具,却被用于世界各地。

要了解一位厨师是否真的擅长烹饪某道特定的菜,你需要进行一次味觉测试。在人工智能的世界里,这种味觉测试被称为基准测试(Benchmark)。把基准测试想象成一场标准化的考试或一个计分板。它不仅仅是问:“这个 AI 会说话吗?”它还会问:“这个 AI 能否用这种特定的语言,遵循这些本地规则,解决这个特定的问题?”如果没有这些本地化的计分板,各国和各公司就像是在用餐,却不知道这顿饭是否新鲜、安全,甚至不知道它原本应该是什么味道。他们只能单方面信任厨师的话。本文认为,拉丁美洲缺少属于自己的“厨房计分板”,如果没有它,该地区就无法真正检查其使用的 AI 是否运行正确,也无法通过改进 AI 来解决其自身独特的难题。


缺失的计分板:拉丁美洲 AI 差距的故事

本文的作者——来自 SURUS 的团队及一名独立研究员——指出,拉丁美洲的技术版图中存在一个巨大的漏洞。他们称之为“缺失的基准测试层”。为了理解为什么这很重要,请想象你正在尝试修理一辆汽车,但你手头的工具却是为另一个品牌的汽车设计的。你可能能完成工作,但不会做到完美,而且你无法准确知道引擎在哪里熄火。这就是拉丁美洲在人工智能领域面临的现状。

两大问题:盲目审计与停滞的引擎

论文解释说,这个缺失的层级造成了两个主要的头疼问题。

首先是审计问题(Audit Problem)。想象一个政府机构购买了一套新的 AI 系统来协助管理公共记录。由于该 AI 是在另一个国家构建的,该机构无法独立检查它是否理解当地法律,或是否能正确使用当地方言。他们被迫只能相信卖家的说法。作者指出,如果没有本地化的基准测试,这些机构就是“盲目的”。他们无法察觉 AI 是否正在犯一些仅在特定语境下才会显现的错误,比如误诊了一种当地的农作物病害,或误解了一个特定的法律术语。

其次是优化问题(Optimization Problem)。这是针对那些试图构建酷炫 AI 工具的公司而言的。现代 AI 开发就像一款电子游戏,你可以通过调整设置来获得更高的分数。但为了获得高分,你需要一个计分板来衡量你的进度。论文认为,如果没有本地化的基准测试,公司就没有可以瞄准的目标。他们无法判断自己的 AI 是否在解决本地问题方面变得更好了,因为他们没有一个可以用来评分的“考试”。这就像是在没有终点线的情况下参加赛跑;你可能跑得很快,但你不知道自己是否真的在赢。

提出的解决方案:EvalsHub 与 LatamBoard

那么,解决办法是什么?作者提议构建一个新的基础设施,称为 EvalsHub,其第一个版本是 LatamBoard

把 LatamBoard 想象成该地区一个巨大的、开源的“考场”。这是一个大学、政府和公司可以发布自己的测试(基准测试),并查看不同 AI 模型在这些测试中表现如何的地方。

  • 任务导向(Task-First): 它不仅仅测试“AI 有多聪明?”,而是围绕特定的工作来构建测试。例如,一个测试可能是专门为“从智利医疗记录中提取医疗信息”或“对哥伦比亚咖啡作物中的害虫进行分类”而设计的。
  • 可复用性(Reusable): 论文使用了一个很好的词组:“一次构建,永久测量(Built once, measured forever)”。一旦创建了一个测试,就可以反复运行。每当有新的 AI 模型发布,或者一家公司调整了其软件,他们都可以运行相同的测试,以观察是否有所改进。这使基准测试变成了一项永久性的基础设施,就像道路或桥梁一样,而不仅仅是一个一次性的项目。

“准入问题”:为什么构建如此困难

论文也承认,构建这些计分板是非常困难的。这不仅仅是编写代码的问题。要为一个特定的工作(如诊断疾病)创建一个有效的测试,你需要四种不同类型的专家协同工作:

  1. 一位领域专家(Domain Expert)(如医生或律师),他们知道什么是“正确的”。
  2. 一位 ML 工程师(ML Engineer),能够将这些知识转化为计算机测试。
  3. 一位统计学家(Statistician),以确保测试题目公平且具有代表性。
  4. 一位开发人员(Developer),以确保测试运行顺畅。

作者称之为“准入问题(Access Problem)”。通常情况下,对工作了解最深的人(如医生)并不懂得如何编写测试,而程序员并不了解医学细节。这种错位意味着很少有人能独立构建这些基准测试。论文建议,为了让 LatamBoard 发挥作用,他们需要找到一种降低门槛的方法,让专家可以在不需要成为编程高手的情况下贡献他们的知识。

未来的愿景:开放且多极化

作者对于这种方式应如何运作有着坚定的立场。他们想要一个“多极化(multipolar)”的世界,这意味着他们不希望由一两个国家来控制所有的 AI 规则。他们希望拉丁美洲拥有自己的声音和自己的标准。

为了实现这一点,他们提议 LatamBoard 必须在设计上是开放的(所有人都可以查看测试和结果),并且在构建上是激励驱动的(人们可以获得荣誉和认可)。如果一家大学创建了一个优秀的本地农业测试,他们将被列为贡献者,而其他人也将受益于该测试。这是一个分享知识能让每个人都变得更聪明、更强大的系统。

仍未知的领域

论文坦诚地表示,这只是一个起点,而非最终成品。他们承认仍有许多大问题需要回答,例如:

  • 当 AI 变得越来越聪明时,我们如何确保测试保持公平?
  • 运行这些测试所需的计算资源由谁出资?
  • 我们如何处理像医疗保健这样隐私至关重要的敏感领域?

作者并不是声称已经解决了所有这些问题。相反,他们向整个社区发出了挑战。他们邀请大学、政府和公司共同构建这一层基础设施。目标是创建一个系统,让拉丁美洲不仅仅是人工智能的消费者,更是其塑造者,拥有属于自己的工具来衡量、改进并信任其所使用的技术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →