← 最新论文
💻 computer science

On the missing data layer and a potential solution

本文指出拉丁美洲人工智能基础设施中缺乏统一数据集层的关键问题,其特征为发现困难和供应不足,并提出了“DataHub”——一种基于特定本体构建的任务优先型数据基础设施,旨在实现数据集的发现、元数据管理、贡献、许可及复用。

原作者: Francis F Daniel, Mauro Ibañez, Francis Perelman, Marian Basti

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Francis F Daniel, Mauro Ibañez, Francis Perelman, Marian Basti

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

缺失的本土大脑原料

想象一下,你正试图烘焙一个完美的蛋糕,但你找到的所有食谱都是为不同的厨房编写的,使用的食材是你从未见过的,烤箱的温度也各不相同。这就是目前拉丁美洲人工智能(AI)的现状。为了理解为什么这很重要,我们需要了解两个简单的概念。首先,AI 模型就像超级聪明的学生;它们通过阅读海量的信息(数据)来学习,从而弄清楚如何解决问题。其次,**基准测试(benchmarks)**就像标准化考试;这些考试是我们给这些学生进行的测试,以查看他们是真的掌握了知识,还是仅仅在瞎猜。

目前,拉丁美洲的大多数 AI “学生”正由来自其他国家的老师进行教学,并使用其他语言编写的教科书。虽然这些学生在数学或编程等通用任务方面表现出色,但当被要求处理与其当地社区相关的特定任务时,例如理解当地俚语、识别当地植物或处理当地法律时,它们往往会出错。核心问题不仅在于变得更聪明,而在于一个地区是否能够建立属于自己的大脑,使其真正理解其自身的人民,或者它是否必须永远依赖于一个在别处构建、且可能并不关心其特定需求的大脑。


AI 大厦缺失的两层楼

根据 SURUS 团队的一篇新论文,拉丁美洲缺失了 AI 大厦中的两个关键楼层:数据集层(dataset layer)基准测试层(benchmarks layer)。可以将数据集层视为 AI 阅读的学习书籍库,而将基准测试层视为我们检查 AI 是否真正聪明的测试中心。没有这两者,该地区就无法构建自己的 AI,甚至无法正确检查它所使用的外国 AI 是否在正常工作。

作者认为,这种缺失造成了两种不同类型的麻烦。对于企业来说,这个问题就像是试图使用一本为欧洲农田编写的指南来识别巴西农场的害虫。任务(寻找害虫)是一样的,但害虫却不同。如果你使用了错误的数据,你的 AI 可能会漏掉那些真正摧毁收成的害虫。对于政府和公共机构而言,问题更为深层:这关乎身份认同。如果一个 AI 是基于外国的故事和价值观训练出来的,它对当地公民的描述可能会不符合实际,或者其决策无法反映当地人的真实生活方式。这就像是一位说着不同语言、且不了解当地文化的市长——他可能很有礼貌,但无法很好地治理你。

大规模数据搜寻

论文指出,拉丁美洲的数据并没有消失,只是“丢失”了。它们像拼图碎片一样散落在互联网的各个角落——有些在研究论文中,有些在 Hugging Face 等平台上,还有一些被困在私营公司的档案库中。目前并没有一张单一的地图可以找到它们。即使你能找到所有数据,与美国或欧洲相比,现有的数据量也远远不够。

这造成了一个恶性循环:因为没有一个可以让你获得认可且易于分享数据的场所,所以人们不愿分享。因为人们不分享,就没有一个庞大的集合来激励其他人加入。作者提出了一个名为 DataHub 的解决方案,这是一个旨在打破这一循环的中央图书馆。它不仅仅是一个列表,而是一个奖励分享行为的系统。如果你贡献了一个数据集,你会获得知名度和认可,从而使分享数据变得物有所值。

一种新的组织方式

论文中最具创意的一部分在于他们建议如何组织这个新图书馆。他们建议不要按“外观”(如图像或文本)或“针对的模型”来分类数据,而是按 AI 需要做什么来分类。

想象一个图书馆,其中的书籍不是按颜色或大小分类,而是按它们能帮你完成的工作来分类。作者提出了一个三级阶梯:

  1. 任务(Task): 工作是什么?(例如:“转录音频”)。
  2. 领域(Domain): 特定的领域是什么?(例如:“医疗”对比“法律”)。
  3. 语言与地区(Language & Region): 谁在说话?(例如:“拉普拉塔河方言西班牙语”对比“哥伦比亚西班牙语”)。

这很重要,因为布宜诺斯艾利斯的医生需要的医疗转录 AI 与波哥大律师需要的 AI 是不同的。通用的 AI 可能会把单词写对,但它可能会错过特定的医学术语或地方口音。通过这种方式组织数据,DataHub 可以确保你构建的 AI 精确地针对你的特定需求进行调整,使其表现得更好,并且感觉更“本土化”。

开放的大门与激励机制

论文对这种建设方式持强硬立场:设计即开放(Open by design)。作者认为,对于一个正在追赶阶段的地区来说,协作是唯一的获胜之道。将数据隐藏在封闭的大门之后并无裨益;公开分享可以让所有人学得更快。然而,他们也知道人们不会仅仅出于善意而分享。该系统必须是“激励驱动的”,这意味着贡献者需要看到收益,例如通过其工作的认可,或将所属机构的名字附着在数据上。

前方的道路

作者明确表示,这仅仅是一个开始——是一个“启动”,而非一个成品。他们承认仍存在巨大的障碍。拉丁美洲不同的国家对隐私和数据有不同的法律,目前还没有就如何标记或授权这些数据达成统一的规则。他们并不声称已经解决了这些问题;相反,他们在邀请所有人——公司、大学和政府——共同参与并找出解决方案。

论文以一个行动呼吁结束:拉丁美洲 AI 的数据集层必须由该地区构建,为该地区构建,否则它将无法建成。DataHub 是第一步,是一个活生生的邀请,邀请任何拥有数据的人加入进来,分享并共同构建一个让拉丁美洲在人工智能世界中拥有自己声音的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →