← 最新论文
💻 computer science

Language Models for Portuguese: A Systematic Mapping Study

本文对 46 个为葡萄牙语开发的语言模型进行了系统性映射研究,通过对其技术特征、演进关系及当前研究空白的全面概述,为该领域的未来发展提供指导。

原作者: Jhessica Silva, Carlos Caetano, Helena Maia, Breno Bernard Nicolau de França, Sandra Avila, Helio Pedrini

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jhessica Silva, Carlos Caetano, Helena Maia, Breno Bernard Nicolau de França, Sandra Avila, Helio Pedrini

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的、繁忙的图书馆,其中的每一本书都用不同的语言编写。长期以来,这个图书馆里最聪明的计算机——那些能够像人类一样阅读、写作和聊天的计算机——大多是用英语训练出来的。它们在英语方面变得极其流利,但当你询问关于其他土地上的故事时,它们经常会踉跄、困惑,或者干脆胡编乱造。这是因为这些计算机的“大脑”是由它们读过的词汇构建的;如果它们读过的特定语言书籍不够多,它们就无法真正理解这些词汇背后的文化、笑话或历史。最近,科学家们开始为葡萄牙语构建专门的计算机,这种语言在巴西、葡萄牙以及非洲和亚洲的部分地区有数亿人在使用。但就像一个书籍散乱的图书馆一样,关于这些新开发的葡萄牙语计算机的信息是混乱的、隐藏在不同地方的,且难以同时被找到。

这篇论文就像一位超级组织有序的图书管理员,决定清理整个葡萄牙语板块。作者们是一支来自巴西大学的团队,他们进行了一场大规模的搜寻,旨在找到所有在 2020 年至 2025 年间发表的、旨在处理葡萄牙语的计算机模型。他们不仅是在计数;他们打开了盒子,检查了手册,并试图弄清楚这些模型是如何构建的、它们接受了什么样的教导,以及是否真的有人可以使用它们。他们发现了 46 个不同的模型,范围从通用的聊天机器人到只谈论法律、医学或石油天然气领域的专家模型。他们的重大发现是:虽然取得了令人兴奋的进展,但这个“图书馆”仍然有些混乱。许多模型就像只有厨师才知道的秘密食谱(代码没有共享),有些则是通过翻译书籍进行教学,导致无法完全捕捉到当地的风味,而且极少有模型经过检查以确保其公平性或安全性。作者们建议,为了让这些计算机真正造福所有说葡萄牙语的人,我们需要停止依赖翻译,更开放地分享我们的蓝图,并确保计算机理解语言的丰富多样性,而不仅仅是理解最流行的那个版本。

伟大的葡萄牙语模型搜寻

把人工智能(AI)的世界想象成一个巨大的建筑工地。多年来,最宏伟、最壮观的摩天大楼都是使用“英语砖块”建造的。这些就是“大语言模型”(LLMs),即那些可以写文章、回答问题甚至编写代码的聪明计算机。但工人们意识到,如果你只用英语砖块来建造,你就无法建造出一座让说葡萄牙语的人感到宾至如归的房子。因此,在 2020 年至 2025 年间,一批新的建设者开始专门为葡萄牙语使用者建造房屋。

问题在于,这些新房子散落在地图各处。有些在华丽的科学期刊中描述,有些只是网站上的笔记,还有些则隐藏在无人问津的技术报告中。这就像是在一个房间里寻找特定的玩具,而玩具被扔进了不同的堆里,有的贴了标签,有的则没有。这篇论文的作者决定整理这个房间。他们进行了一项“系统映射研究”(systematic mapping study),这是一种高级说法,意思就是他们创建了一份包含他们能找到的所有葡萄牙语语言模型的总清单。

他们总共找到了 46 个模型。那是很多不同的计算机!他们像收藏家整理邮票一样对它们进行了分类。他们查看了每个模型是以什么“基础模型”(base model)为起点(比如它是建立在 BERT、Llama 还是 T5 的基础上),它的设计用途是什么(通用聊天、法律咨询、医疗诊断或分析推文),以及它的规模有多大(从拥有 1200 万参数的小型模型到拥有 720 亿参数的庞大模型)。

葡萄牙语 AI 的“家族树”

作者们所做的最酷的事情之一是绘制了一棵“系统发育树”(phylogenetic tree)。想象一下这些计算机的家族树。这棵树展示的不是人类如何与祖父母联系在一起,而是展示了这些 AI 模型如何与其“父母”联系在一起。

他们发现,大多数葡萄牙语模型都是几个著名的“祖先”模型的后代。最大的家族分支来自 BERT,它就像是许多这些模型的曾祖父;他们在发现的 46 个模型中,有 20 个是直接构建在 BERT 或其近亲之上的。第二个最大的家族是 Llama 家族,它是那个时髦的新兴祖先,有 10 个模型基于它。

这棵树还展示了这些模型是如何进化的。有些模型最初是通用型的计算机(样样精通),然后通过专门的训练成为了特定领域的专家。例如,有一个分支是这样的:一个模型最初是一个通用的读者,然后通过学习医学教科书成为了“CardioBERTpt”(心脏科医生 AI),接着另一个版本通过学习法律文件成为了“JurisBERT”(律师 AI)。这就像一个学生从普通学校开始,然后进入专门的学院成为医生或律师。

“开放式大门”问题

作者还检查了这 46 栋房子的门,看看是否有人可以走进去。他们检查了三件事:

  1. 代码: 你能看到蓝图吗?
  2. 模型: 你可以下载完成后的计算机大脑吗?
  3. 数据: 你能看到计算机接受训练时使用的书籍吗?

这里的情况喜忧参半。在 46 个模型中,只有 11 个 提供了供所有人查看的源代码(蓝图)。大约有 5 个 模型是完全锁死的——你根本无法使用它们。至于训练数据(书籍),只有 17 个 模型使用了可以免费下载的数据。其余的模型所使用的数据要么隐藏在付费墙之后,要么需要特殊权限申请,或者由构建它的公司保密。

作者还检查了这些模型是否附带了“模型卡”(Model Card),这就像是 AI 的“营养标签”。它会告诉你这个模型擅长什么、不擅长什么,以及它是否存在偏见。令人震惊的是,在 46 个模型中,只有 3 个 拥有完整、完美的营养标签。大多数模型只有半成品标签,更有 10 个 完全没有任何标签。这意味着如果你使用这些模型,你可能并不清楚自己究竟在接触什么。

“翻译陷阱”与缺失的声音

最重要的发现之一是关于这些模型是如何学习说话的。作者注意到,许多模型是使用从英语翻译成葡萄牙语的书籍进行教学的。想象一下,通过阅读一本最初写于纽约并逐字翻译成葡萄牙语的书来学习巴西文化。你可能会掌握语法,但你会错过俚语、笑话和当地的情感。

论文指出,依赖翻译数据是一个问题。这意味着这些模型可能无法理解葡萄牙语使用者(包括巴西、葡萄牙或非洲)独特的文化细微差别。此外,作者指出,几乎所有的模型都只关注两个版本的葡萄牙语:巴西葡萄牙语和欧洲葡萄牙语。它们完全忽略了其他七个将葡萄牙语作为官方语言的国家,比如安哥拉、莫桑比克和佛得角。作者认为,这是一种“语言歧视”——假设仅仅因为一个模型会说巴西葡萄牙语和欧洲葡萄牙语,它就能代表所有人。作者建议,未来的模型需要使用真正代表所有葡萄牙语国家多样性的数据进行训练。

未来何在?

作者总结道,虽然我们取得了很大进展,但仍有很长的路要走。他们建议,下一代葡萄牙语 AI 需要:

  • 停止使用翻译数据,开始使用来自世界各地真实的、原创的葡萄牙语书籍和对话。
  • 分享他们的蓝图(代码),以便其他科学家可以检查他们的工作并进行改进。
  • 纳入更多声音,包括非洲和亚洲葡萄牙语使用者,而不只是巴西和葡萄牙。
  • 增加更多感官。 目前,大多数模型只能理解文本。作者看到了构建能够理解图像和声音(多模态模型)的专门针对葡萄牙语的计算机的巨大机会,比如一个能看着巴西街道的照片并用当地俚语进行描述的计算机。

简而言之,葡萄牙语 AI 的图书馆正在快速增长,但它需要更好的组织、更开放的大门以及更广泛的声音,才能真正服务于数以亿计的葡萄牙语使用者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →