← 最新论文
💻 computer science

ModernBERT-TR: A Modern Encoder Foundation Model for Turkish

本文介绍了 ModernBERT-TR,这是一个拥有 1.5 亿参数的土耳其语编码器,基于 ModernBERT 架构和自定义分词器,在 1444 亿个 token 上从头开始预训练,其性能显著优于现有的土耳其语基准模型,并且尽管训练资源消耗大幅减少,仍能与规模更大的同期模型相媲美。

原作者: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Besher Alkurdi, Himmet Toprak Kesgin, Muzaffer Kaan Yuce, Mehmet Fatih Amasyali

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座巨大且混乱的图书馆,其中的每一本书都用不同的语言编写而成。长期以来,图书管理员(计算机科学家)建造了一本巨大的、超高密度的百科全书,旨在帮助计算机同时理解所有语言。但当你试图在那本巨著中寻找关于某种微小且特定语言的具体事实时,信息会变得有些模糊。这就像是在拥挤的体育场里试图听清一声耳语;信号在噪音中丢失了。

为了解决这个问题,研究人员开始为单一语言构建较小的、专业化的词典。其中最著名的土耳其语词典建于2020年。这是一个良好的开端,但它是用旧工具建造的,就像是在大家都开着跑车时,你却在骑自行车。与此同时,世界其他地方已经转向了“现代”引擎,这些引擎能读得更快,记忆更长的句子,并且能更好地理解语法的转折与变化。一个大问题是:我们能否使用这些现代工具,专门为土耳其语打造一辆全新的、超快速的跑车,而不需要耗资数十亿美元的预算,也不需要一个像月球一样大的图书馆?

本文介绍了 ModernBERT-TR,这是一种旨在成为计算机终极“土耳其语大脑”的新型人工智能模型。研究人员采用了最新、最先进的架构设计(“ModernBERT”引擎),并从零开始使用土耳其语文本对其进行训练。他们不仅仅是向模型投喂海量数据;他们还精心策划了一种高质量土耳其语写作的平衡组合,并使用了一个专门针对土耳其语单词构建方式进行微调的定制化词典(分词器)。

结果非常强大。尽管这个新模型相对较小——仅包含约1.5亿个“神经元”(参数)——但它的表现优于许多更大的模型,甚至超过了一些参数量几乎是它四倍的模型。在针对11项不同土耳其语任务(如识别仇恨言论或理解电影评论)的测试中,ModernBERT-TR 的平均得分达到了 60.2%,以显著优势击败了排名第二的模型。在一次全量微调测试中,它甚至赶上了规模约为其 7倍数据量(1万亿个token对比该模型的1444亿个token)的竞争对手,证明了聪明的训练方法和更好的架构可以战胜单纯的数据量。

作者认为,其“秘密配方”不仅在于模型的大小,更在于数据的质量组合。他们发现,在训练过程中将特定的高质量土耳其语数据集重复使用五次,比调整批次大小(batch size)等其他设置要重要得多。简而言之,他们打造了一台精悍且高效的土耳其语机器,证明了你不需要规模最大就能做到最好;你只需要最现代且最专注。他们已向公众发布了所有的代码和模型本身,希望能为任何致力于开发土耳其语技术的开发者提供巨大的助力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →