← 最新论文
💬 NLP

Index SLM Technical Report

哔哩哔哩推出了 Index-1.9B,这是一个开源小语言模型系列,其核心是一个在 2.8 万亿 token 上训练的 1.9B 参数基础模型,采用了专门的 Warmup-Stable-Decay 调度方案和 Norm-Head 层,在标准基准测试中实现了极具竞争力的性能,并包含纯预训练、对话对齐以及基于角色的角色扮演等不同变体。

原作者: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在构建一个能装进兜里的、超级聪明的小型机器人大脑。大多数人都认为大脑越大越好,但 Bilibili 的一个团队决定看看他们是否能制造出一个拥有 19 亿参数(我们暂且称之为 Index-1.9B)却能发挥出远超其体量水平的机器人。他们并没有只是简单地缩小一个巨型模型,而是利用 2.8 万亿词汇的阅读材料,从底层开始重新构建了这个引擎。

这是关于他们如何实现这一目标的,以及他们发现了什么,还有他们在过程中发现的那些奇特惊喜的故事。

秘方:如何训练这个大脑

1. 阅读清单(数据)
把训练数据想象成机器人的图书馆。他们并没有把整个互联网都塞进去。他们像图书管理员整理杂乱的阁楼一样对数据进行了清洗。他们删除了重复内容(甚至发现了一个被错误复制了 15.6 万次的月份名称菜单!)并过滤掉了偏见。

  • 配比: 这个图书馆主要由书籍和网页组成,但他们确保包含了 6% 的代码和 10% 的高质量内容,如学术论文和百科全书。
  • 惊喜: 他们发现,在训练的最后阶段阅读“指令手册”(例如“写一首诗”或“解决这个数学问题”)会让机器人在测试中看起来聪明得多。事实上,仅加入 7% 的这种指令数据就让它的测试分数提升了约 7 分。他们甚至发布了两个版本的机器人——一个包含这些额外阅读内容,一个则没有——以便让所有人都能看清这到底起到了多大的作用。

2. 大脑结构(架构)
通常情况下,当你拥有固定的“脑力”(参数)时,你可以让大脑变宽(在同一层中有许多神经元)或者变深(堆叠许多层)。

  • 发现: 团队尝试了“深而窄”的设计(36 层)与“宽而浅”的设计(9 层)的对比。结果是深层设计每次都胜出。这就像建造一座摩天大楼而不是一个宽阔平坦的仓库;对于这个规模而言,向上发展比向外扩张更有效。
  • 稳定器: 他们还添加了一个特殊的“Norm-Head”层。想象一下,当机器人试图预测下一个词时,由于某些词很罕见,它的脑子会感到有点晕眩。这个新层就像一个稳定器,即使在机器人学习速度极快时,也能保持大脑冷静。

3. 学习进度表(“WSD”方法)
大多数机器人的学习节奏是稳定的,或者逐渐减慢。Index-1.9B 使用的是“预热–稳定–衰减”(Warmup–Stable–Decay,简称 WSD)进度表。

  • 策略: 首先,它进行预热。然后,它以恒定的高速进行学习(“稳定”阶段),同时阅读整个图书馆。最后,在“衰减”阶段,它放慢了速度,但转而只阅读最优质、经过精选的书籍(学术论文和百科全书)。
  • 结果: 这种在阅读高质量数据时放慢速度的组合,给了它最大的性能提升。

奇怪的惊喜:“激增”

这是连作者目前都无法完全解释的部分。
在“稳定”阶段,即机器人以恒定速度阅读时,发生了一些奇怪的事情。在阅读了 1.0 到 1.2 万亿个 token 之间,机器人的测试分数突然跳升。它从表现平平跃升到了超越许多 7B 模型的水平,而这一切都没有改变学习速度或数据类型。

  • 确定性: 论文承认这是一个谜。他们暗示,也许是高质量的数据结合快速的学习率在那个时刻产生了共鸣,但他们尚未证明确切原因。这就像一个学生在读完特定章节后突然理解了一切,尽管老师并没有改变教学计划。

机器人的不同版本

该团队并没有止步于一个模型。他们发布了一个完整的家族:

  • Index-1.9B-Base: 一个纯粹的、聪明的、能够应对任何情况的大脑。
  • Index-1.9B-Pure: 一个控制组版本,它从未阅读过指令手册。这证明了主模型的“智能”分数确实来自于那部分额外的阅读。
  • Index-1.9B-Chat: 通过一种被称为“直接偏好优化”(DPO)的技术,被教会了如何与人类友好交流的 Base 模型。这就像教机器人不仅要回答问题,还要回答得“好”,方法是给它展示好的与坏的对话示例。
  • Index-1.9B-Character: 一个可以进行角色扮演的版本。它使用了一种“检索”技巧,通过查找与特定角色过去的对话来保持角色一致性。它在这方面表现出色,在角色扮演测试中的排名高于许多规模更大的模型。

它能做(以及不能做)什么

优势:

  • 智力: 在数学、推理和通用知识的标准测试中,Index-1.9B 的平均分达到了 64.92。这足以与规模大得多的模型竞争,有时甚至能超越它们。具体来说,它在综合平均分上超过了 Llama-2-13B 模型,尽管它并不能在每一个基准测试中都击败所有的更大模型。
  • 语言: 它在中文和英文方面表现出色。此外,他们为该模型构建的 tokenizer 在日语和韩语方面的压缩率在他们对比的所有 tokenizer 中是最强的,这使得它在这些语言中非常高效。
  • 角色扮演: 它可以高度一致地演绎角色,在某项主要排行榜上排名第 9,击败了许多 7B 到 14B 的模型。

局限:

  • 数学与代码: 虽然表现尚可,但作者承认这些领域仍有改进空间。它目前还不是一个数学天才。
  • 事实: 由于体积较小,它可能仍然会编造事实或误解复杂的指令。
  • 谜团: 训练期间那次突然的性能跳升?他们仍然不知道确切原因。

总结

这篇论文表明,你并不需要一个庞大且昂贵的大脑也能变得聪明。如果你给一个小型的机器人喂食正确比例的高质量书籍,教它深度阅读而非广泛阅读,并给它的大脑配备一个特殊的稳定器,它就可以与巨人竞争。他们还证明了“指令数据”(学习如何遵循命令)是提升测试分数的巨大“作弊码”,并且他们发布了证据,让任何人无法掩盖这一事实。

这是一个拥有大个性的、带有几个开放性问题、且拥有巨大潜力的微型模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →