← Últimos artigos
💬 NLP

Index SLM Technical Report

A Bilibili apresenta o Index-1.9B, uma série de pequenos modelos de linguagem abertos apresentando uma base de 1,9 bilhão de parâmetros treinada com 2,8 trilhões de tokens com um cronograma especializado de Warmup-Stable-Decay e uma camada Norm-Head, que alcança um desempenho competitivo em benchmarks padrão e inclui variantes para pré-treinamento puro, alinhamento de chat e interpretação de personagens baseada em caracteres.

Autores originais: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

Publicado 2026-07-14
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está construindo um cérebro de robô minúsculo e superinteligente que cabe no seu bolso. A maioria das pessoas pensa que cérebros maiores são sempre melhores, mas uma equipe da Bilibili decidiu ver se conseguia criar um robô de 1,9 bilhão de parâmetros (vamos chamá-lo de Index-1.9B) que desse socos muito acima de sua categoria de peso. Eles não apenas encolheram um modelo gigante; eles reconstruíram o motor do zero usando 2,8 trilhões de palavras de material de leitura, principalmente em chinês e inglês.

Aqui está a história de como eles fizeram isso, o que descobriram e as surpresas estranhas que encontraram pelo caminho.

O Ingrediente Secreto: Como Eles Treinaram o Cérebro

1. A Lista de Leitura (Dados)
Pense nos dados de treinamento como a biblioteca do robô. Eles não apenas despejaram toda a internet ali. Eles os limparam como um bibliotecário organizando um sótão bagunçado. Eles removeram duplicatas (encontrando até um menu de meses que foi copiado 156.000 vezes por erro!) e filtraram preconceitos.

  • A Mistura: A biblioteca é composta principalmente de livros e páginas da web, mas eles garantiram a inclusão de 6% de código e 10% de conteúdo de alta qualidade, como artigos acadêmicos e enciclopédias.
  • A Surpresa: Eles descobriram que ler "manuais de instrução" (como "Escreva um poema" ou "Resolva este problema matemático") durante a fase final do treinamento tornou o robô muito mais inteligente em testes. Na verdade, adicionar apenas 7% desses dados de instrução aumentou as pontuações de teste em cerca de 7 pontos. Eles até lançaram duas versões do robô — uma com essa leitura extra e outra sem — para que todos pudessem ver exatamente o quanto isso ajudou.

2. A Estrutura do Cérebro (Arquitetura)
Normalmente, quando você tem uma quantidade fixa de "poder cerebral" (parâmetros), você pode tornar o cérebro largo (muitos neurônios em uma camada) ou profundo (muitas camadas empilhadas).

  • A Descoberta: A equipe testou um design "profundo e estreito" (36 camadas) versus um "largo e raso" (9 camadas). O profundo venceu todas as vezes. É como construir um arranha-céu em vez de um armazém largo e plano; para este tamanho, subir funcionou melhor do que expandir para os lados.
  • O Estabilizador: Eles também adicionaram uma camada especial de "Norm-Head". Imagine o cérebro do robô ficando um pouco tonto quando tenta adivinhar a próxima palavra porque algumas palavras são raras. Esta nova camada atua como um estabilizador, mantendo o cérebro calmo mesmo quando o robô está aprendendo super rápido.

3. O Cronograma de Aprendizado (O Método "WSD")
A maioria dos robôs aprende em um ritmo constante ou desacelera gradualmente. O Index-1.9B usa um cronograma "Warmup–Stable–Decay" (Aquecimento–Estável–Decaimento).

  • A Estratégia: Primeiro, ele aquece. Depois, ele aprende em uma velocidade constante e alta (a fase "Estável") enquanto lê toda a biblioteca. Finalmente, na fase de "Decaimento", ele desacelera, mas passa a ler apenas os melhores livros curados (os artigos acadêmicos e enciclopédias).
  • O Resultado: Essa combinação de desacelerar enquanto lê dados de alta qualidade deu a ele o maior impulso de desempenho.

A Surpresa Estranha: O "Surto"

Aqui está a parte que nem mesmo os autores conseguem explicar totalmente ainda.
Durante a fase "Estável", quando o robô estava lendo em uma velocidade constante, algo estranho aconteceu. Entre 1,0 e 1,2 trilhão de tokens de leitura, as pontuações de teste do robô deram um salto repentino. Ele passou de mediano para superar vários modelos de 7B, sem mudar a velocidade de aprendizado ou o tipo de dado.

  • A Certeza: O artigo admite que isso é um mistério. Eles sgetem que talvez os dados de alta qualidade combinados com a taxa de aprendizado rápida tenham simplesmente "clicado" naquele momento, mas não provaram exatamente o porquê. É como um aluno que subitamente entende tudo após ler um capítulo específico, mesmo que o professor não tenha mudado o plano de aula.

As Diferentes Versões do Robô

A equipe não parou em apenas um modelo. Eles lançaram uma família inteira:

  • Index-1.9B-Base: O cérebro bruto e inteligente, pronto para qualquer coisa.
  • Index-1.9B-Pure: Uma versão de controle que nunca leu manuais de instrução. Isso prova que as pontuações "inteligentes" do modelo principal realmente vêm dessa leitura extra.
  • Index-1.9B-Chat: O modelo Base ensinado a conversar gentilmente com humanos, usando uma técnica chamada "Otimização de Preferência Direta" (DPO). Isso é como ensinar o robô não apenas a responder, mas a responder bem, mostrando a ele exemplos de conversas boas vs. ruins.
  • Index-1.9B-Character: Uma versão que pode fazer interpretação de personagens (role-play). Ela usa um truque de "recuperação" (retrieval), onde busca conversas passadas com um personagem específico para manter a consistência do personagem. É tão boa nisso que ocupa o 9º lugar geral em testes de interpretação de personagens, superando muitos modelos muito maiores.

O Que Ele Pode (e Não Pode) Fazer

As Vitórias:

  • Inteligência: Em testes padrão de matemática, raciocínio e conhecimento geral, o Index-1.9B pontua uma média de 64,92. Isso é competitivo com, e às vezes supera, modelos que são várias vezes maiores. Especificamente, ele supera o modelo Llama-2-13B na pontuação média geral, embora não vença todos os benchmarks contra todos os modelos maiores.
  • Linguagem: É ótimo em chinês e inglês. Além disso, o tokenizador que eles construíram para o modelo alcança as taxas de compressão mais fortes para japonês e coreano entre os tokenizadores que compararam, tornando-o eficiente para esses idiomas.
  • Interpretação de Personagens: Pode interpretar personagens com alta consistência, ocupando o 9º lugar geral em um grande ranking, superando muitos modelos de 7B a 14B.

Os Limites:

  • Matemática e Código: Embora seja decente, os autores admitem que estas ainda são áreas de melhoria. Ele ainda não é um gênio da matemática.
  • Fatos: Por ser pequeno, ele ainda pode inventar fatos ou entender mal instruções complexas.
  • O Mistério: Aquele salto repentino de desempenho durante o treinamento? Eles ainda não sabem exatamente o porquê.

O Veredito Final

O artigo mostra que você não precisa de um cérebro massivo e caro para ser inteligente. Se você alimentar um robô pequeno com a mistura certa de livros de alta qualidade, ensiná-lo a ler profundamente em vez de amplamente e der a ele um estabilizador especial para o seu cérebro, ele pode competir com gigantes. Eles também provaram que "dados de instrução" (aprender a seguir ordens) são um enorme "cheat code" para pontuações de teste, e lançaram as evidências para que ninguém possa esconder o fato de que isso funciona.

É um modelo pequeno com uma grande personalidade, algumas perguntas em aberto e um potencial enorme.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →