← Últimos artigos
💬 NLP

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

O artigo apresenta o Nanbeige4.1-3B, um modelo de linguagem aberto e unificado de apenas 3 bilhões de parâmetros que, através de técnicas avançadas de modelagem de recompensa e aprendizado por reforço, alcança desempenho superior em raciocínio, alinhamento, geração de código e interações complexas com ferramentas, superando modelos anteriores de escala similar e até mesmo modelos significativamente maiores.

Autores originais: Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

Publicado 2026-02-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um cozinheiro de cozinha pequena (um modelo de IA de apenas 3 bilhões de parâmetros). Até agora, a regra era: "Para cozinhar um banquete complexo, você precisa de uma cozinha gigante com centenas de chefs". Modelos grandes eram os únicos que conseguiam fazer tudo: escrever poemas, resolver equações difíceis, programar jogos e navegar na internet para encontrar informações.

Mas a equipe do Nanbeige (do Boss Zhipin) decidiu fazer um desafio: Eles criaram um "Super Chef de Cozinha Compacta" chamado Nanbeige4.1-3B.

Aqui está a história de como eles fizeram isso, usando analogias do dia a dia:

1. O Problema: O Chef Especialista vs. O Generalista

Antes, os cozinheiros pequenos eram especialistas em apenas uma coisa.

  • Um era ótimo em matemática, mas se você pedisse para ele navegar na internet para achar uma receita, ele se perdia.
  • Outro era ótimo em programação, mas escrevia textos estranhos e não entendia o que o cliente realmente queria.
  • Os cozinheiros gigantes (modelos de 30B ou 100B parâmetros) faziam tudo bem, mas eram caros e lentos.

O Nanbeige4.1-3B é o primeiro cozinheiro pequeno que faz tudo bem ao mesmo tempo: ele pensa, escreve código, navega na web e se alinha ao gosto humano, tudo com o tamanho de um modelo pequeno.

2. Como eles treinaram esse "Super Chef"? (O Segredo da Receita)

Eles não apenas deram mais comida para o modelo; eles mudaram a forma como ele aprendeu.

A. A Sala de Aula (SFT - Aprendizado Supervisionado)

Imagine que o modelo estava estudando em uma biblioteca. Eles pegaram livros de código, matemática e navegação na web e misturaram tudo.

  • O Truque: Eles não apenas leram os livros; eles praticaram em "livros gigantes" (contexto de 256k tokens). Isso é como dar ao aluno um livro de 1.000 páginas para ler de uma vez só, para que ele consiga lembrar de detalhes do início até o fim de uma conversa longa.

B. O Treinador de "Não Repetir" (RL Ponto a Ponto)

O modelo começou a cometer um erro comum: ele ficava repetindo as mesmas coisas ou falando demais (como um aluno que fica enrolando para não entregar a tarefa).

  • A Solução: Eles contrataram um treinador que dava pontos apenas por respostas diretas e limpas. Se o modelo falava besteira ou repetia, o treinador dizia "não". Isso ensinou o modelo a ser conciso e útil.

C. O Treinador de "Escolha do Melhor" (RL Pares)

Agora, o modelo sabia falar bem, mas precisava saber qual resposta era melhor.

  • O Jogo: Eles mostraram duas respostas para o treinador (uma do modelo e uma de um "gênio") e perguntaram: "Qual é a melhor?". O modelo aprendeu a imitar o "gênio" para ganhar pontos. Isso refinou a qualidade, fazendo-o parecer mais humano e inteligente.

D. O Treinador de "Código Eficiente" (Programação)

Para programar, não basta o código funcionar; ele precisa ser rápido.

  • A Regra de Ouro: Se o código funciona, o modelo ganha pontos. Mas, se o código funciona e é super rápido (como um carro esportivo vs. um caminhão lento), o modelo ganha pontos extras. Isso forçou o modelo a pensar em soluções inteligentes, não apenas em soluções que funcionam.

E. O Treinador de "Detetive" (Busca Profunda)

Esta é a parte mais impressionante. O modelo precisa resolver problemas complexos que exigem pesquisar na internet várias vezes (como um detetive).

  • O Desafio: A maioria dos modelos pequenos desiste depois de 2 ou 3 tentativas de pesquisa. O Nanbeige foi treinado para fazer 600 passos de pesquisa sem se perder.
  • Como? Eles criaram um mapa de "caminhos de pesquisa" (como um labirinto) e treinaram o modelo a não se desviar. Eles ensinaram o modelo a avaliar cada passo: "Essa busca me ajudou ou foi perda de tempo?". Isso permitiu que ele resolva problemas que antes exigiam modelos gigantes.

3. O Resultado: O Milagre do Pequeno Gigante

Os testes mostraram algo incrível:

  • O Nanbeige4.1-3B (pequeno) bateu modelos de 30B e até 80B (gigantes) em várias tarefas, como programação e raciocínio lógico.
  • Em competições reais de programação (LeetCode), ele ficou em 1º lugar em um dos desafios, superando modelos muito maiores.
  • Na busca na internet, ele consegue navegar por horas (600 turnos) para encontrar a resposta, algo que modelos pequenos normais nem conseguem começar.

Resumo em uma frase:

O Nanbeige4.1-3B é como um ferramentário de bolso que, graças a um treinamento inteligente e rigoroso, consegue fazer o trabalho de uma oficina inteira, provando que você não precisa ser gigante para ser genial.

Onde encontrar?
Eles liberaram o modelo para que qualquer pessoa possa usá-lo e estudar como eles fizeram isso. É como se eles tivessem aberto a porta da cozinha para todos verem o segredo do chef.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →