← Últimos artigos
🤖 AI

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Mode

O artigo apresenta o Nanbeige4.2-3B, um modelo agente geral compacto de 3B parâmetros pré-treinado com 28T de tokens com uma arquitetura de Transformer em Loop e treinamento avançado de RL, que supera significativamente modelos muito maiores como o Qwen3.5-9B e o Gemma4-12B em diversos benchmarks agentes, enquanto mantém fortes capacidades de raciocínio.

Autores originais: Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang
Publicado 2026-07-27
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde computadores são como bibliotecas gigantes e superinteligentes. Por muito tempo, a única maneira de obter uma resposta realmente boa dessas bibliotecas era construí-las cada vez maiores, enfiando mais e mais livros (dados) e mais e mais prateleiras (parâmetros). A ideia era simples: se você quer um gênio, precisa de um cérebro gigante. Mas e se você pudesse construir um gênio minúsculo, de bolso? Esta é a grande questão no campo da Inteligência Artificial atualmente: Podemos criar modelos de IA pequenos e eficientes que sejam tão bons em resolver problemas complexos quanto os gigantes massivos e famintos por energia?

Para entender o desafio, pense em um modelo de IA como um estudante. Um estudante de "raciocínio" é bom em matemática e enigmas de lógica, enquanto um estudante "agêntico" é bom em realmente fazer coisas — como usar uma calculadora, pesquisar na internet ou escrever um relatório. Geralmente, estudantes pequenos são ótimos em uma coisa, mas terríveis na outra. Eles podem ser prodígios da matemática que não sabem usar um computador, ou podem ser bons em clicar em botões, mas não conseguem entender a lógica por trás da tarefa. O objetivo desta pesquisa é ver se podemos treinar um único estudante pequeno para ser um mestre tanto em lógica quanto em ação, sem precisar de um cérebro massivo para fazer isso.

Apresentamos o Nanbeige4.2-3B, um novo modelo do Nanbeige LLM Lab que tenta resolver este quebra-cabeça. Pense neste modelo como um "agente geral compacto" — um céreico minúsculo de 3 bilhões de parâmetros que se recusa a ser limitado pelo seu tamanho. Os pesquisadores descobriram que você não precisa tornar o modelo maior para torná-lo mais inteligente; você só precisa ensinar o modelo a usar seu cérebro de forma mais eficiente.

O Ingrediente Secreto: O Cérebro em "Loop"

O primeiro truque que o Nanbeige4.2-3B utiliza é um hack arquitetural inteligente chamado Transformer em Loop (Looped Transformer). Imagine um modelo de IA padrão como uma linha de montagem de uma fábrica com 30 estações. Um dado (como uma pergunta) passa pela estação 1, depois pela 2, depois pela 3, até chegar à 30, e então está pronto. Para tornar a fábrica mais inteligente, você geralmente apenas adiciona mais estações, o que torna a fábrica enorme e cara.

O Nanbeige, no entanto, decidiu manter a fábrica pequena, mas fazer os trabalhadores trabalharem mais arduamente. Em vez de adicionar novas estações, eles construíram um "loop". Depois que o dado passa pelas 30 estações uma vez, ele é enviado de volta ao início e passa pelas mesmas 30 estações uma segunda vez. É como um estudante lendo um parágrafo difícil e, depois, lendo-o novamente para capturar os detalhes que perdeu na primeira vez. Este "loop" permite que o modelo processe a informação de forma muito mais profunda sem adicionar nenhuma parte nova ao cérebro. O artigo descobriu que treinar o modelo do zero com este loop (em vez de apenas adicionar um loop a um modelo existente) foi a chave para fazê-lo funcionar.

Treinando o Gênio de Bolso

Depois de construírem o cérebro, eles tiveram que ensiná-lo. Os pesquisadores não apenas alimentaram o modelo com fatos aleatórios; eles criaram um campo de treinamento rigoroso com três fases distintas, muito parecidas com o cronograma de treinamento de um time esportivo.

Fase 1: A Fundação (Pré-treinamento)
Antes de aprender a realizar tarefas, o modelo leu uma biblioteca massiva de 28 trilhões de tokens (um token é um pedaço de texto, como uma palavra ou parte de uma palavra). Eles ajustaram especificamente esta lista de leitura para incluir muita matemática, código e ciência, garantindo que o modelo tivesse uma base lógica sólida.

Fase 2: Os Exercícios de Prática (Ajuste Fino Supervisionado)
Em seguida, eles ensinaram o modelo a realmente fazer as coisas. Eles criaram uma coleção massiva de "trajetórias" — registros passo a passo de como resolver problemas. Não eram apenas perguntas simples; eram cenários complexos como consertar um programa de computador quebrado, organizar um escritório bagunçado ou usar um conjunto de diferentes ferramentas para encontrar informações.

  • A Estratégia: Eles começaram com problemas lógicos curtos (contexto de 64K) e gradualmente passaram para tarefas mais longas e complexas (até 256K tokens).
  • O Filtro: Eles não aceitavam qualquer resposta. Se o modelo cometesse um erro no meio de uma tarefa longa, eles o ensinavam a se recuperar. Eles usaram uma "máscara de perda" (loss mask) para dizer ao modelo: "Ei, você errou o passo 3, mas não se esqueça do que aconteceu lá para que possa corrigi-lo no passo 4". Isso ensinou o modelo a ser resiliente, não apenas perfeito.

Fase 3: O Apito do Treinador (Aprendizado por Reforço)
Finalmente, eles usaram uma técnica chamada Aprendizado por Reforço (RL) para polir o comportamento do modelo. Isso é como um treinador observando um jogador e dando pontos por movimentos bons e retirando pontos por movimentos ruins.

  • Parando a Prolixidade: Eles notaram que o modelo às vezes ficava preso em loops, repetindo-se ou falando para sempre. Eles o treinaram para parar quando o trabalho estivesse concluído, tornando suas respostas mais curtas e eficientes.
  • O "Controle de Comprimento": Para problemas matemáticos difíceis, eles deixaram o modelo pensar o tempo que fosse necessário. Mas para problemas mais fáceis, eles o penalizaram por demorar demais. Isso forçou o modelo a ser conciso quando podia ser, mas minucioso quando precisava ser.
  • Recompensas de Ação: Eles deram pontos extras ao modelo por usar ferramentas corretamente e retiraram pontos por cometer o mesmo erro duas vezes. Isso ajudou a estabilizar seu desempenho em tarefas longas e complexas.

Os Resultados: Pequeno, mas Poderoso

Então, este minúsculo modelo de 3 bilhões de parâmetros realmente funciona? Os resultados sugerem que ele é surpreendentemente poderoso. Quando testado contra modelos muito maiores, o Nanbeige4.2-3B não apenas se manteve à altura; ele frequentemente venceu.

  • Vencendo os Gigantes: Em testes que medem quão bem o modelo pode atuar como um assistente pessoal (lidando com tarefas de escritório, usando ferramentas e programando), o Nanbeige4.2-3B superou modelos com 9 bilhões e até 12 bilhões de parâmetros. Por exemplo, no SWE-bench Verified (um teste para corrigir bugs de software), ele marcou 63,6%, superando o Qwen3.5 de 9 bilhões de parâmetros (53,1%) e o Gemma4 de 12 bilhões de parâmetros (44,2%).
  • Poder de Raciocínio: Ele não sacrificou sua capacidade cerebral pelo seu tamanho. Em testes difíceis de matemática e ciência como o GPQA-Diamond, ele marcou 87,4%, o que é superior aos modelos maiores.
  • Uso no Mundo Real: Quando colocado em uma configuração de "assistente pessoal" real chamada OpenClaw, ele lidou com tarefas diárias, fluxos de trabalho de escritório e pesquisas profundas melhor do que os modelos maiores, provando que não é apenas um experimento de laboratório, mas uma ferramenta prática.

O Que Isso Significa

O artigo argumenta explicitamente contra a ideia de que você precisa tornar os modelos maiores para torná-los mais inteligentes. Sugere que, com a arquitetura certa (o loop), os dados certos (mistura de alta qualidade de 28T de tokens) e o método de treinamento certo (RL em estágios), um modelo pequeno pode alcançar capacidades "agênticas" que antes se pensava exigirem cérebros massivos.

No entanto, os autores são cuidadosos ao notar que este é um feito específico para este tamanho de modelo e arquitetura. Eles não afirmam que isso resolve todos os problemas de IA para sempre. Em vez disso, sugerem que esta abordagem abre uma nova porta: agora podemos construir assistentes de IA compactos e eficientes que rodam localmente em computadores pessoais, capazes de lidar com tarefas complexas de múltiplas etapas sem a necessidade de um supercomputador na nuvem. O futuro, sugerem eles, pode não ser sobre construir cérebros maiores, mas sobre ensinar cérebros menores a pensar em loops.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →