← Últimos artigos
💬 NLP

Mellum2 Technical Report

O Mellum 2 é um modelo de linguagem de pesos abertos, com 12 bilhões de parâmetros e uma arquitetura de Mistura de Especialistas (Mixture-of-Experts), possuindo 2,5 bilhões de parâmetros ativos por token, especializado em engenharia de software e tarefas agênticas, o qual alcança um desempenho competitivo com modelos maiores através de inovações arquitetônicas como a Predição de Múltiplos Tokens e um currículo de treinamento de três fases abrangendo 10,6 trilhões de tokens.

Autores originais: Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

Publicado 2026-06-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando construir um assistente de codificação superinteligente que vive dentro do seu computador. O desafio é que você quer que ele seja incrivelmente inteligente (como um engenheiro sênior), mas também incrivelmente rápido e barato de operar (como um notebook de escritório padrão). Normalmente, você tem que escolher um: ou a versão "inteligente" é enorme e lenta, ou a versão "rápida" é simples demais para lidar com problemas difíceis.

A equipe da JetBrains construiu o Mellum 2 para resolver exatamente esse problema. Aqui está como eles fizeram isso, explicado de forma simples:

1. O Cérebro "Canivete Suíço" (A Arquitetura)

A maioria dos modelos de IA é como uma única e gigante célula cerebral que faz tudo. O Mellum 2 é diferente. Ele foi construído como uma Mistura de Especialistas (Mixture-of-Experts - MoE).

  • A Analogia: Imagine uma biblioteca enorme com 64 bibliotecários especializados diferentes. Quando você faz uma pergunta, o modelo não acorda todos os 64 bibliotecários. Em vez disso, ele tem um gerente inteligente que escolhe apenas os 8 bibliotecários mais relevantes para a sua pergunta específica.
  • O Resultado: O modelo tem o conhecimento total de um cérebro "gigante" de 12 bilhões de parâmetros, mas para cada palavra que escreve, ele só "pensa" com o poder de um cére contrário de 2,5 bilhões de parâmetros. Isso o torna rápido o suficiente para rodar em hardware padrão, mantendo-se muito inteligente.

2. Os Truques de "Janela Deslizante" e "Rascunho"

Para torná-lo ainda mais rápido, eles adicionaram dois atalhos inteligentes:

  • Janela Deslizante (Sliding Window): Em vez de tentar se lembrar de cada palavra que você já digitou em uma conversa (o que fica lento), o modelo foca nas últimas 1.024 palavras como uma janela deslizante em um trem. Ele mantém o contexto mais recente nítido enquanto deixa os detalhes mais antigos desaparecerem, o que economiza uma tonelada de energia.
  • O Assistente de "Rascunho": O modelo possui um pequeno assistente de "rascunho" integrado. Antes de se comprometer em escrever uma resposta final, esse pequeno assistente adivinha as próximas palavras. Se o palpite estiver correto, o modelo principal pula o trabalho e apenas aceita o rascunho. É como um escritor tendo um amigo sussurrando a próxima frase para que ele possa digitar mais rápido.

3. O Currículo Escolar de "Três Fases"

Eles não apenas alimentaram o modelo com dados aleatórios. Eles o ensinaram em três estágios específicos, como um currículo escolar:

  • Fase 1 (O Generalista): Começaram com uma mistura enorme de dados gerais da internet (70%) e um pouco de código (23%). Isso deu ao modelo uma compreensão ampla de como os humanos falam e escrevem.
  • Fase 2 (O Especialista): Eles mudaram a mistura para incluir mais código de alta qualidade (42%) e matemática. Foi aqui que o modelo começou a aprender as regras específicas de programação.
  • Fase 3 (O Mestre): Na fase final, a mistura era quase inteiramente composta por código e matemática (59% de código). Este é o "treinamento intensivo" onde o modelo afiou suas habilidades para se tornar um especialista.

4. Duas Personalidades: "Instruct" e "Thinking"

A partir do mesmo céreio treinado, eles lançaram duas versões do modelo:

  • O Modelo "Instruct": Este é o trabalhador direto. Você faz uma pergunta e ele dá a resposta imediatamente. É ótimo para tarefas rápidas.
  • O Modelo "Thinking": Este é o pensador profundo. Antes de dar uma resposta, ele escreve um "traço de raciocínio" — uma explicação passo a passo de como resolveu o problema. Isso é como um aluno mostrando o desenvolvimento de um cálculo em uma prova de matemática. O artigo revelou que este modo de "pensamento" torna o modelo muito melhor em resolver quebra-cabeças de lógica difíceis e desafios de codificação complexos.

5. A "Prova" (Testes)

Eles testaram o Mellum 2 contra outros modelos populares.

  • Velocidade: Ele roda tão rápido quanto um modelo de 7 bilhões de parâmetros (que é muito menor que seu tamanho total de 12 bilhões), mas é mais inteligente que muitos modelos de seu tamanho.
  • Codificação: Ele se destaca ao escrever código, depurar (debug) e usar ferramentas (como pesquisar na web ou executar comandos).
  • A Troca (Trade-off): Como focaram intensamente em torná-lo um especialista em codificação, ele é ligeiramente menos conhecedor de fatos gerais do mundo (como história ou biologia) em comparação com modelos treinados para serem chatbots gerais. No entanto, para o seu trabalho pretendido — ajudar desenvolvedores — ele é um dos melhores do setor.

Resumo

O Mellum 2 é um assistente de codificação especializado que utiliza uma arquitetura de "equipe de especialistas" para ser inteligente e rápido. Ele foi treinado através de um currículo cuidadosamente desenhado para dominar código e matemática, e vem em dois sabores: um para respostas rápidas e outro para raciocínio profundo e passo a passo. A equipe o lançou gratuitamente para que qualquer pessoa possa usá-lo para construir softwares melhores.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →