Mellum2 Technical Report
O Mellum 2 é um modelo de linguagem de pesos abertos, com 12 bilhões de parâmetros e uma arquitetura de Mistura de Especialistas (Mixture-of-Experts), possuindo 2,5 bilhões de parâmetros ativos por token, especializado em engenharia de software e tarefas agênticas, o qual alcança um desempenho competitivo com modelos maiores através de inovações arquitetônicas como a Predição de Múltiplos Tokens e um currículo de treinamento de três fases abrangendo 10,6 trilhões de tokens.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você esteja tentando construir um assistente de codificação superinteligente que vive dentro do seu computador. O desafio é que você quer que ele seja incrivelmente inteligente (como um engenheiro sênior), mas também incrivelmente rápido e barato de operar (como um notebook de escritório padrão). Normalmente, você tem que escolher um: ou a versão "inteligente" é enorme e lenta, ou a versão "rápida" é simples demais para lidar com problemas difíceis.
A equipe da JetBrains construiu o Mellum 2 para resolver exatamente esse problema. Aqui está como eles fizeram isso, explicado de forma simples:
1. O Cérebro "Canivete Suíço" (A Arquitetura)
A maioria dos modelos de IA é como uma única e gigante célula cerebral que faz tudo. O Mellum 2 é diferente. Ele foi construído como uma Mistura de Especialistas (Mixture-of-Experts - MoE).
- A Analogia: Imagine uma biblioteca enorme com 64 bibliotecários especializados diferentes. Quando você faz uma pergunta, o modelo não acorda todos os 64 bibliotecários. Em vez disso, ele tem um gerente inteligente que escolhe apenas os 8 bibliotecários mais relevantes para a sua pergunta específica.
- O Resultado: O modelo tem o conhecimento total de um cérebro "gigante" de 12 bilhões de parâmetros, mas para cada palavra que escreve, ele só "pensa" com o poder de um cére contrário de 2,5 bilhões de parâmetros. Isso o torna rápido o suficiente para rodar em hardware padrão, mantendo-se muito inteligente.
2. Os Truques de "Janela Deslizante" e "Rascunho"
Para torná-lo ainda mais rápido, eles adicionaram dois atalhos inteligentes:
- Janela Deslizante (Sliding Window): Em vez de tentar se lembrar de cada palavra que você já digitou em uma conversa (o que fica lento), o modelo foca nas últimas 1.024 palavras como uma janela deslizante em um trem. Ele mantém o contexto mais recente nítido enquanto deixa os detalhes mais antigos desaparecerem, o que economiza uma tonelada de energia.
- O Assistente de "Rascunho": O modelo possui um pequeno assistente de "rascunho" integrado. Antes de se comprometer em escrever uma resposta final, esse pequeno assistente adivinha as próximas palavras. Se o palpite estiver correto, o modelo principal pula o trabalho e apenas aceita o rascunho. É como um escritor tendo um amigo sussurrando a próxima frase para que ele possa digitar mais rápido.
3. O Currículo Escolar de "Três Fases"
Eles não apenas alimentaram o modelo com dados aleatórios. Eles o ensinaram em três estágios específicos, como um currículo escolar:
- Fase 1 (O Generalista): Começaram com uma mistura enorme de dados gerais da internet (70%) e um pouco de código (23%). Isso deu ao modelo uma compreensão ampla de como os humanos falam e escrevem.
- Fase 2 (O Especialista): Eles mudaram a mistura para incluir mais código de alta qualidade (42%) e matemática. Foi aqui que o modelo começou a aprender as regras específicas de programação.
- Fase 3 (O Mestre): Na fase final, a mistura era quase inteiramente composta por código e matemática (59% de código). Este é o "treinamento intensivo" onde o modelo afiou suas habilidades para se tornar um especialista.
4. Duas Personalidades: "Instruct" e "Thinking"
A partir do mesmo céreio treinado, eles lançaram duas versões do modelo:
- O Modelo "Instruct": Este é o trabalhador direto. Você faz uma pergunta e ele dá a resposta imediatamente. É ótimo para tarefas rápidas.
- O Modelo "Thinking": Este é o pensador profundo. Antes de dar uma resposta, ele escreve um "traço de raciocínio" — uma explicação passo a passo de como resolveu o problema. Isso é como um aluno mostrando o desenvolvimento de um cálculo em uma prova de matemática. O artigo revelou que este modo de "pensamento" torna o modelo muito melhor em resolver quebra-cabeças de lógica difíceis e desafios de codificação complexos.
5. A "Prova" (Testes)
Eles testaram o Mellum 2 contra outros modelos populares.
- Velocidade: Ele roda tão rápido quanto um modelo de 7 bilhões de parâmetros (que é muito menor que seu tamanho total de 12 bilhões), mas é mais inteligente que muitos modelos de seu tamanho.
- Codificação: Ele se destaca ao escrever código, depurar (debug) e usar ferramentas (como pesquisar na web ou executar comandos).
- A Troca (Trade-off): Como focaram intensamente em torná-lo um especialista em codificação, ele é ligeiramente menos conhecedor de fatos gerais do mundo (como história ou biologia) em comparação com modelos treinados para serem chatbots gerais. No entanto, para o seu trabalho pretendido — ajudar desenvolvedores — ele é um dos melhores do setor.
Resumo
O Mellum 2 é um assistente de codificação especializado que utiliza uma arquitetura de "equipe de especialistas" para ser inteligente e rápido. Ele foi treinado através de um currículo cuidadosamente desenhado para dominar código e matemática, e vem em dois sabores: um para respostas rápidas e outro para raciocínio profundo e passo a passo. A equipe o lançou gratuitamente para que qualquer pessoa possa usá-lo para construir softwares melhores.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.