← Últimos artigos
💻 computer science

Sumi: Open Uniform Diffusion Language Model from Scratch

O artigo apresenta o Sumi, um modelo de linguagem de difusão uniforme de 7B totalmente aberto, pré-treinado do zero em 1,5 trilhão de tokens, que serve como o primeiro ponto de referência em larga escala para o estudo da difusão uniforme nativa e demonstra desempenho competitivo em benchmarks de conhecimento, raciocínio e codificação.

Autores originais: Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

Publicado 2026-06-19
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Mengyu Ye, Keito Kudo, Wataru Ikeda, Ryosuke Matsuda, Keisuke Sakaguchi, Jun Suzuki

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Uma Nova Maneira de Escrever com IA

Imagine que você está tentando escrever uma história.

  • O Jeito Antigo (Modelos Autoregressivos): Isso é como escrever com uma caneta no papel. Você escreve uma palavra, depois a próxima, depois a próxima. Assim que você escreve uma palavra, ela está feita. Se você cometer um erro, tem que riscar ou recomeçar a página inteira. Você não pode voltar e mudar a primeira palavra sem reescrever tudo o que veio depois dela.
  • O Novo Jeito (Sumi / Difusão Uniforme): Imagine que você está pintando um quadro em uma tela que já está coberta por ruído estático (como a estática de uma TV). Em vez de escrever palavra por palavra, você olha para a tela inteira de uma vez. Você pode escolher qualquer palavra na frase, apagá-la e substituí-la por uma melhor. Você pode fazer isso repetidamente, refinando toda a história simultaneamente até que ela esteja perfeita.

O artigo apresenta o Sumi (que significa "tinta" em japonês), um modelo de IA de 7 bilhões de parâmetros que utiliza este método de "pintura". É a primeira vez que alguém constrói um modelo deste tamanho do zero usando esta técnica específica, em vez de apenas ajustar um antigo modelo de "escrita com caneta".

Como Eles o Construíram: A Analogia da "Escola"

Para treinar o Sumi, os pesquisadores não apenas despejaram textos aleatórios da internet nele. Eles curaram um "currículo escolar" muito específico.

  1. O Livro Didático (Pré-treinamento): Eles alimentaram o modelo com 1,3 trilhão de palavras. Mas eles não pegaram qualquer coisa. Eles filtraram os dados para priorizar conteúdo educativo de alta qualidade. Pense nisso como dar à IA uma biblioteca cheia de livros didáticos, enciclopédias e manuais de código, enquanto filtravam muito do papo casual da internet, memes ou blogs de baixa qualidade.
  2. O Treinamento Especializado (Meio-treinamento): Após a escolaridade geral, deram a ele um "campo de treinamento" focado em três matérias específicas: Programação, Matemática e Raciocínio. Eles adicionaram ainda mais código e problemas matemáticos à sua dieta.
  3. O Resultado: Devido a essa "dieta pesada em educação", o Sumi é muito bom em conhecimento, lógica e escrita de código. No entanto, como não comeu comida suficiente de "conversa casual" ou "senso comum", ele tem um pouco de dificuldade com perguntas de senso comum do dia a dia (como "Por que as pessoas carregam guarda-chuvas quando chove?").

O Desempenho: Quão Bom é o "Pintor"?

Os pesquisadores testaram o Sumi contra outros modelos de IA famosos (como Llama e Falcon) que utilizam o método tradicional de "escrita com caneta".

  • As Vitórias: Em testes envolvendo conhecimento geral, raciocínio e programação, o Sumi teve um desempenho tão bom quanto os melhores modelos de "escrita com caneta", mesmo que esses outros modelos tenham sido treinados com muito mais dados.
  • As Baixas: Em testes que exigem "senso comum" (como entender situações sociais), o Sumi pontuou mais baixo. Os autores admitem que isso provavelmente se deve ao fato de o treinamento ter sido focado demais em matérias escolares e pouco na vida cotidiana.

O Experimento da "Tela": Encontrando o Ponto Ideal

Uma das partes mais interessantes do artigo é como eles testaram a "flexibilidade" do modelo.

  • O Tamanho da Tela: Neste modelo de IA, você precisa decidir o quão longa será a frase antes de começar a gerá-la. Isso é chamado de "comprimento da tela" (canvas length).
  • A Descoberta: O Sumi funciona melhor quando a tela tem exatamente 2048 tokens de comprimento.
    • Se a tela for muito curta, o modelo fica confuso e escreve algo sem sentido.
    • Se a tela for muito longa, ele também fica confuso.
    • É como um músico que consegue tocar uma música perfeitamente se o palco tiver um tamanho específico, mas se o palco for muito pequeno ou muito grande, ele perde o ritmo.

O Mistério do "Comprometimento": Como Ele Decide?

Como o Sumi pode mudar qualquer palavra a qualquer momento, você pode se perguntar: Ele apenas adivinha aleatoriamente ou tem um plano?

  • A Descoberta: Os pesquisadores descobriram que o Sumi não tem uma ordem fixa (como "começar pelo início"). Em vez disso, ele usa um sistema de "confiança".
    • Ele olha para a frase inteira e diz: "Estou bem certo sobre esta palavra, então vou travá-la. Não tenho certeza sobre aquela palavra, então continuarei trabalhando nela".
    • Isso cria uma ordem natural onde ele trava as partes fáceis primeiro e deixa as partes difíceis para depois.
  • Velocidade Paralela: Como ele trava as palavras de confiança primeiro, ele pode na verdade escrever várias palavras ao mesmo tempo (decodificação paralela) para tarefas de programação, o que é mais rápido do que o antigo método de "uma palavra por vez".

O Mito da "Autocorreção"

Uma grande promessa deste método de "pintura" é que a IA deve ser capaz de corrigir seus próprios erros facilmente. Os pesquisadores testaram isso dando ao Sumi tempo extra para revisar suas respostas.

  • O Resultado: Surpreendentemente, não ajudou. Mesmo quando o Sumi teve permissão para reescrever suas respostas várias vezes, ele geralmente apenas mudava uma palavra e depois a voltava para a original. Ele não chegou a "aprender" a corrigir seus erros durante o processo de geração. Parece que o modelo atinge um teto e não sabe como melhorar uma resposta que já foi comprometida/travada.

Resumo

Sumi é um experimento ousado mostrando que podemos construir uma IA poderosa do zero usando um método de "pintura" (Difusão Uniforme) em vez do método tradicional de "escrita".

  • É ótimo em: Matemática, programação e fatos (porque estudou muito).
  • É ok em: Senso comum (porque pulou a parte "divertida").
  • É estranho em: Mudar de ideia (ainda não consegue se autocorrigir bem).

Os autores lançaram o modelo, o código e a receita exata do que o alimentou, esperando que outros cientistas o utilizem para descobrir como tornar este método de "pintura" ainda melhor.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →