← Últimos artigos
💬 NLP

A Tutorial on Diffusion Theory: From Differential Equations to Diffusion Models

Este tutorial fornece um quadro unificado para modelos de difusão ao derivar suas dinâmicas forward e reverse a partir de equações diferenciais, demonstrar a equivalência entre objetivos de treinamento padrão e score matching, e esclarecer as conexões teóricas entre vários métodos de amostragem como DDPM, DDIM e geração guiada.

Autores originais: Jiayi Fu, Yuxia Wang

Publicado 2026-05-22
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Jiayi Fu, Yuxia Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma fotografia bela e de alta resolução de um gato. Agora, imagine aumentar lentamente o ruído estático em uma TV antiga até que aquela imagem se perca completamente em um mar de ruído branco. Esse é o Processo Forward.

Agora, imagine que você tem um detetive superinteligente que pode olhar para esse ruído e dizer: "Se eu remover apenas um pouquinho de ruído deste ponto específico, a orelha do gato começará a aparecer". Se esse detetive puder fazer isso passo a passo, repetidamente, ele pode transformar o ruído de volta em uma imagem clara de um gato. Esse é o Processo Reverse, e é assim que os Modelos de Difusão geram imagens.

Este artigo de Jiayi Fu e Yuxia Wang é essencialmente um "manual do usuário" escrito na linguagem das equações diferenciais (a matemática que descreve como as coisas mudam ao longo do tempo). Ele unifica várias maneiras diferentes pelas quais os cientistas têm pensado sobre esses modelos em uma única história grande e coerente.

Aqui está a divisão de sua história, usando analogias simples:

1. As Duas Maneiras de Descrever a Jornada (ODE vs. SDE)

O artigo começa dizendo que o processo de transformar uma imagem clara em ruído (e vice-versa) pode ser descrito em duas linguagens matemáticas diferentes:

  • O Caminho Estocástico (SDE): Pense nisso como um caminhante atravessando uma floresta nebulosa. Ele tem um mapa (a direção para a qual ele deveria ir), mas o vento (ruído aleatório) continua soprando-o ligeiramente para fora do curso. Cada passo é uma mistura de uma direção planejada e uma rajada aleatória. Esta é a Equação Diferencial Estocástica (SDE).
  • O Caminho Determinístico (ODE): Agora, imagine o mesmo caminhante, mas desta vez o vento é perfeitamente previsível, ou ele está andando em uma esteira rolante gigante e lisa que o move exatamente para onde precisa ir, sem aleatoriedade. Esta é a Equação Diferencial Ordinária (ODE).

A Grande Descoberta: O artigo prova que, embora esses dois caminhos pareçam diferentes (um é instável, o outro é suave), ambos começam no mesmo lugar (uma imagem clara) e terminam no mesmo lugar (ruído puro). Mais importante ainda, ambos seguem exatamente o mesmo "mapa de densidade" em qualquer momento dado. Você pode alternar entre o caminho instável e o caminho suave sem alterar o resultado final.

2. O "Score" (O Instinto do Detetive)

Como o detetive sabe para onde ir? Ele usa algo chamado Score.

Em matemática, o "score" é apenas o gradiente da probabilidade. Em português claro, pense nele como uma inclinação.

  • Se você está de pé em uma colina, a inclinação diz para você qual caminho é "para cima" (onde estão os dados) e qual caminho é "para baixo" (onde está o ruído).
  • A tarefa do modelo é aprender essa inclinação. Ele aprende a olhar para uma imagem ruidosa e dizer: "A direção 'para cima' (em direção a uma imagem real) é desta maneira".

O artigo mostra que a maneira padrão pela qual treinamos esses modelos (pedindo-lhes para adivinhar o ruído que foi adicionado) é matematicamente idêntica a pedir-lhes para aprender essa "inclinação" ou Score. É como ensinar um aluno a resolver um problema de matemática pedindo-lhe para encontrar a resposta, em vez de ensinar-lhe a fórmula diretamente. O artigo prova que esses dois métodos de ensino são, na verdade, a mesma coisa.

3. O Treinamento: Aprendendo a Remover Ruído

O artigo explica que não precisamos ensinar ao modelo a matemática complexa da "inclinação" diretamente. Em vez disso, podemos apenas mostrar a ele uma imagem ruidosa e perguntar: "Qual foi o ruído que adicionamos?"

  • Se o modelo aprender a prever o ruído perfeitamente, ele automaticamente aprende a inclinação.
  • Uma vez que ele conhece a inclinação, pode reverter o processo: começar com ruído puro e caminhar "para cima" para criar uma nova imagem realista.

4. Os Diferentes "Caminhantes" (DDPM, DDIM, DPM-Solver)

O artigo unifica vários algoritmos famosos que as pessoas usam para gerar imagens. Ele explica que todos são apenas maneiras diferentes de dar passos ao longo dessa "inclinação":

  • DDPM (O Caminhante Cuidadoso): Este método dá pequenos passos cautelosos. Ele adiciona um pouco de aleatoriedade a cada passo (como a SDE). É preciso, mas lento.
  • DDIM (O Deslizante Suave): Este método ignora o vento aleatório e simplesmente segue a esteira rolante suave (a ODE). É muito mais rápido porque não perde tempo reagindo a rajadas aleatórias, mas requer um mapa muito bom (um modelo bem treinado).
  • DPM-Solver (O Elevador Expresso): Este é um método novo e sofisticado que usa truques matemáticos para dar grandes e eficientes saltos para cima na colina, em vez de pequenos passos. Ele chega ao topo (a imagem final) em tempo recorde.

O artigo mostra que o DDPM é essencialmente uma versão discreta do caminho instável (SDE), e o DDIM é uma versão discreta do caminho suave (ODE). Eles são dois lados da mesma moeda.

5. Guiando o Processo (Classifier Guidance)

Às vezes, você não quer apenas um gato; você quer um gato preto. Como você orienta o detetive?

  • Classifier Guidance: Você traz um segundo especialista (um classificador) que grita: "Mais preto! Menos branco!" O detetive ouve tanto a inclinação da imagem quanto o grito do especialista, ajustando seu caminho para fazer um gato preto.
  • Classifier-Free Guidance: Em vez de contratar um segundo especialista, você treina o detetive principal para ser capaz de dizer "Não sei o que você quer" (sem condição) e "Sei que você quer um gato preto" (com condição). Durante a geração, você mistura essas duas respostas para orientar o resultado. O artigo explica a matemática por trás de por que essa "mistura" funciona tão bem.

6. A Grande Unificação: Flow Matching

Finalmente, o artigo conecta os Modelos de Difusão a um campo mais recente chamado Flow Matching.

  • Flow Matching é como desenhar uma linha reta de uma nuvem de ruído para uma nuvem de dados.
  • Difusão é como um caminho de rio sinuoso.

O artigo prova que, embora pareçam diferentes, se você os treinar da mesma maneira (prevendo ruído/score), eles acabam descrevendo exatamente a mesma jornada. A função de perda de "previsão de ruído" é, na verdade, uma função de perda de "flow matching" disfarçada. É como perceber que, seja dirigindo um carro ou andando de bicicleta, se você seguir as mesmas coordenadas de GPS, você chega ao mesmo destino.

Resumo

Este artigo é uma ponte. Ele leva o mundo bagunçado e complexo de diferentes algoritmos de difusão (DDPM, DDIM, Flow Matching) e mostra que todos são apenas maneiras diferentes de resolver a mesma equação diferencial.

  • Forward: Transformar dados em ruído (fácil).
  • Reverse: Transformar ruído em dados (difícil).
  • O Segredo: Aprender a "inclinação" (score) adivinhando o ruído.
  • O Resultado: Seja caminhando com um bastão instável (SDE) ou deslizando em um trilho suave (ODE), se você seguir a inclinação, você gerará imagens belas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →