← Últimos artigos
🤖 machine learning

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

O artigo apresenta o MeanFlowNFT, um novo framework que adapta o método de Aprendizado por Reforço de processo direto DiffusionNFT para geradores MeanFlow ao construir um preditor de velocidade instantânea induzido, permitindo assim uma otimização de recompensa eficiente que preserva a amostragem rápida de poucos passos enquanto supera significativamente os modelos existentes de poucos passos e até mesmo de múltiplos passos ajustados por RL em geração de imagem e vídeo.

Autores originais: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

Publicado 2026-07-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô artista a pintar o quadro de um "carro elegante dirigindo por uma rua cyberpunk iluminada por neon". No mundo da inteligência artificial, os principais artistas atuais usam uma técnica chamada difusão ou fluxo. Pense nisso como um escultor talhando um bloco de mármore. Eles começam com um bloco de pedra bruto e ruidoso (estática aleatória) e fazem pequenos ajustes cuidadosos passo a passo para revelar a estátua final. O problema é que esse processo é lento. Para obter uma imagem realmente boa, o robô pode precisar dar 50 ou até 100 pequenos passos, verificando seu trabalho após cada talhe. É como atravessar uma sala dando passos de dois centímetros; você chegará lá, mas leva uma eternidade.

Para tornar isso mais rápido, cientistas inventaram recentemente um novo truque chamado MeanFlow. Em vez de dar passos minúsculos, o robô aprende a prever a "velocidade média" que precisa percorrer ao longo de um longo intervalo de tempo. É como se o robô aprendesse a dar saltos gigantes e confiantes pela sala, em vez de apenas caminhar arrastando os pés. Isso permite que ele crie imagens de alta qualidade em apenas alguns passos. No entanto, há uma pegadinha: esses robôs rápidos são difíceis de ensinar o que os humanos realmente gostam. Geralmente, para ensinar uma IA a ser mais criativa ou a seguir regras melhor, usamos um método chamado Aprendizado por Reforço (RL). Mas os melhores métodos de RL que temos atualmente foram projetados para os robôs lentos, passo a passo, e não para os rápidos, que dão saltos. Tentar ensinar o robô rápido com as lições dos antigos robôs lentos é como tentar ensinar um guepardo a correr dando a ele instruções feitas para uma tartaruga; a matemática simplesmente não se alinha.

É aqui que o novo artigo, MeanFlowNFT, entra. Os pesquisadores fizeram uma pergunta simples, mas difícil: Podemos ensinar nosso robô rápido, que dá saltos, a ser ainda melhor usando os mesmos métodos eficientes de RL que usamos para os lentos, sem diminuir sua velocidade?

A resposta é um sim retumbante, e é assim que eles fizeram. A equipe percebeu que, embora o robô seja treinado para prever a "velocidade média" (para dar aqueles grandes saltos), existe uma ligação matemática oculta entre essa velocidade média e a "velocidade instantânea" (a velocidade em qualquer momento específico minúsculo) que os antigos métodos de RL precisam. Eles construíram uma ponte inteligente chamada preditor de velocidade instantânea induzida. Pense nisso da seguinte forma: o cérebro do robô é treinado para planejar uma longa viagem de carro (a velocidade média). Os pesquisadores criaram um "tradutor" especial que olha para esse plano de viagem longa e instantaneamente descobre o que o velocímetro do carro marcaria em qualquer segundo específico (a velocidade instantânea).

Eles então usaram esse tradutor para ensinar o robô usando o antigo e eficiente método de RL. O robô aprende com o feedback (recompensas) baseado nas leituras do velocímetro do tradutor, mas, assim que a lição termina, o robô volta a usar seu cérebro de "velocidade média" original para gerar imagens. Isso significa que o robô se torna mais inteligente e mais alinhado com as preferências humanas sem perder sua supervelocidade.

Os resultados são impressionantes. Quando testaram isso em geradores de imagem (como o Stable Diffusion 3.5-Medium) e geradores de vídeo (como o Wan2.1), o novo modelo MeanFlowNFT superou consistentemente os modelos rápidos anteriores. De fato, na geração de imagens, ele superou outros modelos de alto nível em 6 de 8 métricas diferentes de qualidade. Mais surpreendente ainda, na geração de vídeo, um modelo MeanFlowNFT de 4 passos obteve uma pontuação de 84,33 em um teste de qualidade chamado VBench. Isso é melhor do que um modelo muito mais lento, o LongCat-Video RL, que obteve apenas 82,57.

O artigo prova que este método não funciona apenas na teoria; ele funciona na prática. Ao usar este truque do "tradutor", eles conseguiram manter o processo de treinamento rápido e eficiente (sem a necessidade de calcular probabilidades complexas), enquanto ainda obtinham os benefícios do aprendizado por reforço avançado. O robô aprende a dar saltos melhores, criando imagens e vídeos mais belos e precisos em uma fração do tempo que costumava levar. É um pouco como ensinar um guepardo a correr mais rápido não fazendo-o caminhar, mas dando a ele um mapa melhor do terreno para que ele saiba exatamente onde colocar suas patas gigantes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →