Identity-Consistent Expression Fields: A Disentangled Neural Radiance Field Framework for Few-Shot Facial Expression Synthesis
Este artigo propõe o Identity-Consistent Expression Fields (ICEF), um framework de Neural Radiance Field desmembrado que separa características de identidade estáticas de deformações de expressão dinâmicas e emprega um mecanismo de deformação ponderado por confiança para alcançar a síntese de expressões faciais de alta qualidade e preservação de identidade em cenários de poucos disparos (few-shot), mesmo ao extrapolar para novas expressões.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando ensinar um robô a desenhar um amigo específico. Você tem apenas três fotos dele: uma sorrindo, uma com aparência de surpreso e uma com o rosto neutro. Seu objetivo é fazer o robô gerar uma imagem inédita desse mesmo amigo fazendo uma careta engraçada e exagerada que você nunca viu antes, como mostrar a língua enquanto levanta uma sobrancelha. Este é o mundo dos Campos de Radiância Neural (NeRF), uma maneira inteligente pela qual os computadores usam matemática para transformar fotos 2D planas em mundos 3D. Pense em um NeRF não como um modelo 3D feito de triângulos, mas como uma "névoa" mágica que sabe exatamente qual cor e densidade deve ter em qualquer ponto do espaço, dependendo de onde você está olhando.
Por muito tempo, essas máquinas de névoa 3D foram ótimas para mostrar um rosto de um novo ângulo, mas quando solicitadas a mudar a expressão (como passar de um sorriso para um franzir de testa) usando apenas algumas fotos, elas frequentemente ficavam confusas. Elas tentavam morfar o rosto inteiro, mas, ao fazer isso, acabavam alterando as características únicas da pessoa. É como tentar mudar a roupa de um personagem em um videogame, mas o motor do jogo acaba mudando o formato do nariz ou a textura da pele junto com as roupas. Este é um grande problema para a criação de avatares virtuais para filmes ou videogames, pois você quer que o personagem pareça ele mesmo, apenas fazendo algo diferente, e não se transformando em um estranho.
Surge uma nova ideia chamada ICEF (Campos de Expressão com Identidade Consistente). Os pesquisadores por trás deste artigo perceberam que os métodos anteriores tentavam deformar um único "volume de características" bagunçado (um recipiente digital de todos os detalhes do rosto) para se ajustar a uma nova expressão. O problema era que esse recipiente era flexível demais; quando solicitado a se esticar para uma nova expressão não vista, ele deformava a identidade da pessoa junto com a expressão. O ICEF sugere uma abordagem mais inteligente: em vez de um único recipiente grande e emaranhado, divida o rosto em duas partes distintas. Primeiro, mantenha um "cartão de identidade" estático e imutável que detém todos os detalhes únicos do rosto da pessoa (sua textura de pele, o formato exato do nariz, a cor dos olhos) em um estado neutro. Segundo, crie um "molde" flexível separado que apenas mova as partes do rosto que realmente mudam quando você faz uma careta (como a boca, os olhos e as sobrancelhas).
O artigo propõe que, ao separar estritamente esses dois elementos, o computador pode esticar o "molde" para criar uma nova expressão sem nunca tocar no "cartão de identidade". Para garantir que o molde não agarre acidentalmente o cartão de identidade, eles adicionaram uma regra especial (um "regularizador") que diz ao computador: "Mova apenas a boca e os olhos; deixe a testa e as bochechas quietas". Além disso, eles perceberam que, se você pedir ao computador para fazer uma expressão que seja muito diferente das poucas fotos que lhe foram dadas, ele pode começar a adivinhar loucamente e cometer erros. Para corrigir isso, o ICEF usa um "medidor de confiança". Se a nova expressão estiver muito longe dos exemplos que ele conhece, o sistema muda automaticamente para uma maneira mais simples e segura de mover o rosto, em vez de confiar em seu palpite complexo e arriscado.
Em seus testes, os autores descobriram que este método funciona muito melhor para manter a pessoa parecendo ela mesma, especialmente quando a nova expressão é muito diferente das fotos de treinamento. Eles mostraram que, enquanto os métodos antigos começavam a borrar ou distorcer a identidade da pessoa ao serem levados ao limite, o ICEF manteve a identidade nítida e consistente. O artigo não afirma que este é um produto perfeito e finalizado para cada rosto possível, mas sugere que esta estratégia de "divisão" é uma maneira sólida de resolver o problema específico do desvio de identidade na animação facial de poucos disparos (few-shot). É um passo em direção à criação de avatares digitais que podem encenar qualquer cena sem perder o próprio rosto no processo.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.