← Últimos artículos
💻 computer science

Identity-Consistent Expression Fields: A Disentangled Neural Radiance Field Framework for Few-Shot Facial Expression Synthesis

Este artículo propone los Campos de Expresión de Identidad Consistente (ICEF, por sus siglas en inglés), un marco de Campos de Radiancia Neuronal desentrelazados que separa las características de identidad estáticas de las deformaciones de expresión dinámicas y emplea un mecanismo de deformación ponderado por confianza para lograr una síntesis de expresiones faciales de alta calidad y preservación de la identidad en escenarios de pocos disparos, incluso al extrapolar a expresiones novedosas.

Autores originales: Minh Tran

Publicado 2026-07-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Minh Tran

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a dibujar a un amigo específico. Solo tienes tres fotos de él: una sonriendo, una con expresión de sorpresa y otra con un rostro neutro. Tu objetivo es hacer que el robot genere una imagen nueva de ese mismo amigo haciendo una cara gracosa y exagerada que nunca has visto, como sacar la lengua mientras levanta una ceja. Este es el mundo de los Campos de Radiancia Neuronal (NeRF, por sus siglas en inglés), una forma ingeniosa en la que las computadoras usan las matemáticas para convertir fotos planas en 2D en mundos en 3D. Piensa en un NeRF no como un modelo 3D hecho de triángulos, sino como una "niebla" mágica que sabe exactamente qué color y densidad debe tener en cualquier punto del espacio, dependiendo desde dónde estés mirando.

Durante mucho tiempo, estas máquinas de niebla 3D fueron excelentes para mostrar un rostro desde un nuevo ángulo, pero cuando se les pedía cambiar la expresión (como pasar de una sonrisa a un ceño fruncido) usando solo unas pocas fotos, solían confundirse. Intentaban transformar todo el rostro, pero al hacerlo, cambiaban accidentalmente los rasgos únicos de la persona. Es como intentar cambiar el atuendo de un personaje en un videojuego, pero el motor del juego cambia accidentalmente la forma de su nariz o la textura de su piel junto con la ropa. Este es un gran problema para la creación de avatares virtuales en películas o videojuegos, porque quieres que el personaje se vea como él mismo, simplemente haciendo algo diferente, no convirtiéndose en un extraño.

Aquí entra una nueva idea llamada ICEF (Campos de Expresión de Identidad Consistente). Los investigadores detrás de este artículo notaron que los métodos anteriores intentaban deformar un único y desordenado "volumen de características" (un contenedor digital de todos los detalles del rostro) para adaptarse a una nueva expresión. El problema era que este contenedor era demasiado flexible; cuando se le pedía que se estirara para una nueva expresión no vista, deformaba la identidad de la persona junto con la expresión. ICEF sugiere un enfoque más inteligente: en lugar de un solo contenedor grande y enredado, divide el rostro en dos partes distintas. Primero, mantén una "tarjeta de identidad" estática e inalterable que contenga todos los detalles únicos del rostro de la persona (la textura de su piel, la forma exacta de su nariz, el color de sus ojos) en un estado neutro. Segundo, crea un "molde" flexible y separado que solo mueva las partes del rostro que realmente cambian cuando haces una mueca (como la boca, los ojos y las cejas).

El artículo propone que, al separar estrictamente estos dos elementos, la computadora puede estirar el "molde" para crear una nueva expresión sin tocar jamás la "tarjeta de identidad". Para asegurarse de que el molde no agarre accidentalmente la tarjeta de identidad, añadieron una regla especial (un regularizador) que le dice a la computadora: "Solo mueve la boca y los ojos; deja la frente y las mejillas quietas". Además, se dieron cuenta de que si le pides a la computadora una expresión que es muy diferente a las pocas fotos que se le dieron, esta podría empezar a adivinar de forma errática y cometer errores. Para solucionar esto, ICEF utiliza un "medidor de confianza". Si la nueva expresión está muy lejos de los ejemplos que conoce, el sistema cambia automáticamente a una forma más simple y segura de mover el rostro, en lugar de confiar en su complejo y arriesgado proceso de adivinación.

En sus pruebas, los autores descubrieron que este método funciona mucho mejor para mantener a la persona pareciéndose a sí misma, especialmente cuando la nueva expresión es muy diferente de las fotos de entrenamiento. Demostraron que, mientras los métodos anteriores empezaban a desenfocar o distorsionar la identidad de la persona al ser presionados al límite, ICEF mantenía la identidad nítida y consistente. El artículo no pretende ser un producto perfecto o terminado para cada rostro posible, pero sugiere que esta estrategia de "división" es una forma sólida de resolver el problema específico de la deriva de identidad en la animación facial con pocos ejemplos. Es un paso hacia la creación de avatares digitales que puedan representar cualquier escena sin perder su propio rostro en el proceso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →