← Últimos artículos
💻 computer science

TempoGFormer: A Gating Mechanism-based Transformer for Physiological Measurement from Facial Videos

Este artículo presenta TempoGFormer, un nuevo modelo basado en Transformer para la fotopletismografía remota que aprovecha un mecanismo de compuerta, un Cabezal de Fusión Temporal-Espectral y una estrategia de Tokenización Espacialmente Solapada para mitigar eficazmente el ruido ambiental y los artefactos de movimiento, logrando así una precisión y eficiencia superiores en la medición fisiológica a partir de videos faciales a través de múltiples conjuntos de datos públicos.

Autores originales: Qilei Zhu, Guanlei Xu, Jie Sun, Xiaogang Xu

Publicado 2026-08-31
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Qilei Zhu, Guanlei Xu, Jie Sun, Xiaogang Xu

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar escuchar un susurro en medio de una bulliciosa plaza de la ciudad. La voz que quieres oír está ahí, transportada por el aire, pero es ahogada por el tráfico, el parloteo y el viento. Este es el desafío fundamental de medir los latidos del corazón humano sin tocar la piel. Durante décadas, los médicos han dependido de sensores de contacto, como el clip colocado en un dedo, para rastrear el pulso. Estos dispositivos funcionan bien, pero son intrusivos e impracticables para muchas situaciones, como monitorear a un bebé que duerme o a un paciente con quemaduras graves. En años recientes, los científicos se han volcado hacia una técnica llamada fotopletismografía remota, que intenta leer el latido del corazón a partir de un simple video del rostro de una persona. La idea es elegante: a medida que la sangre bombea a través del rostro, cambia la forma en que la luz se refleja en la piel, creando un diminuto y rítmico cambio de color. Sin embargo, esta señal es increíblemente tenue, fácilmente perdida en el ruido de los cambios de luz, los movimientos de la cabeza o incluso el parpadeo de la persona.

Un equipo de investigadores de la Universidad de Zhejiang Gongshang ha desarrollado una nueva forma de resolver este problema, creando un sistema que puede escuchar ese susurro con claridad. Construyeron un sofisticado modelo computacional diseñado específicamente para encontrar el latido del corazón oculto dentro de una transmisión de video. En lugar de solo mirar el fotograma por fotograma, su sistema aprende a ignorar las distracciones del entorno y a concentrarse intensamente en los sutiles y rítmicos cambios de color de la piel que indican un corazón latiendo. Al combinar un método que suaviza los datos del video con una nueva forma de filtrar el ruido, han creado una herramienta que es más precisa y eficiente que los intentos anteriores, demostrando que una cámara puede, de hecho, reemplazar a un sensor en muchos escenarios vitales de salud.

Los investigadores llaman a su creación TempoGFormer. Para entender cómo funciona, uno primero debe comprender la dificultad que enfrenta. Cuando una cámara graba un rostro, el video resultante es una cantidad masiva de datos, la mayoría de los cuales es irrelevante para el latido del corazón. La piel podría verse diferente debido a una sombra, una sonrisa o un cambio en la iluminación de la habitación. Los modelos computacionales tradicionales a menudo se confunden con estos cambios, tratando una sombra como un latido o perdiendo la señal real por completo. El nuevo sistema comienza descomponiendo el video en piezas pequeñas, pero hace algo diferente a los métodos antiguos. En lugar de cortar el video en bloques rígidos y no superpuestos, utiliza un enfoque de deslizamiento que permite que las piezas se traslapen. Esto preserva el flujo suave del tiempo entre los fotogramas, asegurando que el modelo vea el movimiento continuo de la sangre en lugar de una serie de instantáneas inconexas. Este paso es crucial porque el latido del corazón es un ritmo continuo, y romperlo demasiado bruscamente destruye el patrón mismo que el modelo necesita encontrar.

Una vez que el video está preparado, el sistema aplica un tipo especial de mecanismo de atención para decidir qué partes de la imagen importan más. En muchos sistemas de visión computacional, el modelo podría distraerse con las características más obvias, como los ojos o la boca, en lugar de los sutiles cambios de color en la piel. El TempoGFormer resuelve esto con un mecanismo de compuerta, una especie de filtro inteligente que se sitúa entre la observación del modelo y su toma de decisiones. Este filtro actúa como un control de volumen para la señal. Analiza la atención que el modelo presta a diferentes partes del rostro y automáticamente baja el volumen en las áreas ruidosas o irrelevantes, mientras sube el volumen en las regiones donde el flujo sanguíneo es más visible. Esto permite que el sistema ignore las distracciones del movimiento y la luz, concentrando su energía estrictamente en la señal fisiológica.

Después de filtrar la señal, el sistema utiliza una cabeza especializada para reconstruir la onda del latido del corazón. Esta parte del modelo observa los datos desde múltiples ángulos, considerando tanto el tiempo de los latidos como la frecuencia del ritmo. Combina estas diferentes vistas para crear una predicción precisa de la frecuencia cardíaca. Los investigadores probaron este sistema en tres conjuntos de datos públicos diferentes, que incluían videos de personas sentadas tranquilamente, jugando y hasta caminando. En cada prueba, el nuevo modelo superó a los métodos existentes, incluidos aquellos basados en técnicas de aprendizaje profundo más antiguas. Logró una mayor precisión en la estimación de la frecuencia cardíaca y produjo una señal más limpia con menos ruido. Incluso cuando el modelo fue entrenado con un conjunto de videos y probado en un conjunto completamente diferente con distintas personas e iluminación, mantuvo su alto nivel de desempeño, demostrando que había aprendido la verdadera naturaleza del latido del corazón en lugar de simplemente memorizar clips de video específicos.

El estudio también analizó el costo de ejecutar este sistema. Aunque el nuevo modelo es ligeramente más complejo que algunas alternativas más simples, no requiere una cantidad excesiva de potencia de cómputo. Logra un equilibrio, utilizando un número manejable de parámetros para alcanzar resultados que son significativamente mejores que la competencia. Los investigadores demostraron que, al refinar la forma en que el modelo presta atención al video y cómo procesa los datos temporales, es posible extraer signos vitales con un nivel de precisión que antes era difícil de lograr sin contacto físico. Este trabajo sugiere que, en un futuro cercano, las cámaras podrían convertirse en herramientas estándar para el monitoreo de la salud, capaces de rastrear la frecuencia cardíaca en hospitales, gimnasios o incluso en el hogar, todo sin un solo cable o sensor adherido al cuerpo. Los hallazgos ofrecen un paso prometedor para hacer que el monitoreo de la salud sea más accesible y menos intrusivo para todos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →