← Derniers articles
💻 computer science

TempoGFormer: A Gating Mechanism-based Transformer for Physiological Measurement from Facial Videos

Cet article introduit TempoGFormer, un nouveau modèle basé sur les Transformers pour la photopléthysmographie à distance qui exploite un mécanisme de porte, une tête de fusion temporelle-spectrale et une stratégie de tokenisation spatialement chevauchée afin d'atténuer efficacement le bruit environnemental et les artefacts de mouvement, atteignant ainsi une précision et une efficacité supérieures dans la mesure physiologique à partir de vidéos faciales à travers plusieurs ensembles de données publics.

Auteurs originaux : Qilei Zhu, Guanlei Xu, Jie Sun, Xiaogang Xu

Publié 2026-08-31
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Qilei Zhu, Guanlei Xu, Jie Sun, Xiaogang Xu

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez essayer d'écouter un chuchotement au milieu d'une place de ville animée. La voix que vous voulez entendre est là, portée par l'air, mais elle est étouffée par le trafic, les bavardages et le vent. C'est le défi fondamental de la mesure des battements de cœur humains sans toucher la peau. Pendant des décennies, les médecins se sont appuyés sur des capteurs de contact, comme le clip placé sur un doigt, pour suivre le pouls. Ces dispositifs fonctionnent bien, mais ils sont intrusifs et peu pratiques dans de nombreuses situations, comme pour surveiller un nourrisson qui dort ou un patient souffrant de brûlures graves. Ces dernières années, les scientifiques se sont tournés vers une technique appelée photopléthysmographie à distance, qui tente de lire le rythme cardiaque à partir d'une simple vidéo du visage d'une personne. L'idée est élégante : à mesure que le sang pompe à travers le visage, il modifie la façon dont la lumière se réfléchit sur la peau, créant un infime changement de couleur rythmique. Cependant, ce signal est incroyablement faible, facilement perdu dans le bruit des changements de lumière, des mouvements de tête ou même du clignement des yeux de la personne.

Une équipe de chercheurs de l'Université de Zhejiang Gongshang a développé une nouvelle façon de résoudre ce problème, en créant un système capable d'entendre ce chuchotement clairement. Ils ont construit un modèle informatique sophistiqué conçu spécifiquement pour trouver le battement de cœur caché à l'intérieur d'un flux vidéo. Au lieu de simplement regarder la vidéo image par image, leur système apprend à ignorer les distractions de l'environnement et à se concentrer intensément sur les changements subtils et rythmiques de la couleur de la peau qui indiquent un cœur qui bat. En combinant une méthode qui lisse les données vidéo avec une nouvelle façon de filtrer le bruit, ils ont créé un outil qui est plus précis et plus efficace que les tentatives précédentes, prouvant qu'une caméra peut effectivement remplacer un capteur dans de nombreux scénarios de santé vitaux.

Les chercheurs appellent leur création TempoGFormer. Pour comprendre comment elle fonctionne, il faut d'abord comprendre la difficulté à laquelle elle est confrontée. Lorsqu'une caméra enregistre un visage, la vidéo résultante est une quantité massive de données, dont la majeure partie est non pertinente pour le rythme cardiaque. La peau peut paraître différente à cause d'une ombre, d'un sourire ou d'un changement de l'éclairage de la pièce. Les modèles informatiques traditionnels se laissent souvent confondre par ces changements, traitant une ombre comme un battement de cœur ou manquant totalement le signal réel. Le nouveau système commence par décomposer la vidéo en petits morceaux, mais il fait quelque chose de différent des anciennes méthodes. Au lieu de découper la vidéo en blocs rigides et non chevauchants, il utilise une approche glissante qui permet aux morceaux de se chevaucher. Cela préserve le flux temporel fluide entre les images, garantissant que le modèle voit le mouvement continu du sang plutôt qu'une série de clichés disjoints. Cette étape est cruciale car le battement de cœur est un rythme continu, et le décomposer trop brutalement détruit le motif même que le modèle doit trouver.

Une fois la vidéo préparée, le système applique un type spécial de mécanisme d'attention pour décider quelles parties de l'image comptent le plus. Dans de nombreux systèmes de vision par ordinateur, le modèle peut être distrait par les caractéristiques les plus évidentes, comme les yeux ou la bouche, plutôt que par les changements de couleur subtils sur la peau. Le TempoGFormer résout cela avec un mécanisme de porte, une sorte de filtre intelligent qui se situe entre l'observation du modèle et sa prise de décision. Ce filtre agit comme un bouton de volume pour le signal. Il analyse l'attention que le modèle porte à différentes parties du visage et baisse automatiquement le volume des zones bruyantes ou non pertinentes tout en augmentant le volume des régions où le flux sanguin est le plus visible. Cela permet au système d'ignorer les distractions de mouvement et de lumière, concentrant son énergie strictement sur le signal physiologique.

Après avoir filtré le signal, le système utilise une tête spécialisée pour reconstruire la forme d'onde du rythme cardiaque. Cette partie du modèle examine les données sous plusieurs angles, en considérant à la fois le timing des battements et la fréquence du rythme. Elle combine ces différentes vues pour créer une prédiction précise de la fréquence cardiaque. Les chercheurs ont testé ce système sur trois ensembles de données publics différents, qui comprenaient des vidéos de personnes assises immobiles, jouant à des jeux et même marchant. Dans chaque test, le nouveau modèle a surpassé les méthodes existantes, y compris celles basées sur d'anciennes techniques d'apprentissage profond. Il a obtenu une plus grande précision dans l'estimation de la fréquence cardiaque et a produit un signal plus propre avec moins de bruit. Même lorsque le modèle a été entraîné sur un ensemble de vidéos et testé sur un ensemble complètement différent avec des personnes et des éclairages différents, il a maintenu son haut niveau de performance, montrant qu'il avait appris la véritable nature du battement de cœur plutôt que de simplement mémoriser des clips vidéo spécifiques.

L'étude a également examiné le coût d'exécution de ce système. Bien que le nouveau modèle soit légèrement plus complexe que certaines alternatives plus simples, il ne nécessite pas une puissance de calcul excessive. Il établit un équilibre, utilisant un nombre gérable de paramètres pour obtenir des résultats nettement meilleurs que la concurrence. Les chercheurs ont démontré qu'en affinant la façon dont le modèle prête attention à la vidéo et la façon dont il traite les données temporelles, il est possible d'extraire des signes vitaux avec un niveau de précision qui était auparavant difficile à atteindre sans contact physique. Ce travail suggère que, dans un avenir proche, les caméras pourraient devenir des outils standards pour le suivi de la santé, capables de suivre la fréquence cardiaque dans les hôpitaux, les salles de sport ou même à domicile, le tout sans aucun fil ou capteur attaché au corps. Les conclusions offrent une étape prometteuse pour rendre le suivi de la santé plus accessible et moins intrusif pour tout le monde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →