Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition
Zero-MELO est un nouveau cadre de calibration de l'évidence au moment du test qui améliore la reconnaissance de micro-gestes en mode zero-shot dans les modèles de langage de grande taille multimodaux en employant un mécanisme de recherche arborescente pour l'acquisition d'évidences visuelles fines et un module de calibration pour atténuer les biais de score, surpassant ainsi de manière significative les bases de référence existantes sur les ensembles de données de référence.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Le mouvement humain est un langage à part entière, qui ne s'exprime pas seulement par de grands gestes comme un signe de la main ou un pouce levé, mais aussi par les changements fugaces, presque invisibles, du corps. Ce sont des micro-gestes : le léger grattage d'une mâchoire, le bref croisement des doigts ou le léger pincement des lèvres. Pendant des décennies, des chercheurs ont étudié ces mouvements minuscules car ils révèlent souvent ce qu'une personne ressent ou pense avant même qu'elle ne parle. Cependant, apprendre aux ordinateurs à reconnaître ces signaux éphémères a représenté un défi tenace. Les mouvements sont trop rapides, trop petits et trop variés d'une personne à l'autre pour que les outils d'analyse vidéo standards puissent les détecter de manière fiable.
Ces dernières années, une nouvelle génération d'intelligence artificielle connue sous le nom de modèles de langage étendus multimodaux a émergé. Ces systèmes sont remarquablement doués pour comprendre les images et les vidéos de manière générale ; ils peuvent décrire une scène, identifier un chien ou expliquer un événement complexe. Pourtant, lorsque des chercheurs ont tenté d'utiliser ces modèles puissants pour repérer les mouvements subtils et spécifiques des micro-gestes, les résultats ont été décevants. Les modèles manquaient souvent l'action subtile, devinant à la place ce que la personne était censée faire en fonction de son apparence ou de ce que le modèle attendait de voir, plutôt que de se baser sur ce qui se passait réellement dans la vidéo. C'était comme si les modèles regardaient l'image globale mais échouaient à remarquer le petit détail critique qui détenait la réponse.
Une équipe de chercheurs a cherché à comprendre pourquoi ces modèles avancés échouaient devant une tâche aussi spécifique et à trouver un moyen d'y remédier sans réentraîner les modèles de zéro. Ils ont découvert que le problème n'était pas que les modèles manquaient de capacité à voir le mouvement, mais plutôt qu'ils ne regardaient pas au bon endroit et étaient induits en erreur par leurs propres attentes internes. Les modèles avaient tendance à s'appuyer trop lourdement sur les schémas linguistiques qu'ils avaient appris à partir du texte, devinant la réponse en fonction de la question plutôt qu'en fonction de la vidéo. Ils se concentraient également souvent sur les mauvaises parties du corps, manquant le mouvement spécifique de la main ou du visage qui définissait le geste.
Pour résoudre ce problème, les chercheurs ont développé une nouvelle méthode appelée Zero-MELO. Au lieu de demander au modèle de donner immédiatement une réponse unique, ils ont conçu un processus qui force le modèle à agir comme un observateur attentif. D'abord, le système demande au modèle d'examiner la vidéo et d'identifier quelles parties du corps pourraient être pertinentes, comme les mains, le visage ou le cou. Ensuite, il guide le modèle pour qu'il zoome sur ces zones spécifiques, créant une série de vues rapprochées pour recueillir de meilleures preuves. Cela s'apparente à la façon dont une personne pourrait plisser les yeux et se rapprocher d'un écran pour voir un petit détail, mais l'ordinateur fait cela de manière systématique sur l'ensemble de la vidéo.
Une fois que le modèle a rassemblé ces vues détaillées et localisées, le système applique une seconde étape pour corriger ses propres biais. Les chercheurs ont constaté que les modèles avaient souvent une forte tendance à deviner certaines réponses communes, quel que soit le contenu de la vidéo. Pour contrer cela, le système demande au modèle d'imaginer la vidéo sans aucun mouvement ni détail visuel, puis de nouveau avec seulement l'apparence statique de la personne. En comparant ces scénarios de type « et si » avec la vidéo réelle, le système peut éliminer les suppositions incorrectes du modèle et se concentrer sur la véritable preuve visuelle. Enfin, le système combine toutes les informations provenant des différentes vues zoomées et des scores corrigés pour prendre une décision finale.
Les résultats de cette approche ont été significatifs. Lors de tests sur des ensembles de données standards contenant des milliers d'exemples de micro-gestes, la nouvelle méthode a considérablement amélioré la précision des modèles. Sur un ensemble de données, le taux de réussite est passé d'environ seize pour cent à près de vingt-sept pour cent, et sur un autre, il a plus que doublé, passant de dix pour cent à plus de vingt-deux pour cent. Ces chiffres représentent un bond en avant substantiel, montrant que les modèles étaient capables de comprendre ces mouvements subtils tout au long du processus, à condition d'être guidés pour regarder de près et réfléchir avec soin.
L'étude suggère que les limites de l'intelligence artificielle actuelle pour comprendre le mouvement humain fin ne sont pas nécessairement un manque d'intelligence, mais un manque d'outils appropriés pour focaliser l'attention. En apprenant aux modèles à chercher des preuves spécifiques et à remettre en question leurs propres hypothèses, les chercheurs ont démontré que ces systèmes peuvent devenir beaucoup plus fiables pour des tâches qui exigent un œil attentif aux détails. Ce travail ne se contente pas d'améliorer une seule tâche ; il offre une nouvelle façon de penser sur la manière d'aider l'intelligence artificielle à voir le monde avec la même précision et la même attention aux détails que les humains utilisent lorsqu'ils observent le langage subtil du corps.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.