HACI-Net: A Hybrid Attention and Channel Interaction Network for Food Image Recognition
Cet article propose HACI-Net, un réseau hybride basé sur ConvNeXt intégrant des mécanismes d'attention spatiale, de coordonnées et de canaux avec des modules d'interaction de canaux pour relever efficacement les défis de la reconnaissance d'images alimentaires, atteignant une précision de l'état de l'art sur les ensembles de données VireoFood-172 et ChineseFoodNet.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Chaque jour, des milliards de personnes font des choix concernant ce qu'elles mangent, des choix qui ont des répercussions sur leur santé, leur énergie et leur bien-être à long terme. Pendant des décennies, le suivi de ces choix a reposé sur la mémoire humaine et la saisie manuelle, un processus sujet à l'erreur et à la fatigue. Ces dernières années, les scientifiques se sont tournés vers l'informatique pour résoudre ce problème, apprenant aux machines à regarder une photographie d'un repas et à identifier exactement ce qui se trouve dans l'assiette. Ce domaine, connu sous le nom de reconnaissance d'images alimentaires, vise à automatiser le suivi de l'alimentation, aidant les gens à gérer leur poids, à prévenir les maladies chroniques et à comprendre leur apport nutritionnel sans le fardeau d'une saisie manuelle constante. Cependant, apprendre à un ordinateur à distinguer deux plats très similaires est notoirement difficile. Un bol de nouilles peut paraître différent selon l'éclairage, l'angle de la caméra ou l'encombrement d'une cuillère et d'une serviette en arrière-plan. De plus, les indices visuels que les humains utilisent pour distinguer les aliments — tels que la texture spécifique d'une sauce ou la disposition des ingrédients — sont souvent dispersés à travers différentes couches de données visuelles, ce qui rend difficile pour les programmes informatiques standards de les assembler en une image claire.
Pour relever ces défis persistants, des chercheurs de l'Université de Jiangnan ont développé un nouveau système appelé HACI-Net. Ce système est conçu pour regarder les images alimentaires comme le ferait un observateur attentif : en se concentrant intensément sur les parties les plus importantes du plat tout en ignorant l'arrière-plan distrayant, et en combinant soigneusement différents indices visuels pour former une compréhension complète. L'équipe a construit son système sur une base moderne appelée ConvNeXt, qui est déjà assez performante pour reconnaître les motifs dans les images. Cependant, ils ont constaté que cette base seule ne suffisait pas pour gérer les différences subtiles entre des catégories alimentaires similaires. Pour y remédier, ils ont ajouté deux outils spécifiques au système. Le premier est un mécanisme d'attention hybride, qui agit comme un projecteur. Il scanne l'image pour trouver les zones les plus significatives, telles que la portion principale de nourriture, et atténue le bruit de l'arrière-plan, comme les assiettes ou les nappes. Cela garantit que l'ordinateur regarde l'aliment lui-même, et non l'environnement qui l'entoure.
Le second outil est un module d'interaction de canaux, qui aide le système à connecter différents types d'informations visuelles. Lorsqu'un ordinateur analyse une image, il décompose l'image en de nombreux canaux distincts, chacun capturant un aspect spécifique comme la couleur, la forme ou la texture. Dans les anciens systèmes, ces canaux travaillaient souvent de manière isolée, échouant à partager ce qu'ils apprenaient les uns avec les autres. Le nouveau module force ces canaux à communiquer entre eux, permettant au système de réaliser qu'une couleur rouge spécifique et une texture lisse spécifique appartiennent au même ingrédient. En mélangeant ces signaux, le système crée une description beaucoup plus riche et précise de l'aliment. Les chercheurs ont testé cette nouvelle approche sur deux grandes collections de photographies alimentaires : l'une contenant 172 types différents de plats provenant de divers environnements de restauration, et une autre contenant 208 plats chinois courants qui sont souvent visuellement très similaires les uns aux autres.
Les résultats ont montré que cette approche combinée fonctionne nettement mieux que les méthodes précédentes. Sur la première collection d'images, le nouveau système a correctement identifié l'aliment 94,17 % du temps. Sur la seconde collection, plus difficile, où les plats se ressemblent presque de manière identique, il a atteint une précision de 85,46 %. Ces chiffres représentent une amélioration par rapport aux autres modèles informatiques de pointe, qui peinaient à atteindre de tels niveaux de précision. Les chercheurs ont vérifié ce succès en créant des cartes thermiques visuelles, qui montrent exactement où l'ordinateur regardait lorsqu'il prenait sa décision. Ces cartes ont révélé que le nouveau système se concentrait nettement sur les aliments, tandis que les anciens modèles étaient souvent distraits par les objets en arrière-plan. Bien que le système soit actuellement assez volumineux et nécessite des ordinateurs puissants pour fonctionner, les chercheurs reconnaissent que les travaux futurs porteront sur la réduction de sa taille et l'augmentation de sa vitesse afin qu'il puisse éventuellement fonctionner sur des appareils du quotidien comme les smartphones. Pour l'instant, l'étude démontre qu'en apprenant aux ordinateurs à mieux prêter attention et à partager l'information plus efficacement, nous pouvons construire des outils qui comprennent nos régimes alimentaires avec un niveau de détail auparavant jugé difficile à atteindre.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.