← Derniers articles
⚡ electrical engineering

Food Portion Estimation: From Pixels to Calories

Cet article explore diverses stratégies, incluant les entrées auxiliaires et les techniques d'apprentissage profond, afin de surmonter le défi de l'estimation des portions alimentaires en trois dimensions à partir d'images en deux dimensions pour une évaluation diététique précise et la prévention des maladies chroniques.

Auteurs originaux : Gautham Vinod, Fengqing Zhu

Publié 2026-02-06
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Gautham Vinod, Fengqing Zhu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de deviner la quantité de nourriture sur une assiette rien qu'en regardant une photographie plate. C'est un peu comme essayer de deviner la taille d'une véritable montagne en regardant simplement un dessin de celle-ci sur une feuille de papier. Vous savez que la montagne est grande, mais est-ce une petite colline ou un sommet massif ? Sans règle ou objet connu pour comparaison, il est impossible de le dire avec certitude.

Ce document, intitulé « Food Portion Estimation: From Pixels to Calories » (Estimation des portions alimentaires : des pixels aux calories), est une revue de la manière dont les scientifiques tentent de résoudre ce problème de la « photo plate vs nourriture réelle ». L'objectif est d'aider les gens à suivre ce qu'ils mangent pour rester en bonne santé, mais le faire en prenant simplement une photo est délicat car les appareils photo perdent la « profondeur » (la distance par rapport à l'objet) lorsqu'ils prennent une photo en 2D.

Voici une décomposition des stratégies abordées dans le document, utilisant des analogies simples :

1. L'ancienne méthode : Utiliser des « règles magiques » et des caméras spéciales

Au début, les scientifiques ont essayé de résoudre le problème de la « photo plate » en ajoutant des outils supplémentaires, un peu comme un menuisier qui ajouterait un niveau à une scie.

  • Capteurs de profondeur spéciaux : Certains systèmes utilisaient des caméras spéciales (comme l'ancien Microsoft Kinect) qui pouvaient « voir » la profondeur en projetant des motifs de lumière invisibles sur la nourriture.
    • Le hic : C'est comme essayer de mesurer un miroir ou un bol de soupe avec un laser ; la lumière rebondit ou disparaît, ce qui confond le capteur. De plus, ces caméras encombrantes ne sont pas du genre à vouloir emporter avec soi à chaque repas.
  • Numérisation à 360 degrés : Une autre méthode demandait aux utilisateurs de faire le tour de leur assiette et de prendre de nombreuses photos, comme un photographe tournant autour d'une statue. L'ordinateur assemble ensuite ces photos pour construire un modèle 3D.
    • Le hic : C'est trop de travail pour une personne affamée. De plus, si la nourriture est molle ou recouverte par d'autres aliments (occlusion), l'ordinateur ne peut pas voir les parties cachées et doit deviner, ce qui entraîne des erreurs.
  • Correspondance de modèles (Template Matching) : Cette approche revient à essayer de faire correspondre un emporte-pièce à une boule de pâte. L'ordinateur possède un modèle 3D parfait d'un burger ou d'une pomme « standard » et tente de le rétrécir ou de l'étirer pour qu'il corresponde à la photo.
    • Le hic : La nourriture réelle est désordonnée. Si quelqu'un a pris une bouchée du burger ou si la croûte est repliée bizarrement, l'emporte-pièce parfait ne convient plus, ce qui conduit à des mesures erronées.

2. La nouvelle méthode : Le « coup de devinette super-intelligent » (Apprentissage profond)

Récemment, les scientifiques ont cessé d'essayer de construire des modèles 3D parfaits et ont commencé à apprendre aux ordinateurs à être très doués pour deviner. C'est le passage au « Deep Learning » (apprentissage profond).

  • Prédiction de profondeur monoculaire : Au lieu d'avoir besoin d'une caméra spéciale, l'ordinateur regarde une seule photo et utilise ce qu'il a « appris » de millions d'autres photos de nourriture pour deviner la profondeur.
    • L'analogie : C'est comme un chef expérimenté qui peut regarder un tas de pâtes et instantanément savoir quelle quantité il y a là, simplement grâce à la forme et aux ombres, sans avoir besoin de mesurer. L'ordinateur apprend ces règles d'« ombres et de formes » à partir de vastes ensembles de données.
  • Régression directe de l'énergie : Certains systèmes sautent l'étape de la supposition 3D. Ils regardent la photo et passent directement à l'affirmation : « Cela ressemble à 300 calories ».
    • L'analogie : C'est comme un sommelier qui goûte un vin et nomme immédiatement le millésime et le prix, plutôt que d'analyser d'abord sa composition chimique.
  • Champs de radiance neuronale (NeRFs) : Il s'agit de la technologie de pointe. Au lieu de construire un maillage 3D solide, elle traite la nourriture comme un nuage continu de couleur et de densité.
    • L'analogie : Imaginez un hologramme capable de combler les lacunes. Même si vous ne voyez que l'avant d'un bol de soupe, cette technologie peut « imaginer » l'arrière et le liquide à l'intérieur, en se basant sur ce qu'elle a appris sur l'apparence habituelle des soupes, gérant mieux les choses délicates comme la vapeur ou les liquides transparents que les anciennes méthodes.

3. Les obstacles persistants

Même avec ces outils d'IA intelligents, le document souligne trois grands problèmes qui doivent encore être résolus :

  • Le problème d'échelle (Le problème du « Où est la règle ? ») : Si vous voyez une minuscule pizza sur une photo, est-ce une mini-pizza proche de la caméra ou une pizza géante loin de celle-ci ? L'ordinateur ne le sait pas, à moins qu'il n'y ait un objet connu (comme une carte de crédit) dans l'image pour servir de règle. Le document note que l'IA actuelle a du mal lorsqu'il n'y a pas d'objets familiers pour comparer.
  • Le problème d'occlusion (Le problème du « Fond caché ») : On ne peut pas voir le fond de la nourriture touchant l'assiette, ni la garniture à l'intérieur d'un burrito. L'ordinateur doit deviner ce qui est caché.
    • L'idée future : Le document suggère que l'IA future pourrait utiliser la « complétion amodale », qui est comme un détective utilisant des indices pour reconstruire une scène de crime qui n'a pas été entièrement vue. Elle pourrait aussi apprendre de vos habitudes alimentaires personnelles pour faire de meilleures suppositions sur ce qui se trouve à l'intérieur.
  • L'écart de densité (Le problème du « Moelleux vs Brique ») : Le volume n'est pas la même chose que le poids. Un croissant moelleux occupe beaucoup d'espace mais contient moins de calories qu'un bagel dense de même taille.
    • L'idée future : Le document suggère d'utiliser des IA avancées (modèles de langage étendus) capables de lire des descriptions textuelles (comme « faible en glucides » ou « dense ») en plus de la photo pour déterminer le poids et les calories plus précisément.

L'essentiel

Le document conclut que nous sommes passés de la nécessité de matériel encombrant et coûteux à l'utilisation de logiciels intelligents qui fonctionnent avec un téléphone standard. Bien que cela facilite grandement l'utilisation pour les gens, ce n'est pas encore parfait. La technologie s'améliore pour deviner les parties cachées et le poids de la nourriture, mais elle éprouve encore des difficultés lorsqu'il n'y a pas de référence claire pour indiquer la taille réelle de l'aliment. L'objectif est de rendre le suivi de la consommation alimentaire aussi simple que de prendre une photo, afin d'aider les gens à gérer leur santé sans les tracas de la saisie manuelle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →