← Derniers articles
💻 computer science

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

Ce document présente OliveGemma, un modèle vision-langage de 3 milliards de paramètres affiné sur un ensemble de données alimentaires européennes unifié, qui atteint une précision supérieure dans la reconnaissance des plats et des ingrédients méditerranéens et européens, surpassant à la fois les modèles de base CNN traditionnels et des modèles frontières propriétaires nettement plus grands.

Auteurs originaux : Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

Publié 2026-08-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où votre téléphone pourrait regarder la photo de votre déjeuner et savoir instantanément exactement ce que vous avez mangé, jusqu'aux herbes spécifiques dans la sauce. Ce n'est pas seulement un tour de magie amusant ; c'est une révolution potentielle pour la façon dont nous suivons notre santé. Pendant des décennies, les scientifiques ont tenté d'apprendre aux ordinateurs à reconnaître la nourriture, mais c'est un travail notoirement complexe. Imaginez cela comme essayer de trier une pile de jumeaux identiques : une pizza avec du fromage supplémentaire ressemble presque à une pizza avec moins de fromage, et une « salade grecque » dans un pays peut sembler totalement différente d'une « salade grecque » dans un autre. Les programmes informatiques traditionnels, qui sont comme des suiveurs de règles rigides, se confondent souvent face à ces infimes différences. Cependant, un nouveau type de technologie appelé « Modèle de Vision-Langage » (VLM) change la donne. Au lieu de simplement mémoriser des images, ces modèles sont comme des étudiants super intelligents qui ont lu des millions de livres sur la nourriture et regardé des millions de photos. Ils peuvent comprendre qu'un plat est une « pizza » non pas seulement grâce à sa forme ronde, mais parce qu'ils comprennent le concept de pâte, de fromage et de sauce tomate travaillant ensemble. Cet article examine si nous pouvons apprendre à l'un de ces étudiants intelligents à devenir un expert de classe mondiale de la cuisine méditerranéenne et européenne sans avoir besoin d'un superordinateur de la taille d'une maison.

Voici OliveGemma, un nouvel expert spécialisé en reconnaissance alimentaire créé par des chercheurs de l'Université d'Ioannina. Vous pouvez considérer OliveGemma comme un petit cerveau super efficace construit sur une base massive et open-source appelée PaliGemma-2-3B. Alors que le cerveau original possède environ 3 milliards de « neurones » (paramètres), les chercheurs ne voulaient pas réentraîner l'ensemble de la structure — cela reviendrait à vouloir réécrire une encyclopédie entière juste pour mettre à jour la recette de la lasagne. Au lieu de cela, ils ont utilisé une astuce ingénieuse appelée LoRA (Low-Rank Adaptation). Imaginez que le grand cerveau est une immense bibliothèque, et que LoRA est un petit bloc-notes adhésif que les chercheurs attachent aux étagères. Ils écrivent uniquement de nouvelles notes sur ce bloc-notes, apprenant à la bibliothèque comment reconnaître des plats spécifiques comme la « salade grecque » ou le « tiramisu » sans modifier les livres originaux.

L'équipe a entraîné ce cerveau « adhésif » sur une vaste collection de 17 340 photos de nourriture méditerranéenne et européenne, qu'ils ont nettoyées et organisées en 216 catégories spécifiques. Ils ne lui ont pas seulement demandé « Qu'est-ce que c'est ? » ; ils lui ont appris à raisonner. Ils ont posé des questions telles que : « Quels ingrédients sont probablement présents ici ? » et « Quels indices visuels vous indiquent qu'il s'agit d'une pizza et non d'un pain plat ? » Le résultat est un modèle incroyablement petit et léger — d'environ 90 mégaoctets. C'est si petit qu'il peut fonctionner sur un ordinateur ordinaire avec un processeur standard et 16 Go de RAM, ce qui signifie qu'il n'a pas besoin d'envoyer vos photos de nourriture vers un énorme serveur dans le cloud pour fonctionner. C'est un point crucial pour la confidentialité, surtout dans les hôpitaux où les données des patients doivent rester sécurisées.

Lorsque les chercheurs ont mis OliveGemma à l'épreuve, les résultats ont été étonnamment puissants. Dans une compétition directe contre les meilleurs programmes traditionnels de reconnaissance d'images (appelés CNN), OliveGemma a gagné, atteignant un taux de précision de 92,96 % dans l'identification du plat correct. C'est une amélioration de 7,31 % par rapport au concurrent traditionnel le plus fort. Mais le véritable choc est survenu lorsqu'ils ont comparé OliveGemma aux « géants » du monde de l'IA : les modèles massifs et propriétaires de Google (Gemini), OpenAI (GPT) et Anthropic (Claude). Même si ces géants sont beaucoup plus grands et ont parcouru l'intégralité d'Internet, ils ont eu du mal lorsqu'on leur a demandé de choisir parmi la même liste spécifique de 216 plats. OliveGemma les a battus par une marge énorme, surpassant le meilleur d'entre eux d'environ 18 % et certains de près de 64 %.

L'article suggère que cela se produit parce que les modèles géants sont trop généraux ; ils sont comme des médecins généralistes qui savent un peu tout sur tout, mais ne sont pas experts dans un domaine spécifique. OliveGemma, en revanche, est un spécialiste. Il a été affiné spécifiquement pour comprendre les subtiles différences entre des plats méditerranéens similaires. De plus, OliveGemma ne s'est pas contenté de deviner le nom du plat ; il pouvait également lister les ingrédients probables avec une grande précision, obtenant la liste exacte environ 90,79 % du temps. Il pouvait vous dire qu'un « tiramisu » contient du mascarpone et une génoise imbibée de café, et même deviner les ingrédients cachés comme les jaunes d'œufs et le vin de Marsala, même si vous ne pouviez pas les voir sur la photo.

Les auteurs notent prudemment que, bien qu'il s'agisse d'une avancée significative, ce n'est pas une baguette magique qui résout tous les problèmes alimentaires. Le modèle est actuellement limité aux 216 plats européens et méditerranéens sur lesquels il a été entraîné ; il ne saurait pas identifier un type spécifique de nouille d'Asie centrale. Cependant, l'étude suggère fortement que vous n'avez pas besoin d'un superordinateur basé sur le cloud valant des milliards de dollars pour obtenir des résultats de haut niveau dans des domaines spécialisés. En utilisant un petit modèle open-source et en l'enseignant de la bonne manière avec quelques millions de paramètres, les chercheurs peuvent créer des outils qui sont non seulement plus précis, mais aussi plus privés, reproductibles et accessibles à toute personne possédant un ordinateur standard. OliveGemma prouve que parfois, un petit spécialiste bien entraîné bat un géant généraliste à chaque fois.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →