OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet
Dit artikel introduceert OliveGemma, een vision-language model met 3 miljard parameters dat is gefinetuned op een verenigde Europese dieetdataset en een superieure nauwkeurigheid bereikt in het herkennen van Mediterrane en Europese gerechten en hun ingrediënten, waarbij het zowel traditionele CNN-baselines als aanzienlijk grotere propriëtaire frontier-modellen overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je telefoon naar een foto van je lunch kan kijken en direct precies weet wat je hebt gegeten, tot aan de specifieke kruiden in de saus. Dit is niet zomaar een leuk trucje voor op een feestje; het is een potentiële revolutie voor hoe we onze gezondheid bijhouden. Decennialang hebben wetenschappers geprobeerd computers te leren om voedsel te herkennen, maar het is een berucht rommelige klus. Denk eraan als het proberen te sorteren van een stapel identiek uitziende tweelingen: een pizza met extra kaas ziet er bijna hetzelfde uit als een pizza met minder kaas, en een "Griekse salade" in het ene land kan er totaal anders uitzien dan een "Griekse salade" in een ander land. Traditionele computerprogramma's, die als rigide regelvolgers zijn, raken vaak in de war door deze kleine verschillen. Echter, een nieuw type technologie genaamd een "Vision-Language Model" (VLM) verandert het spel. In plaats van alleen plaatjes te onthouden, zijn deze modellen als superintelligente studenten die miljoenen boeken over voedsel hebben gelezen en miljoenen foto's hebben bekeken. Ze kunnen begrijpen dat een gerecht "pizza" is, niet alleen vanwege de ronde vorm, maar omdat ze het concept van deeg, kaas en tomatensaus begrijpen die samenwerken. Dit artikel duikt in de vraag of we een van deze slimme studenten kunnen leren om een wereldklasse expert te worden in de Mediterrane en Europese keuken zonder een supercomputer ter grootte van een huis nodig te hebben.
Maak kennis met OliveGemma, een nieuwe, gespecialiseerde expert in voedselherkenning, gecreëerd door onderzoekers van de Universiteit van Ioannina. Je kunt OliveGemma zien als een klein, uiterst efficiënt brein dat is gebouwd bovenop een enorme, open-source basis genaamd PaliGemma-2-3B. Terwijl het oorspronkelijke brein ongeveer 3 miljard "neuronen" (parameters) heeft, wilden de onderzoekers niet het hele ding opnieuw trainen — dat zou zijn alsof je een hele encyclopedie probeert te herschrijven om alleen het recept voor lasagne bij te werken. In plaats daarvan gebruikten ze een slimme truc genaamd LoRA (Low-Rank Adaptation). Stel je voor dat het grote brein een enorme bibliotheek is, en LoRA is een klein blokje plaknotities dat de onderzoekers aan de planken bevestigen. Ze schrijven alleen nieuwe notities op dit blokje, waardoor de bibliotheek leert hoe ze specifieke gerechten zoals "Griekse salade" of "tiramisu" moeten herkennen zonder de originele boeken te veranderen.
Het team trainde dit "plaknotitie-brein" op een enorme collectie van 17.340 foto's van Mediterrane en Europese gerechten, die ze hebben opgeschoond en georganiseerd in 216 specifieke categorieën. Ze vroegen het niet alleen: "Wat is dit?"; ze leerden het te redeneren. Ze stelden vragen zoals: "Welke ingrediënten zitten er waarschijnlijk in?" en "Welke visuele aanwijzingen vertellen je dat dit een pizza is en geen platbrood?". Het resultaat is een model dat ongelooflijk klein en lichtgewicht is — slechts ongeveer 90 megabyte groot. Dit is zo klein dat het kan draaien op een gewone computer met een standaard processor en 16 GB RAM, wat betekent dat het je voedselfoto's niet naar een gigantische cloudserver hoeft te sturen om te werken. Dit is een grote zaak voor de privacy, vooral in ziekenhuizen waar patiëntgegevens veilig moeten blijven.
Toen de onderzoekers OliveGemma op de proef stelden, waren de resultaten verrassend krachtig. In een directe strijd tegen de beste traditionele beeldherkenningsprogramma's (genaamd CNN's), won OliveGemma, met een nauwkeurigheid van 92,96% bij het identificeren van het juiste gerecht. Dat is een verbetering van 7,31% ten opzichte van de sterkste traditionele concurrent. Maar de echte schok kwam toen ze OliveGemma vergeleken met de "reuzen" van de AI-wereld: de enorme, propriëtaire modellen van Google (Gemini), OpenAI (GPT) en Anthropic (Claude). Hoewel die reuzen veel groter zijn en het hele internet hebben gezien, hadden ze moeite wanneer ze gevraagd werden om uit dezelfde specifieke lijst van 216 gerechten te kiezen. OliveGemma versloeg hen met een enorme marge, presteerde ongeveer 18% beter dan de beste van hen en bij sommige zelfs wel 64% meer.
Het artikel suggereert dat dit gebeurt omdat de gigantische modellen te algemeen zijn; ze zijn als huisartsen die een beetje van alles weten, maar geen expert zijn in één specifiek vakgebied. OliveGemma is daarentegen een specialist. Het is specifiek getraind om de subtiele verschillen tussen vergelijkbare Mediterrane gerechten te begrijpen. Bovendien raadde OliveGemma niet alleen de naam van het gerecht; het kon ook met hoge nauwkeurigheid de waarschijnlijke ingrediënten opsommen, waarbij het de exacte lijst in ongeveer 90,79% van de gevallen correct kreeg. Het kon je vertellen dat een "tiramisu" mascarpone en koffie-doordrenkte cake bevat, en zelfs verborgen ingrediënten zoals eierdooiers en Marsala-wijn kon raden, zelfs als je ze niet in de foto kon zien.
De auteurs merken voorzichtig op dat hoewel dit een belangrijke stap voorwaarts is, het geen toverstaf is die elk voedselprobleem oplost. Het model is momenteel beperkt tot de 216 Europese en Mediterrane gerechten waarop het is getraind; het zou niet weten hoe het een specifiek type noedel uit Centraal-Azië moet identificeren. Echter, de studie suggereert sterk dat je geen miljarden kostende, cloud-gebaseerde supercomputer nodig hebt om topresultaten te behalen in gespecialiseerde velden. Door een klein, open-source model te gebruiken en het op de juiste manier te onderwijzen met een paar miljoen parameters, kunnen onderzoekers tools creëren die niet alleen nauwkeuriger, maar ook privaat, reproduceerbaar en toegankelijk zijn voor iedereen met een standaard computer. OliveGemma bewijst dat soms een kleine, goed getrainde specialist elke keer wint van een reusachtige generalist.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.