← Nieuwste papers
💻 computer science

HACI-Net: A Hybrid Attention and Channel Interaction Network for Food Image Recognition

Dit artikel stelt HACI-Net voor, een op ConvNeXt gebaseerd hybride netwerk dat ruimtelijke, coördinaten- en kanaalattentiemechanismen integreert met kanaalinteractiemodules om uitdagingen in voedselbeeldherkenning effectief aan te pakken, waarbij de state-of-the-art nauwkeurigheid wordt bereikt op de VireoFood-172 en ChineseFoodNet datasets.

Oorspronkelijke auteurs: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

Gepubliceerd 2026-09-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Elke dag maken miljarden mensen keuzes over wat ze eten, keuzes die doorwerken in hun gezondheid, energie en langetermijnwelzijn. Decennialang vertrouwde het bijhouden van deze keuzes op het menselijk geheugen en handmatige registratie, een proces dat gevoelig is voor fouten en vermoeidheid. In de afgelopen jaren hebben wetenschappers zich tot computers gekeerd om dit probleem op te lossen, door machines te leren naar een foto van een maaltijd te kijken en precies te identificeren wat er op het bord ligt. Dit vakgebied, bekend als voedselbeeldherkenning, heeft als doel de voedingsmonitoring te automatiseren, waardoor mensen hun gewicht kunnen beheren, chronische ziekten kunnen voorkomen en hun voedingsinname kunnen begrijpen zonder de last van constante handmatige invoer. Het is echter berucht moeilijk om een computer te leren het onderscheid te maken tussen twee zeer vergelijkbare gerechten. Een kom noedels kan er anders uitzien afhankelijk van de verlichting, de hoek van de camera of de rommel van een lepel en servet op de achtergrond. Bovendien zijn de visuele aanwijzingen die mensen gebruiken om voedsel van elkaar te onderscheiden — zoals de specifieke textuur van een saus of de schikking van ingrediënten — vaak verspreid over verschillende lagen visuele gegevens, waardoor het voor standaard computerprogramma's moeilijk is om deze samen te voegen tot een duidelijk beeld.

Om deze hardnekkige uitdagingen aan te pakken, hebben onderzoekers aan de Jiangnan Universiteit een nieuw systeem ontwikkeld genaamd HACI-Net. Dit systeem is ontworpen om naar voedselafbeeldingen te kijken zoals een zorgvuldige waarnemer dat zou doen: door intens te focussen op de belangrijkste delen van het gerecht terwijl de afleidende achtergrond wordt genegeerd, en door verschillende visuele aanwijzingen zorgvuldig te combineren om een volledig begrip te vormen. Het team bouwde hun systeem op een modern fundament genaamd ConvNeXt, dat al erg goed is in het herkennen van patronen in afbeeldingen. Ze kwamen er echter achter dat dit fundament alleen niet voldoende was om de subtiele verschillen tussen vergelijkbare voedselcategorieën aan te kunnen. Om dit op te lossen, voegden ze twee specifieke hulpmiddelen toe aan het systeem. Het eerste is een hybride aandachtmechanisme, dat werkt als een zoeklicht. Het scant de afbeelding om de meest significante gebieden te vinden, zoals het hoofdbestanddeel van het voedsel, en dimt de ruis van de achtergrond, zoals borden of tafelkleden. Dit zorgt ervoor dat de computer naar het voedsel zelf kijkt, en niet naar de omgeving die eromheen zit.

Het tweede hulpmiddel is een kanaalinteractiemodule, die het systeem helpt om verschillende soorten visuele informatie met elkaar te verbinden. Wanneer een computer een afbeelding analyseert, breekt hij het beeld af in veel afzonderlijke kanalen, die elk een specifiek aspect zoals kleur, vorm of textuur vastleggen. In oudere systemen werkten deze kanalen vaak geïsoleerd, waardoor ze niet leerden van elkaar. De nieuwe module dwingt deze kanalen om met elkaar te communicen, waardoor het systeem kan beseffen dat een specifieke rode kleur en een specifieke gladde textuur bij hetzelfde ingrediënt horen. Door deze signalen bij elkaar te mengen, creëert het systeem een veel rijker en nauwkeuriger beschrijving van het voedsel. De onderzoekers testten deze nieuwe aanpak op twee grote collecties voedselfoto's: één met 172 verschillende soorten gerechten uit diverse eetomgevingen, en een andere met 208 veelvoorkomende Chinese gerechten die visueel vaak zeer vergelijkbaar zijn.

De resultaten toonden aan dat deze gecombineerde aanpak aanzienlijk beter werkt dan eerdere methoden. Op de eerste collectie afbeeldingen identificeerde het nieuwe systeem het voedsel in 94,17% van de gevallen correct. Op de moeilijkere tweede collectie, waar gerechten bijna identiek lijken, bereikte het een nauwkeurigheid van 85,46%. Deze cijfers vertegenwoordigen een verbetering ten opzichte van andere leidende computermodellen, die moeite hadden om dit niveau van precisie te bereiken. De onderzoekers verifieerden dit succes door visuele heatmaps te maken, die laten zien waar de computer precies naar keek toen hij een beslissing nam. Deze kaarten lieten zien dat het nieuwe systeem scherp focuste op de voedselitems, terwijl oudere modellen vaak werden afgeleid door objecten op de achtergrond. Hoewel het systeem momenteel nog vrij groot is en krachtige computers vereist om te draaien, erkennen de onderzoekers dat toekomstig werk zich zal richten op het kleiner en sneller maken ervan, zodat het uiteindelijk kan draaien op alledaagse apparaten zoals smartphones. Voor nu demonstreert de studie dat door computers beter te leren opletten en informatie effectiever te laten delen, we tools kunnen bouwen die ons dieet begrijpen met een detailniveau dat voorheen moeilijk geacht werd te bereiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →