← Últimos artigos
💻 computer science

HACI-Net: A Hybrid Attention and Channel Interaction Network for Food Image Recognition

Este artigo propõe o HACI-Net, uma rede híbrida baseada em ConvNeXt que integra mecanismos de atenção espacial, de coordenada e de canal com módulos de interação de canal para enfrentar eficazmente os desafios no reconhecimento de imagens de alimentos, alcançando precisão de estado da arte nos conjuntos de dados VireoFood-172 e ChineseFoodNet.

Autores originais: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

Publicado 2026-09-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Todos os dias, bilhões de pessoas fazem escolhas sobre o que comer, escolhas que repercutem em sua saúde, energia e bem-estar a longo prazo. Durante décadas, o rastreamento dessas escolhas dependeu da memória humana e do registro manual, um processo propenso a erros e fadiga. Nos últimos anos, cientistas recorreram aos computadores para resolver esse problema, ensinando máquinas a olhar para uma fotografia de uma refeição e identificar exatamente o que está no prato. Este campo, conhecido como reconhecimento de imagens de alimentos, visa automatizar o monitoramento dietético, ajudando as pessoas a controlar o peso, prevenir doenças crônicas e compreender sua ingestão nutricional sem o fardo da constante entrada manual de dados. No entanto, ensinar um computador a distinguir entre dois pratos muito semelhantes é notoriamente difícil. Uma tigela de macarrão pode parecer diferente dependendo da iluminação, do ângulo da câmera ou da desordem de uma colher e um guardanapo ao fundo. Além disso, as pistas visuais que os humanos usam para diferenciar os alimentos — como a textura específica de um molho ou o arranjo dos ingredientes — estão frequentemente espalhadas por diferentes camadas de dados visuais, tornando difícil para programas de computador padrão juntá-las em uma imagem clara.

Para enfrentar esses desafios persistentes, pesquisadores da Universidade de Jiangnan desenvolveram um novo sistema chamado HACI-Net. Este sistema foi projetado para olhar para imagens de alimentos da mesma forma que um observador atento faria: focando intensamente nas partes mais importantes do prato enquanto ignora o fundo de distração, e combinando cuidadosamente diferentes pistas visuais para formar uma compreensão completa. A equipe construiu seu sistema sobre uma base moderna conhecida como ConvNeXt, que já é bastante boa em reconhecer padrões em imagens. No entanto, eles descobriram que essa base sozinha não era suficiente para lidar com as diferenças sutis entre categorias de alimentos semelhantes. Para corrigir isso, eles adicionaram duas ferramentas específicas ao sistema. A primeira é um mecanismo de atenção híbrida, que atua como um holofote. Ele varre a imagem para encontrar as áreas mais significativas, como a porção principal de comida, e atenua o ruído do fundo, como pratos ou toalhas de mesa. Isso garante que o computador esteja olhando para o próprio alimento, não para o ambiente ao redor dele.

A segunda ferramenta é um módulo de interação de canais, que ajuda o sistema a conectar diferentes tipos de informações visuais. Quando um computador analisa uma imagem, ele decompõe a foto em muitos canais separados, cada um capturando um aspecto específico, como cor, forma ou textura. Em sistemas antigos, esses canais frequentemente trabalhavam isoladamente, falhando em compartilhar o que aprendiam uns com os outros. O novo módulo força esses canais a conversarem entre si, permitindo que o sistema perceba que uma cor vermelha específica e uma textura lisa específica pertencem ao mesmo ingrediente. Ao misturar esses sinais, o sistema cria uma descrição muito mais rica e precisa do alimento. Os pesquisadores testaram essa nova abordagem em duas grandes coleções de fotografias de alimentos: uma contendo 172 tipos diferentes de pratos de vários ambientes de refeição, e outra contendo 208 pratos chineses comuns que são visualmente muito semelhantes entre si.

Os resultados mostraram que essa abordagem combinada funciona significativamente melhor do que métodos anteriores. Na primeira coleção de imagens, o novo sistema identificou corretamente o alimento 94,17% das vezes. Na segunda coleção, mais difícil, onde os pratos parecem quase idênticos, ele alcançou uma precisão de 85,46%. Esses números representam uma melhoria em relação a outros modelos de computador líderes, que tiveram dificuldade em atingir esses níveis de precisão. Os pesquisadores verificaram esse sucesso criando mapas de calor visuais, que mostram exatamente onde o computador estava olhando quando tomava sua decisão. Esses mapas revelaram que o novo sistema focava agudamente nos itens de comida, enquanto modelos antigos frequentemente se distraíam com objetos de fundo. Embora o sistema seja atualmente bastante grande e exija computadores potentes para rodar, os pesquisadores reconhecem que o trabalho futuro se concentrará em torná-lo menor e mais rápido para que possa eventualmente rodar em dispositivos cotidianos, como smartphones. Por enquanto, o estudo demonstra que, ao ensinar os computadores a prestar melhor atenção e a compartilhar informações de forma mais eficaz, podemos construir ferramentas que compreendam nossas dietas com um nível de detalhe anteriormente considerado difícil de alcançar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →