← Últimos artículos
💻 computer science

HACI-Net: A Hybrid Attention and Channel Interaction Network for Food Image Recognition

Este artículo propone HACI-Net, una red híbrida basada en ConvNeXt que integra mecanismos de atención espacial, de coordenadas y de canal con módulos de interacción de canales para abordar eficazmente los desafíos en el reconocimiento de imágenes de alimentos, logrando una precisión de vanguardia en los conjuntos de datos VireoFood-172 y ChineseFoodNet.

Autores originales: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

Publicado 2026-09-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Cada día, miles de millones de personas toman decisiones sobre qué comer, decisiones que repercuten en su salud, energía y bienestar a largo plazo. Durante décadas, el seguimiento de estas elecciones ha dependido de la memoria humana y del registro manual, un proceso propenso al error y a la fatiga. En años recientes, los científicos han recurrido a las computadoras para resolver este problema, enseñando a las máquinas a mirar una fotografía de una comida e identificar exactamente qué hay en el plato. Este campo, conocido como reconocimiento de imágenes de alimentos, tiene como objetivo automatizar el monitoreo dietético, ayudando a las personas a controlar su peso, prevenir enfermedades crónicas y comprender su ingesta nutricional sin la carga de la entrada manual constante. Sin embargo, enseñar a una computadora a distinguir entre dos platos muy similares es notoriamente difícil. Un tazón de fideos puede verse diferente dependiendo de la iluminación, el ángulo de la cámara o el desorden de una cuchara y una servilleta en el fondo. Además, las pistas visuales que los humanos utilizan para diferenciar los alimentos —como la textura específica de una salsa o la disposición de los ingredientes— suelen estar dispersas en diferentes capas de datos visuales, lo que dificulta que los programas informáticos estándar puedan unirlas en una imagen clara.

Para abordar estos desafíos persistentes, investigadores de la Universidad de Jiangnan han desarrollado un nuevo sistema llamado HACI-Net. Este sistema está diseñado para mirar las imágenes de alimentos de la misma manera que lo haría un observador atento: enfocándose intensamente en las partes más importantes del plato mientras ignora el fondo que distrae, y combinando cuidadosamente diferentes pistas visuales para formar una comprensión completa. El equipo construyó su sistema sobre una base moderna conocida como ConvNeXt, la cual ya es bastante buena reconociendo patrones en imágenes. Sin embargo, descubrieron que esta base por sí sola no era suficiente para manejar las sutiles diferencias entre categorías de alimentos similares. Para solucionar esto, añadieron dos herramientas específicas al sistema. La primera es un mecanismo de atención híbrido, que actúa como un reflector. Escanea la imagen para encontrar las áreas más significativas, como la porción principal de comida, y atenúa el ruido del fondo, como platos o manteles. Esto asegura que la computadora esté mirando la comida en sí, no el entorno que la rodea.

La segunda herramienta es un módulo de interacción de canales, que ayuda al sistema a conectar diferentes tipos de información visual. Cuando una computadora analiza una imagen, descompone la foto en muchos canales separados, cada uno capturando un aspecto específico como el color, la forma o la textura. En los sistemas anteriores, estos canales solían trabajar de forma aislada, fallando al no compartir lo que aprendían entre sí. El nuevo módulo obliga a estos canales a hablar entre sí, permitiendo que el sistema se dé cuenta de que un color rojo específico y una textura suave específica pertenecen al mismo ingrediente. Al mezclar estas señales, el sistema crea una descripción mucho más rica y precisa de la comida. Los investigadores probaron este nuevo enfoque en dos grandes colecciones de fotografías de alimentos: una que contenía 172 tipos diferentes de platos de diversos entornos de comedor, y otra que contenía 208 platos comunes chinos que suelen ser visualmente muy similares entre sí.

Los resultados mostraron que este enfoque combinado funciona significativamente mejor que los métodos anteriores. En la primera colección de imágenes, el nuevo sistema identificó correctamente la comida el 94.17% de las veces. En la segunda colección, más difícil, donde los platos se ven casi idénticos, alcanzó una precisión del 85.46%. Estas cifras representan una mejora sobre otros modelos informáticos líderes, que tuvieron dificultades para alcanzar estos niveles de precisión. Los investigadores verificaron este éxito creando mapas de calor visuales, que muestran exactamente dónde estaba mirando la computadora cuando tomaba su decisión. Estos mapas revelaron que el nuevo sistema se enfocaba nítidamente en los alimentos, mientras que los modelos anteriores a menudo se distraían con objetos del fondo. Aunque el sistema es actualmente bastante grande y requiere computadoras potentes para funcionar, los investigadores reconocen que el trabajo futuro se centrará en hacerlo más pequeño y rápido para que eventualmente pueda ejecutarse en dispositivos cotidianos como teléfonos inteligentes. Por ahora, el estudio demuestra que, al enseñar a las computadoras a prestar mejor atención y a compartir información de manera más efectiva, podemos construir herramientas que comprendan nuestras dietas con un nivel de detalle que antes se consideraba difícil de lograr.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →