HACI-Net: A Hybrid Attention and Channel Interaction Network for Food Image Recognition
تقترح هذه الورقة البحثية شبكة HACI-Net، وهي شبكة هجينة قائمة على ConvNeXt تدمج آليات الانتباه المكاني والإحداثي والقنوي مع وحدات التفاعل القنوي لمعالجة التحديات في التعرف على صور الأطعمة بفعالية، محققةً دقة هي الأفضل حالياً في مجموعتي بيانات VireoFood-172 وChineseFoodNet.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في كل يوم، يتخذ مليارات البشر قرارات بشأن ما يأكلونه، وهي قرارات تترك آثاراً ممتدة على صحتهم، وطاقتهم، ورفاهيتهم على المدى الطويل. ولعقود من الزمن، اعتمد تتبع هذه الخيارات على الذاكرة البشرية والتدوين اليدوي، وهي عملية عرضة للخطأ والإرهاق. وفي السنوات الأخيرة، لجأ العلماء إلى الحواسيب لحل هذه المشكلة، حيث علموا الآلات كيفية النظر إلى صورة لوجبة وتحديد ما يوجد في الطبق بدقة. يهدف هذا المجال، المعروف باسم التعرف على صور الطعام، إلى أتمتة مراقبة النظام الغذائي، مما يساعد الناس على إدارة الوزن، والوقاية من الأمراض المزمنة، وفهم مدخولهم الغذائي دون عبء الإدخال اليدوي المستمر. ومع ذلك، فإن تعليم الكمبيوتر التمييز بين طبقين متشابهين للغاية هو أمر صعب للغاية. فقد يبدو وعاء من المعكرونة مختلفاً اعتماداً على الإضاءة، أو زاوية الكاميرا، أو وجود ملعقة ومنديل في الخلفية. علاوة على ذلك، فإن الدلائل البصرية التي يستخدمها البشر للتمييز بين الأطعى — مثل القوام المحدد للصلصة أو ترتيب المكونات — غالباً ما تكون مبعثرة عبر طبقات مختلفة من البيانات البصرية، مما يجعل من الصعب على البرامج الحاسوبية القياسية تجميعها في صورة واضحة.
ولمعالجة هذه التحديات المستمرة، طور باحثون في جامعة جيانغنان نظاماً جديداً يسمى HACI-Net. صُمم هذا النظام لينظر إلى صور الطعام كما يفعل المراقب المتأني: من خلال التركيز بشدة على الأجزاء الأكثر أهمية في الطبق مع تجاهل الخلفية المشتتة، ومن خلال الجمع بعناية بين الدلائل البصرية المختلفة لتكوين فهم كامل. بنى الفريق نظامهم على أساس حديث يُعرف باسم ConvNeXt، وهو نظام جيد بالفعل في التعرف على الأنماط في الصور. ومع ذلك، وجدوا أن هذا الأساس وحده لم يكن كافياً للتعامل مع الاختلافات الدقيقة بين فئات الطعام المتشابهة. ولإصلاح ذلك، أضافوا أداتين محددتين إلى النظام. الأداة الأولى هي آلية الانتباه الهجين، والتي تعمل مثل كشاف الضوء؛ فهي تمسح الصورة للعثور على المناطق الأكثر أهمية، مثل الجزء الرئيسي من الطعام، وتخفت ضجيج الخلفية، مثل الأطباق أو مفارش الطاولة. وهذا يضمن أن الكمبيوتر ينظر إلى الطعام نفسه، وليس البيئة المحيطة به.
الأداة الثانية هي وحدة التفاعل بين القنوات، والتي تساعد النظام على ربط أنواع مختلفة من المعلومات البصرية. عندما يحلل الكمبيوتر صورة ما، فإنه يفكك الصورة إلى العديد من القنوات المنفصلة، حيث تلتقط كل قناة جانباً محدداً مثل اللون أو الشكل أو الملمس. في الأنظمة القديمة، كانت هذه القنوات تعمل غالباً بشكل منعزل، وتفشل في مشاركة ما تعلمته مع بعضها البعض. أما الوحدة الجديدة فتجبر هذه القنوات على التواصل فيما بينها، مما يسمح للنظام بإدراك أن لوناً أحمر معيناً وملمساً ناعماً معيناً ينتميان إلى نفس المكون. ومن خلال خلط هذه الإشارات معاً، يخلق النظام وصفاً أغنى وأكثر دقة للطعام. اختبر الباحثون هذا النهج الجديد على مجموعتين كبيرتين من صور الطعام: إحداهما تحتوي على 172 نوعاً مختلفاً من الأطباق من بيئات تناول طعام متنوعة، والأخرى تحتوي على 208 طبقاً صينياً شائعاً غالباً ما تكون متشابهة بصرياً للغاية فيما بينها.
أظهرت النتائج أن هذا النهج المشترك يعمل بشكل أفضل بكثير من الطرق السابقة. ففي المجموعة الأولى من الصور، حدد النظام الجديد الطعام بشكل صحيح بنسبة 94.17% من المرات. وفي المجموعة الثانية الأكثر صعوبة، حيث تبدو الأطباق متطابقة تقريباً، حقق دقة بلغت 85.46%. وتمثل هذه الأرقام تحسناً عن النماذج الحاسوبية الرائدة الأخرى، والتي عانت للوصول إلى هذه المستويات من الدقة. وقد تحقق الباحثون من هذا النجاح من خلال إنشاء خرائط حرارية بصرية، والتي توضح بالضبط أين كان الكمبيوتر ينظر عندما اتخذ قراره. وكشفت هذه الخرائط أن النظام الجديد ركز بحدة على عناصر الطعام، بينما تشتتت النماذج الأقدم غالباً بالأجسام الموجودة في الخلفية. وبينما يعد النظام حالياً كبيراً جداً ويتطلب أجهزة كمبيوتر قوية لتشغيله، يقر الباحثون بأن العمل المستقبلي سيركز على جعله أصغر وأسرع حتى يمكن تشغيله في نهاية المطاف على الأجهزة اليومية مثل الهواتف الذكية. وفي الوقت الحالي، تثبت الدراسة أنه من خلال تعليم الحواسيب الانتباه بشكل أفضل ومشاركة المعلومات بفعالية أكبر، يمكننا بناء أدوات تفهم أنظمتنا الغذائية بمستوى من التفاصيل كان يُعتقد سابقاً أنه صعب التحقيق.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.