← नवीनतम पेपर
💻 computer science

HACI-Net: A Hybrid Attention and Channel Interaction Network for Food Image Recognition

यह शोध पत्र HACI-Net का प्रस्ताव करता है, जो एक ConvNeXt-आधारित हाइब्रिड नेटवर्क है जो खाद्य छवि पहचान में चुनौतियों को प्रभावी ढंग से संबोधित करने के लिए चैनल इंटरेक्शन मॉड्यूल के साथ स्थानिक (spatial), समन्वय (coordinate) और चैनल अटेंशन तंत्र को एकीकृत करता है, जिससे VireoFood-172 और ChineseFoodNet डेटासेट पर अत्याधुनिक सटीकता प्राप्त होती है।

मूल लेखक: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

प्रकाशित 2026-09-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiyong Xiao, Chaoliang Liu, Zhaohong Deng

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हर दिन, अरबों लोग इस बारे में चुनाव करते हैं कि क्या खाना है, ऐसे चुनाव जो उनके स्वास्थ्य, ऊर्जा और दीर्घकालिक कल्याण पर प्रभाव डालते हैं। दशकों तक, इन चुनावों को ट्रैक करने के लिए मानवीय स्मृति और मैन्युअल लॉगिंग पर भरोसा किया गया, जो त्रुटियों और थकान की प्रक्रिया है। हाल के वर्षों में, वैज्ञानिकों ने इस समस्या को हल करने के लिए कंप्यूटर की ओर रुख किया है, मशीनों को भोजन की एक तस्वीर देखकर यह पहचानने के लिए प्रशिक्षित किया है कि प्लेट पर वास्तव में क्या है। खाद्य छवि पहचान (food image recognition) के रूप में ज्ञात यह क्षेत्र आहार संबंधी निगरानी को स्वचालित करने का लक्ष्य रखता है, जिससे लोगों को वजन प्रबंधित करने, पुरानी बीमारियों को रोकने और निरंतर मैन्युअल प्रविष्टि के बोझ के बिना अपने पोषण संबंधी सेवन को समझने में मदद मिलती है। हालाँकि, कंप्यूटर को दो बहुत समान व्यंजनों के बीच अंतर करना सिखाना बेहद कठिन है। नूडल्स का एक कटोरा कैमरा के कोण, रोशनी या पृष्ठभूमि में चम्मच और नैपकिन की अव्यवस्था के आधार पर अलग दिख सकता है। इसके अलावा, मनुष्य जिन दृश्य संकेतों का उपयोग खाद्य पदार्थों को अलग करने के लिए करते हैं—जैसे कि सॉस की विशिष्ट बनावट या सामग्रियों की व्यवस्था—वे अक्सर विभिन्न दृश्य डेटा की अलग-अलग परतों में बिखरे होते हैं, जिससे मानक कंप्यूटर प्रोग्रामों के लिए उन्हें एक स्पष्ट चित्र में जोड़ना कठिन हो जाता है।

इन निरंतर चुनौतियों का समाधान करने के लिए, जियांगनान विश्वविद्यालय के शोधकर्ताओं ने HACI-Net नामक एक नई प्रणाली विकसित की है। यह प्रणाली भोजन की छवियों को एक सतर्क पर्यवेक्षक की तरह देखने के लिए डिज़ाइन की गई है: व्यंजन के सबसे महत्वपूर्ण हिस्सों पर ध्यान केंद्रित करके और पृष्ठभूमि के विकर्षणों को अनदेखा करके, और एक पूर्ण समझ बनाने के लिए विभिन्न दृश्य संकेतों को सावधानीपूर्वक संयोजित करके। टीम ने अपनी प्रणाली को ConvNeXt नामक एक आधुनिक आधार पर बनाया है, जो छवियों में पैटर्न पहचानने में पहले से ही काफी कुशल है। हालाँकि, उन्होंने पाया कि केवल यह आधार समान खाद्य श्रेणियों के बीच सूक्ष्म अंतरों को संभालने के लिए पर्याप्त नहीं था। इसे ठीक करने के लिए, उन्होंने प्रणाली में दो विशिष्ट उपकरण जोड़े। पहला एक हाइब्रिड अटेंशन मैकेनिज्म (hybrid attention mechanism) है, जो एक स्पॉटलाइट की तरह कार्य करता है। यह छवि को स्कैन करके सबसे महत्वपूर्ण क्षेत्रों, जैसे कि भोजन के मुख्य भाग को ढूंढता है और प्लेट या मेजपोश जैसे बैकग्राउंड के शोर को कम कर देता है। यह सुनिश्चित करता है कि कंप्यूटर भोजन के आसपास के वातावरण को नहीं, बल्कि स्वयं भोजन को देख रहा है।

दूसरा उपकरण एक चैनल इंटरेक्शन मॉड्यूल (channel interaction module) है, जो प्रणाली को विभिन्न प्रकार की दृश्य जानकारी को जोड़ने में मदद करता है। जब एक कंप्यूटर किसी छवि का विश्लेषण करता है, तो वह चित्र को कई अलग-अलग चैनलों में तोड़ देता है, जिनमें से प्रत्येक रंग, आकार या बनावट जैसे विशिष्ट पहलू को कैप्चर करता है। पुराने सिस्टम में, ये चैनल अक्सर अलग-थलग काम करते थे, और एक-दूसरे के साथ सीखी गई जानकारी साझा करने में विफल रहते थे। नया मॉड्यूल इन चैनलों को एक-दूसरे से बात करने के लिए मजबूर करता है, जिससे प्रणाली को यह समझने में मदद मिलती है कि एक विशिष्ट लाल रंग और एक विशिष्ट चिकनी बनावट एक ही सामग्री से संबंधित हैं। इन संकेतों को आपस में मिलाकर, प्रणाली भोजन का कहीं अधिक समृद्ध और सटीक विवरण तैयार करती है। शोधकर्ताओं ने इस नए दृष्टिकोण का परीक्षण भोजन की तस्वीरों के दो बड़े संग्रहों पर किया: एक जिसमें विभिन्न डाइनिंग परिवेशों से 172 अलग-अलग प्रकार के व्यंजन शामिल थे, और दूसरा जिसमें 20 योग्य सामान्य चीनी व्यंजन शामिल थे जो अक्सर दिखने में बहुत समान होते हैं।

परिणामों ने दिखाया कि यह संयुक्त दृष्टिकोण पिछले तरीकों की तुलना में काफी बेहतर काम करता है। छवियों के पहले संग्रह पर, नई प्रणाली ने 94.17% बार भोजन की सही पहचान की। दूसरे अधिक कठिन संग्रह पर, जहाँ व्यंजन लगभग एक जैसे दिखते हैं, इसने 85.46% की सटीकता प्राप्त की। ये संख्याएँ अन्य अग्रणी कंप्यूटर मॉडलों की तुलना में सुधार दर्शाती हैं, जिन्हें इस स्तर की सटीकता तक पहुँचने में संघर्ष करना पड़ा था। शोधकर्ताओं ने विज़ुअल हीटमैप्स (visual heatmaps) बनाकर इस सफलता की पुष्टि की, जो दिखाते हैं कि निर्णय लेने के समय कंप्यूटर कहाँ देख रहा था। इन मानचित्रों ने खुलासा किया कि नया सिस्टम भोजन की वस्तुओं पर तीव्रता से केंद्रित था, जबकि पुराने मॉडल अक्सर बैकग्राउंड की वस्तुओं से विचलित हो जाते थे। हालाँकि वर्तमान में यह प्रणाली काफी बड़ी है और इसे चलाने के लिए शक्तिशाली कंप्यूटरों की आवश्यकता होती है, शोधकर्ताओं ने स्वीकार किया कि भविष्य का कार्य इसे छोटा और तेज़ बनाना होगा ताकि यह अंततः स्मार्टफोन जैसे रोजमर्रा के उपकरणों पर चल सके। फिलहाल, यह अध्ययन प्रदर्शित करता है कि कंप्यूटर को बेहतर ध्यान देने और जानकारी को अधिक प्रभावी ढंग से साझा करने के लिए प्रशिक्षित करके, हम ऐसे उपकरण बना सकते हैं जो हमारे आहार को विवरण के उस स्तर के साथ समझते हैं जिसे पहले कठिन माना जाता था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →