← नवीनतम पेपर
💻 computer science

Ingredient-Level Food Image Segmentation for Nutrition Awareness

यह शोध पत्र FoodSeg103 डेटासेट के लिए एक SegFormer-आधारित सामग्री-स्तरीय सिमेंटिक सेगमेंटेशन सिस्टम प्रस्तुत करता है जो एक छोटे बेसलाइन मॉडल से बेहतर प्रदर्शन करता है और विशिष्ट पोषण संबंधी मूल्यों का अनुमान लगाए बिना पोषण जागरूकता का समर्थन करने के लिए अनुमानित मास्क को दृश्य सामग्री-क्षेत्र प्रतिशत में परिवर्तित करता है।

मूल लेखक: Jonesh Shrestha

प्रकाशित 2026-06-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jonesh Shrestha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक स्वादिष्ट, जटिल व्यंजन की प्लेट देख रहे हैं। एक मानक कंप्यूटर प्रोग्राम उस तस्वीर को देखकर बस इतना कह सकता है, "यह एक सलाद है।" लेकिन यह एक सिम्फनी ऑर्केस्ट्रा का वर्णन केवल यह कहकर करने जैसा है कि, "यह संगीत है।" यह उन सभी व्यक्तिगत वाद्ययंत्रों को छोड़ देता है जो अपनी अलग भूमिका निभा रहे हैं।

यह शोध पत्र इस बारे में है कि कंप्यूटर को केवल व्यंजन का नाम बताने से कहीं अधिक कुछ करना सिखाया जाए। यह चाहता है कि कंप्यूटर एक अति-सटीक खाद्य कलाकार (super-precise food artist) की तरह कार्य करे जो एक फोटो को देख सके और उसके हर एक छोटे से हिस्से को रंग-कोड (color-code) कर सके: "यहाँ चावल है, यहाँ चिकन है, यहाँ सॉस है, और यहाँ ब्रोकली है।"

यहाँ विवरण दिया गया है कि लेखक, जोन्श श्रेष्ठ (Jonesh Shrestha) ने वास्तव में क्या किया और क्या पाया:

लक्ष्य: "एक लेबल" से "पिक्सेल-दर-पिक्सेल" तक

अधिकांश फूड ऐप्स केवल पूरे भोजन के नाम का अनुमान लगाते हैं। यह अध्ययन इससे कहीं अधिक गहराई में जाना चाहता था। वे एक ऐसा सिस्टम बनाना चाहते थे जो एक फोटो को देखे और एक ऐसा मानचित्र (map) बनाए जहाँ प्रत्येक पिक्सेल (छवि को बनाने वाले सूक्ष्म बिंदु) को उसके विशिष्ट घटक (ingredient) के साथ लेबल किया गया हो।

इसे एक कलरिंग बुक (रंग भरने वाली किताब) की तरह समझें। कंप्यूटर केवल यह कहने के बजाय कि "यह एक बर्गर की तस्वीर है," वास्तव में बन (bun) को एक रंग, पैटी को दूसरा रंग, लेट्यूस को तीसरा रंग और चीज़ को चौथा रंग देता है।

उपकरण: दो "मस्तिष्क" मॉडल

यह करने के लिए, लेखक ने SegFormer नामक एक स्मार्ट कंप्यूटर मस्तिष्क के दो संस्करणों का उपयोग किया।

  • छोटा मस्तिष्क (Seglement-B0): एक हल्का, तेज़ संस्करण। इसे एक ऐसे छात्र के रूप में सोचें जो बुद्धिमान तो है लेकिन शायद थोड़ा थका हुआ है।
  • बड़ा मस्तिष्क (SegFormer-B1): एक बड़ा, अधिक शक्तिशाली संस्करण। इसे एक ऐसे छात्र के रूप में सोचें जिसने अधिक अध्ययन किया है और जिसकी याददाश्त बड़ी है।

लेखक ने इन दोनों मस्तिष्क मॉडलों को FoodSeg103 (खाद्य चित्रों का एक विशाल संग्रह जहाँ प्रत्येक घटक पहले से ही मनुष्यों द्वारा लेबल किया गया है) नामक डेटासेट का उपयोग करके बिल्कुल एक ही प्रशिक्षण पाठ्यक्रम से गुजारा। एकमात्र अंतर मस्तिष्क का आकार था; बाकी सब कुछ (डेटा, नियम, प्रशिक्षण में लगा समय) बिल्कुल समान रहा।

परिणाम: बड़ा मस्तिष्क विजेता है

जब परीक्षा हुई, तो बड़े मस्तिष्क (B1) ने हर मामले में छोटे मस्तिष्क से बेहतर प्रदर्शन किया।

  • सटीकता (Accuracy): बड़े मस्तिष्क ने लगभग 79% पिक्सेल सही पहचाने, जबकि छोटे मस्तिष्क ने लगभग 77%
  • "ओवरलैप" स्कोर: सबसे महत्वपूर्ण स्कोर (जिसे "IoU" कहा जाता है) यह मापता है कि कंप्यूटर का रंगीन मानचित्र वास्तविक सामग्रियों से कितनी अच्छी तरह मेल खाता है। बड़े मस्तिष्क ने इस स्कोर में महत्वपूर्ण सुधार किया (0.25 से बढ़कर 0.32 हो गया)।

इसका क्या अर्थ है? बड़ा मॉडल यह समझने में बेहतर था कि एक सामग्री कहाँ समाप्त होती है और दूसरी कहाँ शुरू होती है, विशेष रूप से उन अस्त-व्यस्त व्यंजनों में जहाँ चीजें आपस में मिली हुई होती हैं।

"जादुई" आउटपुट: एक दृश्य रेसिपी

एक बार जब कंप्यूटर अपना मानचित्र बना लेता है, तो सिस्टम एक और शानदार काम करता है। यह पिक्सेल की गिनती करता है और उन्हें एक प्रतिशत सारांश (percentage summary) में बदल देता है।

कल्पना कीजिए कि कंप्यूटर आपकी फोटो देखता है और कहता है:

"ठीक है, जो मैं देख रहा हूँ उसके आधार पर, इस प्लेट में 62% गाजर, 20% चावल और 12% हरी बीन्स हैं।"

यह आपको आपके भोजन की संरचना का एक त्वरित दृश्य सारांश देता है, बिना किसी मैन्युअल वजन या कैलोरी गणना के।

वास्तविकता की जाँच: यह क्या नहीं कर सकता

लेखक इस तकनीक की सीमाओं के बारे में बहुत ईमानदार हैं।

  • यह एक 2D स्नैपशॉट है: कंप्यूटर केवल एक सपाट तस्वीर देखता है। उसे यह नहीं पता कि भोजन कितना मोटा है या कितना भारी है। चावल की एक पतली परत और चावल का एक गहरा कटोरा फोटो में चावल की समान मात्रा के रूप में दिख सकते हैं।
  • कोई जादुई पोषण तथ्य नहीं: लेखक स्पष्ट रूप से कहते हैं कि यह सिस्टम कैलोरी, वसा, प्रोटीन या सटीक भाग आकार (portion sizes) की गणना नहीं करता है। यह आपको नहीं बता सकता कि भोजन में कितनी कैलोरी है।
  • यह एक "प्रथम चरण" है: इसे एक सहायक के रूप में समझें जो आपको आपके प्लेट पर क्या है, इसका एक मोटा अंदाज़ा देता है, जैसे कि "स्वस्थ खाने की प्लेट" (Healthy Eating Plate) गाइड जो दृश्य अनुपातों (जैसे "अपनी प्लेट का आधा हिस्सा सब्जियों से भरें") का सुझाव देती है। यह जागरूकता के लिए एक उपकरण है, न कि सटीक आहार ट्रैकिंग के लिए कोई चिकित्सा उपकरण।

निष्कर्ष

यह शोध पत्र यह सिद्ध करता है कि हम कंप्यूटर को खाद्य छवियों को उनके व्यक्तिगत घटकों में उचित सटीकता के साथ तोड़ने के लिए प्रशिक्षित कर सकते हैं। बड़ा मॉडल (SegFormer-B1) विजेता है, और सिस्टम एक अव्यवस्थित खाद्य फोटो को एक सरल प्रतिशत सूची (जैसे "ज्यादातर गाजर, कुछ चावल") में बदल सकता है।

हालाँकि, यह किसी पोषण विशेषज्ञ या खाद्य तराजू का विकल्प नहीं है। यह एक दृश्य उपकरण है जो आपको यह देखने में मदद करता है कि आप क्या खा रहे हैं, न कि एक कैलकुलेटर जो आपको ठीक से बताता है कि आप कितनी ऊर्जा का सेवन कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →