← नवीनतम पेपर
⚡ electrical engineering

Food Portion Estimation: From Pixels to Calories

यह शोध पत्र सटीक आहार मूल्यांकन और पुराने रोगों की रोकथाम के लिए दो-आयामी छवियों से त्रि-आयामी खाद्य भाग के आकार का अनुमान लगाने की चुनौती को दूर करने हेतु सहायक इनपुट और डीप लर्निंग तकनीकों सहित विभिन्न रणनीतियों का अन्वेषण करता है।

मूल लेखक: Gautham Vinod, Fengqing Zhu

प्रकाशित 2026-02-06
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gautham Vinod, Fengqing Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप केवल एक सपाट तस्वीर देखकर यह अनुमान लगाने की कोशिश कर रहे हैं कि प्लेट में कितना भोजन है। यह कुछ वैसा ही है जैसे किसी कागज पर बने पहाड़ के चित्र को देखकर वास्तविक जीवन के पहाड़ के आकार का अनुमान लगाना। आप जानते हैं कि पहाड़ बड़ा है, लेकिन क्या यह एक छोटा टीला है या एक विशाल शिखर? बिना किसी पैमाने (रूलर) या तुलना के लिए किसी ज्ञात वस्तु के, यह निश्चित रूप से बताना असंभव है।

यह शोध पत्र, जिसका शीर्षक "फूड पोर्शन एस्टीमेशन: फ्रॉम पिक्सल टू कैलोरीज" है, इस बात की समीक्षा है कि वैज्ञानिक इस "सपाट फोटो बनाम वास्तविक भोजन" वाली समस्या को हल करने की कोशिश कैसे कर रहे हैं। इसका लक्ष्य लोगों को स्वस्थ रहने में मदद करने के लिए उनके द्वारा खाए जाने वाले भोजन को ट्रैक करना है, लेकिन केवल एक फोटो लेकर ऐसा करना कठिन है क्योंकि कैमरे 2D फोटो लेते समय "गहराई" (चीजें कितनी दूर हैं) को खो देते हैं।

यहाँ उन रणनीतियों का विवरण दिया गया जिनकी चर्चा इस पेपर में की गई है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. पुराना तरीका: "जादुई पैमाने" और विशेष कैमरे का उपयोग करना

शुरुआत में, वैज्ञानिकों ने एक बढ़ई द्वारा आरी में लेवल जोड़ने की तरह, "सपाट फोटो" की समस्या को ठीक करने के लिए अतिरिक्त उपकरणों का उपयोग करने की कोशिश की।

  • विशेष डेप्थ सेंसर्स (Depth Sensors): कुछ सिस्टमों ने विशेष कैमरों का उपयोग किया (जैसे पुराना माइक्रोसॉफ्ट किनेक्ट) जो अदृश्य प्रकाश पैटर्न को भोजन पर प्रोजेक्ट करके "गहराई" देख सकते थे।
    • चुनौती: यह एक दर्पण या सूप के कटोरे को लेजर से मापने की कोशिश करने जैसा है; प्रकाश टकराकर वापस चला जाता है या गायब हो जाता है, जिससे सेंसर भ्रमित हो जाता है। साथ ही, ये भारी-भरकम कैमरे ऐसी चीज़ नहीं हैं जिन्हें आप हर भोजन के साथ अपने पास रखना चाहें।
  • 360-डिग्री स्कैनिंग: एक अन्य विधि में उपयोगकर्ताओं को अपनी प्लेट के चारों ओर घूमने और कई तस्वीरें लेने के लिए कहा गया, जैसे कि कोई फोटोग्राफर किसी मूर्ति के चारों ओर घूमता है। कंप्यूटर फिर इन तस्वीरों को जोड़कर एक 3D मॉडल बनाता है।
    • चुनौती: एक भूखे व्यक्ति के लिए यह बहुत अधिक काम है। इसके अलावा, यदि भोजन नरम है या अन्य भोजन से ढका हुआ है (occlusion), तो कंप्यूटर छिपे हुए हिस्सों को नहीं देख पाता है और उन्हें अनुमान लगाना पड़ता है, जिससे त्रुटियां होती हैं।
  • टेम्पलेट मैचिंग (Template Matching): यह दृष्टिकोण एक आटे के लोई पर कुकी कटर फिट करने की कोशिश करने जैसा है। कंप्यूटर के पास एक "मानक" बर्गर या सेब का एक आदर्श 3D मॉडल होता है और वह फोटो से मेल खाने के लिए उसे सिकोड़ने या खींचने की कोशिश करता है।
    • चुनौती: असली भोजन अव्यवस्थित होता है। यदि किसी ने बर्गर का एक हिस्सा खा लिया है या उसकी क्रस्ट अजीब तरह से मुड़ी हुई है, तो वह आदर्श कुकी कटर फिट नहीं बैठता, जिससे गलत माप मिलता है।

2. नया तरीका: "सुपर-इंटेलिजेंट गेस" (डीप लर्निंग)

हाल ही में, वैज्ञानिकों ने पूर्ण 3D मॉडल बनाने के बजाय कंप्यूटर को बहुत अच्छा अनुमान लगाना सिखाना शुरू कर दिया है। यह "डीप लर्निंग" का बदलाव है।

  • मोनोकुलर डेप्थ प्रेडिक्शन (Monocular Depth Prediction): विशेष कैमरे की आवश्यकता के बजाय, कंप्यूटर एक एकल फोटो को देखता है और लाखों अन्य खाद्य चित्रों से जो उसने "सीखा" है, उसका उपयोग करके गहराई का अनुमान लगाता है।
    • उपमा: यह एक अनुभवी शेफ की तरह है जो पास्ता के ढेर को देखकर तुरंत जान जाता है कि वहां कितना है, केवल उसके आकार और छाया को देखकर, बिना उसे मापने की आवश्यकता के। कंप्यूटर इन "छाया और आकार" के नियमों को विशाल डेटासेट से सीखता है।
  • डायरेक्ट एनर्जी रिग्रेशन (Direct Energy Regression): कुछ सिस्टम 3D अनुमान लगाने की प्रक्रिया को पूरी तरह से छोड़ देते हैं। वे फोटो देखते हैं और सीधे यह कहते हैं कि, "यह 300 कैलोरी जैसा दिखता है।"
    • उपमा: यह एक सोमेलियर (sommelier) की तरह है जो वाइन को चखकर तुरंत उसके वर्ष और कीमत बता देता है, बजाय इसके कि पहले उसके रासायनिक संरचना का विश्लेषण करे।
  • न्यूरल रेडिएंस फील्ड्स (NeRFs): यह अत्याधुनिक तकनीक है। एक ठोस 3D मेश बनाने के बजाय, यह भोजन को रंग और घनत्व के एक निरंतर बादल (continuous cloud) के रूप में मानता है।
    • उपमा: एक होलोग्राम की कल्पना करें जो खाली जगहों को भर सकता है। भले ही आप सूप के कटोरे का केवल सामने का हिस्सा देख रहे हों, यह तकनीक यह "कल्पना" कर सकती है कि पीछे का हिस्सा और तरल पदार्थ अंदर कैसा है, क्योंकि इसने सीखा है कि सूप आमतौर पर कैसा दिखता है। यह तकनीक भाप या पारदर्शी तरल पदार्थों को पुराने तरीकों की तुलना में बेहतर तरीके से संभालती है।

3. शेष बाधाएं

इन स्मार्ट AI टूल्स के बावजूद, पेपर में तीन बड़ी समस्याओं की ओर इशारा किया गया है जिन्हें अभी भी हल करने की आवश्यकता है:

  • स्केल की समस्या (द "पैसा कहाँ है?" वाली समस्या): यदि आप फोटो में एक छोटा पिज्जा देखते हैं, तो क्या वह कैमरे के पास रखा एक मिनी-पिज्जा है, या दूर रखा एक विशाल पिज्जा? कंप्यूटर को तब तक पता नहीं चलेगा जब तक कि चित्र में तुलना के लिए कोई ज्ञात वस्तु (जैसे क्रेडिट कार्ड) न हो। पेपर नोट करता है कि वर्तमान AI संघर्ष करता है जब तुलना के लिए कोई परिचित वस्तु मौजूद नहीं होती।
  • ओक्लूजन (Occlusion) की समस्या (द "छिपे हुए तल" वाली समस्या): आप प्लेट को छूने वाले भोजन के निचले हिस्से को नहीं देख सकते, या बरिटो के अंदर की फिलिंग को नहीं देख सकते। कंप्यूटर को छिपे हुए हिस्से का अनुमान लगाना पड़ता है।
    • भविष्य का विचार: पेपर सुझाव देता है कि भविष्य का AI "अमोडल कंप्लीशन" (amodal completion) का उपयोग कर सकता है, जो एक जासूस की तरह है जो अपराध स्थल के सुरागों का उपयोग करके उस दृश्य को फिर से बनाने की कोशिश करता है जिसे पूरी तरह से नहीं देखा गया था। यह आपके व्यक्तिगत खान-पान की आदतों से सीखकर बेहतर अनुमान लगा सकता है।
  • डेंसिटी गैप (घनत्व का अंतर) (द "फ्लफी बनाम ईंट" वाली समस्या): आयतन (volume) का अर्थ वजन नहीं है। एक फ्लफी क्रोइसेंट (croissant) बहुत जगह घेरता है लेकिन उसी आकार के घने बेगल (bagel) की तुलना में इसमें कम कैलोरी होती है।
    • भविष्य का विचार: पेपर सुझाव देता है कि उन्नत AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग किया जा सकता है जो फोटो के साथ-साथ टेक्स्ट विवरण (जैसे "लो-कार्ब" या "घना") को पढ़कर वजन और कैलोरी का अधिक सटीक अनुमान लगा सके।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हम भारी, महंगे हार्डवेयर से हटकर स्मार्ट सॉफ्टवेयर की ओर बढ़ गए हैं जो एक मानक फोन कैमरे के साथ काम करता है। हालांकि यह हमें बहुत आसान बनाता है, लेकिन यह अभी भी पूर्ण नहीं है। तकनीक छिपे हुए हिस्सों और भोजन के वजन का अनुमान लगाने में बेहतर हो रही है, लेकिन यह अभी भी तब संघर्ष करती है जब कोई स्पष्ट संदर्भ (reference) नहीं होता जिससे यह बताया जा सके कि भोजन वास्तव में कितना बड़ा है। लक्ष्य भोजन के सेवन को ट्रैक करना उतना ही आसान बनाना है जितना कि एक फोटो खींचना, जिससे लोग बिना किसी परेशानी के अपने स्वास्थ्य का प्रबंधन कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →