DietDelta: A Vision-Language Approach for Dietary Assessment via Before-and-After Images
यह शोध पत्र DietDelta का प्रस्ताव करता है, जो एक विजन-लैंग्वेज फ्रेमवर्क है जो सटीक रूप से खाद्य-वस्तु-स्तर के उपभोग का अनुमान लगाने के लिए युग्मित 'पहले और बाद' की छवियों और प्राकृतिक भाषा प्रॉम्प्ट्स का लाभ उठाता है, जिसमें गहराई सेंसर या सेगमेंटेशन मास्क जैसे प्रतिबंधात्मक इनपुट की आवश्यकता नहीं होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप आज आपने कितना खाया है, इसका हिसाब रखने की कोशिश कर रहे हैं। आमतौर पर, आपको अंदाज़ा लगाना पड़ता है, डायरी में लिखना पड़ता है, या खाना खाने से पहले उसकी फोटो लेनी पड़ती है। लेकिन यहाँ एक समस्या है: खाने की भरी हुई प्लेटों की तस्वीरें आपको यह नहीं बतातीं कि आपने वास्तव में क्या खाया है। हो सकता है कि आपने पास्ता का आधा हिस्सा प्लेट में ही छोड़ दिया हो, या आपने केक का एक बड़ा टुकड़ा खा लिया हो लेकिन केवल एक छोटी सी फोटो ली हो।
वर्तमान कंप्यूटर प्रोग्राम जो आपके कैलोरी का अनुमान लगाने की कोशिश करते हैं, वे आंखों पर पट्टी बांधे हुए शेफ की तरह हैं। वे भरी हुई प्लेट की तस्वीर देखते हैं और कुल वजन का अनुमान लगाते हैं, लेकिन वे आपको ठीक से यह नहीं बता सकते कि आपने "चिकन" का कितना हिस्सा खाया बनाम कितना "चावल" पीछे छोड़ दिया। उन्हें काम करने के लिए विशेष 3D कैमरों या कई कोणों (angles) की आवश्यकता होती है, जो कष्टप्रद और अव्यावहारिक है।
पेश है DietDelta, एक नया AI सिस्टम जो एक अति-सतर्क पोषण विशेषज्ञ (nutritionist) की तरह काम करता है जिसके पास एक जादुई आवर्धक लेंस (magnifying glass) है।
मुख्य विचार: "पहले और बाद" की ट्रिक
केवल पूरी प्लेट को देखने के बजाय, DietDelta दो तस्वीरों को देखता है:
- "पहले" की फोटो: पूरी मील (खाना)।
- "बाद" की फोटो: खाली (या बिखरी हुई) प्लेट।
इन दोनों की तुलना करके, AI गणना कर सकता है कि वास्तव में क्या गायब हुआ। यह एक जासूस की तरह रहस्य सुलझाने जैसा है: "चिकन यहाँ था, अब यह गायब है। चावल अभी भी वहीं है। इसलिए, आपने चिकन खाया है।"
यह कैसे काम करता है: "टेक्स्ट-सर्च" सादृश्य (Analogy)
अधिकांश AI मॉडल भोजन को खोजने के लिए इमेज को छोटे-छोटे पहेली के टुकड़ों (segmentation) में काटने की कोशिश करते हैं। यह एक किताब में किसी विशिष्ट शब्द को खोजने के लिए हर एक अक्षर को काटने जैसा है। यह धीमा और अव्यवस्थित है।
DietDelta कुछ अधिक स्मार्ट करता है। यह प्राकृतिक भाषा (Natural Language) का उपयोग एक सर्च बार के रूप में करता है।
- पुराना तरीका: "उन सभी पिक्सेल को खोजें जो भोजन जैसे दिखते हैं।"
- DietDelta का तरीका: आप टाइप करते हैं, "मुझे चिकन का वजन दिखाओ।"
AI इस टेक्स्ट प्रॉम्प्ट का उपयोग एक फ्लैशलाइट की तरह करता है। यह "पहले" की फोटो और "बाद" की फोटो में विशेष रूप से चिकन पर रोशनी डालता है। यह ब्रोकली, प्लेट और मेज को अनदेखा कर देता है। यह केवल चिकन पर ध्यान केंद्रित करता है, गणना करता है कि कितना गायब हुआ, और आपको उसका वजन बताता है।
दो-चरणीय प्रशिक्षण (The "School" Analogy)
शोधकर्ताओं ने इस AI को दो चरणों में सिखाया, जैसे कि एक छात्र नया कौशल सीख रहा हो:
चरण 1: बुनियादी बातें सीखना (पूर्ण वजन - Absolute Weight)
AI को हजारों भरी हुई भोजन की तस्वीरें दिखाई जाती हैं जिनमें लेबल होता है, "यह 200 ग्राम चिकन है।" यह पहचानना सीखता है कि चिकन कैसा दिखता है और आमतौर पर कितना भारी होता है। यह केवल एक टेक्स्ट लेबल को पढ़कर खाद्य पदार्थों को पहचानने में बहुत कुशल हो जाता है।चरण 2: अंतर सीखना (खपत - Consumption)
अब, AI को फोटो के जोड़ों (जोड़ों) के साथ दिखाया जाता है (पहले और बाद की तस्वीरें)। यह बदलावों को पहचानना सीखता है। इसे समझ आता है, "आह, 'पहले' की फोटो में चिकन का हिस्सा बड़ा है, लेकिन 'बाद' की फोटो में यह बहुत छोटा है। जो अंतर है, वही वह है जो व्यक्ति ने खाया है।"
यह एक बड़ी बात क्यों है?
- विशेष उपकरणों की आवश्यकता नहीं: आपको 3D स्कैनर या डेप्थ कैमरा की आवश्यकता नहीं है। बस एक साधारण स्मार्टफोन फोटो काम करती है।
- यह "प्लेट वेस्ट" (बचे हुए खाने) को संभालता है: यदि आप अपनी प्लेट में खाना छोड़ देते हैं, तो AI उसे देख लेता है। यह यह मान नहीं लेता कि आपने सब कुछ खा लिया। यह शुद्ध (net) सेवन की गणना करता है।
- यह सटीक है: "यह पूरा भोजन 500 कैलोरी है" का अनुमान लगाने के बजाय, यह कहता है, "आपने 150 ग्राम चिकन और 50 ग्राम चावल खाया, लेकिन आपने 100 ग्राम चावल छोड़ दिया।"
परिणाम
शोधकर्ताओं ने इसका परीक्षण तीन अलग-अलग सार्वजनिक डेटासेट्स पर किया। इसके परिणाम ऐसे थे जैसे एक स्प्रिंटर (धावक) मैराथन धावक को हरा रहा हो:
- पुराने तरीकों ने बड़ी गलतियाँ कीं (जैसे यह अनुमान लगाना कि आपने 500 ग्राम भोजन खाया जबकि आपने केवल 100 ग्राम खाया था)।
- DietDelta अविश्वसनीय रूप से सटीक था, जिसने मौजूदा सर्वोत्तम तरीकों की तुलना में त्रुटियों को आधे से अधिक कम कर दिया।
निचोड़ (Bottom Line)
DietDelta ऐसा है जैसे आपने अपने डाइट ट्रैकर को एक्स-रे चश्मे और एक आवर्धक लेंस दे दिया हो। यह केवल पूरे भोजन का अनुमान नहीं लगाता; यह उस विशिष्ट भोजन पर ज़ूम करता जिसके बारे में आपने पूछा है, "पहले" और "बाद" की तुलना करता है, और आपको बताता है कि आपने वास्तव में क्या उपभोग किया है। यह मधुमेह (diabetes) को प्रबंधित करने, वजन घटाने, या बस स्वस्थ खाने की कोशिश करने वाले लोगों के लिए गेम-चेंजर हो सकता है, जिससे सटीक ट्रैकिंग करना केवल एक फोटो खींचने जितना आसान हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।