← नवीनतम पेपर
💻 computer science

DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding

यह शोध पत्र DishSeg24k प्रस्तुत करता है, जो 24,096 छवियों और 278 सूक्ष्म श्रेणियों वाली खाद्य विभाजन (food segmentation) के लिए एक बड़े पैमाने का बेंचमार्क है, साथ ही FEAST, एक नवीन ट्रांसफार्मर मॉडल जो जटिल, लॉन्ग-टेल डाइनिंग परिदृश्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए सुदृढीकरण लर्निंग-निर्देशित मिक्स्चर-ऑफ-एक्सपर्ट्स और स्टोकेस्टिक एक्सपर्ट डिकोडिंग का लाभ उठाता है।

मूल लेखक: Yilin Wang, Haochen Shi, Guanyu Chen, Weiqing Min, Jinkai Zheng, Chenggang Yan, Shuqiang Jiang

प्रकाशित 2026-08-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yilin Wang, Haochen Shi, Guanyu Chen, Weiqing Min, Jinkai Zheng, Chenggang Yan, Shuqiang Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को उसकी आँखों के माध्यम से दुनिया को समझना सिखाने की कोशिश कर रहे हैं। कंप्यूटर विज़न नामक यह क्षेत्र, मशीन को देखने की क्षमता देने जैसा है, लेकिन एक ट्विस्ट के साथ: केवल यह पहचानने के बजाय कि "वहाँ एक बिल्ली है," रोबोट को उस बिल्ली के हर एक हिस्से के चारों ओर एक सटीक रूपरेखा (आउटलाइन) खींचनी होगी, उसके कान को उसकी पूंछ से, और उसकी पूंछ को उस कालीन से अलग करना होगा जिस पर वह बैठी है। इसे इमेज सेगमेंटेशन (image segmentation) कहा जाता है। यह उस सुपरपावर के पीछे है जिसके जरिए सेल्फ-ड्राइविंग कारें जान पाती हैं कि सड़क कहाँ खत्म होती है और फुटपाथ कहाँ शुरू होता है, या मेडिकल स्कैनर एक छोटे से ट्यूमर का पता लगा पाते हैं। लेकिन जहाँ रोबले कारों और बिल्लियों को पहचानने में काफी अच्छे हो रहे हैं, वे एक बिखरी हुई, स्वादिष्ट समस्या में संघर्ष कर रहे हैं: भोजन।

भोजन रोबोट के लिए इतना कठिन क्यों है? क्योंकि रात के खाने की एक प्लेट कार की तरह नहीं होती; यह एक अराजक जिग्सॉ पहेली की तरह है। एक ट्रे की कल्पना करें जिसमें चावल, स्टिर-फ्राई बीफ और टमाटर सब एक साथ घुसे हुए हैं। चावल बीफ को छू रहे हैं, बीफ टमाटरों को छू रहा है, और वे सभी एक ही प्लेट साझा कर रहे हैं। रोबोट के लिए, यह भूरे और लाल रंग का एक विशाल धब्बा मात्र है। यदि रोबोट यह नहीं बता सकता कि बीफ कहाँ समाप्त होता है और चावल कहाँ शुरू होता है, तो वह आपको यह नहीं बता पाएगा कि आपने कितना प्रोटीन खाया या आपके भोजन की लागत कितनी थी। यही फूड सेगमेंटेशन (food segmentation) की चुनौती है: कंप्यूटर को एक बिखरे हुए भोजन के थाल को सुलझाना, यह पता लगाना कि कौन सा टुकड़ा किस व्यंजन का है, और उसके चारों ओर एक सटीक रेखा खींचना, तब भी जब व्यंजन एक के ऊपर एक रखे हों और संदिग्ध रूप से एक जैसे दिख रहे हों।

यहीं पर एक नया अध्ययन आता है, जो दुनिया के सबसे बिखरे हुए डाइनिंग टेबल्स से निपटने के लिए आया है। शोधकर्ताओं ने, जिनका नेतृत्व यिलिन वांग और उनके सहयोगियों ने किया, महसूस किया कि मौजूदा कंप्यूटर प्रोग्राम विफल हो रहे थे क्योंकि उन्हें सफेद मेज पर अकेले रखे गए एकल व्यंजनों की साफ, आदर्श तस्वीरों पर प्रशिक्षित किया गया था। हालाँकि, वास्तविक जीवन एक भीड़भाड़ वाले बुफे की तरह है। इसे ठीक करने के लिए, उन्होंने DishSeg24k नामक एक विशाल नया प्रशिक्षण पुस्तकालय बनाया। यह केवल कुछ तस्वीरें नहीं हैं; यह 24,096 छवियों का एक संग्रह है जिसमें 112,281 अलग-अलग खाद्य पदार्थ और 278 विभिन्न प्रकार के व्यंजन शामिल हैं, जिन्हें वास्तविक, व्यस्त रेस्टोरेंट्स और कैंटीन में कैप्चर किया गया है। उन्होंने इसमें दुर्लभ, क्षेत्रीय विशिष्टताओं की एक लंबी सूची भी शामिल की ताकि यह सुनिश्चित हो सके कि रोबोट केवल चावल और नूडल्स जैसे सबसे आम खाद्य पदार्थों को ही न पहचाने।

लेकिन एक बेहतरीन लाइब्रेरी होना ही काफी नहीं है; रोबोट को सोचने का एक नया तरीका चाहिए। लेखकों ने FEAST (Food Expert-Adaptive Segmentation Transformers) नामक एक नई विधि प्रस्तावित की। पुराने तरीके से रोबोट को सिखाने को एक कठोर, चरण-दर-चरण निर्देश पुस्तिका की तरह समझें: "चरण 1: लाल धब्बे को देखें। चरण 2: मान लें कि यह टमाटर है।" यदि रोबोट चरण 1 में गलती करता है, तो वह फंस जाता है। हालाँकि, FEAST इस प्रक्रिया को विशेषज्ञों की एक टीम द्वारा खेले जाने वाले "20 सवाल" (20 Questions) के खेल की तरह मानता है। एक एकल, सीधे पथ का पालन करने के बजाय, रोबोट खुद से पूछता है, "क्या होगा अगर यह लाल धब्बा वास्तव में टमाटर सॉस है, या शायद बीफ का एक टुकड़ा?" यह अलग-अलग संभावनाओं को तलाशता है, जैसे कि एक जासूस अलग-अलग सिद्धांतों को आजमा रहा हो।

इसे काम करने के योग्य बनाने के लिए, शोधकर्ताओं ने रोबोट के दिमाग के अंदर एक "विशेषज्ञों की टीम" दी। विशेषज्ञों के एक समूह की कल्पना करें: एक तरल सॉस को पहचानने में माहिर है, दूसरा कुरकुरी बनावट (textures) का विशेषज्ञ है, और तीसरा ओवरलैपिंग प्लेटों को संभालने में कुशल है। जब रोबोट भोजन के एक भ्रमित करने वाले ढेर को देखता है, तो वह केवल एक विशेषज्ञ को नहीं चुनता; बल्कि वह एक स्मार्ट मैनेजर को यह तय करने देता है कि उस विशिष्ट क्षण के लिए किन विशेषज्ञों की बात सुननी है। इसे मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts - MoE) सिस्टम कहा जाता है। यह सुनिश्चित करने के लिए कि यह टीम संतुलित रहे और वे सभी केवल सबसे आम भोजन (जैसे चावल) पर सहमत न हो जाएं, शोधकर्ताओं ने रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) से प्रेरित एक तकनीक का उपयोग किया। यह एक कोच की तरह है जो टीम को एक कठिन सीमा को सही ढंग से अलग करने पर हाई-फाइव (एक इनाम) देता है और भ्रमित होने पर एक कोमल "फिर से प्रयास करें" कहता है, जिससे वे वास्तविक समय में अपनी गलतियों से सीख सकें।

परिणाम प्रभावशाली हैं। उनके नए, बिखरे हुए डेटासेट पर परीक्षण किए जाने पर, इस नए "विशेषज्ञों की टीम" वाले दृष्टिकोण ने पिछले सर्वश्रेष्ठ तरीकों को महत्वपूर्ण अंतर से पीछे छोड़ दिया। इसने एक प्रमुख माप में खाद्य पदार्थों को अलग करने की सटीकता को 3.21% से, दूसरे में 3.68% से, और तीसरे में 4.00% से सुधारा। शोधकर्ताओं ने अपने तरीके का परीक्षण FoodSeg103 नामक एक पुराने, छोटे डेटासेट पर भी किया, और यह वहां भी प्रतिस्पर्धा में बेहतर प्रदर्शन करता रहा, जिससे पता चलता है कि सोचने का यह नया तरीका अन्य प्रकार की बिखरी हुई छवियों के लिए भी काम कर सकता है।

संक्षेप में, यह पेपर हमें केवल भोजन का एक बड़ा फोटो एल्बम ही नहीं देता; बल्कि यह रोबोट को एक बिखरे हुए भोजन को देखने का एक स्मार्ट, अधिक लचीला तरीका भी देता है। एक विशाल, वास्तविक डेटासेट और एक निर्णय लेने वाली प्रणाली को जोड़कर, जो विभिन्न संभावनाओं को तलाश सकती है और विशिष्ट विशेषज्ञों की एक टीम से सीख सकती है, लेखकों ने कंप्यूटरों के लिए एक वास्तविक दुनिया के जटिल, स्वादिष्ट और बिखरे हुए भोजन को वास्तव में समझने का एक आशाजनक मार्ग दिखाया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →