← नवीनतम पेपर
💻 computer science

LlamaSeg: Image Segmentation via Autoregressive Mask Generation

LlamaSeg एक विजुअल ऑटोरेग्रेसिव फ्रेमवर्क है जो मास्क को नेक्स्ट-टोकन प्रेडिक्शन के लिए विजुअल टोकन के रूप में एनकोड करके कई इमेज सेगमेंटेशन कार्यों को एकीकृत करता है, जिसे बेहतर मास्क सटीकता और ओपन-वोकैबुलरी लोकलाइजेशन प्राप्त करने के लिए एक नए 2M-स्केल SA-OVRS डेटासेट और एक नवीन हॉसरडॉर्फ-आधारित मीट्रिक द्वारा समर्थित किया गया है।

मूल लेखक: Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई स्केचबुक है जो न केवल चित्र बनाती है, बल्कि आपके शब्दों को पूरी तरह से समझती भी है। यदि आप इसे कहते हैं, "बाएँ वाले बस को बनाओ," तो यह केवल अनुमान नहीं लगाती; यह उस विशिष्ट बस की सटीक रूपरेखा (आउटलाइन) पिक्सेल दर पिक्सेल बनाती है। यह LlamaSeg के पीछे का मूल विचार है, जो कंप्यूटर के लिए छवियों को समझने का एक नया तरीका है, जहाँ वह छवियों को एक ऐसी कहानी की तरह देखता है जिसे वह एक बार में एक शब्द करके लिखता है।

पुराना तरीका बनाम नया तरीका

लंबे समय से, तस्वीरों में वस्तुओं को खोजने की कोशिश करने वाले कंप्यूटरों को एक "रिले रेस" (relay race) दृष्टिकोण का उपयोग करना पड़ता था। पहले, एक AI अनुमान लगाता था कि वस्तु क्या है (जैसे "बस" कहना), फिर उस अनुमान को दूसरी, विशेष रूप से बनाई गई AI को सौंप देता था ताकि वह उसकी रूपरेखा बना सके। यह एक दोस्त से कार का वर्णन करने के लिए कहने जैसा है, और फिर उस विवरण को दूसरे दोस्त को उसे बनाने के लिए सौंपने जैसा है। यह काम करता है, लेकिन यह बोझिल है और इसके लिए दो अलग-अलग विशेषज्ञों की आवश्यकता होती है।

अन्य तरीकों ने निर्देशांकों (coordinates) की सूची बनाकर रूपरेखा बनाने की कोशिश की, जैसे कि कहना "बिंदु 1 से शुरू करें, बिंदु 2 पर जाएँ, फिर बिंदु 3 पर जाएँ।" लेकिन यह एक जटिल आकार को सैकड़ों छोटे चरणों की सूची बनाकर बनाने की कोशिश करने जैसा है; यह अव्यवस्थित और धीमा हो जाता है।

LlamaSeg रिले रेस और निर्देशांक सूचियों को त्याग देता है। इसके बजाय, यह मास्क (रूपरेखा) को एक दृश्य कहानी (visual story) के रूप में देखता है। यह छवि को "टोकन" नामक छोटे पहेली के टुकड़ों में तोड़ देता है। जिस तरह एक भाषा मॉडल वाक्य में अगले शब्द की भविष्यवाणी करता है, वैसे ही LlamaSeg मास्क बनाने के लिए अगले "विजुअल टोकन" की भविष्यवाणी करता है। यह ऐसा है जैसे कंप्यूटर आपके टेक्स्ट प्रॉम्प्ट से सीधे बस की रूपरेखा को एक-एक छोटे ब्लॉक के माध्यम से लिख रहा है।

गुप्त सामग्री: एक विशाल नई लाइब्रेरी

कंप्यूटर को यह सिखाने के लिए, आपको उदाहरणों की एक विशाल लाइब्रेरी की आवश्यकता होती है। लेखकों ने महसूस किया कि मौजूदा लाइब्रेरी बहुत छोटी थी या उनमें पर्याप्त विविधता नहीं थी। इसलिए, उन्होंने SA-OVRS नामक एक नई लाइब्रेरी बनाई।

SA-OVRS को 20 लाख (2 million) विभिन्न वस्तुओं वाले एक विशाल, सुपर-व्यवस्थित फोटो एल्बम के रूप में समझें। लेकिन सबसे खास बात यह है कि हर एक वस्तु को केवल "कुर्सी" या "कुत्ता" के रूप में लेबल नहीं किया गया है। प्रत्येक वस्तु का एक समृद्ध, ओपन-वोकैबुलरी विवरण है। एक कुर्सी को "टूटे पैर वाली लाल कुर्सी" के रूप में लेबल किया जा सकता है, जबकि दूसरी को "बाईं ओर की कुर्सी" कहा जा सकता है। इस डेटासेट में 5,800 से अधिक विभिन्न प्रकार के लेबल और विवरण शामिल हैं, जो रोजमर्रा की वस्तुओं से लेकर जटिल दृश्यों तक सब कुछ कवर करते हैं। उन्होंने इसे दो चरणों वाली प्रक्रिया का उपयोग करके बनाया: पहले, उन्होंने छवियों को लेबल के साथ मिलाया, और दूसरे, उन्होंने AI का उपयोग करके प्रत्येक वस्तु के लिए अद्वितीय, वर्णनात्मक वाक्य लिखे ताकि यह सुनिश्चित हो सके कि कंप्यूटर समान चीजों के बीच अंतर करना सीख सके।

यह कितनी अच्छी तरह काम करता है?

लेखकों ने LlamaSeg का परीक्षण कई मानक चुनौतियों पर किया यह देखने के लिए कि क्या यह वास्तव में पुराने तरीकों की तुलना में बेहतर चित्र बना सकता है।

  • स्कोरबोर्ड: ADE20K और COCO-Stuff जैसे सामान्य इमेज डेटासेट पर परीक्षणों में, LlamaSeg ने पिछले "विजुअल जेनेरेटिव" मॉडलों की तुलना में उच्च स्कोर प्राप्त किया। उदाहरण के लिए, उनके बड़े मॉडल (LlamaSeg-L) ने ADE20K पर 52.0 और COCO-Stuff पर 55.7 का स्कोर प्राप्त किया। यह अन्य जेनेरेटिव मॉडलों की तुलना में एक महत्वपूर्ण उछाल है, यहाँ तक कि उन मॉडलों की तुलना में भी जो बहुत बड़े हैं।
  • "एज" (किनारे) का परीक्षण: किसी वस्तु के अंदर का हिस्सा बनाना आसान है; किनारे को पूरी तरह से बनाना कठिन है। लेखकों ने इसे मापने के लिए एक नया पैमाना बनाया जिसे dAHD (औसत हॉसरडॉर्फ डिस्टेंस) कहा जाता है। कम स्कोर का अर्थ है कि किनारा वास्तविक चीज़ के अधिक करीब है। LlamaSeg ने इस परीक्षण में अविश्वसनीय रूप से कम स्कोर (जैसे, ADE20K पर 25.54) प्राप्त किया, जिसका अर्थ है कि इसकी रूपरेखा अन्य जेनेरेटिव मॉडलों की तुलना में बहुत अधिक स्पष्ट और सटीक है।
  • गति: क्योंकि LlamaSeg मास्क को एक बार में एक टोकन के रूप में लिखता है (एक वाक्य लिखने की तरह), यह कुछ पुराने समानांतर (parallel) तरीकों की तुलना में धीमा है। हालाँकि, यह अन्य जेनेरेटिव मॉडलों की तुलना में बहुत तेज़ है जो ऐसा करने की कोशिश करते हैं। उदाहरण के लिए, यह 0.250 FPS (फ्रेम प्रति सेकंड) पर चलता है, जो Unified-IO2-Large नामक प्रतिस्पर्धी मॉडल के 0.017 FPS की तुलना में एक बड़ा सुधार है।

लेखक क्या दावा नहीं कर रहे हैं

यह जानना महत्वपूर्ण है कि यह पेपर क्या नहीं कहता है। लेखक स्पष्ट रूप से इस विचार का खंडन करते हैं कि आपको भाषा मॉडल द्वारा वस्तु का अनुमान लगाने के बाद मास्क बनाने के लिए एक अलग "विशेषज्ञ" मॉडल की आवश्यकता है। वे दिखाते हैं कि एक एकल, एकीकृत प्रणाली यह पूरा काम कर सकती है।

वे यह भी सुझाव देते हैं कि जबकि उनका मॉडल चित्र बनाने में बेहतरीन है, फिर भी यह कुछ विशिष्ट "रेफरिंग सेगमेंटेशन" कार्यों में विशेष "डिस्क्रिमिनेटिव" (पुराने ज़माने के विशेषज्ञ) मॉडलों से पीछे है। वे यह दावा नहीं करते कि उन्होंने सब कुछ हल कर लिया है; वे बस यह दिखाते हैं कि यह नया "कहानी की तरह लिखने वाला" दृष्टिकोण एक शक्तिशाली, एकीकृत तरीका है जो सर्वोत्तम परिणामों के बहुत करीब पहुँच जाता है।

निचोड़ (The Bottom Line)

LlamaSeg सुझाव देता है कि यदि आप इमेज सेगमेंटेशन को एक भाषा समस्या की तरह मानते हैं—जहाँ कंप्यूटर मास्क को टोकन-दर-टोकन "लिखता" है—तो आप विभिन्न AI विशेषज्ञों की टीम की आवश्यकता के बिना अविश्वसनीय रूप से सटीक परिणाम प्राप्त कर सकते हैं। अपने नए 20 लाख नमूनों वाले डेटासेट पर प्रशिक्षण देकर, उन्होंने दिखाया कि यह तरीका पिछले जेनेरेटिव दृष्टिकोणों की तुलना में बहुत महीन, अधिक सटीक मास्क बना सकता है, जो यह सिद्ध करता है कि कभी-कभी, चित्र बनाने का सबसे अच्छा तरीका उसे लिखना होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →