← नवीनतम पेपर
💻 computer science

X2SAM: Any Segmentation in Images and Videos

X2SAM एक एकीकृत मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो एक LLM को मास्क मेमोरी मॉड्यूल के साथ जोड़कर किसी भी सेगमेंटेशन क्षमताओं को छवियों से वीडियो तक विस्तारित करता है, जिससे विविध सेगमेंटेशन कार्यों में संवादात्मक निर्देशों और विजुअल प्रॉम्प्ट्स दोनों से उच्च-गुणवत्तापूर्ण, टेम्पोरल रूप से सुसंगत मास्क जनरेशन सक्षम होता है।

मूल लेखक: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट असिस्टेंट है जो किसी फोटो या वीडियो को देख सकता है और आपको बता सकता है कि वास्तव में क्या हो रहा है। लंबे समय तक, ये असिस्टेंट "बड़ी तस्वीर" बताने में तो माहिर थे (जैसे "पार्क में खेलता हुआ एक कुत्ता") लेकिन वे विशिष्ट विवरणों की ओर इशारा करने में बहुत खराब थे (जैसे "कुत्ते के बाएं पंजे के चारों ओर एक घेरा बनाओ")।

दूसरी ओर, आपके पास विशेष उपकरण (specialized tools) हैं जो उन सटीक घेरे (masks) बनाने में अद्भुत हैं, लेकिन वे ऐसे रोबोट की तरह हैं जो केवल "यहाँ क्लिक करें" या "एक बॉक्स बनाएं" जैसे सरल कमांड समझते हैं। वे जटिल वाक्यों को नहीं समझ पाते जैसे, "उस कुत्ते को ढूंढो जो लाल गेंद का पीछा कर रहा है और उसके चारों ओर घेरा बनाओ।"

X2SAM वह नया "सुपर-कनेक्टर" है जो इस अंतर को पाटता है। यह एक संवादात्मक AI के मस्तिष्क को एक सटीक ड्राइंग टूल के हाथों के साथ जोड़ता है, और यह स्थिर तस्वीरों (still photos) और चलते हुए वीडियो (moving videos) दोनों के लिए काम करता है।

यहाँ बताया गया है कि यह कैसे काम करता है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. तस्वीरों और वीडियो के लिए "यूनिवर्सल ट्रांसलेटर"

X2SAM को एक यूनिवर्सल ट्रांसलेटर के रूप में सोचें जो "मानवीय भाषा" और "पिक्सेल भाषा" दोनों बोलता है।

  • पुराना तरीका: यदि आप किसी वीडियो में एक विशिष्ट वस्तु को खोजना चाहते थे, तो आपको एक उपकरण का उपयोग वीडियो को समझने के लिए और दूसरे का उपयोग आउटलाइन बनाने के लिए करना पड़ता था। वे एक-दूसरे से ठीक से बात नहीं कर पाते थे।
  • X2SAM का तरीका: आप इसके साथ स्वाभाविक रूप से बात कर सकते हैं। आप कह सकते हैं, "सफेद दीवार के पास आगे-पीछे चल रहे व्यक्ति को दिखाओ," या यहाँ तक कि अपनी स्क्रीन पर किसी स्थान की ओर इशारा करके कह सकते हैं, "इस क्षेत्र में क्या है उसे ढूंढो।" X2SAM निर्देश को समझता है और तुरंत आपके लिए आउटलाइन बना देता है, चाहे वह एक अकेली फोटो हो या 10 सेकंड का वीडियो क्लिप।

2. चलती तस्वीरों के लिए "मेमोरी बैंक"

यही वह गुप्त मंत्र (secret sauce) है जो X2SAM को वीडियो के लिए खास बनाता है।

  • समस्या: यदि आप किसी मानक AI को वीडियो में किसी व्यक्ति को ट्रैक करने के लिए कहते हैं, तो वह अक्सर प्रत्येक फ्रेम (प्रत्येक सेकंड का हिस्सा) को एक बिल्कुल नई इमेज की तरह देखता है। वह व्यक्ति को ट्रैक करना खो सकता है जब वह किसी पेड़ के पीछे जाता है या जब कैमरा हिलता है।
  • X2SAM का समाधान: X2SAM के पास एक मास्क मेमोरी मॉड्यूल (Mask Memory Module) है। इसे एक "स्टिक नोट" प्रणाली के रूप में सोचें। जैसे-जैसे वीडियो चलता है, X2SAM लिख लेता है कि पिछला फ्रेम में वस्तु कहाँ थी और उस नोट को अपनी जेब में रखता है। जब यह अगले फ्रेम को देखता है, तो यह अपने नोट्स चेक करता है और कहता है, "आह, मुझे पता है कि यह व्यक्ति अभी यहीं था, इसलिए वह शायद अभी भी यहीं होगा।" यह इसे वस्तु के चारों ओर का घेरा (outline) सुचारू और सुसंगत बनाए रखने की अनुमति देता है, भले ही वस्तु हिल रही हो, छिप रही हो, या अपना आकार बदल रही हो।

3. कार्यों का "स्विस आर्मी नाइफ"

पेपर का दावा है कि X2SAM एक ही सिस्टम के साथ कार्यों की एक विशाल विविधता को संभाल सकता है, न कि प्रत्येक काम के लिए अलग उपकरण की आवश्यकता होती है। यह कर सकता है:

  • जेनेरिक सेगमेंटेशन (Generic Segmentation): "इस तस्वीर में हर चीज़ के लिए आउटलाइन बनाओ।"
  • रेफरिंग सेगमेंटेशन (Referring Segmentation): "टोपी पहने हुए बिल्ली को ड्रा करो।"
  • रीज़निंग सेगमेंटेशन (Reasoning Segmentation): "उस वस्तु को ढूंढें जिसका उपयोग गिलास में पानी डालने के लिए किया जा सकता है।" (इसे यह समझने के लिए सोचना पड़ता है कि वह जग/पिचर है, न कि केवल "पिचर" शब्द को खोजना)।
  • विजुअल ग्राउंडेड सेगमेंटेशन (Visual Grounded Segmentation): आप स्क्रीन पर एक जगह की ओर इशारा करते हैं, और यह उस वस्तु को बना देता है जिसकी ओर आप इशारा कर रहे हैं।
  • बातचीत (Conversation): यह मास्क बनाते समय आपके साथ चित्र या वीडियो के बारे में चैट कर सकता है।

4. इसने कैसे सीखा (प्रशिक्षण)

इतना अच्छा बनने के लिए, शोधकर्ताओं ने इसे केवल एक समय में एक चीज़ नहीं सिखाई। उन्होंने एक यूनिफाइड जॉइंट ट्रेनिंग (Unified Joint Training) रणनीति का उपयोग किया।

  • उपमा: एक छात्र को पढ़ाने की कल्पना करें। उन्हें सोमवार को गणित और मंगलवार को इतिहास सिखाने के बजाय, आप उन्हें इतिहास के तथ्यों का उपयोग करके गणित के सवाल हल करना सिखाते हैं, और इसके विपरीत भी, सब कुछ एक साथ।
  • X2SAM को एक साथ छवियों और वीडियो के विशाल मिश्रण पर प्रशिक्षित किया गया था। इससे इसे यह सीखने में मदद मिली कि फोटो में "कुत्ते" को खोजने के नियम वीडियो में "कुत्ते" को खोजने के समान हैं, लेकिन इसमें एक अतिरिक्त मोड़ है—यह याद रखना कि कुत्ता एक सेकंड पहले कहाँ था।

5. नया "टेस्ट" (V-VGD)

लेखकों ने वीडियो विजुअल ग्राउंडेड (V-VGD) सेगमेंटेशन नामक एक नया टेस्ट भी बनाया है।

  • उपमा: पहले, टेस्ट मुख्य रूप से पूछते थे, "क्या आप कुत्ते को ढूंढ सकते हैं?" X2SAM का नया टेस्ट पूछता है, "मैं स्क्रीन पर एक जगह की ओर इशारा कर रहा हूँ; क्या आप उस वस्तु को ढूंढ सकते हैं जिसकी ओर मैं इशारा कर रहा हूँ और जैसे-जैसे वह हिलती है, उसे ट्रैक कर सकते हैं?" यह परीक्षण करता है कि क्या AI वास्तव में एक दृश्य संकेत (visual cue) और चलते हुए ऑब्जेक्ट के बीच के संबंध को समझ सकता है। X2SAM ने इस टेस्ट में शानदार प्रदर्शन किया और पिछले मॉडल्स को पीछे छोड़ दिया।

सारांश में

X2SAM एक मानव कलाकार को देने जैसा है जिसकी आँखें हर पिक्सेल को देखने की क्षमता रखती हैं, एक ऐसा मस्तिष्क जो जटिल वाक्यों और तर्क को समझता है, और एक ऐसी याददाश्त जो याद रखती है कि चीजें एक क्षण पहले कहाँ थीं। यह आपको फोटो और वीडियो दोनों में विशिष्ट चीजों को खोजने और उनकी रूपरेखा (outline) बनाने के लिए कंप्यूटर के साथ स्वाभाविक बातचीत करने की अनुमति देता है, वह भी एक ही बार में।

यह क्या नहीं करता (पेपर के आधार पर):
पेपर पूरी तरह से छवियों और वीडियो में वस्तुओं को सेगमेंट (आउटलाइन) करने की तकनीकी क्षमता पर केंद्रित है। यह दावा नहीं करता है कि इसका उपयोग मेडिकल डायग्नोसिस, सेल्फ-ड्राइविंग कारों या सुरक्षा निगरानी के लिए किया जाएगा, हालांकि ऐसी तकनीक के लिए ये भविष्य के संभावित उपयोग हो सकते हैं। यह पूरी तरह से निर्देशों के आधार पर दृश्य सामग्री को समझने और उसकी रूपरेखा बनाने का एक उपकरण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →