← नवीनतम पेपर
💻 computer science

CPS4: Class Prompt driven Semi-Supervised Spine Segmentation with Class-specific Consistency Constraint

यह शोध पत्र CPS4 का प्रस्ताव करता है, जो एक नवीन टेक्स्ट-गाइडेड सेमी-सुपरवाइज्ड स्पाइन सेगमेंटेशन फ्रेमवर्क है जो उच्च गुणवत्ता वाले सूडो लेबल्स उत्पन्न करने के लिए VLM प्रीट्रेनिंग के दौरान क्लास-विशिष्ट कंसिस्टेंसी कंस्ट्रेंट्स का लाभ उठाता है, और केवल 5% लेबल किए गए डेटा के साथ बेहतर प्रदर्शन प्राप्त करता है।

मूल लेखक: Qingtao Pan, Hongzan Sun, Bing Ji, Shuo Li

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingtao Pan, Hongzan Sun, Bing Ji, Shuo Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को मानव रीढ़ की हड्डी के हर एक कशेरुका (vertebra) और डिस्क (disc) को एमआरआई स्कैन से पहचानने और रेखांकित करने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। यह एक कठिन काम है क्योंकि रीढ़ के कई हिस्से बहुत समान दिखते हैं, और मेडिकल इमेज के हर एक पिक्सेल को लेबल करना समुद्र तट पर रेत के कणों को गिनने जैसा है—इसमें बहुत समय लगता है और इसके लिए एक अत्यधिक प्रशिक्षित विशेषज्ञ की आवश्यकता होती है।

यह शोध पत्र इस समस्या को हल करने के लिए CPS4 नामक एक नई विधि पेश करता है। इसे इस तरह डिज़ाइन किया गया है कि यह तब भी काम कर सके जब रोबोट के पास केवल कुछ "लेबल किए गए" उदाहरण (जहाँ एक इंसान ने पहले से ही रूपरेखा बना दी है) और "अनलेबल" छवियों का एक विशाल ढेर (जहाँ किसी ने कुछ भी नहीं बनाया है) हो।

यहाँ बताया गया है कि CPS4 कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

समस्या: रोबोट भ्रमित हो जाता है

आमतौर पर, जब रोबट अनलेबल छवियों से सीखने की कोशिश करते हैं, तो वे रूपरेखाओं का अनुमान लगाते हैं (जिन्हें "स्यूडो-लेबल्स" कहा जाता है) और फिर अपने ही अनुमानों से सीखने की कोशिश करते हैं। समस्या यह है कि यदि रोबोट शुरुआत में एक छोटी सी गलती करता है, तो वह उसी गलती को बार-बार करता रहता है, जिससे स्थिति और खराब होती जाती है। यह एक छात्र की तरह है जो गणित सीखने के लिए अपने उस दोस्त के उत्तरों की नकल करने की कोशिश कर रहा है जिसे खुद उत्तरों का पता नहीं है।

समाधान: एक "टेक्स्ट गाइड" (Text Guide)

लेखकों ने महसूस किया कि जबकि रोबोट अनुमान लगाने में बुरा है, वह भाषा समझने में काफी अच्छा है। उन्होंने रोबोट को ध्यान केंद्रित करने में मदद करने के लिए टेक्स्ट प्रॉम्प्ट्स (जैसे "यह लम्बर वर्टेब्रा 1 है" लिखना) का उपयोग करने का निर्णय लिया।

रोबोट को एक बहुत ही बुद्धिमान लेकिन थोड़ा विचलित होने वाले कलाकार के रूप में सोचें। यदि आप कलाकार को सिर्फ कहें, "एक रीढ़ की हड्डी बनाओ," तो कलाकार एक बिखरा हुआ धब्बा बना सकता है। लेकिन यदि आप कलाकार को एक विशिष्ट निर्देश कार्ड सौंपते हैं जिसमें लिखा है, "केवल लंबर वर्टेब्रा 1 पर ध्यान केंद्रित करें," तो कलाकार उस विशिष्ट भाग को बहुत अधिक सटीकता से बना सकता है।

CPS4 कैसे काम करता है (दो चरणों वाला नृत्य)

यह विधि प्रशिक्षण की दो चरणों वाली प्रक्रिया का उपयोग करती है, जिसे लेखक CPS4 कहते हैं:

चरण 1: "कठोर शिक्षक" चरण (प्रीट्रेनिंग)
अनलेबल छवियों पर अनुमान लगाने से पहले, रोबोट को टेक्स्ट निर्देशों को पूरी तरह से सुनना सीखना होगा।

  • उपमा: कल्पना करें कि एक शिक्षक एक छात्र को एक विशिष्ट हड्डी की तस्वीर दिखा रहा है और कह रहा है, "यह T12 कशेरुका है।" छात्र को यह सीखना चाहिए कि उसे ठीक उसी हड्डी की ओर इशारा करना है और बाकी सब कुछ को अनदेखा करना है।
  • नवाचार: लेखकों ने रोबोट को ध्यान केंद्रित करने के लिए मजबूर करने के लिए दो विशेष "नियम" (लॉस फंक्शन्स) बनाए:
    1. टोकन-लेवल अटेंशन (Token-Level Attention): यह सुनिश्चित करता है कि रोबोट जानता है कि वाक्य का कौन सा शब्द छवि के किस भाग के अनुरूप है। यह ऐसा है जैसे यह सुनिश्चित करना कि शब्द "T12" रोबोट के दिमाग में T12 हड्डी के साथ चिपका हुआ है।
    2. पिक्सेल-लेवल अटेंशन (Pixel-Level Attention): यह सुनिश्चित करता है कि रोबोट केवल अस्पष्ट रूप से हड्डी की ओर इशारा न करे, बल्कि केवल एक छोटे कोने को नहीं, बल्कि पूरी हड्डी को सटीक रूप से कवर करे।
  • परिणाम: रोबोट टेक्स्ट विवरण और वास्तविक छवि भाग को मजबूती से जोड़ना सीख जाता है।

चरण 2: "सहायक" चरण (सेमी-सुपरवाइज्ड सेगमेंटेशन)
अब, रोबोट अनलेबल छवियों से निपटने के लिए तैयार है।

  • प्रक्रिया: प्रत्येक अनलेबल स्पाइन इमेज के लिए, रोबोट अपने प्रशिक्षित "टेक्स्ट गाइड" का उपयोग करके रीढ़ के प्रत्येक प्रकार के हिस्से (जैसे, एक T10 के लिए, एक T11 के लिए, आदि) के लिए एक अलग मैप बनाता है।
  • जादू: यह इन व्यक्तिगत मैप्स को एक बड़े, उच्च-गुणवत्ता वाले "मास्टर मैप" में मिला देता है। यह मास्टर मैप एक अनुमान से कहीं बेहतर है क्योंकि यह टेक्स्ट प्रॉम्प्ट्स द्वारा निर्देशित था।
  • लूप: रोबोट इस "टेक्स्ट-गाइडेड मैप" का उपयोग खुद को सिखाने के लिए करता है, अपनी गलतियों को सुधारता है और अपने आप से अधिक तेज़ी से सीखता है।

परिणाम: कम डेटा के साथ बड़ी जीत

शोधकर्ताओं ने एक सार्वजनिक स्पाइन डेटासेट पर परीक्षण किया।

  • चुनौती: उन्होंने रोबोट को केवल 5% लेबल किए गए डेटा (एक बहुत ही छोटी मात्रा) का उपयोग करके प्रशिक्षित करने की कोशिश की।
  • परिणाम: इतने कम डेटा के बावजूद, CPS4 ने 80.44% का डाइस स्कोर (Dice score) प्राप्त किया।
  • तुलना: यह सभी लोकप्रिय तरीकों से बेहतर था, जिनमें विजन-लैंग्वेज मॉडल (जो टेक्स्ट का उपयोग करते हैं) और वे भी शामिल हैं जो टेक्स्ट का उपयोग नहीं करते हैं। इसने साबित कर दिया कि रोबोट को गाइड करने के लिए टेक्स्ट प्रॉम्प्ट का उपयोग करने से "अनुमान" बहुत अधिक सटीक हो जाते हैं।

दृश्य प्रमाण

शोध पत्र अन्य तरीकों के साथ उनके तरीके की तुलना करने वाली तस्वीरें (चित्र 3 और 5) दिखाता है।

  • अन्य तरीके: अक्सर भ्रमित हो जाते हैं, विभिन्न कशेरुकाओं को मिला देते हैं या हिस्सों को पूरी तरह से छोड़ देते हैं।
  • CPS4: "अटेंशन मैप्स" (रोबोट का आंतरिक फोकस) दिखाते हैं कि वह जानता है कि कहाँ देखना है। जब टेक्स्ट कहता है "L5," तो रोबोट का फोकस पूरी तरह से L5 कशेरुका पर लॉक हो जाता है, और वह रीढ़ के बाकी हिस्सों को अनदेखा कर देता है।

सारांश

संक्षेप में, CPS4 एक ऐसा सिस्टम है जो टेक्स्ट विवरणों को एक "स्पॉटलाइट" के रूप में उपयोग करके कंप्यूटर को स्पाइन को सेगमेंट करना सिखाता है। पहले कंप्यूटर को यह समझने के लिए प्रशिक्षित करके कि कौन सा टेक्स्ट किस हड्डी से संबंधित है, और फिर इस समझ का उपयोग बेहतर अभ्यास उदाहरण बनाने के लिए करके, यह सिस्टम बहुत सटीक रूप से स्पाइन को मैप करना सीख सकता है, भले ही मनुष्यों ने शुरू करने के लिए बहुत कम उदाहरण दिए हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →