← नवीनतम पेपर
🤖 machine learning

US-JEPA: A Joint Embedding Predictive Architecture for Medical Ultrasound

यह शोध पत्र US-JEPA का प्रस्ताव करता है, जो अल्ट्रासाउंड इमेजिंग की शोर संबंधी चुनौतियों से निपटने के लिए एक स्टैटिक-टीचर एसिमेट्रिक लेटेंट ट्रेनिंग ऑब्जेक्टिव का उपयोग करने वाला एक सेल्फ-सुपरवाइज्ड फ्रेमवर्क है, जो व्यापक UltraBench बेंचमार्क पर अत्याधुनिक मॉडलों के विरुद्ध प्रतिस्पर्धी प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Ashwath Radhachandran, Vedrana Ivezić, Shreeram Athreya, Ronit Anilkumar, Corey W. Arnold, William Speier

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ashwath Radhachandran, Vedrana Ivezić, Shreeram Athreya, Ronit Anilkumar, Corey W. Arnold, William Speier

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अल्ट्रासाउंड छवियों को समझना सिखाने की कोशिश कर रहे हैं। अल्ट्रासाउंड एक "धुंधले" एक्स-रे की तरह है; यह शरीर के अंदर देखने के लिए बेहतरीन है क्योंकि इसमें रेडिएशन नहीं होता, लेकिन इसकी छवियां अक्सर दानेदार, शोर भरी और स्टेटिक (static) से भरी होती हैं, जैसे कि एक पुराना टीवी चैनल जो पूरी तरह से ट्यून नहीं हो पा रहा हो।

लंबे समय तक, एआई (AI) शोधकर्ताओं ने कंप्यूटर को इन छवियों को समझने के लिए यह कहकर सिखाने की कोशिश की कि वे चित्र को फिर से बनाएँ (reconstruct)। यह एक पहेली देने जैसा है जिसमें कुछ हिस्से गायब हैं और रोबोट से कहना है, "खाली जगहों को इस तरह भरें कि चित्र मूल चित्र जैसा ही दिखे।"

समस्या:
एक सामान्य फोटो में (जैसे कि बिल्ली की तस्वीर), यदि आप बिल्ली के कान का एक हिस्सा छिपा देते हैं, तो एआई अनुमान लगा सकता है कि वहां क्या है क्योंकि पिक्सेल एक जैसे दिखते हैं। लेकिन अल्ट्रासाउंड में, "दाने" (शोर) रैंडम होते हैं। यदि एआई गायब हिस्सों को भरने की कोशिश करता है, तो वह वास्तविक अंग के बजाय रैंडम स्टेटिक और धुंधले आर्टिफैक्ट्स (artifacts) को याद करने लगता है। यह कार के आकार को उसके विंडशील्ड पर जमी धूल का अध्ययन करके सीखने जैसा है।

समाधान: US-JEPA
लेखकों ने एक नया सिस्टम बनाया जिसे US-JEPA कहा जाता है। धुंधली तस्वीर को फिर से बनाने के बजाय, उन्होंने खेल ही बदल दिया।

यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

1. "शिक्षक" और "छात्र"

कल्पना कीजिए कि एक मास्टर शेफ (शिक्षक) और एक कुकिंग स्टूडेंट (छात्र) हैं।

  • पुराना तरीका: छात्र शिक्षक द्वारा बनाई गई डिश की नकल पिक्सेल-दर-पिक्सेल करने की कोशिश करता है। यदि ड्राइंग में कोई धब्बा है, तो छात्र उस धब्बे की भी नकल करता है।
  • US-JEPA का तरीका: शिक्षक छात्र को डिश को फिर से बनाने के लिए नहीं कहता। इसके बजाय, शिक्षक छात्र को एक डिश की तस्वीर दिखाता है जिसका एक बड़ा हिस्सा गायब है (मास्क्ड)। फिर शिक्षक कहता है, "बाकी प्लेट के आधार पर, मुझे बताओ कि गायब हिस्से का फ्लेवर प्रोफाइल या टेक्सचर कैसा होना चाहिए।"

छात्र गायब पिक्सेल को बनाने की कोशिश नहीं कर रहा है; वह गायब हिस्से की अवधारणा (concept) को समझने की कोशिश कर रहा है। यह एआई को रैंडम शोर (जैसे, "यह स्टेटिक का एक कण है") के बजाय अंग की संरचना (जैसे, "यह एक किडनी है") सीखने के लिए मजबूर करता है।

2. "फ्रोजन" (स्थिर) शिक्षक

आमतौर पर, इन एआई सेटअपों में, शिक्षक भी सीख रहा होता है और लगातार अपनी राय बदल रहा होता है, जिससे छात्र भ्रमित हो जाता है।

  • नवाचार: लेखकों ने एक "फ्रोजन टीचर" का उपयोग किया। इस शिक्षक को एक सेवानिवृत्त मास्टर शेफ के रूप में सोचें जिसने पहले से ही सब कुछ सीख लिया है और अब केवल अपना ज्ञान बांट रहा है। शिक्षक बदलता नहीं है; वह केवल एक स्थिर, विश्वसनीय लक्ष्य प्रदान करता है जिसे छात्र को प्राप्त करना है। यह सीखने की प्रक्रिया को बहुत अधिक स्थिर और कुशल बनाता है।

3. "काले बॉर्डर" को अनदेखा करना

अल्ट्रासाउंड छवियों में अक्सर बड़े काले बॉर्डर, मरीजों के नाम और किनारे पर माप के पैमाने होते हैं।

  • नवाचार: सिस्टम में एक विशेष फिल्टर (जिसे USrc कहा जाता है) है जो एक स्पॉटलाइट की तरह काम करता है। यह एआई को बताता है, "काले बॉर्डर और टेक्स्ट को अनदेखा करो; केवल उस चमकते हुए हिस्से पर ध्यान दो जहाँ शरीर है।" यह एआई को "ब्लैक बॉर्डर" क्या होता है, यह सीखने में अपनी मानसिक शक्ति बर्बाद करने से रोकता है।

4. बड़ा टेस्ट: UltraBench

अपने नए सिस्टम को साबित करने के लिए, लेखकों ने केवल एक छोटे डेटासेट पर परीक्षण नहीं किया। उन्होंने अल्ट्रासाउंड एआई के लिए एक विशाल "ओलंपिक्स" जैसा UltraBench बनाया।

  • उन्होंने 50 अलग-अलग सार्वजनिक स्रोतों (हृदय, लिवर, थायराइड आदि को कवर करते हुए) से लगभग 5 मिलियन अल्ट्रासाउंड फ्रेम एकत्र किए।
  • उन्होंने अपने नए एआई का परीक्षण वर्तमान में उपलब्ध हर अन्य शीर्ष अल्ट्रासाउंड एआई के खिलाफ किया।
  • परिणाम: US-JEPA अधिकांश श्रेणियों में पहले स्थान पर रहा या बराबरी पर रहा। इससे भी अधिक प्रभावशाली बात यह है कि जब उन्हें बहुत कम लेबल वाले उदाहरण दिए गए (जैसे कि केवल 1% डेटा दिखाना), तब भी इसने अविश्वसनीय रूप से अच्छा प्रदर्शन किया। चिकित्सा के क्षेत्र में यह बहुत महत्वपूर्ण है क्योंकि लेबल किया हुआ डेटा प्राप्त करना कठिन और महंगा है।

यह क्यों मायने रखता है?

US-JEPA को एक डॉक्टर के सहायक को सिखाने के एक नए तरीके के रूप में सोचें। उन्हें समुद्र तट के हर एक रेत के कण (शोर) को याद करने के बजाय, उन्हें समुद्र के आकार को पहचानना सिखाना है।

  • यह मजबूत (Robust) है: भले ही अल्ट्रासाउंड मशीन पुरानी हो, ऑपरेटर का हाथ हिल रहा हो, या इमेज दानेदार हो, यह एआई फिर भी समझता है कि वह क्या देख रहा है।
  • यह कुशल (Efficient) है: यह तेजी से सीखता है और विशेषज्ञ बनने के लिए कम लेबल वाले उदाहरणों की आवश्यकता होती है।
  • यह खुला (Open) है: लेखकों ने अपना डेटा और बेंचमार्क सार्वजनिक कर दिया है, ताकि अन्य शोधकर्ता शून्य से शुरुआत करने के बजाय इस नींव पर आगे बढ़ सकें।

संक्षेप में, US-JEPA कंप्यूटर को मानव शरीर के अंदर "देखने" के लिए सिखाने का एक स्मार्ट और अधिक स्थिर तरीका है, जो स्टेटिक को अनदेखा करता है और वास्तविक एनाटॉमी (शरीर रचना) पर ध्यान केंद्रित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →