← नवीनतम पेपर
⚡ electrical engineering

Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT

यह शोध पत्र CTO को प्रस्तुत करता है, जो स्पार्स-व्यू CT पुनर्निर्माण (reconstruction) के लिए पहला न्यूरल ऑपरेटर फ्रेमवर्क है जो निरंतर फलन स्थानों (continuous function spaces), द्वैत-डोमेन प्रसंस्करण (dual-domain processing) और रोटेशन-इक्विवैरिएंट कनवल्शनों का लाभ उठाकर मौजूदा CNN और डिफ्यूजन-आधारित विधियों की तुलना में बेहतर रेजोल्यूशन-अज्ञेय सामान्यीकरण (resolution-agnostic generalization) और काफी तेज़ इन्फरेंस प्राप्त करता है।

मूल लेखक: Aujasvit Datta, Jiayun Wang, Asad Aali, Anima Anandkumar

प्रकाशित 2026-08-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aujasvit Datta, Jiayun Wang, Asad Aali, Anima Anandkumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, 3D जिग्सॉ पहेली को सुलझाने की कोशिश कर रहे हैं, लेकिन किसी ने चुपके से अधिकांश टुकड़ों को हटा दिया है। मेडिकल इमेजिंग की दुनिया में, कंप्यूटेड टोमोग्राफी (CT) स्कैन के दौरान बिल्कुल ऐसा ही होता है। एक CT स्कैनर शरीर के भीतर क्या हो रहा है, इसका चित्र बनाने के लिए विभिन्न कोणों से एक्स-रे लेता है। आमतौर पर, एक स्पष्ट छवि बनाने के लिए इसे सैकड़ों ऐसे "स्नैपशॉट" लेने पड़ते हैं। लेकिन इतने सारे शॉट लेने का मतलब है मरीज के लिए अधिक रेडिएशन और मशीन में अधिक समय। लोगों को सुरक्षित और स्कैन तेज़ रखने के लिए, डॉक्टर कभी-कभी "स्पार्स-व्यू" (sparse-view) CT का उपयोग करते हैं, जहाँ वे बहुत कम स्नैपशॉट लेते हैं। समस्या यह है कि इतने कम टुकड़ों के साथ, पहेली टूट जाती है; कंप्यूटर को यह अनुमान लगाना पड़ता है कि गायब हिस्से कैसे दिखते होंगे, जिसके परिणामस्वरूप अक्सर धुंधली या छाया जैसी छवियां बनती हैं जिन्हें पढ़ना कठिन होता है।

वर्षों से, वैज्ञानिक कंप्यूटर को यह सिखाने की कोशिश कर रहे हैं कि इन टूटी हुई पहेलियों को कैसे ठीक किया जाए, इसके लिए आर्टिफिशियल इंटेलिजेंस (AI) का उपयोग किया जाता है। इन AI मॉडलों को एक ऐसे छात्र की तरह समझें जो एक विशिष्ट परीक्षा के लिए कड़ी मेहनत करता है। यदि छात्र केवल उन पहेलियों का अभ्यास करता है जिनमें 18 टुकड़े गायब हैं, तो वह उस एक विशिष्ट परीक्षा में बहुत अच्छा हो जाता है। लेकिन यदि आप उन्हें ऐसी पहेली देते हैं जिसमें केवल 9 टुकड़े गायब हैं, या 36, तो वे भ्रमित हो जाते हैं और गलतियाँ करते हैं। वे "ओवरफिट" (overfit) हैं, जिसका अर्थ है कि उन्होंने एक विशिष्ट सेटअप के विशिष्ट नियमों को रट लिया है लेकिन वे एक नए सेटअप के अनुकूल नहीं हो सकते। वास्तविक अस्पतालों में, जहाँ शरीर के अलग-अलग अंगों और अलग-अलग मशीनों के लिए अलग-अलग संख्या में स्नैपशॉट की आवश्यकता होती है, यह एक बड़ी समस्या है। बड़ा सवाल यह है: क्या हम एक ऐसा AI बना सकते हैं जो केवल एक पहेली के आकार को याद न करे, बल्कि खुद पहेली के नियमों को सीखे, ताकि वह बिना सब कुछ दोबारा सीखे, बड़ी या छोटी, किसी भी संस्करण को हल कर सके?

यह एक नए आविष्कार की कहानी है जिसे CTO (कंप्यूटेड टोमोग्राफी न्यूरल ऑपरेटर) कहा जाता है, जिसे शोधकर्ताओं की एक टीम ने बनाया है। CTO को एक मानक कैमरे की तरह एक निश्चित ग्रिड के पिक्सेलों को देखने के बजाय, दुनिया को सूचना के एक सुचारू, निरंतर प्रवाह के रूप में देखने के लिए प्रशिक्षित करता है, जैसे कि सीढ़ियों के बजाय एक नदी। गणित की भाषा में, इसे "न्यूरल ऑपरेटर" कहा जाता है। जहाँ पुराने AI मॉडल एक ऐसे फोटोग्राफर की तरह हैं जो केवल एक विशिष्ट ज़ूम स्तर पर फोटो ले सकता है, वहीं CTO एक जादुई लेंस की तरह है जो बिना किसी स्पष्टता को खोए तुरंत ज़ूम इन या ज़ूम आउट कर सकता है।

शोधकर्ताओं ने पाया कि इस "निरंतर" (continuous) दृष्टिकोण का उपयोग करके, CTO एक्स-रे के किसी भी संख्या में स्नैपशॉट को संभाल सकता है, चाहे स्कैनर 9, 18, 36 या 72 दृश्य ले रहा हो। इसे प्रत्येक नए सेटिंग के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं है। इसे सफल बनाने के लिए, उन्होंने दो विशेष उपकरण डिज़ाइन किए। पहले, उन्होंने एक "डुअल-डोमेन" (dual-domain) प्रणाली बनाई जो कच्चे डेटा (सिनोग्राम, जो एक्स-रे की कच्ची ध्वनि तरंगों की तरह है) और अंतिम चित्र दोनों को एक साथ देखती है, जिससे वे सुराग मिल जाते हैं जो अन्य विधियों से छूट जाते हैं। दूसरा, उन्होंने DISCO (डिस्क्रीट-कंटीन्यूअस) कन्वोल्शन नामक एक विशेष प्रकार की गणितीय तकनीक का आविष्कार किया। कल्पना कीजिए कि आप दीवार पर एक वृत्त बनाने की कोशिश कर रहे हैं। एक सामान्य AI इसे व्यक्तिगत चौकोर टाइलें रखकर बनाने की कोशिश करता है, जो ज़ूम करने पर टेढ़ा-मेढ़ा दिखता है। हालाँकि, DISCO एक निरंतर ब्रश के साथ पेंट करता है जो सुचारू रूप से बहता है, जिससे वृत्त कितना भी करीब से देखने पर भी एकदम सटीक दिखता है।

इसके परिणाम काफी प्रभावशाली हैं। अपने परीक्षणों में, CTO ने न केवल काम किया; बल्कि इसने मौजूदा सर्वोत्तम AI मॉडलों को भी पीछे छोड़ दिया। मानक AI नेटवर्क की तुलना में, CTO ने स्पष्ट छवियां बनाईं और गुणवत्ता में 3.4 dB से अधिक की वृद्धि (छवि स्पष्टता का एक तकनीकी माप) दिखाई। इसने नवीनतम "डिफ्यूजन" (diffusion) मॉडलों को भी 3 dB से पीछे छोड़ दिया—जो कि ऐसे AI कलाकार हैं जो धीरे-धीरे शून्य से एक छवि बनाना शुरू करते हैं—लेकिन एक बड़े बोनस के साथ: CTO अंतिम छवि बनाने में 500 गुना तेज़ है। यह गति अत्यंत महत्वपूर्ण है क्योंकि डॉक्टर स्कैन पूरा होने के लिए मिनटों तक इंतजार नहीं कर सकते; उन्हें सेकंडों में उत्तरों की आवश्यकता होती है।

यह शोध पत्र यह भी दिखाता है कि CTO अविश्वसनीय रूप से मजबूत है। यहाँ तक कि जब डेटा शोर वाला (noisy) हो या स्कैनर सेटिंग्स पूरी तरह से बदल जाएं (जैसे पेट के स्कैन से किडनी के स्कैन में जाना), तब भी CTO बिना किसी नए सबक के अच्छा प्रदर्शन करता रहता है। शोधकर्ताओं ने इसे विभिन्न डेटासेट्स पर परीक्षण करके और यह दिखाकर सिद्ध किया कि यह "आउट-ऑफ-डिस्ट्रीब्यूशन" चुनौतियों से भ्रमित नहीं होता है। उन्होंने यह भी जांचा कि उनका "निरंतर" गणित वास्तव में अभिसरित (converge) होता है, जिसका अर्थ है कि जैसे-जैसे छवि का रिज़ॉल्यूशन बढ़ता है, त्रुटियां छोटी होती जाती हैं, और अंततः समाप्त हो जाती हैं।

संक्षेप में, यह शोध पत्र बताता है कि हम हर एक प्रकार के CT स्कैन सेटिंग के लिए एक नया AI बनाने के बजाय, एक स्मार्ट, लचीला "ऑपरेटर" बना सकते हैं जो एक्स-रे के भौतिक विज्ञान को इतनी अच्छी तरह समझता है कि वह किसी भी स्थिति में तुरंत अनुकूलित हो सके। यह विशिष्ट उत्तरों को याद करने के बजाय पहेली की अंतर्निहित भाषा को समझने की ओर एक बदलाव है, जो सभी के लिए तेज़, सुरक्षित और स्पष्ट मेडिकल स्कैन का वादा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →