← नवीनतम पेपर
💻 computer science

Predicting Functions, Not Features: KANs with Function-Space Joint-Embedding Predictive Learning for Medical Image Segmentation

यह शोध पत्र फंक्शन-स्पेस जॉइंट-एम्बेडिंग प्रेडिक्टिव लर्निंग (FS-JEPA) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो मेडिकल इमेज सेगमेंटेशन के लिए कोलमोगोरोव-आर्नोल्ड नेटवर्क्स (KANs) को एक मास्क्ड सेल्फ-सुपरवाइज्ड तरीके से व्यक्तिगत एज फंक्शन्स के स्ट्रक्चर्ड मल्टी-रेडियस सिग्नेचर की भविष्यवाणी करके उन्नत बनाता है, जिससे पांच बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Yungeng Liu, Xuanzi Fang, Yuge Zhang, Shuqi Ren, Haijin Zeng, Yongyong Chen

प्रकाशित 2026-08-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yungeng Liu, Xuanzi Fang, Yuge Zhang, Shuqi Ren, Haijin Zeng, Yongyong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक्स-रे से दिल का चित्र बनाना सिखाने की कोशिश कर रहे हैं। यह मेडिकल इमेज सेगमेंटेशन (medical image segmentation) की दुनिया है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जहाँ कंप्यूटर अंगों, ट्यूमर या ऊतकों (tissues) के चारों ओर सटीक रूपरेखा खींचना सीखते हैं। यह एक कठिन काम है क्योंकि मेडिकल इमेज अक्सर धुंधली होती हैं, स्वस्थ और बीमार ऊतकों के बीच की सीमाएं अस्पष्ट होती हैं, और रोबोट को डॉक्टरों की मदद करने के लिए अविश्वसनीय रूप से सटीक होना पड़ता है।

इसे करने के लिए, आधुनिक AI "न्यूरल नेटवर्क" का उपयोग करता है, जो गणितीय कनेक्शनों के विशाल जाल की तरह होते हैं। लंबे समय तक, इन नेटवर्कों ने निश्चित नियमों (जैसे एक लाइट स्विच जो हमेशा चालू या बंद रहता है) का उपयोग किया। लेकिन, एक नया और अधिक आकर्षक प्रकार का नेटवर्क जिसे कोल्मोगोरोव-आर्नोल्ड नेटवर्क (Kolmogorov–Arnold Network - KAN) कहा जाता है, सामने आया है। निश्चित नियमों के बजाय, KANs हर एक कनेक्शन पर "सीखने योग्य फलनों" (learnable functions) का उपयोग करते हैं। इसे ऐसे समझें: एक सामान्य नेटवर्क में, हर तार एक कठोर पाइप की तरह है। KAN में, हर तार एक लचीला, आकार बदलने वाला रबर बैंड है जिसे नेटवर्क अपनी जरूरत के अनुसार टेढ़ा-मेढ़ा, सीधा या घुमावदार बना सकता है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह है: हम इन रबर बैंडों को सही तरीके से खींचना कैसे सिखाएं?

यहीं से एक नया अध्ययन आता है। शोधकर्ताओं ने पाया कि हालांकि KANs शक्तिशाली हैं, लेकिन उन्हें प्रशिक्षित करने का मानक तरीका एक संगीतकार को केवल पूरे ऑर्केस्ट्रा की अंतिम ध्वनि के आधार पर आंकने जैसा है, बिना व्यक्तिगत वायलिन वादकों को सुने। उन्होंने महसूस किया कि "रबर बैंड" (फलन/functions) को इस बारेगत पर्याप्त विशिष्ट फीडबैक नहीं मिल रहा था कि वे उनके आपस में मिलने से पहले कैसे व्यवहार कर रहे हैं। इसे ठीक करने के लिए, उन्होंने एक नई प्रशिक्षण तकनीक विकसित की जिसे FS-JEPA कहा जाता है। केवल अंतिम परिणाम को देखने के बजाय, उन्होंने AI को प्रत्येक रबर बैंड के व्यवहार के "आकार" (shape) की पहले से भविष्यवाणी करने के लिए प्रेरित किया। इस पद्धति को पांच अलग-अलग मेडिकल इमेज डेटासेट्स पर परीक्षण करके, उन्होंने दिखाया कि यह विधि पिछले KAN-आधारित तरीकों की तुलना में AI को बहुत अधिक स्पष्ट और सटीक रूपरेखा खींचने में मदद करती है, जिससे औसत सटीकता स्कोर में 2.25 प्रतिशत अंक का सुधार हुआ।

समस्या: "ऑर्केस्ट्रा" बनाम "सोलोइस्ट"

आइए इसकी कार्यप्रणाली को समझते हैं। एक मानक KAN में, नेटवर्क परतों (layers) से बना होता है। प्रत्येक परत इनपुट लेती है और इन विशेष "रबर बैंड" फलनों के माध्यम से आउटपुट बनाने के लिए उन्हें पास करती है। समस्या यह है कि नेटवर्क को आमतौर पर अंतिम आउटपुट—"ऑर्केस्ट्रा" के गीत—को देखकर प्रशिक्षित किया जाता है। यदि गीत अच्छा लगता है, तो नेटवर्क को एक गोल्ड स्टार मिलता है। यदि यह बुरा लगता है, तो उसे रेड लाइट मिलती है।

लेकिन यहाँ एक पेंच है: रबर बैंडों के कई अलग-अलग संयोजन एक ही अंतिम गीत उत्पन्न कर सकते हैं। हो सकता है कि एक रबर बैंड बहुत अधिक खिंच गया हो, लेकिन दूसरा ठीक उसी तरह दब गया हो ताकि वह उसे संतुलित कर सके। नेटवर्क को गोल्ड स्टार मिलता है, लेकिन व्यक्तिगत रबर बैंडों को कभी यह नहीं पता चलता कि वे उस तरह क्यों खिंचे थे। वे बिना किसी स्पष्ट लक्ष्य के अनुमान लगाते रहते हैं। यह एक कंडक्टर को एक वायलिन वादक से यह कहने जैसा है, "संगीत अच्छा लग रहा है," बिना यह बताए कि उसका विशिष्ट नोट सुर में था या नहीं।

समाधान: रबर बैंड के "आकार" की भविष्यवाणी करना

इस शोध के लेखकों ने, जिनका नेतृत्व युंगेंग लुओ (Yungeng Liu) और जुआनज़ी फांग (Xuanzi Fang) ने किया, खेल को बदलने का निर्णय लिया। उन्होंने पूछा: "क्या होगा यदि हम AI को प्रत्येक रबर बैंड के अंतिम गीत में मिलने से पहले उसके व्यवहार की भविष्यवाणी करना सिखा सकें?"

उन्होंने फंक्शन-स्पेस जॉइंट-एम्बेडिंग प्रेडिक्टिव लर्निंग (Function-Space Joint-Embedding Predictive Learning - FS-JEPA) नामक एक प्रणाली बनाई। यह कैसे काम करती है, इसके लिए एक मनोरंजक उपमा का उपयोग करते हैं:

कल्पना कीजिए कि आपके पास एक जादुई रबर बैंड (एक KAN एज फंक्शन) है। पुराने तरीके में, आप रबर बैंड को केवल तभी देखते थे जब वह एक विशिष्ट बिंदु तक खिंच जाता था। लेकिन एक रबर बैंड उस बिंदु के थोड़ा बाएँ या दाएँ भी बहुत अलग व्यवहार कर सकता है। शायद वह वहां सख्त है, या शायद वह बहुत लचीला है।

नई विधि, FS-JEPA, केवल एक बिंदु को नहीं देखती है। यह AI से एक "मल्टी-रेडियस सिग्नेचर" (multi-radius signature) की भविष्यवाणी करने के लिए कहती है। इसे रबर बैंड के आकार की केवल केंद्र पर ही नहीं, बल्कि उसके आसपास छह अलग-अलग स्थानों पर (जैसे एक छोटा हेलो/आभामंडल माप) स्नैपशॉट लेने के रूप में सोचें। यह "सिग्नेचर" AI को बताता है कि रबर बैंड स्थानीय रूप से (locally) कैसे व्यवहार कर रहा है।

प्रशिक्षण प्रक्रिया "आकार का अनुमान लगाने" के खेल की तरह काम करती है:

  1. मास्क्ड ऑनलाइन ब्रांच (The Masked Online Branch): AI को रबर बैंड के व्यवहार का एक "मास्क्ड" संस्करण दिखाया जाता है (कुछ हिस्से छिपे हुए होते हैं)। इसे पूरा "सिग्नेचर" (छह स्थानों पर आकार) का अनुमान लगाना होता है।
  2. टारगेट ब्रांच (The Target Branch): एक "टीचर" संस्करण का AI (जो धीरे-धीरे और स्थिरता से चलता है, जैसे एक शांत गुरु) पूर्ण, अनमास्क्ड रबर बैंड को देखता है और सही सिग्नेचर बनाता है।
  3. मैच (The Match): छात्र AI, शिक्षक के सिग्नेचर से मेल खाने की कोशिश करता है। यदि वह आकार को सही पहचान लेता है, तो वह सीखता है।

महत्वपूर्ण रूप से, AI केवल आकार का अनुमान नहीं लगाता है; यह इस बात का भी ध्यान रखता है कि वह किस रबर बैंड को देख रहा है। चूंकि हजारों रबर बैंड होते हैं, इसलिए सिस्टम "निर्देशांकों" (coordinates) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि छात्र उसी रबर बैंड के आकार का अनुमान लगा रहा है जिसे शिक्षक दिखा रहा है। यह सुनिश्चित करता है कि सीखना सटीक हो और चीजें आपस में न मिलें।

परिणाम: स्पष्ट रूपरेखा, बेहतर स्कोर

शोधकर्ताओं ने स्तन के घावों, थायराइड स्कैन और हिस्टोलॉजी छवियों सहित पांच अलग-अलग मेडिकल इमेज डेटासेट्स पर इस नई विधि का परीक्षण किया। उन्होंने इसकी तुलना सबसे अच्छे मौजूदा KAN-आधारित मॉडलों और अन्य मानक मेडिकल AI मॉडलों से की।

परिणाम स्पष्ट थे:

  • बेहतर सटीकता: FS-JEPA पद्धति ने सभी पांच डेटासेट्स में उच्चतम औसत Dice स्कोर 83.37% और IoU 75.04% प्राप्त किया।
  • प्रतिस्पर्धा को पछाड़ना: इसने सबसे मजबूत प्रतिस्पर्धी KAN-आधारित विधि (UUEKAN) को Dice स्कोर में +2.25 प्रतिशत अंक से पीछे छोड़ दिया।
  • कोई अतिरिक्त लागत नहीं: सबसे अच्छी बात यह है कि यह "अनुमानित लर्निंग" केवल प्रशिक्षण के दौरान होती है। एक बार जब AI प्रशिक्षित हो जाता है, तो अतिरिक्त "अनुमान लगाने वाले" हिस्सों को हटा दिया जाता है। अंतिम मॉडल का आकार और गति मूल मॉडल के समान ही होती है, लेकिन यह अधिक स्मार्ट होता है क्योंकि इसने अपने प्रशिक्षण के दौरान बेहतर आदतें सीखी हैं।

यह क्यों महत्वपूर्ण है

यह शोध पत्र सुझाव देता है कि सीखने के लक्ष्य को अंतिम "ऑर्केस्ट्रा" की ध्वनि से हटाकर प्रत्येक व्यक्तिगत वाद्य यंत्र के विशिष्ट "आकार" पर ले जाकर, हम इन लचीले नेटवर्कों को बहुत अधिक प्रभावी ढंग से प्रशिक्षित कर सकते हैं। लेखकों ने पाया कि केवल एक बिंदु की भविष्यवाणी करना पर्याप्त नहीं था; AI को वास्तव में फलन (function) को समझने के लिए "स्थानीय विविधताओं" (local variations/multi-radius signature) को देखने की आवश्यकता थी।

प्रयोगों में, उन्होंने अन्य विचारों को भी खारिज किया, जैसे कि केवल अंतिम विशेषता की भविष्यवाणी करना या रबर बैंड से एक एकल प्रतिक्रिया की भविष्यवाणी करना। वे तरीके उतने अच्छे से काम नहीं कर पाए, जिससे पता चलता है कि फलन के स्थानीय व्यवहार को पकड़ना ही KANs की पूरी क्षमता को अनलॉक करने की कुंजी है।

अंततः, यह शोध दिखाता है कि हमें बेहतर परिणाम प्राप्त करने के लिए अपने मेडिकल AI मॉडलों को बड़ा या अधिक जटिल बनाने की आवश्यकता नहीं है। इसके बजाय, यह बदलकर कि हम उन्हें कैसे सिखाते हैं—उन्हें अपने स्वयं के आंतरिक फलनों के विस्तृत आकार की भविष्यवाणी करने के लिए कहकर—हम उन्हें चिकित्सा में सबसे महत्वपूर्ण चीजों के चारों ओर अधिक स्पष्ट और सटीक सीमाएं खींचने में मदद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →