← नवीनतम पेपर
💻 computer science

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX एक नवीन ग्राफ-कंडीशन्ड विजन-लैंग्वेज आर्किटेक्चर है जो अल्सेरेटिव कोलाइटिस के लिए व्याख्यात्मक एंडोस्कोपिक कैप्शनिंग को उन्नत करने हेतु लीजन-सेंट्रिक सीन ग्राफ्स का निर्माण करता है ताकि टोकन-लेवल जनरेशन को निर्देशित किया जा सके, जिससे मौजूदा मॉडलों की तुलना में नैदानिक सटीकता, व्याख्यात्मकता और ग्राउंडिंग में सुधार होता है और मतिभ्रम (hallucinations) कम होता है।

मूल लेखक: Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

प्रकाशित 2026-08-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मानव कोलन के भीतर, अल्सरेटिव कोलाइटिस नामक एक पुरानी स्थिति कोलन की परत को सूजन युक्त, लाल और नाजुक बना देती है। यह समझने के लिए कि सूजन कितनी गंभीर है, डॉक्टर एंडोस्कोपी नामक एक प्रक्रिया पर भरोसा करते हैं, जहाँ एक लचीले कैमरे को पाचन मार्ग के माध्यम से गुजारा जाता है ताकि ऊतकों की छवियां ली जा सकें। इसके बाद एक विशेषज्ञ इन तस्वीरों का परीक्षण करता है, जिसमें रक्तस्राव (bleeding), अल्सर या सामान्य रक्त वाहिका पैटर्न के नुकसान जैसे विशिष्ट संकेतों की तलाश की जाती है। जो कुछ वे देखते हैं, उसके आधार पर, वे गंभीरता का स्कोर निर्धारित करते हैं और बीमारी की स्थिति का विस्तृत विवरण लिखते हैं। यह प्रक्रिया उपचार तय करने के लिए महत्वपूर्ण है, लेकिन यह कठिन और व्यक्तिपरक भी है। दो अलग-अलग डॉक्टर एक ही छवि को देख सकते हैं और इस बात पर असहमत हो सकते हैं कि रोगी कितना बीमार है, या एक डॉक्टर समस्या के किसी सूक्ष्म संकेत को मिस कर सकता है जिसे दूसरा पकड़ लेता।

वर्षों से, वैज्ञानिकों ने ऐसे कंप्यूटर प्रोग्राम बनाने की कोशिश की है जो इन चिकित्सा छवियों को पढ़ सकें और अपने स्वयं के विवरण लिख सकें, इस उम्मीद में कि वे डॉक्टरों को अधिक सुसंगत और सटीक बनाने में मदद करेंगे। शुरुआती प्रयासों में आर्टिफिशियल इंटेलिजेंस का उपयोग किया गया था जो पूरी तस्वीर को एक साथ देखता था, और एक वाक्य लिखने की कोशिश करने से पहले पूरी छवि को एक एकल सारांश में संकुचित कर देता था। हालांकि ये सिस्टम प्रवाहपूर्ण पाठ (fluent text) उत्पन्न कर सकते थे, लेकिन वे अक्सर अपने शब्दों को छवि के वास्तविक रोग वाले स्थानों से जोड़ने में विफल रहे। वे ऐसे रक्तस्राव का वर्णन कर सकते थे जो वहां मौजूद नहीं था या एक गंभीर अल्सर को मिस कर सकते थे क्योंकि वे विशिष्ट विवरणों के बजाय "बड़ी तस्वीर" (big picture) को देख रहे थे। जुड़ाव की इस कमी ने कंप्यूटर की रिपोर्टों को नैदानिक उपयोग के लिए अविश्वसनीय बना दिया, क्योंकि मशीन यह समझाने में असमर्थ थी कि उसने जो लिखा वह क्यों लिखा।

शोधकर्ताओं के एक दल ने अब LUX नामक एक नई प्रणाली विकसित की है जो इस कार्य के प्रति कंप्यूटर के दृष्टिकोण को बदल देती है। एक एंडोस्कोपिक छवि को एक एकल, धुंधले संपूर्ण भाग के रूप में मानने के बजाय, LUX छवि को विशिष्ट, सार्थक भागों में विभाजित करता है। जब सिस्टम सूजन वाले कोलन की तस्वीर देखता है, तो यह सबसे पहले समस्या वाले क्षेत्रों के सटीक स्थानों की पहचान करता है, जैसे कि लालिमा का एक पैच या एक छोटा सा घाव। फिर यह इन स्थानों को एक कहानी के व्यक्तिगत पात्रों के रूप में मानता है, और यह मानचित्रित करता है कि वे एक-दूसरे से कैसे संबंधित हैं। यदि एक घाव रक्तस्राव वाले क्षेत्र के बगल में है, तो सिस्टम उस संबंध को नोट करता है। यह रोग का एक संरचित मानचित्र बनाता है, जहाँ प्रत्येक नोड (node) एक विशिष्ट घाव (lesion) का प्रतिनिधित्व करता है और उनके बीच की प्रत्येक रेखा उनके बीच के संबंध, जैसे कि निकटता या समानता को दर्शाती है।

यह घावों का मानचित्र कंप्यूटर के लिखने का आधार बनता है। छवि के सामान्य प्रभाव के आधार पर अनुमान लगाने के बजाय, सिस्टम इस मानचित्र का उपयोग अपने द्वारा उत्पन्न प्रत्येक शब्द को निर्देशित करने के लिए करता है। जैसे-जैसे यह एक वाक्य का निर्माण करता है, यह अपने काम की जांच लगातार उन विशिष्ट स्थानों के विरुद्ध करता है जिन्हें इसने पहचाना है। यदि यह "रक्तस्राव" शब्द लिखता है, तो सिस्टम यह सुनिश्चित करता है कि यह शब्द छवि में पहचाने गए रक्तस्राव के एक विशिष्ट क्षेत्र से सीधे जुड़ा हुआ है। यह विधि कंप्यूटर को दृश्य साक्ष्य के आधार पर अपनी भाषा को स्थापित करने के लिए मजबूर करती है, जिससे कंप्यूटर द्वारा ऐसे लक्षणों का आविष्कार करने की संभावना समाप्त हो जाती है जो वास्तव में मौजूद नहीं हैं। परिणाम एक ऐसा विवरण है जो न केवल पेशेवर लगता है बल्कि सीधे उस भौतिक साक्ष्य की ओर भी संकेत करता है जो प्रत्येक दावे का समर्थन करता है।

शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण कई अन्य तरीकों के विरुद्ध किया, जिसमें व्यापक, सामान्य-उद्देश्य वाले आर्टिफिशियल इंटेलिजेंस मॉडल शामिल हैं जिन्होंने लाखों दस्तावेज़ पढ़े हैं। उन्होंने पाया कि LUX छवियों का वर्णन करने में काफी बेहतर था। इसने त्रुटियों को कम किया, जैसे कि एक स्वस्थ कोलन को रोगग्रस्त बताना या एक गंभीर अल्सर को मिस करना। उन परीक्षणों में, जो यह मापते थे कि कंप्यूटर के विवरण मानव विशेषज्ञों द्वारा लिखे गए विवरणों से कितने मेल खाते हैं, LUX ने अन्य सभी प्रणालियों को पछाड़ दिया। यह "हैलुसिनेशन" (hallucinations) को कम करने में विशेष रूप से सफल रहा, जो एक शब्द है जिसका उपयोग शोधकर्ता तब करते हैं जब कोई कंप्यूटर आत्मविश्वास के साथ ऐसी चीज़ का वर्णन करता है जो वास्तव में वहां नहीं होती है। जबकि अन्य सिस्टमों ने लगभग 9.4 प्रतिशत बार ऐसी गलतियाँ कीं, LUX ने उस दर को घटाकर केवल 5.3 प्रतिशत कर दिया।

अध्ययन ने यह भी दिखाया कि यह नई विधि कंप्यूटर को बीमारी की गंभीरता को अधिक सटीक रूप से समझने में मदद करती है। अल्सरेटिव कोलाइटिस में, गंभीरता अक्सर इस बात से निर्धारित होती है कि विभिन्न संकेत एक साथ कैसे दिखाई देते हैं और वे कहाँ स्थित होते हैं। चूंकि LUX इन संकेतों के बीच के संबंधों को मानचित्रित करता है, इसलिए यह केवल पूरी छवि को देखने वाली प्रणालियों की तुलना में अधिक सटीकता के साथ एक हल्के मामले और एक गंभीर मामले के बीच अंतर बता सकता है। जब मानव डॉक्टरों ने LUX द्वारा उत्पन्न विवरणों की समीक्षा की, तो उन्होंने उन्हें अत्यधिक सटीक और नैदानिक रूप से उपयोगी बताया, और उल्लेख किया कि सिस्टम ने संवहनी पैटर्न (vascular patterns) और ऊतक बनावट (tissue texture) जैसे विशिष्ट लक्षणों की सही पहचान की।

यह कार्य बताता है कि चिकित्सा इमेजिंग के लिए, विशेष रूप से एंडोस्कोपी जैसे जटिल क्षेत्रों में, केवल कंप्यूटर को स्मार्ट बनाना या उसे अधिक डेटा देना पर्याप्त नहीं है। सिस्टम को इसे उस तरह से देखने के लिए सिखाया जाना चाहिए जैसे एक डॉक्टर देखता है: विशिष्ट, स्थानीयकृत समस्याओं पर ध्यान केंद्रित करके और यह समझने के लिए कि वे एक साथ कैसे फिट बैठते हैं। वाक्य लिखने से पहले रोग का एक संरचित मानचित्र बनाकर, LUX छवि को देखने और उसका अर्थ समझने के बीच के अंतर को पाटता है। यह दृष्टिकोण ऐसे आर्टिफिशियल इंटेलिजेंस की ओर एक मार्ग प्रदान करता है जो न केवल प्रवाहपूर्ण है, बल्कि भरोसेमंद और पारदर्शी भी है, जो डॉक्टरों को एक ऐसा उपकरण प्रदान करता है जो अपने तर्क को स्पष्ट रूप से समझा सके जैसा कि वह रोगी की स्थिति का वर्णन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →