← नवीनतम पेपर
💻 computer science

XSPLAIN: XAI-enabling Splat-based Prototype Learning for Attribute-aware INterpretability

XSPLAIN 3D गॉसियन स्प्लेटिंग वर्गीकरण के लिए एक नवीन, ante-hoc व्याख्यात्मकता ढांचा है जो वर्गीकरण प्रदर्शन से समझौता किए बिना सहज, विशेषता-जागरूक स्पष्टीकरण प्रदान करने के लिए प्रोटोटाइप-आधारित शिक्षण और एक प्रतिवर्ती ऑर्थोगोनल रूपांतरण का उपयोग करता है।

मूल लेखक: Dominik Galus, Julia Farganus, Tymoteusz Zapala, Mikołaj Czachorowski, Piotr Borycki, Przemysław Spurek, Piotr Syga

प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dominik Galus, Julia Farganus, Tymoteusz Zapala, Mikołaj Czachorowski, Piotr Borycki, Przemysław Spurek, Piotr Syga

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-इंटेलिजेंट रोबोट है जो किसी वस्तु के 3D स्कैन को देख सकता है—जैसे कि एक कार, एक कुर्सी, या एक खिलौना—और तुरंत आपको बता सकता है कि वह वास्तव में क्या है। यह बहुत अच्छा है, लेकिन इसमें एक पेंच है: रोबोट एक "ब्लैक बॉक्स" है। वह आपको सही उत्तर तो देता है, लेकिन वह यह नहीं बता सकता कि क्यों। हो सकता है कि वह कार की पहचान करने के लिए पहियों को देख रहा हो, या वह गलती से फर्श पर पड़ी एक रैंडम छाया को देख रहा हो। चिकित्सा या सेल्फ-ड्राइविंग कारों जैसे महत्वपूर्ण क्षेत्रों में, "बस मुझ पर भरोसा करो" कहना काफी नहीं है।

यह पेपर XSPLAIN को पेश करता है, जो इन 3D AI मॉडल्स को "बोलने" और अपने तर्क को उस तरह समझाने का एक नया तरीका है जिसे इंसान वास्तव में समझ सकें।

यह कैसे काम करता है, इसे तीन सरल अवधारणाओं में विभाजित किया गया है:

1. "लेगो ब्रिक" दृष्टिकोण (वोक्सेल एग्रीगेशन - Voxel Aggregation)

मानक AI अक्सर 3D डेटा को लाखों छोटे बिंदुओं के एक अराजक बादल के रूप में देखता है। यह एक घर को समझने के लिए कंक्रीट के हर एक रेत के कण को देखने जैसा है। यह बहुत अधिक और अव्यवस्थित है।

XSPLAIN इसके बजाय स्थान को "वोक्सेल्स" (voxels) के एक ग्रिड में व्यवस्थित करता है—इन्हें अदृश्य लेगो ब्रिक्स (Lego bricks) के रूप में सोचें। हर रेत के कण को देखने के बजाय, AI इन ईंटों को देखता है। यह AI को शोर (noise) या स्कैन में तैरते हुए धूल के कणों से ध्यान भटकने के बजाय ठोस, सार्थक आकृतियों (जैसे कि एक दरवाजा या हैंडल) पर ध्यान केंद्रित करने में मदद करता है।

2. "अनुवादक" (फीचर डिसेंटैंगलमेंट - Feature Disentanglement)

AI के मस्तिष्क के भीतर, जानकारी गणितीय संकेतों के एक विशाल, उलझे हुए जाल के रूप में संग्रहीत होती है। यह स्पैगेटी के एक बड़े कटोरे जैसा है जहाँ सभी स्वाद (रंग, आकार, बनावट) आपस में मिल गए हैं। यदि आप AI से पूछते हैं, "यह कार क्यों है?", तो वह उत्तर नहीं दे सकता क्योंकि वह "पहिए होने के गुण" को "लाल होने के गुण" से अलग नहीं कर सकता।

XSPLAIN एक चतुर गणितीय ट्रिक (ऑर्थोगोनल ट्रांसफॉर्मेशन) का उपयोग करता है जो एक स्वाद विभाजक (flavor separator) के रूप में कार्य करता है। यह उस स्पैगेटी को सुलझा देता है। यह जानकारी को इस तरह घुमाता है कि मस्तिष्क का एक "चैनल" विशेष रूप से "गोलाई" को संभालता है, दूसरा "लंबाई" को, और तीसरा "सपाटपन" को।

महत्वपूर्ण बात यह है कि शोधकर्ताओं ने इसे इस तरह से डिजाइन किया है कि यह "अनुवादक" AI की मूल बुद्धिमत्ता को नहीं बदलता है। यह एक चश्मा पहनने जैसा है जो दुनिया को स्पष्ट बनाता है, बिना उन वस्तुओं को बदले जिन्हें आप देख रहे हैं।

3. "यह वैसा ही दिखता है जैसा कि वह" तर्क (प्रोटोटाइप लर्निंग - Prototype Learning)

अधिकांश AI स्पष्टीकरण "सैलियंसी मैप्स" (saliency maps) होते हैं—वे केवल वस्तु के हिस्सों को चमकते हुए रंगों के साथ हाइलाइट करते हैं (जैसे कि एक हीट मैप)। यह अक्सर अस्पष्ट और अनुपयोगी होता है।

XSPLAIN प्रोटोटाइप्स (Prototypes) का उपयोग करता है। यह कहने के बजाय कि, "मुझे लगता है कि यह एक कार है क्योंकि यहाँ एक चमकता हुआ लाल धब्बा है," XSPLAIN कहता है:

"मुझे लगता है कि यह एक कार है क्योंकि वस्तु का यह विशिष्ट हिस्सा बिल्कुल वैसा ही दिखता है जैसा कि मेरे प्रशिक्षण मैनुअल में देखी गई कार का यह हिस्सा था।"

यह अपनी याददाश्त से सबसे प्रतिनिधि "उदाहरणों" को ढूंढता है और उन्हें आपको दिखाता है। यह एक शिक्षक के कहने के बीच का अंतर है, "उत्तर 42 है क्योंकि यह गणित है," और एक शिक्षक के कहने के बीच, "उत्तर 42 है क्योंकि यह उसी पैटर्न का पालन करता है जैसा कि हमने कल किया था उदाहरण।"

परिणाम: एक विश्वसनीय विशेषज्ञ

शोधकर्ताओं ने 51 लोगों के साथ इसका परीक्षण किया, और परिणाम स्पष्ट थे: मनुष्यों ने भारी रूप से XSPLAIN को प्राथमिकता दी। इसने न केवल एक सही उत्तर दिया; बल्कि एक ठोस (convincing) उत्तर भी दिया।

संक्षेप में: XSPLAIN एक रहस्यमय, "ब्लैक बॉक्स" 3D स्कैनर को एक पारदर्शी विशेषज्ञ में बदल देता है जो किसी वस्तु के एक विशिष्ट हिस्से की ओर इशारा कर सकता है और कह सकता है, "मैं इसे कुर्सी कह रहा हूँ क्योंकि यह पैर ठीक वैसा ही दिखता है जैसा कि मैंने पहले देखी गई कुर्सियों के पैर दिखते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →