← नवीनतम पेपर
💻 computer science

VISIONLOGIC: From Neuron Activations to Causally Grounded Concept Rules for Vision Models

विज़नलॉजिक (VisionLogic) एक नवीन न्यूरल-सिम्बॉलिक फ्रेमवर्क है जो प्रेडिकेट्स (predicates) बनाने के लिए एक्टिवेशन थ्रेशोल्ड्स को सीखने, क्लास-लेवल लॉजिकल रूल्स को प्रेरित करने और एब्लेशन-आधारित परीक्षणों के माध्यम से इन नियमों को कॉज़ली वैलिडेटेड विज़ुअल कॉन्सेप्ट्स में ग्राउंड करने के माध्यम से विज़न मॉडल्स के लिए निष्ठापूर्ण, पदानुक्रमित स्पष्टीकरण उत्पन्न करता है।

मूल लेखक: Chuqin Geng, Yuhe Jiang, Ziyu Zhao, Haolin Ye, Anqi Xing, Li Zhang, Xujie Si

प्रकाशित 2026-02-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chuqin Geng, Yuhe Jiang, Ziyu Zhao, Haolin Ye, Anqi Xing, Li Zhang, Xujie Si

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन रहस्यमय शेफ (AI) है जो हर बार एक बेहतरीन स्टेक बना सकता है। आप उससे पूछते हैं, "आपने नमक क्यों डाला?" शेफ काउंटर पर रखे नमक के डिब्बों की ओर इशारा कर सकता है और कह सकता है, "क्योंकि जब मैं स्टेक बनाता हूँ तो नमक आमतौर पर यहीं होता है।"

अधिकांश वर्तमान AI व्याख्याकार (explainers) इसी तरह काम करते हैं। वे सहसंबंधों (correlations) को देखते हैं (चीजें जो एक साथ होती हैं)। लेकिन क्या होगा अगर नमक का डिब्बा वहां सिर्फ इसलिए रखा है क्योंकि शेफ हमेशा एक नमकीन खिड़की के पास खाना बनाता है, न कि इसलिए कि वास्तव में स्टेक के लिए नमक की आवश्यकता थी? शेफ एक कारण का "भ्रम" (hallucinating) पैदा कर रहा हो सकता है, और दी गई व्याख्या भ्रामक हो सकती है।

VISIONLOGIC एक नया फ्रेमवर्क है जो एक जासूस की तरह काम करता है ताकि यह पता लगाया जा सके कि शेफ जिस तरह से खाना बनाता है, उसके वास्तविक कारण क्या हैं। यह केवल यह नहीं देखता कि काउंटर पर क्या रखा है; यह परीक्षण करता है कि यदि किसी सामग्री को हटा दिया जाए तो क्या होगा।

यहाँ बताया गया है कि VISIONLOGIC कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "लाइट स्विच" अनुवाद (न्यूरॉन से प्रेडिकेट तक)

डीप लर्निंग मॉडल लाखों छोटे स्विचों से बने होते हैं जिन्हें न्यूरॉन कहा जाता है। जब एक न्यूरॉन सक्रिय होता है, तो यह एक लाइट स्विच चालू होने जैसा होता है।

  • पुराना तरीका: शोधकर्ता यह अनुमान लगाने की कोशिश करते थे कि प्रत्येक लाइट स्विच का क्या अर्थ है, केवल उन चित्रों को देखकर जहाँ वह चालू था। यह एक कमरे को देखकर यह अनुमान लगाने जैसा था कि कौन सा लाइट स्विच क्या नियंत्रित करता है।
  • VISIONLOGIC का तरीका: वे AI को इन अव्यवस्थित लाइट स्विचों को सरल हाँ/नहीं नियमों (जिन्हें "प्रेडिकेट्स" कहा जाता है) में अनुवाद करना सिखाते हैं। "न्यूरॉन 45 की तीव्रता 0.87 है" के बजाय, यह बन जाता है "क्या 'गिलहरी की पूंछ' मौजूद है? हाँ।" यह AI के जटिल गणित को एक सरल चेकलिस्ट में बदल देता है।

2. "क्या होगा अगर?" परीक्षण (कारण संबंधी आधार - Causal Grounding)

अधिकांश तरीके यहीं रुक जाते हैं। VISIONLOGIC और आगे जाता है और यह सिद्ध करता है कि चेकलिस्ट की मदें वास्तव में निर्णय का कारण बनती हैं।

  • उपमा: कल्पना कीजिए कि AI कहता है, "मुझे लगता है कि यह एक गिलहरी है क्योंकि मुझे एक पूंछ दिख रही है।"
  • परीक्षण: VISIONLOGIC गिलहरी की तस्वीर लेता है और डिजिटल रूप से पूंछ को मिटा देता है (इसे स्टैटिक नॉइज़ से बदल देता है)।
    • यदि AI अचानक कहता है, "मुझे नहीं पता कि यह क्या है," तो पूंछ कारण संबंधी रूप से महत्वपूर्ण (causally important) है। AI को निर्णय लेने के लिए पूंछ की आवश्यकता थी।
    • यदि AI बिना पूंछ के भी कहता है, "वह एक गिलहरी है!", तो पूंछ वास्तविक कारण नहीं थी। शायद AI केवल पीछे के पेड़ों को देख रहा था।
  • VISIONLOGIC इसे बार-बार करता है, मिटाए गए क्षेत्र को छोटा करता जाता है जब तक कि वह उस सटीक पिक्सेल-परफेक्ट स्थान को न ढूंढ ले जो मायने रखता है। यह एक मूर्तिकार की तरह है जो पत्थर को तब तक छीलता रहता है जब तक कि केवल आवश्यक आकार ही शेष न रह जाए।

3. "नियम पुस्तिका" (तार्किक नियम)

एक बार जब यह सिद्ध हो जाता है कि कौन सी विशेषताएं वास्तव में महत्वपूर्ण हैं, तो VISIONLOGIC AI के लिए एक सरल नियम पुस्तिका लिखता है।

  • एक ब्लैक बॉक्स के बजाय, आपको एक स्पष्ट वाक्य मिलता है जैसे:

    "यदि (गिलहरी की पूंछ मौजूद है) और (गिलहरी का सिर मौजूद है) और (कुत्ते के कान मौजूद नहीं हैं) तो: यह एक गिलहरी है।"

यह एक बड़ी बात क्यों है?

  1. यह "धोखेबाजों" को पकड़ लेता है: कल्पना कीजिए कि एक AI जो सोचता है कि "गायें" केवल "हरी घास" हैं। यदि आप उसे रेगिस्तान में गाय दिखाते हैं, तो वह विफल हो जाता है। पुराने तरीके कहेंगे, "AI घास देख रहा है, इसलिए वह गाय समझ रहा है।" VISIONLOGIC इस परीक्षण को करेगा, यह महसूस करेगा कि घास गाय के निर्णय का कारण नहीं है, और कहेगा, "नहीं, AI वास्तव में सींगों और थनों को देख रहा है।" यह संयोग को नहीं, बल्कि सत्य को खोजता है।
  2. यह किसी भी AI पर काम करता है: चाहे वह पुराना स्कूल का दिमाग (CNN) हो या आधुनिक ट्रांसफार्मर (ViT), VISIONLOGIC उनके विचारों को मानव-पठनीय तर्क में अनुवादित कर सकता है।
  3. इंसान इस पर अधिक भरोसा करते हैं: वास्तविक लोगों के साथ परीक्षणों में, VISIONLOGIC ने लोगों को यह समझने में बहुत बेहतर मदद की कि AI कैसे सोच रहा है। लोग वास्तव में यह अनुमान लगा सकते थे कि AI आगे क्या करेगा क्योंकि नियम समझ में आने वाले थे।

निष्कर्ष

VISIONLOGIC एक ऐसे अनुवादक की तरह है जो "मानव तर्क" बोलता है, न कि "गणित"। यह केवल यह अनुमान नहीं लगाता कि AI क्या सोच रहा है; यह AI के निर्णयों का परीक्षण करके इसे सिद्ध करता है, जिससे यह सुनिश्चित होता है कि हमें जो स्पष्टीकरण मिलते हैं वे केवल भाग्यशाली अनुमानों पर नहीं, बल्कि वास्तविक कारण-और-प्रभाव पर आधारित हैं। यह AI को बीमारियों का निदान करने या कार चलाने जैसे महत्वपूर्ण कार्यों के लिए सुरक्षित और अधिक भरोसेमंद बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →