← नवीनतम पेपर
💻 computer science

A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle

यह शोधपत्र विजुअल मैकेनिस्टिक इंटरप्रिटेबिलिटी (visual mechanistic interpretability) के लिए एक वितरण संबंधी दृष्टिकोण (distributional view) प्रस्तावित करता है जो मौजूदा प्रतिमानों में सांख्यिकीय पूर्वाग्रहों को हल करने के लिए कार्य को एक KL-न्यूनतम अनुकूलन समस्या (KL-minimal optimization problem) के रूप में सूत्रबद्ध करता है, और व्याख्यात्मकता (interpretability) तथा निष्ठा (faithfulness) के बीच एक सैद्धांतिक संतुलन प्राप्त करने के लिए ऊर्जा-निर्देशित डिफ्यूजन पोस्टीरियर सैंपलिंग (energy-guided diffusion posterior sampling) के माध्यम से साकार एक KL-न्यूनतम सॉफ्ट-कन्स्ट्रेंट सिद्धांत प्रस्तुत करता है।

मूल लेखक: Guancheng Zhou, Yisi Luo, Zhengfu He, Zhenyu Jin, Xuyang Ge, Wentao Shu, Deyu Meng, Xipeng Qiu

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guancheng Zhou, Yisi Luo, Zhengfu He, Zhenyu Jin, Xuyang Ge, Wentao Shu, Deyu Meng, Xipeng Qiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट AI है जो तस्वीरों को देखता है और समझता है कि उनमें क्या है। लेकिन हमारे लिए, यह AI एक "ब्लैक बॉक्स" (black box) है। हम देख सकते हैं कि यह उस तस्वीर को प्रोसेस करता है जिसे यह देख रहा है, और हम वह अंतिम उत्तर भी देख सकते हैं जो यह देता है, लेकिन इसके अंदर के लाखों छोटे गियर और स्विच (न्यूरॉन्स) एक रहस्य हैं। हम जानना चाहते हैं: यह विशिष्ट छोटा स्विच वास्तव में किस बारे में सोच रहा है?

यह पेपर इस ब्लैक बॉक्स के अंदर झांकने का एक नया तरीका प्रस्तावित करता है, विशेष रूप से विज़न मॉडल्स (vision models) के लिए। यहाँ इसका विवरण सरल उपमाओं (analogies) के साथ दिया गया है।

समस्या: "बुरे जासूस" वाले दृष्टिकोण (The "Bad Detective" Approaches)

वर्तमान में, शोधकर्ता इन AI स्विचों को समझने के लिए दो मुख्य तरीकों का उपयोग करते हैं, जिनमें दोनों की कमियां हैं:

  1. "खोज अभियान" (डेटासेट सर्च - The "Scavenger Hunt"): वे मौजूदा तस्वीरों के एक विशाल पुस्तकालय में खोज करते हैं ताकि उन तस्वीरों को ढूँढा जा सके जो स्विच को सबसे ज़ोर से "डिंग!" (ding!) करने पर मजबूर कर दें।
    • कमी: यह एक लाइब्रेरी में मौजूद "डॉग" (कुत्ते) डिटेक्टर को समझने की कोशिश करने जैसा है, जहाँ आप केवल 100 बेहतरीन कुत्ते की तस्वीरों को देखते हैं। आप शायद उन अजीब, अनोखे कुत्तों को मिस कर दें, या हो सकता है कि आपको बस कुछ भाग्यशाली तस्वीरें मिल जाएं जो दिखने में तो कुत्ते जैसी हैं, लेकिन वास्तव में वह नहीं हैं जिसके बारे में AI "सोच" रहा है। यह लाइब्रेरी में पहले से मौजूद चीज़ों तक ही सीमित है।
  2. "सपनों का बुनकर" (ऑप्टिमाइज़ेशन - The "Dream Weaver"): वे एक खाली, स्टैटिक-भरे स्क्रीन से शुरुआत करते हैं और गणितीय रूप से पिक्सेल को तब तक बदलते रहते हैं जब तक कि स्विच सबसे ज़ोर से "डिंग!" न करने लगे।
    • कमी: यह अक्सर "सुपर-स्टिमुली" (super-stimuli) बनाता है—ऐसी छवियां जो गणितीय रूप से तो AI के लिए एकदम सही हैं, लेकिन इंसानों के लिए वे अजीब पैटर्न या एलियन स्टैटिक जैसी दिखती हैं। यह एक रेडियो को ट्यून करने जैसा है जब तक कि आप एक ऐसी आवाज़ न सुन लें जो इतनी तेज़ हो कि आपके कान दुखने लगें, लेकिन वह आवाज़ केवल शोर है, कोई गाना नहीं। AI खुश है, लेकिन इंसान उसे समझ नहीं सकते।

नया विचार: "वितरण संबंधी दृष्टिकोण" (The "Distributional View")

लेखक सुझाव देते हैं कि हमें एकल छवियों को देखना बंद कर देना चाहिए और डिस्ट्रीब्यूशन्स (या संभावनाओं के "बादलों") के बारे में सोचना शुरू करना चाहिए।

AI की दुनिया की समझ को "प्राकृतिक छवियों" (असली बिल्लियों, कुत्तों, पेड़ों आदि की तस्वीरों) के एक विशाल, धुंधले बादल के रूप में कल्पना करें। जब एक विशिष्ट स्विच सक्रिय होता है, तो वह केवल एक फोटो नहीं चुनता; वह उस पूरे बादल को एक नया आकार देता है। वह कहता है, "ठीक है, सभी संभावित छवियों के इस बादल के भीतर, मैं अब उस हिस्से पर ध्यान केंद्रित कर रहा हूँ जो इस विशिष्ट विशेषता जैसा दिखता है।"

लक्ष्य एक नया "छवियों का बादल" खोजने का है जो:

  1. वफादार (Faithful) हो: यह वास्तव में स्विच को मजबूती से सक्रिय करता है।
  2. व्याख्या योग्य (Interpretable) हो: यह अभी भी वास्तविक दुनिया की प्राकृतिक तस्वीरों के बादल जैसा दिखता है, न कि किसी एलियन स्टैटिक जैसा।

समाधान: "सॉफ्ट कंस्ट्रेंट" का सिद्धांत (The "Soft Constraint" Principle)

लेखक एक सिद्धांत पेश करते हैं जिसे KL-Minimal Soft-Constraint कहा जाता है।

  • पुराना तरीका (हार्ड कंस्ट्रेंट - Hard Constraint): एक क्लब के बाउंसर की कल्पना करें जो कहता है, "यदि आपका स्कोर ठीक 90 से ऊपर नहीं है, तो आप बाहर हैं।" यह बादल के निचले हिस्से को अचानक काट देता है। यह एक तीखा किनारा बनाता है जहाँ छवियां अचानक समझ से बाहर हो जाती हैं।
  • नया तरीका (सॉफ्ट कंस्ट्रेंट - Soft Constraint): एक ऐसे बाउंसर की कल्पना करें जो कहता है, "हमें उच्च स्कोर वाले लोग चाहिए, लेकिन आइए पूरे समूह को वीआईपी (VIP) सेक्शन की ओर धीरे से धकेलें, बजाय इसके कि सबको बाहर निकाल दिया जाए।" यह भीड़ (डिस्ट्रीब्यूशन) को सहज और प्राकृतिक बनाए रखता है, बस उसे उस विशेषता की ओर थोड़ा सा मोड़ देता है जिसकी AI परवाह करता है।

यह "सॉफ्ट कंस्ट्रेंट" यह सुनिश्चित करता है कि हमारे द्वारा बनाई गई छवियां अभी भी वास्तविक फोटो के रूप में पहचान योग्य (व्याख्या योग्य) हों, जबकि वे यह साबित करने में भी सक्षम हों कि वे AI के स्विच को ट्रिगर करती हैं (वफादार)।

टूल: एनर्जी-गाइडेड डिफ्यूजन (Energy-Guided Diffusion - EnergyDPS)

इन छवियों को वास्तव में बनाने के लिए, वे EnergyDPS नामक टूल का उपयोग करते हैं।

एक डिफ्यूजन मॉडल (Diffusion Model) को एक मास्टर पेंटर के रूप में सोचें जो शून्य से किसी भी यथार्थवादी दृश्य को पेंट करना जानता है। आमतौर पर, यह पेंटर अकेला काम करता है।

  • नवाचार: लेखक पेंटर को एक "चुंबकीय मार्गदर्शक" (Energy function) देते हैं। यह मार्गदर्शक वह AI स्विच है जिसे वे समझना चाहते हैं।
  • यह कैसे काम करता है: जैसे ही पेंटर एक रैंडम इमेज बनाना शुरू करता है, मार्गदर्शक ब्रश के स्ट्रोक्स को धीरे से उन पैटर्न्स की ओर खींचता है जो AI स्विच को खुश करते हैं।
  • परिणाम: पेंटर एक सुंदर, यथार्थवादी छवि बनाता है जिसमें स्वाभाविक रूप से वह विशेषता होती है जिसे AI देख रहा है, बिना किसी अजीब टेक्स्ट प्रॉम्प्ट या लाखों मौजूदा तस्वीरों को स्कैन करने की आवश्यकता के।

यह क्यों महत्वपूर्ण है

पेपर ने इसे एक आधुनिक विज़न मॉडल (DINOv3) पर टेस्ट किया। उन्होंने पाया कि:

  • पुराने तरीकों ने अक्सर ऐसी छवियां बनाईं जो या तो समझने के लिए बहुत अजीब थीं या वास्तव में AI की वास्तविक सोच का प्रतिनिधित्व नहीं करती थीं।
  • उनके नए तरीके ने ऐसी छवियां बनाईं जिन्हें इंसान आसानी से पहचान सकते थे (जैसे "दिल के आकार" या "पंखों के पैटर्न") और जिन्हें AI ने भी अत्यधिक प्रासंगिक पाया।

संक्षेप में: AI को कठोर नियमों या अव्यवस्थित खोज के माध्यम से अपना हाथ दिखाने के लिए मजबूर करने के बजाय, वे एक जनरेटिव आर्टिस्ट (सृजनात्मक कलाकार) को ठीक वही पेंट करने के लिए धीरे से निर्देशित करते हैं जो AI सोच रहा है, जिससे परिणाम एक प्राकृतिक, वास्तविक दुनिया की फोटो जैसा बना रहता है। यह हमें AI के "दिमाग" के अंदर एक स्पष्ट और अधिक ईमानदार खिड़की प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →