← नवीनतम पेपर
🤖 machine learning

When Attribution Patching Lies: Diagnosis and a Second-Order Correction

यह शोध पत्र डाउनस्ट्रीम नेटवर्क में गैर-रेखीयताओं (non-linearities) को एट्रिब्यूशन पैचिंग (attribution patching) में त्रुटि के प्राथमिक स्रोत के रूप में पहचानता है और एक गणनात्मक रूप से कुशल हेसियन-वेक्टर-प्रोडक्ट (Hessian-vector-product) सुधार प्रस्तुत करता है जो विभिन्न मॉडल पैमानों पर मैकेनिस्टिक इंटरप्रिटेबिलिटी सर्किट की सटीकता और विश्वसनीयता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Luyang Zhang, Jialu Wang

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luyang Zhang, Jialu Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: AI के "मस्तिष्क कोशिकाओं" को खोजने की कोशिश

कल्पना कीजिए कि आपके पास एक विशाल, जटिल मशीन (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिख सकती है, गणित की समस्याओं को हल कर सकती है और आपसे बातें कर सकती है। वैज्ञानिक यह जानना चाहते हैं कि इस मशीन के कौन से विशिष्ट हिस्से विशिष्ट व्यवहारों के लिए जिम्मेदार हैं। उदाहरण के लिए, कौन सा "न्यूरॉन" "banana" के बजाय "apple" शब्द का उपयोग करने का निर्णय लेता है?

इन हिस्सों को खोजने के लिए, शोधकर्ता एक्टिवेशन पैचिंग (Activation Patching) नामक तकनीक का उपयोग करते हैं। इसे मशीन पर एक "सर्जरी" के रूप में सोचें:

  1. आप मशीन को एक सामान्य वाक्य के साथ चलाते हैं (जैसे, "The cat sat on the mat")।
  2. आप इसे एक बिगड़े हुए वाक्य के साथ फिर से चलाते हैं (जैसे, "The dog sat on the mat")।
  3. आप पहले रन की आंतरिक "मस्तिष्क गतिविधि" को दूसरे रन में बदल देते हैं।
  4. यदि मशीन अचानक ऐसे व्यवहार करने लगती है जैसे वह फिर से बिल्ली के बारे में बात कर रही हो, तो आप जान जाते हैं कि वह विशिष्ट हिस्सा महत्वपूर्ण है।

समस्या: आधुनिक AI के हर एक हिस्से पर यह सर्जरी करना एक गगनचुंबी इमारत की हर एक ईंट का परीक्षण करने जैसा है यह देखने के लिए कि कौन सी ईंट छत को थामे हुए है। इसमें बहुत अधिक समय और कंप्यूटर शक्ति लगती है।

शॉर्टकट: "एट्रिब्यूशन पैचिंग" (Attribution Patching)

चूंकि पूर्ण सर्जरी बहुत धीमी है, इसलिए शोधकर्ता एट्रिब्यूशन पैचिंग नामक एक शॉर्टकट का उपयोग करते हैं। हिस्सों को वास्तव में बदलने के बजाय, वे एक गणितीय अनुमान (एक "फर्स्ट-ऑर्डर एप्रोक्सिमेशन") का उपयोग करते हैं यह भविष्यवाणी करने के लिए कि कौन से हिस्से महत्वपूर्ण हो सकते हैं।

इसे इस तरह सोचें:

  • असली सर्जरी (एक्टिवेशन पै칭): आप वास्तव में कार का इंजन बदलते हैं और देखते हैं कि क्या वह बेहतर चलती है। सटीक, लेकिन इसमें घंटों लगते हैं।
  • शॉर्टकट (एट्रिब्यूशन पैचिंग): आप इंजन को देखते हैं, एक त्वरित गणना करते हैं, और अनुमान लगाते हैं, "हाँ, यह इंजन ही शायद समस्या है।" यह तेज़ है, लेकिन कभी-कभी अनुमान गलत होता है।

खोज: यह शॉर्टकट कब झूठ बोलता है

इस पेपर के लेखकों ने पूछा: "यह शॉर्टकट कब विफल होता है, और क्यों?"

उन्होंने पाया कि शॉर्टकट इसलिए विफल नहीं होता क्योंकि वह हिस्से की वजह से है, बल्कि इसलिए होता है क्योंकि उस हिस्से के बाद क्या होता है

डोमिनो चेन (Domino Chain) की उपमा:
कल्पना कीजिए कि डोमिनो की एक पंक्ति है।

  • शॉर्टकट की गलती: शॉर्टकट उस पहले डोमिनो को देखता जिसे आपने धक्का दिया और मान लेता है, "यदि मैं इसे धक्का दूँगा, तो पूरी पंक्ति गिर जाएगी।" यह मानता है कि धक्का एक सीधी, अनुमानित रेखा में यात्रा करता है।
  • वास्तविकता: एक जटिल AI में, "धक्का" अन्य डोमिनो के घुमावदार रास्ते से होकर गुजरता है। कभी-कभी, रास्ता मुड़ जाता है, या बल बढ़ जाता है, या अन्य बलों द्वारा रद्द कर दिया जाता है। शॉर्टकट इन घुमावों को नहीं देख पाता; वह केवल तत्काल धक्के को देखता है।

यह पेपर साबित करता है कि सबसे बड़ी त्रुटियां इसलिए होती हैं क्योंकि शॉर्टकट नेटवर्क के बाकी हिस्सों में सिग्नल द्वारा लिए जाने वाले पथ की वक्रता (curvature) को अनदेखा कर देता है। यह स्टीयरिंग व्हील को देखकर कार चलाने की कोशिश करने जैसा है, यह भूलकर कि आगे का रास्ता तीखे मोड़ों से भरा है।

समाधान: "स्क्रीन-फ्लैग-फिक्स" पाइपलाइन

लेखक इस समस्या को बिना धीमा किए ठीक करने के लिए तीन चरणों वाला वर्कफ़्लो प्रस्तावित करते हैं। वे इसे स्क्रीन-फ्लैग-फिक्स (Screen-Flag-Fix) कहते हैं।

1. स्क्रीन (त्वरित अनुमान - Screen)

पहले, AI के हर हिस्से पर तेज़, सस्ते शॉर्टकट (एट्रिब्यूशन पैचिंग) को चलाएं। यह आपको एक मोटा अनुमान देता है कि कौन महत्वपूर्ण है।

  • उपमा: आप भीड़ को जल्दी से स्कैन करते हैं ताकि यह अनुमान लगाया जा सके कि VIP कौन है। आपको 100 संदिग्धों की एक सूची मिलती है।

2. फ्लैग (विश्वसनीयता की जांच - Flag)

इसके बाद, अपनी सूची की जाँच करने के लिए एक नए "विश्वसनीयता स्कोर" (Reliability Score) का उपयोग करें। यह स्कोर पूछता है: "क्या आगे का रास्ता घुमावदार होने की संभावना है?"

  • यदि स्कोर कम है, तो शॉर्टकट शायद सही था।
  • यदि स्कोर अधिक है, तो शॉर्टकट संभवतः झूठ बोल रहा है क्योंकि रास्ता बहुत जटिल है।
  • उपमा: आप अपने 100 संदिग्धों की सूची देखते हैं। आप महसूस करते हैं कि उनमें से 90 के लिए, रास्ता सीधा है, इसलिए आपका अनुमान ठीक है। लेकिन 10 के लिए, रास्ता तीखे मोड़ों से भरा है। आप उन 10 को "अविश्वसनीय" के रूप में फ्लैग (चिह्नित) करते हैं।

3. फिक्स (लक्षित सर्जरी - Fix)

अंत में, आप केवल फ्लैग किए गए आइटम्स पर महंगी, सटीक "सर्जरी" (एक हेसियन-वेक्टर प्रोडक्ट या HVP का उपयोग करके) करते हैं।

  • उपमा: आप पूरी भीड़ की दोबारा जांच नहीं करते। आप केवल उन 10 संदिग्ध लोगों का गहन बैकग्राउंड चेक करते जिन्हें आपने फ्लैग किया था। इससे आपका 90% समय बचता है लेकिन फिर भी आप असली VIP को पकड़ लेते हैं।

यह क्यों मायने रखता है

यह पेपर दिखाता है कि यह तरीका अविश्वसनीय रूप से अच्छा काम करता है:

  1. यह सटीक है: यह AI के मस्तिष्क में होने वाली त्रुटियों को ठीक करता है जो "घुमावदार रास्तों" के कारण होती हैं। कुछ परीक्षणों में, इसने त्रुटियों को 80% से अधिक कम कर दिया।
  2. यह तेज़ है: क्योंकि यह केवल उन्हीं हिस्सों को ठीक करता है जो वास्तव में खराब हैं, यह हर चीज़ के लिए पूर्ण सर्जरी करने की तुलना में बहुत सस्ता है।
  3. यह स्केल करता है: अन्य तरीके जो इन त्रुटियों को ठीक करने की कोशिश करते हैं (जैसे "इंटीग्रेटेड ग्रेडिएंट्स"), बड़े AI मॉडल (जैसे 8 बिलियन पैरामीटर वाले) पर उपयोग करना असंभव हो जाता है। यह नया तरीका उन विशाल मॉडलों पर भी काम करता है।

निष्कर्ष

यह पेपर हमें सिखाता है कि AI के मस्तिष्क को समझने के लिए सामान्य शॉर्टकट अक्सर अविश्वसनीय होता है क्योंकि यह नेटवर्क में बाद में सिग्नल द्वारा लिए जाने वाले जटिल रास्तों को अनदेखा कर देता है। अविश्वसनीय अनुमानों को खोजने और केवल उन्हें ठीक करने के लिए एक स्मार्ट "चेकलिस्ट" का उपयोग करके, हम एक त्वरित अनुमान की गति के साथ पूर्ण सर्जरी की सटीकता प्राप्त कर सकते है। यह वैज्ञानिकों को यह समझने के लिए एक अधिक सटीक मानचित्र बनाने में मदद करता है कि AI मॉडल वास्तव में कैसे सोचते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →