← नवीनतम पेपर
🤖 machine learning

IG-Lens: Exact Additive Probability Attribution Across Transformer Layers via Telescoping Integrated Gradients

यह शोध पत्र IG-Lens प्रस्तुत करता है, जो एक नवीन विधि है जो एक एकल पथ (single path) के साथ टेलोस्कोपिंग इंटीग्रेटेड ग्रेडिएंट्स (telescoping Integrated Gradients) को लागू करके ट्रांसफॉर्मर परतों में सटीक, योगात्मक संभाव्यता एट्रिब्यूशन (additive probability attribution) प्राप्त करती है, जिससे मौजूदा लॉजिट-आधारित या गैर-योगात्मक रीडआउट टूल्स की गैर-रैखिकता और पूर्वाग्रह सीमाओं को पार करते हुए बिना विविक्तीकरण त्रुटि (discretization error) के पूर्णता सुनिश्चित की जाती है।

मूल लेखक: Duc Anh Nguyen

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Duc Anh Nguyen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े लैंग्वेज मॉडल (जैसे कि इस चैट को चलाने वाला मॉडल) की कल्पना एक बहु-मंजिला कारखाने के रूप में करें जहाँ एक कच्चा विचार नीचे से प्रवेश करता है और एक तैयार उत्पाद (एक अनुमानित शब्द) ऊपर से बाहर आता है।

लंबे समय से, शोधकर्ता एक सरल प्रश्न का उत्तर देने की कोशिश कर रहे हैं: "इस कारखाने के ठीक किस तल (floor) पर 'Hanoi' कहने का निर्णय वास्तव में लिया जाता है?"

मौजूदा उपकरण इस प्रश्न का उत्तर देने का प्रयास करते रहे हैं, लेकिन वे खराब मुनीमों (accountants) की तरह रहे हैं:

  • कुछ उपकरण प्रत्येक तल को देखते हैं और अनुमान लगाते हैं कि कारखाना कितना "आत्मविश्वासी" है, लेकिन उनके अनुमानों का योग 100% नहीं होता है। यह ऐसा है जैसे कहना कि फ्लोर 1 पर 40% भरोसा है, फ्लोर 2 पर 60% और फ्लोर 3 पर 80%—कुल मिलाकर 180%, जो कि तर्कहीन है।
  • अन्य उपकरण कच्चे नंबरों (logits) को देखते हैं जो उन्हें प्रतिशत में बदलने से पहले होते हैं। लेकिन कच्चे नंबरों को संभावनाओं (probabilities) में बदलना एक केक बनाने जैसा है; आप केवल आटे और अंडों को अलग-अलग जोड़कर तैयार केक का वजन उम्मीद नहीं कर सकते। "बेकिंग" (वह गणित जिसे softmax कहा जाता है) सब कुछ बदल देता है।
  • तीसरा समूह प्रत्येक तल पर किए गए कार्य को मापने का प्रयास करता है, लेकिन वे प्रत्येक तल को एक अलग शुरुआती बिंदु के विरुद्ध मापते हैं, इसलिए उनके नंबरों का कुल योग मिलकर कुल कार्य नहीं बता पाता है।

IG-Lens का आगमन: एक आदर्श मुनीम

यह पेपर IG-Lens को पेश करता है, जो इस कारखाने के लिए एक आदर्श मुनीम की तरह काम करने वाली एक नई विधि है। यह एक "टेलीस्कोपिंग" ट्रिक (सोचिए एक कोलैप्सिबल टेलीस्कोप की तरह जो फैलता और सिकुड़ता है) का उपयोग करके इस समस्या को हल करता है।

यह सरल शब्दों में इस प्रकार काम करता है:

1. "एक-बार का स्नैपशॉट" नियम
शब्द को पूरे कारखाने से गुजरने और हर मोड़ पर अन्य शब्दों के साथ मिश्रित होने देने के बजाय, IG-Lens विशिष्ट स्तरों (floors) पर शब्द की स्थिति का एक "स्नैपशॉट" लेता है। फिर यह पूछता है: "यदि हम फ्लोर 10 से स्थिति (state) लें और उसे केवल अंतिम 'फिनिशिंग' मशीन (वह हिस्सा जो कच्चे डेटा को संभावना में बदलता है) के माध्यम से चलाएं, तो परिणाम क्या होगा?"

2. टेलीस्कोपिंग सम (Telescoping Sum)
IG-Lens यात्रा को खंडों (जैसे, फ्लोर 10 से 11, 11 से 12, आदि) में विभाजित करता है।

  • यह फ्लोर 10 पर शब्द की संभावना की गणना करता है।
  • यह फ्लोर 11 पर संभावना की गणना करता है।
  • उनके बीच का अंतर उस विशिष्ट खंड पर किया गया सटीक कार्य है।
  • क्योंकि यह हर चरण पर परिवर्तन को मापता है, इसलिए जब आप नीचे से ऊपर तक सभी परिवर्तनों को जोड़ते हैं, तो वे पूरी तरह से शुरुआत से अंत तक के कुल परिवर्तन के बराबर होते हैं। इसमें कोई भी गणित गायब नहीं होता, कोई "बेकिंग त्रुटि" नहीं होती, और कोई राउंडिंग की समस्या नहीं होती।

3. "प्रेडिक्शन-अवेयर" फ़िल्टर
अधिकांश विधियाँ यह अनुमान लगाने के लिए कि महत्व क्या है, यह देखती हैं कि नंबर कितना हिलते (gradients) हैं। लेकिन कभी-कभी नंबर बहुत अधिक हिलते हैं बिना अंतिम निर्णय को बदले।
IG-Lens अधिक स्मार्ट है। यह एक तल को कार्य का श्रेय तभी देता है जब शब्द की वास्तविक संभावना बदली हो। यदि नंबर हिलते हैं लेकिन भविष्यवाणी नहीं बदलती, तो IG-Lens उस हलचल को अनदेखा कर देता है। यह एक ऐसे मैनेजर की तरह है जो केवल उन दिनों के लिए श्रमिकों को भुगतान करता है जब उन्होंने वास्तव में एक कार्य पूरा किया हो, न कि उन दिनों के लिए जब वे केवल बक्से इधर-उधर ले जाने में व्यस्त थे।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

  • यह सटीक है: पिछले उपकरणों के विपरीत जो आपको एक अनुमान देते हैं, IG-Lens गारंटी देता है कि यदि आप प्रत्येक परत के योगदान को जोड़ते हैं, तो आपको बिल्कुल अंतिम संभावना प्राप्त होगी। यह गणितीय रूप से पूर्ण है (कंप्यूटर गणित की सीमाओं तक)।
  • यह "ऑनसेट" (शुरुआत) को ढूंढता है: यह आपको बता सकता है कि मॉडल ने शब्द पर निर्णय ठीक किस परत पर लिया था। उदाहरण के लिए, यह दिखा सकता है कि शब्द "capital" के लिए, निर्णय मुख्य रूप से परत 12 द्वारा लिया गया था, लेकिन "Hanoi" के लिए, निर्णय बहुत बाद में, परत 15 या 16 के आसपास हुआ था।
  • यह सीमाओं के बारे में ईमानदार है: पेपर स्वीकार करता है कि एक ट्रेड-ऑफ है। क्योंकि IG-Lens एक विशिष्ट परत पर शब्द के "स्नैपशॉट" को देखता है, यह उस कार्य को नहीं गिनता जो वह परत तब कर सकती है जब शब्द ऊपर की ओर यात्रा करता है। यह मापता है: "जहाँ से हमने शुरू किया था, उसे देखते हुए इस परत ने अंतिम उत्तर में कितना योगदान दिया?" न कि "इस परत का पूरे सिस्टम पर कुल प्रभाव क्या था?"

निचोड़

IG-Lens AI मॉडलों के भीतर देखने का एक नया तरीका है जो अंततः इस प्रश्न का उत्तर देता है, "मॉडल ने निर्णय कब लिया?"—एक गणितीय रूप से पूर्ण "रसीद" के साथ जो 100% तक जुड़ती है। यह अनुमान नहीं लगाता; यह परत दर परत संभावना के सटीक परिवर्तन की गणना करता है, शोर को फ़िल्टर करता है और आपको दिखाता है कि निर्णय वास्तव में कहाँ हुआ था।

लेखक इसे परीक्षण करने की योजना बना रहे हैं: उन परतों पर मॉडल को "तोड़कर" (break करके) जिन्हें IG-Lens ने पहचाना है, यह देखने के लिए कि क्या मॉडल वास्तव में वहीं सही ढंग से काम करना बंद कर देता है, जो यह सिद्ध करेगा कि विधि वास्तविक निर्णय बिंदुओं को खोज रही है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →