← नवीनतम पेपर
💬 NLP

Interpreto: An Explainability Library for Transformers

Interpreto एक ओपन-सोर्स पायथन लाइब्रेरी है जो HuggingFace लैंग्वेज मॉडल्स के लिए एट्रिब्यूशन और कॉन्सेप्ट-आधारित स्पष्टीकरण विधियों को एकीकृत करती है, जो हालिया शोध को व्यावहारिक टूलिंग के साथ जोड़ते हुए कॉन्सेप्ट लर्निंग और इंटरप्रिटेशन के लिए एक विशिष्ट एंड-टू-एंड पाइपलाइन प्रदान करती है।

मूल लेखक: Antonin Poché, Thomas Mullor, Gabriele Sarti, Frédéric Boisnard, Corentin Friedrich, Charlotte Claye, François Hoofd, Raphael Bernas, Céline Hudelot, Fanny Jourdan

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Antonin Poché, Thomas Mullor, Gabriele Sarti, Frédéric Boisnard, Corentin Friedrich, Charlotte Claye, François Hoofd, Raphael Bernas, Céline Hudelot, Fanny Jourdan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट है जो हजारों किताबें पढ़ता है और कहानियाँ लिखता है या यह अनुमान लगाता है कि आप क्या महसूस कर रहे हैं। यह अपने काम में अविश्वसनीय रूप से कुशल है, लेकिन यह एक "ब्लैक बॉक्स" (black box) भी है। आप इनपुट (वह टेक्स्ट जो आप देते हैं) और आउटपुट (जो उत्तर वह देता है) को देखते हैं, लेकिन आपको पता नहीं चलता कि उसने उस उत्तर तक पहुँचने का निर्णय कैसे लिया। यह एक जादूगर को टोपी से खरगोश निकालते हुए देखने जैसा है, लेकिन आप उसका करतब नहीं देख सकते।

INTERPRETO एक नया ओपन-सोर्स टूलकिट है जिसे उस टोपी के पर्दे को उठाने के लिए डिज़ाइन किया गया है। यह एक लाइब्रेरी (प्रोग्रामर के लिए उपकरणों का संग्रह) है जो हमें इन "ब्लैक बॉक्स" AI मॉडल्स के भीतर झाँकने और उनकी विचार प्रक्रिया को समझने में मदद करती है।

यह कैसे काम करता है, यहाँ इसके दो मुख्य "सुपरपावर्स" में विभाजित है:

1. "हाइलाइटर" की शक्ति (Attributions)

उपमा: कल्पना कीजिए कि आप एक रहस्यमयी उपन्यास पढ़ रहे हैं, और आप जानना चाहते हैं कि जासूस ने केस को कैसे सुलझाया। आप एक पीला हाइलाइटर उठाते हैं और टेक्स्ट में उन विशिष्ट शब्दों को मार्क करते हैं जिन्होंने जासूस को सुराग दिया।

  • INTERPRETO इसे कैसे करता है: यह Attribution नामक एक विधि का उपयोग करता है। जब AI एक भविष्यवाणी करता है (जैसे "यह ट्वीट गुस्से वाला है" या "अगला शब्द 'बिल्ली' है"), तो INTERPRETO वापस जाता है और उन विशिष्ट शब्दों को हाइलाइट करता है जो सबसे अधिक महत्वपूर्ण थे।
  • यह क्यों शानदार है: यह केवल अनुमान नहीं लगाता; यह हर शब्द को एक स्कोर देता है। क्या शब्द "क्रोधित" ने गुस्से की भविष्यवाणी को प्रेरित किया? या क्या यह विस्मयादिबोधक चिह्न (!) था? यह पढ़ने (classification) और लिखने (text generation) दोनों के लिए काम करता है।

2. "अनुवादक" की शक्ति (Concepts)

उपमा: कल्पना कीजिए कि रोबोट का मस्तिष्क केवल शब्दों की एक सूची नहीं है, बल्कि अमूर्त विचारों (abstract ideas) का एक विशाल पुस्तकालय है। शायद मस्तिष्क में एक "दराज" पर "उदासी" लिखा है, दूसरी पर "गणित के तथ्य", और तीसरी पर "खेलों की शब्दावली"। जब रोबोट एक वाक्य पढ़ता है, तो वह देखता है कि इन दराजों के अंदर क्या है।

  • INTERPRETO इसे कैसे करता है: यह Concept-Based शक्ति है। केवल शब्दों को हाइलाइट करने के बजाय, INTERPRETO AI के मस्तिष्क के भीतर इन छिपे हुए "दराजों" (concepts) को खोजने की कोशिश करता है।
    • चरण 1: यह AI के अंदर के कच्चे विद्युत संकेतों (activations) को देखने के लिए उसे खोल देता है।
    • चरण 2: यह पैटर्न खोजने के लिए समान संकेतों को एक साथ समूहित करता है (जैसे, "ओह, यह न्यूरॉन्स का समूह हमेशा तब सक्रिय होता है जब टेक्स्ट में 'पैसा' का उल्लेख होता है")।
    • चरण 3: यह इन समूहों को मानव-पठनीय नाम (जैसे "वित्तीय शब्दावली" या "भावनात्मक पीड़ा") देने के लिए दूसरे, सरल AI का उपयोग करता है।
    • चरण 4: यह आपको बताता है कि उन "दराजों" ने अंतिम उत्तर में कितना योगदान दिया।

यह एक बड़ी बात क्यों है?

INTERPRETO से पहले, यदि आप यह करना चाहते थे, तो आपको एक मास्टर बढ़ई होना पड़ता था। आपको अलग-अलग दुकानों से एक आरी (एक उपकरण), एक हथौड़ा (दूसरा उपकरण), और एक लेवल (तीसरा उपकरण) खरीदना पड़ता, और फिर उन्हें एक साथ काम करने के लिए figuring out करना पड़ता। यह बहुत अव्यवस्थित और कठिन था।

INTERPRETO एक स्विस आर्मी नाइफ (Swiss Army Knife) की तरह है।

  • एक टूल, दो काम: यह एक ही पैकेज में "हाइलाइटर" (शब्दों) और "अनुवादक" (कॉन्सेप्ट्स) दोनों को संभालता है।
  • सभी के साथ काम करता है: यह सबसे लोकप्रिय AI मॉडल्स (HuggingFace) के साथ आसानी से काम करता है, इसलिए आपको इसे उपयोग करने के लिए कोई नई भाषा सीखने की आवश्यकता नहीं है।
  • रिसर्च से वास्तविकता तक: यह विश्वविद्यालय की प्रयोगशालाओं के जटिल गणित को सरल कोड में बदल देता है जिसे एक सामान्य डेवलपर केवल कुछ लाइनों के साथ चला सकता है।

एक वास्तविक दुनिया का परिदृश्य

कल्पना कीजिए कि एक बैंक ऋण (loan) स्वीकृत करने के लिए एक AI का उपयोग करता है। AI ऋण को अस्वीकार कर देता है, लेकिन बैंक को नहीं पता कि क्यों।

  • INTERPRETO के बिना: बैंक केवल जानता है कि "AI ने मना कर दिया।" वे फंस गए हैं।
  • INTERPRETO के साथ:
    • हाइलाइटर दिखाता है कि AI ने आवेदक के "ऋण-से-आय अनुपात" (debt-to-income ratio) पर बहुत अधिक ध्यान केंद्रित किया।
    • अनुवादक प्रकट करता है कि AI के पास एक छिपा हुआ "कॉन्सेप्ट" है जो "उच्च जोखिम वाले उद्योग" (High Risk Industries) के लिए है जिसे उसने पिछले डेटा से सीखा है, और आवेदक उसी उद्योग में काम करता है।
    • परिणाम: बैंक अब पूर्वाग्रह (bias) को ठीक कर सकता है, तर्क को समझ सकता है, और सिस्टम पर भरोसा कर सकता है (या यदि तर्क गलत है तो उसे ठीक कर सकता है)।

निचोड़ (The Bottom Line)

INTERPRETO AI मस्तिष्क का यूजर मैनुअल है। यह एक Large Language Model के रहस्यमय, चमकते हुए मस्तिष्क को ऐसी चीज़ में बदल देता है जिसे हम वास्तव में देख, समझ और डीबग कर सकते हैं। यह हमें "कंप्यूटर ने ऐसा कहा" से "यहाँ सटीक रूप से बताया गया है कि कंप्यूटर ने ऐसा क्यों कहा" की ओर ले जाने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →