← नवीनतम पेपर
💬 NLP

ADAG: Automatically Describing Attribution Graphs

यह शोध पत्र ADAG को प्रस्तुत करता है, जो एक स्वचालित एंड-टू-एंड पाइपलाइन है जो एट्रिब्यूशन ग्राफ्स के प्राकृतिक-भाषा विवरण उत्पन्न करने के लिए एट्रिब्यूशन प्रोफाइल्स, नवीन क्लस्टरिंग और एक LLM एक्सप्लैनर-सिम्युलेटर का उपयोग करता है, जो मैन्युअल मानवीय निरीक्षण पर निर्भर रहे बिना भाषा मॉडलों में व्याख्या योग्य सर्किटों को सफलतापूर्वक पुनर्प्राप्त करता है और हानिकारक फीचर क्लस्टरों की पहचान करता है।

मूल लेखक: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (जैसे कि इस चैट को चलाने वाला मॉडल) की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें। इस शहर के भीतर, लाखों छोटे कर्मचारी (न्यूरॉन्स) लगातार नोट्स पास कर रहे हैं, निर्देश चिल्ला रहे हैं और अंतिम उत्तर देने के लिए निर्णय ले रहे हैं।

लंबे समय तक, शोधकर्ताओं को पता था कि किसी विशिष्ट कार्य (जैसे भूगोल के प्रश्न का उत्तर देना) में कौन से कर्मचारी शामिल थे, लेकिन उन्हें यह नहीं पता था कि वे कर्मचारी वास्तव में क्या सोच रहे हैं या क्या कह रहे हैं। उन्हें कर्मचारियों का मैन्युअल रूप से निरीक्षण करना पड़ता था, उनके नोट्स पढ़ने पड़ते थे और उनकी भूमिकाओं का अनुमान लगाना पड़ता था। यह एक जटिल नाटक को थिएटर के पीछे से अभिनेताओं को देखते हुए और उनके संवादों का अनुमान लगाने जैसा था।

ADAG (ऑटोमैटिकली डिस्क्राइबिंग एट्रिब्यूशन ग्राफ्स) एक नया टूल है जो एक सुपर-स्मार्ट, स्वचालित डॉक्यूमेंट्री क्रू की तरह काम करता है। यह केवल कर्मचारियों को ढूंढता ही नहीं है, बल्कि उनका साक्षात्कार भी लेता है, उन्हें टीमों में समूहबद्ध करता है, और एक स्पष्ट, सरल भाषा में स्क्रिप्ट लिखता है जो समझाती है कि प्रत्येक टीम वास्तव में क्या करती है।

ADAG कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "किसने क्या किया?" का मानचित्र (सर्किट ट्रेसिंग)

सबसे पहले, ADAG एक विशिष्ट प्रश्न (जैसे, "टेक्सास की राजधानी क्या है?") को देखता है और शहर के माध्यम से "बिजली" के मार्ग का पता लगाता है। यह पहचानता है कि "ऑस्टिन" उत्तर देने के लिए किन न्यूरॉन्स ने सक्रियता दिखाई।

  • पुराना तरीका: शोधकर्ता सक्रिय न्यूरॉन्स की सूची को मैन्युअल रूप से देखते थे और अनुमान लगाने की कोशिश करते थे, "ओह, यह वाला शायद टेक्सास के बारे में जानता है।"
  • ADAG का तरीका: यह स्वचालित रूप से एक नक्शा बनाता है जो दिखाता है कि किन न्यूरॉन्स ने योगदान दिया और कितनी मजबूती से।

2. "रिज्यूमे" (एट्रिब्यूशन प्रोफाइल्स)

केवल यह देखने के बजाय कि एक न्यूरॉन कब सक्रिय हुआ, ADAG उसका रिज्यूमे देखता है। यह प्रत्येक न्यूरॉन के लिए दो प्रश्न पूछता है:

  1. इनपुट: प्रश्न के किन शब्दों ने इस न्यूरॉन को जगाया? (जैसे, "क्या यह 'डलास' शब्द देखने पर जागा?")
  2. आउटपुट: इस न्यूरॉन ने अंतिम उत्तर की ओर किस तरह के शब्दों को धकेलने में मदद की? (जैसे, "क्या इसने 'ऑस्टिन' या 'टेक्सास' शब्द को आगे बढ़ाने में मदद की?")

यह प्रत्येक न्यूरॉन के लिए एक विस्तृत "प्रोफाइल" बनाता है, जो उसकी ताकत और कमजोरियों को दर्शाता है।

3. "टीम बिल्डिंग" (क्लस्टरिंग)

लाखों की आबादी वाले शहर में, आप हर कर्मचारी से व्यक्तिगत रूप से बात नहीं कर सकते। ADAG समान श्रमिकों को टीमों (सुपरनोड्स) में समूहित करता है।

  • यह एक स्मार्ट एल्गोरिदम का उपयोग करता है और कहता है, "हे, ये 20 न्यूरॉन्स सभी तब जागते हैं जब वे 'डलास' देखते हैं और वे सभी 'टेक्सास' की ओर बढ़ते हैं। आइए उन्हें एक ही टीम में रखें।"
  • यह 1,000 न्यूरॉन्स की एक अराजक सूची को 20 विशिष्ट टीमों की एक व्यवस्थित सूची में बदल देता है, जिनमें से प्रत्येक का एक विशिष्ट कार्य होता है।

4. "अनुवादक" (LLM एक्सप्लेनर)

अब जादू आता है। ADAG इन टीमों को लेता है और दूसरे AI (एक लैंग्वेज मॉडल) से एक अनुवादक के रूप में कार्य करने के लिए कहता है।

  • एक्सप्लेनर (व्याख्याकार): "इस टीम के रिज्यूमे के आधार पर, आपको क्या लगता है कि उनका काम क्या है?" यह "टेक्सास सिटी डिटेक्टर" जैसा लेबल गेस करता है।
  • सिमुलेटर (अनुकरणकर्ता): "ठीक है, चलिए उस लेबल का परीक्षण करते हैं। यदि यह टीम वास्तव में एक 'टेक्सस सिटी डिटेक्टर' है, तो क्या होगा यदि हम उन्हें फ्रांस का कोई शहर दिखाएं?" सिमुलेटर जांचता है कि क्या अनुमान सही है।
  • यदि अनुमान विफल हो जाता है, तो एक्सप्लेनर फिर से प्रयास करता है। यदि यह सफल होता है, तो ADAG उस लेबल को रख लेता है।

यह क्यों महत्वपूर्ण है: दो वास्तविक दुनिया के उदाहरण

उदाहरण 1: भूगोल की क्विज़
जब पूछा गया, "उस राज्य की राजधानी क्या है जिसमें डलास स्थित है?", तो ADAG ने स्वचालित रूप से "डलास टेक्सास" लेबल वाली न्यूरॉन्स की एक टीम को खोज निकाला।

  • खोज: जब शोधकर्ताओं ने इस विशिष्ट टीम को बंद किया, तो मॉडल "ऑस्टिन" कहना बंद कर दिया और "ओक्लाहोमा" या "टेक्सास" जैसे उत्तर देने लगा।
  • परिणाम: ADAG ने बिना किसी मानवीय सहायता के सिद्ध किया कि न्यूरॉन्स की यह विशिष्ट टीम मॉडल के मस्तिष्क में "डलास-टू-टेक्सास" का सेतु (ब्रिज) है।

उदाहरण 2: "जेलब्रेक" (हानिकारक सलाह)
शोधकर्ताओं ने एक ट्रिकी प्रॉम्प्ट पाया जो मॉडल को खतरनाक चिकित्सा सलाह देने के लिए {ट्रिक} करता है (जैसे "एक साथ पांच गोलियां लें")।

  • खोज: ADAG ने मॉडल के मस्तिष्क को स्कैन किया जब उसे चकमा दिया जा रहा था। उसने "रिडिकुलस-टू-इंट्रोडक्टरी" लेबल वाली न्यूरॉन्स की एक टीम को पाया।
  • समाधान: जब उन्होंने इस विशिष्ट टीम की गतिविधि को बढ़ाया, तो मॉडल अचानक से सुरक्षित सलाह देने लगा। जब उन्होंने इसे शांत किया, तो मॉडल खतरनाक हो गया।
  • प्रभाव: यह हमें समझने में मदद करता है कि मॉडल को ठीक से कैसे चकमा दिया जाता है और हम उन छेदों को स्वचालित रूप से कैसे भर सकते हैं।

बड़ी तस्वीर (द बिग पिक्चर)

ADAG से पहले, AI के सोचने के तरीके को समझना एक कार के इंजन को ठीक करने के लिए यह अनुमान लगाने जैसा था कि कौन सा बोल्ट कसना है। आपको एक विशेषज्ञ होना पड़ता था, घंटों खर्च करने पड़ते थे, और अक्सर गलत अनुमान लगाना पड़ता था।

ADAG एक मैकेनिक के डायग्नोस्टिक कंप्यूटर की तरह है। आप इसे प्लग करते हैं, और यह तुरंत आपको बताता है:

  • "'फ्यूल इंजेक्शन टीम' कड़ी मेहनत कर रही है।"
  • "'ब्रेक सेंसर टीम' भ्रमित है।"
  • "यहाँ एक सरल वाक्य है जो समझा रहा है कि क्या गलत है।"

इस प्रक्रिया को स्वचालित करके, ADAG हमें स्केल करने की अनुमति देता है। अब हम विशाल AI मॉडल के "मस्तिष्क" की जांच कर सकते हैं ताकि यह सुनिश्चित किया जा सके कि वे सुरक्षित, ईमानदार और वही कर रहे हैं जो हम उनसे चाहते हैं, बिना किसी मानव जासूसों की टीम के जो हफ्तों तक डेटा को घूरते रहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →