ADAG: Automatically Describing Attribution Graphs
यह शोध पत्र ADAG को प्रस्तुत करता है, जो एक स्वचालित एंड-टू-एंड पाइपलाइन है जो एट्रिब्यूशन ग्राफ्स के प्राकृतिक-भाषा विवरण उत्पन्न करने के लिए एट्रिब्यूशन प्रोफाइल्स, नवीन क्लस्टरिंग और एक LLM एक्सप्लैनर-सिम्युलेटर का उपयोग करता है, जो मैन्युअल मानवीय निरीक्षण पर निर्भर रहे बिना भाषा मॉडलों में व्याख्या योग्य सर्किटों को सफलतापूर्वक पुनर्प्राप्त करता है और हानिकारक फीचर क्लस्टरों की पहचान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक लार्ज लैंग्वेज मॉडल (जैसे कि इस चैट को चलाने वाला मॉडल) की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें। इस शहर के भीतर, लाखों छोटे कर्मचारी (न्यूरॉन्स) लगातार नोट्स पास कर रहे हैं, निर्देश चिल्ला रहे हैं और अंतिम उत्तर देने के लिए निर्णय ले रहे हैं।
लंबे समय तक, शोधकर्ताओं को पता था कि किसी विशिष्ट कार्य (जैसे भूगोल के प्रश्न का उत्तर देना) में कौन से कर्मचारी शामिल थे, लेकिन उन्हें यह नहीं पता था कि वे कर्मचारी वास्तव में क्या सोच रहे हैं या क्या कह रहे हैं। उन्हें कर्मचारियों का मैन्युअल रूप से निरीक्षण करना पड़ता था, उनके नोट्स पढ़ने पड़ते थे और उनकी भूमिकाओं का अनुमान लगाना पड़ता था। यह एक जटिल नाटक को थिएटर के पीछे से अभिनेताओं को देखते हुए और उनके संवादों का अनुमान लगाने जैसा था।
ADAG (ऑटोमैटिकली डिस्क्राइबिंग एट्रिब्यूशन ग्राफ्स) एक नया टूल है जो एक सुपर-स्मार्ट, स्वचालित डॉक्यूमेंट्री क्रू की तरह काम करता है। यह केवल कर्मचारियों को ढूंढता ही नहीं है, बल्कि उनका साक्षात्कार भी लेता है, उन्हें टीमों में समूहबद्ध करता है, और एक स्पष्ट, सरल भाषा में स्क्रिप्ट लिखता है जो समझाती है कि प्रत्येक टीम वास्तव में क्या करती है।
ADAG कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:
1. "किसने क्या किया?" का मानचित्र (सर्किट ट्रेसिंग)
सबसे पहले, ADAG एक विशिष्ट प्रश्न (जैसे, "टेक्सास की राजधानी क्या है?") को देखता है और शहर के माध्यम से "बिजली" के मार्ग का पता लगाता है। यह पहचानता है कि "ऑस्टिन" उत्तर देने के लिए किन न्यूरॉन्स ने सक्रियता दिखाई।
- पुराना तरीका: शोधकर्ता सक्रिय न्यूरॉन्स की सूची को मैन्युअल रूप से देखते थे और अनुमान लगाने की कोशिश करते थे, "ओह, यह वाला शायद टेक्सास के बारे में जानता है।"
- ADAG का तरीका: यह स्वचालित रूप से एक नक्शा बनाता है जो दिखाता है कि किन न्यूरॉन्स ने योगदान दिया और कितनी मजबूती से।
2. "रिज्यूमे" (एट्रिब्यूशन प्रोफाइल्स)
केवल यह देखने के बजाय कि एक न्यूरॉन कब सक्रिय हुआ, ADAG उसका रिज्यूमे देखता है। यह प्रत्येक न्यूरॉन के लिए दो प्रश्न पूछता है:
- इनपुट: प्रश्न के किन शब्दों ने इस न्यूरॉन को जगाया? (जैसे, "क्या यह 'डलास' शब्द देखने पर जागा?")
- आउटपुट: इस न्यूरॉन ने अंतिम उत्तर की ओर किस तरह के शब्दों को धकेलने में मदद की? (जैसे, "क्या इसने 'ऑस्टिन' या 'टेक्सास' शब्द को आगे बढ़ाने में मदद की?")
यह प्रत्येक न्यूरॉन के लिए एक विस्तृत "प्रोफाइल" बनाता है, जो उसकी ताकत और कमजोरियों को दर्शाता है।
3. "टीम बिल्डिंग" (क्लस्टरिंग)
लाखों की आबादी वाले शहर में, आप हर कर्मचारी से व्यक्तिगत रूप से बात नहीं कर सकते। ADAG समान श्रमिकों को टीमों (सुपरनोड्स) में समूहित करता है।
- यह एक स्मार्ट एल्गोरिदम का उपयोग करता है और कहता है, "हे, ये 20 न्यूरॉन्स सभी तब जागते हैं जब वे 'डलास' देखते हैं और वे सभी 'टेक्सास' की ओर बढ़ते हैं। आइए उन्हें एक ही टीम में रखें।"
- यह 1,000 न्यूरॉन्स की एक अराजक सूची को 20 विशिष्ट टीमों की एक व्यवस्थित सूची में बदल देता है, जिनमें से प्रत्येक का एक विशिष्ट कार्य होता है।
4. "अनुवादक" (LLM एक्सप्लेनर)
अब जादू आता है। ADAG इन टीमों को लेता है और दूसरे AI (एक लैंग्वेज मॉडल) से एक अनुवादक के रूप में कार्य करने के लिए कहता है।
- एक्सप्लेनर (व्याख्याकार): "इस टीम के रिज्यूमे के आधार पर, आपको क्या लगता है कि उनका काम क्या है?" यह "टेक्सास सिटी डिटेक्टर" जैसा लेबल गेस करता है।
- सिमुलेटर (अनुकरणकर्ता): "ठीक है, चलिए उस लेबल का परीक्षण करते हैं। यदि यह टीम वास्तव में एक 'टेक्सस सिटी डिटेक्टर' है, तो क्या होगा यदि हम उन्हें फ्रांस का कोई शहर दिखाएं?" सिमुलेटर जांचता है कि क्या अनुमान सही है।
- यदि अनुमान विफल हो जाता है, तो एक्सप्लेनर फिर से प्रयास करता है। यदि यह सफल होता है, तो ADAG उस लेबल को रख लेता है।
यह क्यों महत्वपूर्ण है: दो वास्तविक दुनिया के उदाहरण
उदाहरण 1: भूगोल की क्विज़
जब पूछा गया, "उस राज्य की राजधानी क्या है जिसमें डलास स्थित है?", तो ADAG ने स्वचालित रूप से "डलास टेक्सास" लेबल वाली न्यूरॉन्स की एक टीम को खोज निकाला।
- खोज: जब शोधकर्ताओं ने इस विशिष्ट टीम को बंद किया, तो मॉडल "ऑस्टिन" कहना बंद कर दिया और "ओक्लाहोमा" या "टेक्सास" जैसे उत्तर देने लगा।
- परिणाम: ADAG ने बिना किसी मानवीय सहायता के सिद्ध किया कि न्यूरॉन्स की यह विशिष्ट टीम मॉडल के मस्तिष्क में "डलास-टू-टेक्सास" का सेतु (ब्रिज) है।
उदाहरण 2: "जेलब्रेक" (हानिकारक सलाह)
शोधकर्ताओं ने एक ट्रिकी प्रॉम्प्ट पाया जो मॉडल को खतरनाक चिकित्सा सलाह देने के लिए {ट्रिक} करता है (जैसे "एक साथ पांच गोलियां लें")।
- खोज: ADAG ने मॉडल के मस्तिष्क को स्कैन किया जब उसे चकमा दिया जा रहा था। उसने "रिडिकुलस-टू-इंट्रोडक्टरी" लेबल वाली न्यूरॉन्स की एक टीम को पाया।
- समाधान: जब उन्होंने इस विशिष्ट टीम की गतिविधि को बढ़ाया, तो मॉडल अचानक से सुरक्षित सलाह देने लगा। जब उन्होंने इसे शांत किया, तो मॉडल खतरनाक हो गया।
- प्रभाव: यह हमें समझने में मदद करता है कि मॉडल को ठीक से कैसे चकमा दिया जाता है और हम उन छेदों को स्वचालित रूप से कैसे भर सकते हैं।
बड़ी तस्वीर (द बिग पिक्चर)
ADAG से पहले, AI के सोचने के तरीके को समझना एक कार के इंजन को ठीक करने के लिए यह अनुमान लगाने जैसा था कि कौन सा बोल्ट कसना है। आपको एक विशेषज्ञ होना पड़ता था, घंटों खर्च करने पड़ते थे, और अक्सर गलत अनुमान लगाना पड़ता था।
ADAG एक मैकेनिक के डायग्नोस्टिक कंप्यूटर की तरह है। आप इसे प्लग करते हैं, और यह तुरंत आपको बताता है:
- "'फ्यूल इंजेक्शन टीम' कड़ी मेहनत कर रही है।"
- "'ब्रेक सेंसर टीम' भ्रमित है।"
- "यहाँ एक सरल वाक्य है जो समझा रहा है कि क्या गलत है।"
इस प्रक्रिया को स्वचालित करके, ADAG हमें स्केल करने की अनुमति देता है। अब हम विशाल AI मॉडल के "मस्तिष्क" की जांच कर सकते हैं ताकि यह सुनिश्चित किया जा सके कि वे सुरक्षित, ईमानदार और वही कर रहे हैं जो हम उनसे चाहते हैं, बिना किसी मानव जासूसों की टीम के जो हफ्तों तक डेटा को घूरते रहें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।