← नवीनतम पेपर
🧬 biology

Mechanistic Interpretability of Antibody Language Models Using SAEs

यह शोध पत्र ऑटोरेग्रेसिव एंटीबॉडी लैंग्वेज मॉडल्स की व्याख्या करने और उन्हें नियंत्रित करने के लिए TopK और ऑर्डर्ड स्पार्स ऑटोएनकोडर (SAEs) के उपयोग की जांच करता है, जिसमें यह पाया गया है कि जबकि जैविक अवधारणाओं को मैप करने के लिए TopK SAEs बेहतर हैं, सटीक जेनेरेटिव स्टीयरिंग के लिए ऑर्डर्ड SAEs अधिक प्रभावी हैं।

मूल लेखक: Rebonto Haque, Oliver M. Turnbull, Anisha Parsan, Nithin Parsan, John J. Yang, Anna L. Beukenhorst, Charlotte M. Deane

प्रकाशित 2026-04-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rebonto Haque, Oliver M. Turnbull, Anisha Parsan, Nithin Parsan, John J. Yang, Anna L. Beukenhorst, Charlotte M. Deane

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

एंटीबॉडी की "गुप्त भाषा": एक सरल मार्गदर्शिका

कल्पना कीजिए कि आप लाखों निर्देश पुस्तिकाओं (manuals) से भरी एक विशाल, जटिल लाइब्रेरी को समझने की कोशिश कर रहे हैं। ये पुस्तिकाएं अंग्रेजी में नहीं, बल्कि एक विशेष "जैविक कोड" में लिखी गई हैं जो एंटीबॉडी बनाने के तरीके का वर्णन करती हैं—वे नन्हे सैनिक जो आपके इम्यून सिस्टम में वायरस और बैक्टीरिया का शिकार करते हैं।

वैज्ञानिकों ने "AI लाइब्रेरियन" (जिन्हें एंटीबॉडी लैंग्वेज मॉडल कहा जाता है) बनाए हैं जिन्होंने इन सभी पुस्तिकाओं को पढ़ा है। ये AI लाइब्रेरियन नई पुस्तिकाएं लिखने (नए एंटीबॉडी उत्पन्न करने) में अविश्वसनीय रूप से कुशल हैं, लेकिन एक बड़ी समस्या है: वे "ब्लैक बॉक्स" हैं।

भले ही AI एक आदर्श मैनुअल लिख सकता है, लेकिन हमें वास्तव में यह नहीं पता कि वह कैसे सोच रहा है। क्या वह वास्तव में जीव विज्ञान को समझ रहा है, या वह केवल पैटर्न के आधार पर अनुमान लगा रहा है? यदि हम जीवन बचाने वाली दवाओं को डिजाइन करने के लिए AI का उपयोग करना चाहते हैं, तो हम केवल इस उम्मीद पर नहीं छोड़ सकते कि वह सही होगा; हमें कार की तरह AI के अंदर झांकने और उसे नियंत्रित करने की क्षमता चाहिए।

यह शोध पत्र स्पार्स ऑटोएनकोडर्स (Sparse Autoencoders - SAEs) नामक एक उपकरण का उपयोग करके AI के मस्तिष्क के भीतर "झांकने" के एक नए तरीके की खोज करता है।


दो उपकरण: "हाइलाइटर" बनाम "मास्टर आर्किटेक्ट"

शोधकर्ताओं ने इन SAE उपकरणों का उपयोग करके AI को समझने के दो अलग-अलग तरीकों का परीक्षण किया। इसे एक जटिल संगीत को समझने की कोशिश करने जैसा समझें।

1. TopK SAE (द "हाइलाइटर")

कल्प цикла करें कि आप एक छात्र को एक पाठ्यपुस्तक देते हैं और उनसे कहते हैं, "हर पन्ने पर केवल 32 सबसे महत्वपूर्ण शब्दों को हाइलाइट करें।"

  • यह क्या करता है: यह विशिष्ट, सूक्ष्म विवरणों को ढूंढता है। यह एंटीबॉडी कोड के एक विशिष्ट "शब्द" की ओर इशारा कर सकता है और कह सकता है, "यह हिस्सा एंटीबॉडी के इस विशिष्ट परिवार से संबंधित है।" यह बहुत दृश्य (visual) और समझने में आसान है—जैसे किसी विशिष्ट वाक्य पर एक चमकीला नियॉन हाइलाइट देखना।
  • दोष: सिर्फ इसलिए कि आप एक शब्द को हाइलाइट कर सकते हैं, इसका मतलब यह नहीं है कि आप कहानी बदल सकते हैं। यदि आप AI को उस हाइलाइट किए गए शब्द को जोर से चिल्लाकर बताने की कोशिश करते हैं, तो AI भ्रमित हो जाता है। यह एक कुकबुक में "सेब" शब्द को हाइलाइट करने जैसा है; आप शब्द को देख तो सकते हैं, लेकिन "सेब!" चिल्लाने से रेसिपी केक से बदलकर पाई (pie) नहीं हो जाती। यह व्याख्या योग्य (interpretable) है (आप इसे देखते हैं), लेकिन नियंत्रण योग्य (steerable) नहीं है (आप इसे नियंत्रित नहीं कर सकते)।

2. Ordered SAE (द "मास्टर आर्किटेक्ट")

अब, कल्पना करें कि शब्दों को हाइलाइट करने के बजाय, आप पुस्तक के विषयों (themes) को देखते हैं। "सेब" के बजाय, यह उपकरण "फल" या "मिठाई" की अवधारणा को देखता है।

  • यह क्या करता है: यह जानकारी को एक पदानुक्रम (hierarchy) में व्यवस्थित करता है। यह पहले बड़े, अमूर्त विचारों (मुख्य योजना) को देखता है और फिर बाद में सूक्ष्म विवरणों को।
  • लाभ: यह उपकरण एक स्टीयरिंग व्हील (steering wheel) है। यदि आप AI को कहते हैं, "मुझे इस 'फल' की अवधारणा और अधिक दो," तो AI वास्तव में अपना आउटपुट बदल देता है। वह ऐसी रेसिपी लिखना शुरू कर देता है जो अधिक मिठाई जैसी होती हैं। यह वैज्ञानिकों को यह कहने की अनुमति देता है, "इस एंटीबॉडी को इस विशिष्ट परिवार जैसा बनाओ," और AI वास्तव में ऐसा करता है।
  • समझौता (Trade-off): यह देखना कठिन है कि विचार ठीक कहाँ स्थित है। यह एक एकल शब्द पर नियॉन हाइलाइट जैसा नहीं है; यह एक सामान्य "वाइब" (vibe) की तरह है जो पूरे पन्ने पर फैला हुआ है। यह नियंत्रण योग्य (steerable) है, लेकिन दृश्य रूप से सरल (visually simple) नहीं है।

यह क्यों मायने रखता है?

चिकित्सा की दुनिया में, "लगभग सही" होना पर्याप्त नहीं है। यदि हम एक नए वायरस से लड़ने के लिए एंटीबॉडी डिजाइन कर रहे हैं, तो हमें इसके गुणों को सटीक रूप से ट्यून करने में सक्षम होना चाहिए—इसे अधिक स्थिर, अधिक घुलनशील, या लक्ष्य से जुड़ने में अधिक प्रभावी बनाना।

इस शोध पत्र का मुख्य निष्कर्ष यह है:

  1. हम AI के "विचारों" को देख सकते हैं: हमने सिद्ध किया कि AI वास्तव में जैविक नियमों (जैसे कि एक एंटीबॉडी किस "परिवार" से संबंधित है) को सीखता है।
  2. हमें स्टीयरिंग व्हील मिल गया है: हमने पाया कि जबकि "हाइलाइटर" विधि यह देखने के लिए बेहतरीन है कि AI क्या जानता है, "मास्टर आर्किटेक्ट" विधि वह है जिसकी हमें आवश्यकता है यदि हम वास्तव में AI को विशिष्ट, उपयोगी दवाएं डिजाइन करने के लिए आदेश देना चाहते हैं।

इन "स्टीयरिंग व्हील्स" में महारत हासिल करके, वैज्ञानिक एक ऐसे भविष्य के करीब पहुंच रहे हैं जहां हम केवल बीमारियों से लड़ने का अनुमान नहीं लगाते, बल्कि हम युद्ध जीतने के लिए जैविक उपकरणों को सटीक रूप से प्रोग्राम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →