← नवीनतम पेपर
🤖 machine learning

CLT-Forge: A Scalable Library for Cross-Layer Transcoders and Attribution Graphs

यह शोध पत्र CLT-Forge को प्रस्तुत करता है, जो एक ओपन-सोर्स लाइब्रेरी है जो लार्ज लैंग्वेज मॉडल्स की मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) की रेडंडेंसी और जटिलता की चुनौतियों को संबोधित करने के लिए क्रॉस-लेयर ट्रांसकोडर्स (Cross-Layer Transcoders) के स्केलेबल डिस्ट्रीब्यूटेड ट्रेनिंग और व्यापक व्याख्यात्मक विश्लेषण (interpretability analysis) को सक्षम बनाती है।

मूल लेखक: Florent Draye, Abir Harrasse, Vedant Palit, Tung-Yu Wu, Jiarui Liu, Punya Syon Pandey, Roderick Wu, Terry Jingchen Zhang, Zhijing Jin, Bernhard Schölkopf

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Florent Draye, Abir Harrasse, Vedant Palit, Tung-Yu Wu, Jiarui Liu, Punya Syon Pandey, Roderick Wu, Terry Jingchen Zhang, Zhijing Jin, Bernhard Schölkopf

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिखता है, सवालों के जवाब देता है और आपसे बातें करता है। लेकिन यहाँ एक समस्या है: यह रोबोट एक "ब्लैक बॉक्स" है। आप देख सकते हैं कि क्या अंदर जा रहा है (आपका सवाल) और क्या बाहर आ रहा है (जवाब), लेकिन आपको पता नहीं है कि इसके दिमाग के अंदर क्या हो रहा है।

मैकेनिस्टिक इंटरप्रिटेबिलिटी (Mechanistic interpretability) वह क्षेत्र है जो उस बॉक्स को खोलने और उसके घूमने वाले गियरों को देखने की कोशिश कर रहा है।

यह पेपर एक नया टूल पेश करता है जिसे CLT-Forge कहा जाता है। इसे एक यूनिवर्सल ट्रांसलेटर और एक हाई-डेफिनिशन माइक्रोस्कोप के रूप में सोचें जो एक साथ मिला हुआ है, जिसे शोधकर्ताओं को यह समझने में मदद करने के लिए डिज़ाइन किया गया है कि ये AI दिमाग वास्तव में कैसे काम करते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "शोर भरा पुस्तकालय" (The Noisy Library)

कल्पना कीजिए कि AI का दिमाग 100 मंजिलों (लेयर्स) वाला एक विशाल पुस्तकालय है। अतीत में, शोधकर्ताओं ने हर मंजिल पर हर एक किताब (फीचर) का मानचित्र बनाने की कोशिश की।

  • समस्या: उन्होंने पाया कि एक ही किताब (कॉन्सेप्ट) मंजिल 1, मंजिल 5 और मंजिल 90 पर भी मौजूद थी, लेकिन थोड़े अलग शीर्षकों के साथ। इसने एक ऐसा नक्शा बना दिया जिसमें हजारों डुप्लिकेट प्रविष्टियाँ थीं। यह एक ऐसे शहर में नेविगेट करने जैसा था जहाँ "मेन स्ट्रीट" को हर ब्लॉक पर "मेन सेंट", "मेन रोड" और "मेन एवेन्यू" नाम दिया गया हो। नक्शा बहुत बड़ा, अस्त-व्यस्त और पढ़ने में असंभव था।

2. समाधान: क्रॉस-लेयर ट्रांसकोडर्स (CLTs)

लेखकों ने मस्तिष्क को मैप करने के लिए एक स्मार्ट तरीके का उपयोग किया जिसे क्रॉस-लेयर ट्रांसकोडर्स (Cross-Layer Transcoders) कहा जाता है।

  • उपमा: हर मंजिल पर हर किताब को अलग से सूचीबद्ध करने के बजाय, उन्होंने एक केंद्रीकृत कैटलॉग (centralized catalog) बनाया। उन्होंने महसूस किया कि "बिल्ली" (Cat) की अवधारणा वही है चाहे वह मंजिल 1 पर हो या मंजिल 50 पर। इसलिए, उन्होंने उन सभी को एक एकल "बिल्ली" प्रविष्टि के तहत एक साथ जोड़ दिया।
  • परिणाम: यह मानचित्र को एक अव्यवस्थित 100-पेज के दस्तावेज़ से सिकोड़कर एक साफ-सुथरी, संक्षिप्त 10-पेज की मार्गदर्शिका में बदल देता है। यह अनावश्यक दोहराव को हटा देता है और AI के तर्क को बहुत स्पष्ट बनाता है।

3. नया टूल: CLT-Forge

हालाँकि यह "स्मार्ट कैटलॉग" का विचार मौजूद था, लेकिन इसे बनाना अविश्वसनीय रूप से कठिन था। इसके लिए सुपरकंप्यूटर, भारी मात्रा में मेमोरी और बहुत अधिक मैनुअल कोडिंग की आवश्यकता थी। यह एक हथौड़े और टूथब्रश से गगनचुंबी इमारत बनाने की कोशिश करने जैसा था।

CLT-Forge वह निर्माण किट (construction kit) है जो इन मानचित्रों को बनाना आसान और तेज़ बनाता है। यह एक ओपन-सोर्स सॉफ्टवेयर लाइब्रेरी (एक टूलबॉक्स) है जो तीन मुख्य कार्य करती है:

A. "स्मार्ट वेयरहाउस" (स्केलेबल ट्रेनिंग)

इन मॉडल्स को प्रशिक्षित करने के लिए AI के दिमाग से अरबों सूक्ष्म विवरणों (एक्टिवेशन्स) को याद रखने की आवश्यकता होती है।

  • पुराना तरीका: आपको इस डेटा को स्टोर करने के लिए एक शहर के आकार का गोदाम चाहिए होगा।
  • CLT-Forge का तरीका: यह कंप्रेशन और क्वांटाइजेशन (compression and quantization) का उपयोग करता है। कल्पना कीजिए कि आप एक 4K मूवी को बिना कहानी खोए एक उच्च-गुणवत्ता वाली MP3 फ़ाइल में सिकोड़ रहे हैं। CLT-Forge डेटा स्टोरेज की जरूरतों को 7 से 12 गुना तक कम कर देता है, जिससे शोधकर्ता इन मॉडल्स को किसी बड़ी इमारत के आकार के सुपरकंप्यूटर के बजाय मानक कंप्यूटर क्लस्टर्स पर प्रशिक्षित कर सकते हैं।

B. "ऑटो-ट्रांसलेटर" (स्वचालित व्याख्यात्मकता)

एक बार जब मॉडल प्रशिक्षित हो जाता है, तो आपके पास अमूर्त "फीचर्स" (जैसे "उदासी" या "गणित" का कोड) की एक सूची होती है। आपको यह जानने की आवश्यकता है कि उनका वास्तव में क्या अर्थ है।

  • पुराना तरीका: एक शोधकर्ता को मैन्युअल रूप से हजारों उदाहरणों को देखना पड़ता, अनुमान लगाना पड़ता कि किसी फीचर का क्या अर्थ है, और फिर उसका विवरण लिखना पड़ता।
  • CLT-Forge का तरीका: यह एक स्वचालित पाइपलाइन (automated pipeline) चलाता है। यह डेटा को स्कैन करता है, प्रत्येक फीचर के लिए सबसे अच्छे उदाहरण ढूंढता है, और यहाँ तक कि आपके लिए एक साधारण अंग्रेजी स्पष्टीकरण लिखने के लिए दूसरे AI का उपयोग भी करता है। यह ऐसा है जैसे आपके पास इंटर्न की एक टीम हो जो तुरंत सारांशित कर दे कि मशीन के हर एक गियर का क्या काम है।

C. "इंटरैक्टिव मैप" (विज़ुअलाइज़ेशन)

अंत में, आपको यह देखने की आवश्यकता है कि ये फीचर्स एक-दूसरे से कैसे बात करते हैं।

  • पुराना तरीका: डेटा केवल एक स्प्रेडशीट या एक स्थिर छवि (static image) था।
  • CLT-Forge का तरीका: यह एक लाइव, इंटरैक्टिव डैशबोर्ड (एक वीडियो गेम मैप की तरह) प्रदान करता है। आप एक फीचर पर क्लिक कर सकते हैं, देख सकते हैं कि वह अन्य किन फीचर्स को प्रभावित करता है, उन्हें "टीमों" (क्लस्टर्स) में समूहित कर सकते हैं, और यहाँ तक कि प्रयोग (interventions) भी चला सकते हैं यह देखने के लिए कि यदि आप मस्तिष्क के एक हिस्से को बदलते हैं तो क्या होता है।

यह क्यों मायने रखता है?

इससे पहले, केवल कुछ बड़ी टेक कंपनियों (जैसे एंथ्रोपिक) के पास इस तरह के गहरे AI विश्लेषण को करने के लिए संसाधन थे। वे अपने टूल्स को गुप्त रखते थे।

CLT-Forge इन ब्लूप्रिंट्स और निर्माण उपकरणों को जनता के लिए जारी करने जैसा है। यह किसी भी शोधकर्ता, छात्र या जिज्ञासु मन को निम्नलिखित कार्य करने की अनुमति देता है:

  1. इन जटिल मॉडल्स को कुशलतापूर्वक प्रशिक्षित (Train) करना।
  2. बिल्कुल यह समझना कि AI कैसे सोचता है।
  3. AI के आंतरिक तर्क को देखकर उसे ठीक (Fix) या बेहतर बनाना।

संक्षेप में, CLT-Forge AI के बिखरे हुए, भारी-भरकम दिमाग को एक साफ, पठनीय और इंटरैक्टिव मानचित्र में बदल देता है, जिससे हर किसी के लिए मशीन के पीछे के "जादू" को समझना संभव हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →