← नवीनतम पेपर
💬 NLP

Turn-Averaged SAEs for Feature Discovery and Long-Context Attribution

यह शोध पत्र टर्न-एवरेज्ड स्पार्स ऑटोएनकोडर (SAEs) को प्रस्तुत करता है जो मानक टोकन-आधारित SAEs की स्केलेबिलिटी सीमाओं को दूर करने के लिए संपूर्ण वार्तालाप टर्नों में औसत मॉडल एक्टिवेशन्स को पुनर्गठित करते हैं, जिससे लंबी-संदर्भ वाली भाषा मॉडल ट्रांसक्रिप्ट्स के लिए अधिक व्यापक फीचर डिस्कवरी और सरलीकृत एट्रिब्यूशन विश्लेषण सक्षम होता है।

मूल लेखक: Kevin Der, Harish Kamath, Ben Thompson

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kevin Der, Harish Kamath, Ben Thompson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक इंसान और एक AI के बीच हुई एक लंबी, जटिल बातचीत को समझने की कोशिश कर रहे हैं। आप यह जानना चाहते हैं कि AI ने जो कहा, उसने वह क्यों कहा।

AI अनुसंधान की दुनिया में, वैज्ञानिक एक उपकरण का उपयोग करते हैं जिसे स्पार्स ऑटोएनकोडर (Sparse Autoencoder - SAE) कहा जाता है। एक SAE को एक अत्यंत व्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) के रूप में समझें जो AI के विचारों को छोटे, विशिष्ट "स्टिकी नोट्स" (sticky notes) में तोड़ देता है।

पुराना तरीका: "टोकन-दर-टोकन" लाइब्रेरियन

पारंपरिक रूप से, यह लाइब्रेरियन बातचीत को एक-एक शब्द (या "टोकन") करके देखता है।

  • समस्या: यदि बातचीत 1,000 शब्दों की लंबी है, तो लाइब्रेरियन 1,000 स्टिकी नोट्स लिखता है। यदि बातचीत 100,000 शब्दों की है, तो वे 100,000 नोट्स लिखते हैं।
  • परिणाम: नोट्स अविश्वसनीय रूप से विस्तृत होते हैं। एक नोट कह सकता है "यहाँ 'apple' शब्द आया था।" दूसरा कह सकता है "वहाँ 'run' शब्द आया था।" लेकिन जब आप पूरी कहानी को देखने की कोशिश करते हैं, तो आप स्टिकी नोट्स के समुद्र में डूब जाते हैं। आप पेड़ों को देखकर जंगल नहीं देख पाते। यह बताना असंभव हो जाता है कि AI "अभद्र" (rude) हो रहा था, "रचनात्मक" (creative) था, या "गणित के बारे में" बात कर रहा था, क्योंकि ये बड़े विचार हजारों छोटे नोट्स में बिखरे हुए हैं।

नया विचार: "टर्न-एवरेज्ड" (Turn-Averaged) लाइब्रेरियन

लेखकों ने एक नया तरीका पेश किया जिसे टर्न-एवरेज्ड SAEs कहा जाता है। हर एक शब्द को देखने के बजाय, वे लाइब्रेरियन से कहते हैं कि वह बातचीत के एक पूरे "टर्न" (बातचीत का एक पूरा हिस्सा, जैसे AI या इंसान का एक पूर्ण उत्तर) को देखे और उस टर्न के सभी विचारों का औसत (average) ले।

रचनात्मक उपमा: स्मूदी बनाम फ्रूट सलाद

  • पुराना तरीका (प्रति-टोकन): कल्पना कीजिए कि एक फ्रूट सलाद है जहाँ आप हर एक बीज, त्वचा का हर छोटा टुकड़ा और चीनी का हर एक कण देख सकते हैं। यह बहुत विस्तृत है, लेकिन यदि आप जानना चाहते हैं कि सलाद "मीठा" है या "खट्टा", तो आपको हर एक टुकड़े को गिनना होगा।
  • नया तरीका (टर्न-एवरेज्ड): कल्पना कीजिए कि आपने उस फ्रूट सलाद को ब्लेंड करके एक "स्मूदी" बना दिया है। आप उस स्मूदी में विशिष्ट बीज और छिलके खो देते हैं (व्यक्तिगत शब्दों के सूक्ष्म विवरण), लेकिन आपको पूरे स्वाद का एक सटीक और स्पष्ट अनुभव मिलता है। क्या यह एक "स्ट्रॉबेरी स्मूदी" है? हाँ। क्या यह "तीखा" है? नहीं। ब्लेंडर (औसत निकालने की प्रक्रिया) शोर को छान देता है और मुख्य तस्वीर को बनाए रखता है।

उन्होंने क्या पाया

शोधकर्ताओं ने इस नए "स्मूदी" दृष्टिकोण का परीक्षण एक 7-बिलियन-पैरामीटर वाले AI मॉडल (एक बहुत स्मार्ट लेकिन अभी तक "सुपर-इंटेलिजेंट" नहीं होने वाला AI) पर वास्तविक चैट डेटा का उपयोग करके किया। यहाँ उनकी खोजें दी गई हैं:

  1. बड़ी तस्वीर देखने में बेहतर: जब उन्होंने AI से पूछा कि बातचीत का एक टर्न किस बारे में था, तो "टर्न-एवरेज्ड" नोट्स ने "उपयोगकर्ता अभद्र हो रहा है," "विषय कार सुरक्षा के बारे में है," या "AI अत्यधिक उत्साही हो रहा है" जैसे उच्च-स्तरीय विचारों को पकड़ने में बहुत बेहतर प्रदर्शन किया। पुराना "शब्द-दर-शब्द" वाला तरीका ज्यादातर केवल विशिष्ट शब्दों या व्याकरण के पैटर्न को सूचीबद्ध करता था, जिससे समग्र भाव (vibe) छूट जाता था।
  2. लंबी कहानियों को संभालना: क्योंकि वे पूरे टर्न का औसत लेते हैं, इसलिए ये नए नोट्स एक छोटे वाक्य की तरह ही 30,000 शब्दों के दस्तावेज़ के लिए भी उतने ही प्रभावी ढंग से काम करते हैं। पुराना तरीका लंबे टेक्स्ट के साथ अभिभूत और अव्यवस्थित हो जाता।
  3. "मातृका डोल" (Matryoshka Doll) समाधान: उन्होंने एक विशेष "नेस्टेड" (Nested) मॉडल भी बनाया। एक रूसी गुड़िया (Nesting Doll) की कल्पना करें।
    • भीतरी गुड़िया में "स्मूदी" वाले नोट्स होते हैं (टर्न की बड़ी तस्वीर)।
    • बाहरी गुड़िया में "फ्रूट सलाद" वाले नोट्स होते हैं (व्यक्तिगत शब्दों के विशिष्ट विवरण)।
      यह उन्हें एक ही सिस्टम में बड़े चित्र और सूक्ष्म विवरण दोनों रखने की अनुमति देता है।

"एट्रिब्यूशन" (कारण का पता लगाना) के लिए यह क्यों महत्वपूर्ण है

इन उपकरणों के सबसे प्रमुख उपयोगों में से एक एट्रिब्यूशन ग्राफ (attribution graph) बनाना है, जो यह दिखाता है कि AI के मस्तिष्क का एक हिस्सा दूसरे हिस्से को कैसे प्रभावित करता है।

  • पुराना मैप: लंबी बातचीत के लिए, इस मैप में लाखों बिंदु और रेखाएं थीं। यह एक उलझा हुआ जाल था जिसे कोई इंसान पढ़ नहीं सकता था।
  • नया मैप: टर्न-एवरेज्ड SAEs के साथ, मैप सरल हो जाता है। हर शब्द के लिए एक बिंदु होने के बजाय, हर टर्न के लिए एक बिंदु होता है। मैप एक साफ, पठनीय फ्लोचार्ट बन जाता है जो ठीक से दिखाता है कि कैसे एक उपयोगकर्ता के प्रश्न से एक विशिष्ट AI उत्तर तक पहुँचा।

पेपर से एक वास्तविक उदाहरण

शोधकर्ताओं ने इसका परीक्षण एक ऐसी बातचीत पर किया जहाँ AI शुरू में एक सवाल का जवाब देने से मना कर देता है, फिर धीरे-धीरे मान जाता है, और अंत में निरर्थक टेक्स्ट (degenerate text) उगलने लगता है।

  • पुराने तरीके का उपयोग करके: मैप समझने के लिए बहुत जटिल था। यह "रासायनिक नामों" या "JSON कोड" जैसी यादृच्छिक चीजों की ओर इशारा कर रहा था, जो कारण के रूप में समझ में नहीं आ रहे थे।
  • नए तरीके का उपयोग करके: मैप ने घटनाओं की एक श्रृंखला को स्पष्ट रूप से दिखाया:
    1. शुरुआती टर्न्स में "AI सुरक्षा" और "परमाणु हथियारों" से संबंधित फीचर्स थे।
    2. इसने "जेलब्रेक प्रयासों का पता लगाने" (detecting jailbreak attempts) वाले फीचर को सक्रिय किया।
    3. वह अंततः "निरर्थक आउटपुट" (degenerate output) की ओर ले गया।
      नए तरीके ने AI के टूटने के पीछे के "क्यों" को सफलतापूर्वक ट्रैक किया, जिसे पुराना तरीका स्पष्ट रूप से नहीं कर सका।

निष्कर्ष

यह पेपर दिखाता है कि AI के विचारों को पूरी बातचीत के टर्न पर "ब्लेंड" (blend) करके, हम ऐसे उपकरण बना सकते हैं जो AI द्वारा किए जा रहे कार्यों के अर्थ, शैली और सुरक्षा को समझने में कहीं अधिक सक्षम हैं, विशेष रूप से लंबी बातचीत में। यह एक अराजक ढेर को एक स्पष्ट, पठनीय कहानी में बदल देता है।

नोट: यह पेपर विशेष रूप से AI मॉडलों का विश्लेषण करने और उन्हें समझने के तरीके में सुधार करने पर केंद्रित है। यह दावा नहीं करता है कि ये उपकरण अभी नैदानिक उपयोग (clinical use), चिकित्सा निदान, या सीधे उपभोक्ता उत्पादों में तैनाती के लिए तैयार हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →