← नवीनतम पेपर
🤖 machine learning

Geometric Evolution Maps: Extracting Stable Concept Probes from Transformer Residual Streams

यह शोध पत्र ज्योमेट्रिक इवोल्यूशन मैप्स (GEMs) को प्रस्तुत करता है, जो विविध आर्किटेक्चरों में पारंपरिक फिक्स्ड-लेयर या पीक-स्कोर दृष्टिकोणों की तुलना में अधिक विश्वसनीय कॉन्सेप्ट प्रोब्स निकालने के लिए ट्रांसफॉर्मर रेसिडुअल स्ट्रीम्स में अवधारणाओं के दिशात्मक प्रक्षेपवक्र (डायरेक्शनल ट्रॅजेक्टरी) को ट्रैक करता है और उन स्थिर "हैंडऑफ लेयर्स" की पहचान करता है जहाँ निरूपण (रिप्रेजेंटेशन्स) स्थिर होते हैं।

मूल लेखक: James Henry

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: James Henry

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ट्रांसफॉर्मर AI मॉडल की कल्पना एक विशाल, बहु-मंजिला फैक्ट्री के रूप में करें जहाँ कच्चे विचार नीचे से प्रवेश करते हैं और ऊपर तक एक तैयार उत्पाद बनने के लिए परत-दर-परत प्रोसेस होते हैं।

लंबे समय तक, शोधकर्ता जो यह समझने की कोशिश कर रहे थे कि AI क्या सोच रहा है (जैसे कि क्या वह "क्रोध," "सत्य," या "खतरा" को समझता है), उनके पास एक सरल नियम था: बस सबसे ऊपरी मंजिल को देखें। उन्होंने माना कि जब तक कोई विचार अंतिम परत तक पहुँचता है, वह पूरी तरह से निर्मित और स्थिर हो जाता है।

यह पेपर तर्क देता है कि यह नियम गलत है। यह एक रेसिपी को समझने की कोशिश करने जैसा है जिसमें केवल अंतिम परोसे गए व्यंजन को देखा जाता है, इस बात को नजरअंदाज करते हुए कि सामग्री को हर एक मंजिल पर अलग-अलग तरीकों से काटा गया, मिलाया गया, गर्म किया गया और चलाया गया था।

यहाँ उस पेपर का सरल विवरण दिया गया जिसे इस शोधकर्ता ने खोजा और प्रस्तावित किया है:

1. समस्या: विचार ऊपर की ओर घूमते हैं (Spin Like a Top)

लेखकों ने पाया कि जब एक AI किसी अवधारणा (जैसे "व्यंग्य" या "खतरा") के बारे में "सोचता" है, तो उसके आंतरिक मेमोरी में उस विचार का प्रतिनिधित्व करने का तरीका जैसे-जैसे वह फैक्ट्री के फर्शों पर ऊपर जाता है, बेहद तेजी से घूमता रहता है।

  • उपमा: एक समूह की कल्पना करें जो मानव पिरामिड बनाने की कोशिश कर रहा है। नीचे, वे बस एक-दूसरे के हाथ पकड़ रहे हैं और अपना संतुलन खोजने के लिए गोल-गोल घूम रहे हैं। वे सब दिशाहीन हैं।
  • डेटा: पेपर ने इस "घूर्णन" (spin) को मापा। अधिकांश मामलों में, प्रक्रिया की शुरुआत में विचार की दिशा अंतिम स्थान की तुलना में लगभग पूरी तरह से अलग थी (जैसे उत्तर बनाम दक्षिण की ओर इशारा करना)।
  • गलती: यदि आप विचार को तब "प्रोब" (पता लगाने) की कोशिश करते हैं जब वह अभी भी फैक्ट्री के बीच में घूम रहा हो, तो हो सकता है कि आप उसे गलत दिशा में पकड़े। आपको लग सकता है कि AI "खतरे" के बारे में सोच रहा है, जबकि वह वास्तव में खतरे के बारे में अंततः सोचने के लिए हिस्सों को व्यवस्थित कर रहा होता है।

2. समाधान: "हैंडऑफ" लेयर (The "Handoff" Layer)

लेखकों ने एक नई विधि पेश की जिसे जियोमेट्रिक इवोल्यूशन मैप्स (GEMs) कहा जाता है। यह अनुमान लगाने के बजाय कि किस मंजिल को देखना है, GEMs विचार को ट्रैक करते हैं ताकि यह पता लगाया जा सके कि वह सटीक क्षण कब आता है जब वह घूमना बंद करता है और अपनी जगह पर स्थिर हो जाता है।

  • उपमा: एक रिले रेस के बारे में सोचें। धावक (परतें) बैटन (अवधारणा) को आपस में आगे-पीछे पास करते हैं। कुछ समय के लिए, बैटन डगमगाता है और अजीब तरह से पास किया जाता है। लेकिन फिर, एक विशिष्ट क्षण आता है—हैंडऑफ (Handoff)—जहाँ धावक अंततः बैटन को पकड़ लेता है, अपनी पकड़ मजबूत करता है, और एक सीधी रेखा में दौड़ना शुरू करता है।
  • खोज: पेपर ने पाया कि यह "मजबूत पकड़" एक विशिष्ट मंजिल पर होती है, जिसे वे हैंडऑफ लेयर कहते हैं। एक बार जब विचार इस लेयर को पार कर जाता है, तो वह घूमना बंद कर देता है और ऊपर तक स्थिर रहता है।
  • परिणाम: यदि आप जानना चाहते हैं कि AI क्या सोच रहा है, तो आपको सबसे ऊपर (जहाँ वह भटक गया हो सकता है) या बीच में (जहाँ वह अभी भी घूम रहा हो) नहीं देखना चाहिए। आपको ठीक हैंडऑफ लेयर पर देखना चाहिए, जहाँ विचार अपने अंतिम, स्थिर आकार में सेट हो जाता है।

3. सिद्धांत का परीक्षण

शोधकर्ताओं ने इसका परीक्षण 23 अलग-अलग AI मॉडलों (छोटे से लेकर बहुत बड़े मॉडलों तक) और 17 अलग-अलग प्रकार की अवधारणाओं (जैसे "व्यंग्य," "तत्परता," "धोखाधड़ी," आदि) पर किया।

  • तुलना: उन्होंने अपने नए "हैंडऑफ" तरीके की तुलना पुराने "पीक" (Peak) तरीके (उस मंजिल को देखना जहाँ विचार सबसे अधिक मुखर दिखता था, भले ही वह अभी भी घूम रहा हो) से की।
  • परिणाम: हैंडऑफ विधि 68% समय बेहतर थी। कई मामलों में, यह काफी अधिक सटीक थी।
  • कैच (Catch): यह बड़े मॉडलों में सबसे अच्छा काम करता है। बहुत छोटे मॉडलों में, "घूर्णन" कभी-कभी इतना अराजक होता है या फैक्ट्री इतनी छोटी होती है कि विचार के स्थिर होने से पहले ही वह ऊपर पहुँच जाता है।

4. विभिन्न प्रकार की फैक्ट्रियों के लिए विशेष नियम

पेपर ने गौर किया कि अलग-अलग प्रकार के AI फैक्ट्रियां अलग तरह से व्यवहार करती हैं:

  • मानक फैक्ट्रियां (MHA): इनमें लगभग हमेशा एक स्पष्ट "हैंडऑफ" लेयर होती है जहाँ विचार स्थिर हो जाता है। नया तरीका यहाँ बहुत अच्छा काम करता है।
  • ग्रुपेड फैक्ट्रियां (GQA): इनकी आंतरिक संरचना अधिक जटिल होती है। ये कभी-कभी जल्दी स्थिर होती हैं या अलग व्यवहार करती हैं, इसलिए "हैंडऑफ" विधि यहाँ उतनी प्रभावी नहीं है, लेकिन फिर भी उपयोगी है।
  • "नियर-टॉप" (Near-Top) नियम: कभी-कभी, विचार इतनी देर से स्थिर होता है कि वह लगभग सबसे ऊपरी मंजिल पर पहुँच जाता है। यदि आप वहां विचार की जांच करने की कोशिश करते हैं, तो आप गलती से इसे अंतिम "पैकेजिंग" चरण (बोलने के लिए तैयार होना) के साथ मिला सकते हैं। लेखकों ने इन दुर्लभ मामलों को संभालने के लिए एक विशेष नियम बनाया, यह सुनिश्चित करते हुए कि वे पैकेजिंग प्रक्रिया से भ्रमित न हों।

5. इसका क्या अर्थ है (और क्या नहीं है)

  • यह क्या सिद्ध करता है: पेपर सिद्ध करता है कि AI अवधारणाएं स्थिर नहीं हैं; वे गतिशील प्रक्रियाएं हैं जो स्थिर होने से पहले घूमती और घूमती रहती हैं। उन्हें समझने के लिए, आपको वह क्षण ढूंढना होगा जब वे हिलना बंद कर देते हैं।
  • यह क्या दावा नहीं करता: पेपर यह दावा नहीं करता कि इससे AI सुरक्षित बनता है, या अब हम AI के व्यवहार को पूरी तरह से नियंत्रित कर सकते हैं। यह केवल एक बेहतर "माइक्रोस्कोप" प्रदान करता है जिससे हम देख सकें कि AI के विचार वास्तव में कहाँ स्थिर हैं।
  • एक विफलता: पेपर स्वीकार करता है कि एक विशिष्ट छोटा मॉडल (gpt2) नियमों को तोड़ गया। इस बहुत छोटे फैक्ट्री में, "हैंडऑफ" शीर्ष के बहुत करीब हुआ, जिससे यह तरीका पैकेजिंग प्रक्रिया के साथ भ्रमित हो गया। यह एक ज्ञात सीमा है, सामान्य सिद्धांत की खामी नहीं।

सारांश

AI के मस्तिष्क को एक नदी के रूप में सोचें। इसे अध्ययन करने का पुराना तरीका समुद्र को देखने जैसा था जहाँ नदी समाप्त होती है, यह मानते हुए कि पानी शांत था। यह पेपर कहता है, "नहीं, पानी पूरे रास्ते उथल-पुथल और घूम रहा है।"

जियोमेट्रिक इवोल्यूशन मैप एक ऐसे सेंसर की तरह है जो नदी में तैरता है, और उस सटीक क्षण का इंतजार करता है जब पानी घूमना बंद कर देता है और सीधा बहने लगता है। एक बार जब यह शांत स्थान (हैंडऑफ लेयर) पा लेता है, तो यह एक स्नैपशॉट लेता है। यह स्नैपशॉट ऊपर या नीचे लिए गए किसी भी स्नैपशॉट की तुलना में कहीं अधिक स्पष्ट और सटीक चित्र है कि AI वास्तव में क्या सोच रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →