Circuit Fingerprints: How Answer Tokens Encode Their Geometrical Path
यह शोध पत्र "सर्किट फिंगरप्रिंट" (Circuit Fingerprint) परिकल्पना का प्रस्ताव करता है, जो यह प्रतिपादित करता है कि उत्तर टोकन (answer tokens) ज्यामितीय रूप से उन सर्किट्स की दिशाओं को कूटबद्ध (encode) करते हैं जो उन्हें उत्पन्न करते हैं, जिससे ग्रेडिएंट-आधारित या कारण संबंधी हस्तक्षेप (causal intervention) विधियों के बजाय ज्यामितीय संरेखण (geometric alignment) के माध्यम से सर्किट की खोज और सक्रियता स्टीयरिंग (activation steering) संभव हो पाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक विशाल, जटिल शहर कैसे काम करता है। इसे अध्ययन करने के दो मुख्य तरीके हो सकते हैं:
- जासूस दृष्टिकोण (सर्किट डिस्कवरी): आप लोगों का पीछा करते हैं, देखते हैं कि वे कहाँ चलते हैं, और देखते हैं कि वे बिंदु A से बिंदु B तक पहुँचने के लिए किन चौराहों का उपयोग करते हैं। आप उन "सड़कों" (सर्किट्स) का मानचित्र बनाने की कोशिश कर रहे हैं जो लोग विशिष्ट कार्यों को पूरा करने के लिए उपयोग करते हैं।
- वास्तुकार दृष्टिकोण (एक्टिवेशन स्टीयरिंग): आपको इतिहास की परवाह नहीं है; आप बस शहर को बदलना चाहते हैं। आप जानना चाहते हैं, "यदि मैं चाहता हूँ कि हर कोई खुश महसूस करे, तो मुझे किन सड़कों को फूलों से सजाना चाहिए?" आप शहर के "मिजाज" को "स्टीयर" (नियंत्रित) करने की कोशिश कर रहे हैं।
लंबे समय तक, AI शोधकर्ताओं को लगा कि ये दो बिल्कुल अलग काम हैं। लेकिन, यह पेपर, "सर्किट फिंगरप्रिंट्स" (Circuit Fingerprints), तर्क देता है कि वे वास्तव में एक ही सिक्के के दो पहलू हैं।
मुख्य विचार: "ब्रेडक्रंब" सिद्धांत (The "Breadcrumb" Theory)
शोधकर्ताओं ने कुछ बेहद दिलचस्प खोजा: गंतव्य स्वयं यात्रा का एक मानचित्र अपने भीतर रखता है।
इसे इस तरह सोचें: यदि आपको रेगिस्तान के बीच में रेत का एक ढेर मिलता है, तो आप उस रेत के आकार और बनावट को देखकर ठीक से पता लगा सकते हैं कि कौन सी हवाओं और टीलों ने उसे वहाँ तक पहुँचाने के लिए रास्ता दिखाया था। रेत अपने सफर का एक "फिंगरप्रिंट" (छाप) अपने साथ ले जाती है।
एक AI मॉडल में, "उत्तर" (जैसे शब्द "पेरिस") केवल एक यादृच्छिक शब्द नहीं है जो अचानक बाहर आता है। जिस तरह से मॉडल का आंतरिक "मस्तिष्क" "पेरिस" शब्द को दर्शाता है, उसमें वास्तव में उन सभी गणितीय "सड़कों" का एक ज्यामितीय हस्ताक्षर (geometric signature) होता है, जिनका उपयोग मॉडल उस निष्कर्ष तक पहुँचने के लिए किया था।
"रीड-राइट" द्वैतता (The "Read-Write" Duality)
यह पेपर प्रस्तावित करता है कि क्योंकि उत्तर में ही मानचित्र मौजूद है, इसलिए हम दो चीजें कर सकते हैं:
- पढ़ना (जासूस): हम एक उत्तर के "फिंगरप्रिंट" को देख सकते हैं और पीछे की ओर जाकर यह पता लगा सकते हैं कि मॉडल ने वहां तक पहुँचने के लिए किन सटीक "सड़कों" (न्यूरॉन्स और कनेक्शनों) का उपयोग किया। यह हमें बिना हर एक कनेक्शन को मैन्युअल रूप से टेस्ट करने की थकाऊ मेहनत के, "सर्किट" को खोजने की अनुमति देता है।
- लिखना (वास्तुकार): क्योंकि अब हम जानते हैं कि कौन सी "सड़कें" एक निश्चित भावना या तथ्य की ओर ले जाती हैं, इसलिए हम उन सड़कों पर "लिख" सकते हैं। यदि हम चाहते हैं कि AI अधिक आनंदित हो, तो हम केवल उससे विनम्रता से नहीं कहते (प्रॉम्प्टिंग); बल्कि हम वास्तव में उसके आंतरिक "मानचित्र" में जाते हैं और "आनंदमय" सड़कों पर सक्रियता (activations) को थोड़ा धकेलते (nudge) हैं।
यह क्यों मायने रखता है? (परिणाम)
शोधकर्ताओं ने कई AI मॉडलों पर इसका परीक्षण किया और दो बड़ी जीत देखी:
- यह कुशल है: वे उन "सड़कों" को खोजने में लगभग उतने ही सक्षम थे जिनका उपयोग AI पहेलियों (जैसे नाम पहचानना या क्रियाओं के साथ सहमत होना) को हल करने के लिए करता है, जितना कि महंगे और धीमे पारंपरिक तरीके, लेकिन बहुत अधिक सरलता से।
- यह अधिक शक्तिशाली है: जब उन्होंने AI को "भावनात्मक" बनाने की कोशिश की, तो उनका "स्टीयरिंग" तरीका केवल टेक्स्ट के माध्यम से AI से "कृपया खुश रहें" कहने की तुलना में बहुत बेहतर रहा। उनकी विधि ने भावना को लगभग 70% बार सही पकड़ा, जबकि केवल टेक्स्ट के माध्यम से पूछने पर यह केवल 53% बार ही सफल रहा। सबसे महत्वपूर्ण बात यह है कि भावनात्मक होने के दौरान भी AI स्मार्ट और तथ्यात्मक बना रहा।
निष्कर्ष
यह पेपर सुझाव देता है कि एक AI केवल यादृच्छिक नंबरों का ब्लैक बॉक्स नहीं है। इसके बजाय, यह एक ज्यामितीय परिदृश्य (geometric landscape) है। AI का हर विचार अपने पदचिह्न छोड़ता है, और यदि हम उन पदचिह्नों को पढ़ना सीख जाते हैं, तो हम न केवल यह समझते हैं कि AI कैसे सोचता है—बल्कि हम इसे निर्देशित करने के लिए स्टीयरिंग व्हील भी प्राप्त कर लेते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।