The Information Geometry of Softmax: Probing and Steering
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, जटिल जहाज (एक AI मॉडल) को एक विशिष्ट गंतव्य तक ले जाने की कोशिश कर रहे हैं (जैसे एक नए विचार की ओर ले जाना, जैसे किसी वाक्य को "he" से बदलकर "she" करना या एक "कुत्ते" की छवि को "बिल्ली" में बदलना)।
लंबे समय तक, शोधकर्ताओं ने इन जहाजों को सीधे तौर पर स्टीयरिंग व्हील घुमाकर चलाने की कोशिश की। उन्होंने यह मान लिया था कि समुद्र समतल और एक समान है, जैसे बर्फ की एक विशाल चादर। यदि वे उत्तर दिशा में जाना चाहते थे, तो वे बस व्हील को उत्तर की ओर धकेल देते थे। इसे यूक्लिडियन स्टीयरिंग (Euclidean steering) कहा जाता है।
हालाँकि, यह शोध पत्र तर्क देता है कि जिस समुद्र पर AI मॉडल चलते हैं, वह सपाट बर्फ नहीं है। वास्तव में, यह एक घुमावदार, ऊबड़-खाबड़ परिदृश्य है जहाँ दो बिंदुओं की "निकटता" इस बात पर निर्भर करती है कि जहाज का व्यवहार कितना समान है, न कि केवल इस पर कि वे मानचित्र पर कितनी दूर दिखते हैं। लेखक इसे सूचना ज्यामिति (Information Geometry) कहते हैं।
यहाँ उनकी खोज और उनके नए तरीके, डुअल स्टीयरिंग (Dual Steering) का सरल उपमाओं के साथ विवरण दिया गया है:
1. समस्या: "सपाट मानचित्र" का जाल
शोध पत्र कहता है कि अधिकांश वर्तमान विधियाँ AI के आंतरिक विचारों (प्रतिनिधित्वों) के साथ ऐसा व्यवहार करती हैं जैसे वे एक सपाट, सीधी रेखा वाली दुनिया में मौजूद हों।
- उपमा: कल्पना कीजिए कि आप पेंट के दो रंगों को मिला रहे हैं। यदि आप लाल और नीले को एक सीधी रेखा में मिलाते हैं, तो आपको बैंगनी रंग मिलता है। लेकिन यदि आप संभावनाओं (जैसे बारिश होने की संभावना बनाम धूप होने की संभावना) को मिला रहे हैं, तो गणित अलग होता है।
- समस्या: जब शोधकर्ता किसी चीज़ को बदलने के लिए (जैसे "कुत्ता" से "बिल्ली") AI को एक सीधी रेखा में धकेलते हैं, तो वे अनजाने में अन्य जगहों पर भी पेंट बिखेर देते हैं। AI अचानक "साइकिल" या "बादलों" के बारे में बात करने लग सकता है क्योंकि उस सीधी रेखा वाले धक्के ने पूरे सिस्टम के संतुलन को बिगाड़ दिया। इसे "ऑफ-टारगेट लीकेज" (off-target leakage) कहा जाता है।
2. समाधान: "घुमावदार मानचित्र" (सूचना ज्यामिति)
लेखकों ने महसूस किया कि AI का "मस्तिष्क" एक संभाव्यता मशीन (probability machine) की तरह काम करता है। जब AI तय करता है कि अगला शब्द क्या कहना है, तो वह संख्याओं को प्रतिशत (संभावनाओं) में बदलने के लिए सॉफ्टमैक्स (Softmax) नामक एक गणितीय उपकरण का उपयोग करता है।
- अंतर्दृष्टि: क्योंकि AI संभावनाओं के साथ काम करता है, इसलिए वह जिस स्थान पर रहता है वह घुमावदार है। इस घुमावदार स्थान में, "सबसे सीधा" रास्ता एक सीधी रेखा नहीं है; यह एक वक्र (curve) है जो संभावना के नियमों का सम्मान करता है।
- उपमा: पृथ्वी के बारे में सोचें। यदि आप न्यूयॉर्क से लंदन तक उड़ना चाहते हैं, तो सबसे छोटा रास्ता जमीन के माध्यम से एक सीधी रेखा नहीं है; यह सतह के साथ एक वक्र (great circle) है। यदि आप पृथ्वी के माध्यम से एक सीधी रेखा में उड़ने की कोशिश करेंगे, तो आप दुर्घटनाग्रस्त हो जाएंगे। इसी तरह, यदि आप AI को उसके घुमावदार संभाव्यता स्थान में एक "सीधी रेखा" में चलाने की कोशिश करते हैं, तो आप अनचाहे विचारों से टकरा जाते हैं।
3. नया तरीका: "डुअल स्टीयरिंग" (Dual Steering)
यह शोध पत्र एक नया तरीका पेश करता है जिससे AI को नियंत्रित किया जा सकता है जिसे डुअल स्टीयरिंग कहा जाता है। बजाय इसके कि वे AI को एक सीधी रेखा में धकेलें (यूक्लिडियन), वे उसे संभाव्यता स्थान के प्राकृतिक घुमावों के साथ चलाते हैं।
यह कैसे काम करता है:
- यूक्लिडियन स्टीयरिंग (पुराना तरीका): आप स्टीयरिंग व्हील पकड़ते हैं और उसे "बिल्ली" की ओर सीधे झटके से खींचते हैं। ऐसा करते समय, आप डैशबोर्ड पर रखे "कुत्ता" और "पक्षी" के पुतलों को भी अनजाने में गिरा देते हैं।
- डुअल स्टीयरिंग (नया तरीका): आप एक विशेष मानचित्र का उपयोग करके नेविगेट करते हैं जो जानता है कि इलाका घुमावदार है। आप जहाज को ऐसे पथ पर चलाते हैं जो "कुत्ते" को "बिल्ली" में बदल देता है बिना "पक्षी" या "साइकिल" के पुतलों को छुए।
"डुअल" अवधारणा: शोध पत्र बताता है कि AI के डेटा को देखने के दो तरीके हैं:
- प्राइमल स्पेस (Primal Space): वे कच्ची संख्याएँ जो AI देखता है।
- डुअल स्पेस (Dual Space): वास्तविक संभावनाएँ (व्यवहार) जो AI उत्पन्न करता है।
लेखकों ने पाया कि व्यवहार को स्पष्ट रूप से बदलने के लिए, आपको "डुअल स्पेस" (संभावनाओं की दुनिया) में स्टीयरिंग करनी होगी और फिर उसे वापस कच्ची संख्याओं में अनुवादित करना होगा।
4. उन्होंने क्या सिद्ध किया
लेखकों ने गणितीय रूप से सिद्ध किया कि डुअल स्टीयरिंग "गोल्डिलॉक्स" (Goldilocks) विधि है:
- यह सफलतापूर्वक लक्षित अवधारणा को बदल देता है (उदाहरण के लिए, AI को "कुत्ता" के बजाय "बिल्ली" कहने के लिए प्रेरित करता है)।
- यह अन्य सभी चीजों को न्यूनतम नुकसान पहुँचाता है। यह अन्य असंबंधित चीजों (जैसे "दोस्त" या "साइकिल") की संभावना को बिल्कुल वैसा ही रखता है जैसा वे पहले थे।
5. वास्तविक दुनिया के परीक्षण
उन्होंने वास्तविक AI मॉडलों (जैसे टेक्स्ट के लिए Gemma-3 और छवियों के लिए MetaCLIP) पर इसका परीक्षण किया।
- टेक्स्ट उदाहरण: जब उन्होंने AI को एक वाक्य को "He is my..." से "She is my..." में बदलने के लिए कहा, तो पुराने तरीके ने अनजाने में AI को अजीब तरीके से "मित्रों" या "चाचाओं" के बारे में बात करने पर मजबूर कर दिया। नया तरीका "He" को "She" में पूरी तरह से बदल देता है जबकि वाक्य की संरचना और अर्थ को बरकरार रखता है।
- इमेज उदाहरण: जब एक "बिल्ली" की छवि को "कुत्ते" में बदलते समय, पुराने तरीके ने कभी-कभी गलती से पृष्ठभूमि में "डॉग-कैट हाइब्रिड" या "साइकिल" जोड़ दी। नया तरीका बिल्ली को कुत्ते के साथ सफाई से बदल देता है, जिससे बैकग्राउंड और अन्य वस्तुएं अप्रभावित रहती हैं।
सारांश
शोध पत्र का दावा है कि AI मॉडल एक सपाट मानचित्र पर नहीं रहते; वे एक घुमावदार, संभाव्यता-आधारित परिदृश्य में रहते हैं। यदि आप उन्हें एक सीधी रेखा के साथ चलाने की कोशिश करते हैं, तो आप अराजकता पैदा करते हैं। डुअल स्टीयरिंग का उपयोग करके, जो उस परिदृश्य के प्राकृतिक घुमावों का सम्मान करता है, आप AI के मन को एक विशिष्ट चीज़ के बारे में बदले बिना बाकी सब कुछ को गलती से तोड़े बिना बदल सकते हैं।
नोट: यह शोध पत्र पूरी तरह से इस बात पर केंद्रित है कि कैसे ये मॉडल काम करते हैं और कैसे उन्हें लीनियर प्रोब्स (linear probes) का उपयोग करके नियंत्रित किया जा सकता है। यह सामान्य AI सुरक्षा मुद्दों को हल करने का दावा नहीं करता है, न ही यह नैदानिक या चिकित्सा अनुप्रयोगों पर चर्चा करता है। यह पूरी तरह से AI के "स्टीयरिंग व्हील" को अधिक सटीक बनाने और इसके अनचाहे दुष्प्रभावों को कम करने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।