← नवीनतम पेपर
🤖 machine learning

Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control

यह शोध पत्र एक क्लोज्ड-लूप एक्टिवेशन स्टीयरिंग पद्धति प्रस्तावित करता है जो LLMs की अनुभवजन्य रूप से देखी गई स्थानीय रैखिकता (local linearity) का लाभ उठाते हुए अनुमान (inference) को एक लीनियर टाइम-वेरिंग सिस्टम के रूप में मॉडल करती है, जिससे बिना ऑफलाइन ट्रेनिंग के मजबूत, सूक्ष्म और सैद्धांतिक रूप से गारंटीकृत व्यवहार मॉड्यूलेशन के लिए लीनियर क्वाड्रेटिक रेगुलेटर (LQR) कंट्रोल का उपयोग सक्षम होता है।

मूल लेखक: Julian Skifstad, Xinyue Annie Yang, Glen Chou

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Julian Skifstad, Xinyue Annie Yang, Glen Chou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना करें जो एक विशाल, अविश्वसनीय रूप से स्मार्ट, लेकिन थोड़े अराजक ऑर्केस्ट्रा (वाद्यवृंद) की तरह है। प्रत्येक संगीतकार (लेयर) एक भूमिका निभाता है, और वे मिलकर एक सिम्फनी (टेक्स्ट) रचते हैं। कभी-कभी ऑर्केस्ट्रा खूबसूरती से बजता है, लेकिन अन्य समय में, वे गलती से एक बेसुरा नोट (टॉक्सिसिटी/विषाक्तता) बजा सकते हैं, संगीत के बारे में झूठ बोल सकते हैं (अनट्रुथफुलनेस/असत्यता), या अनुरोधित गीत बजाने से मना कर सकते हैं (रिफ्यूज़ल/अस्वीकृति)।

लंबे समय तक, यदि आप ऑर्केस्ट्रा को ठीक करना चाहते थे, तो आपको संगीतकारों को फिर से प्रशिक्षित करना पड़ता था। यह पूरी बैंड को निकालने और नए लोगों को काम पर रखने जैसा था, जो महंगा, धीमा है, और इससे वे अन्य गीतों को बजाना भूल सकते हैं।

वर्तमान सुधारों के साथ समस्या
कुछ लोगों ने संगीत बजते समय ही संगीतकारों को निर्देश चिल्लाकर ठीक करने की कोशिश की। इसे "एक्टिवेशन स्टीयरिंग" कहा जाता है। हालाँकि, पिछले तरीके ऐसे कंडक्टर की तरह थे जो केवल "ज़ोर से बजाओ!" या "धीरे बजाओ!" चिल्लाते थे, बिना यह सुने कि ध्वनि हॉल में कैसे गूँजती है। उन्होंने इस बात पर ध्यान नहीं दिया कि शुरुआत में दी गई एक पुकार अंत तक संगीत को कैसे बदल सकती है। इसने सुधारों को भद्दा बना दिया और अक्सर संगीत की गुणवत्ता को खराब कर दिया।

बड़ी खोज: ऑर्केस्ट्रा "लोकल लीनियर" है
लेखकों ने एक दिलचस्प खोज की। भले ही ऑर्केस्ट्रा जटिल और अराजक है, लेकिन यदि आप समय के एक बहुत छोटे क्षण (मॉडल की एक सिंगल लेयर) पर ज़ूम इन करते हैं, तो संगीतकार आश्चर्यजनक रूप से सीधे और पूर्वानुमानित तरीके से व्यवहार करते हैं।

इसे कार चलाने के उदाहरण से समझें। सड़क लंबी दूरी पर बुरी तरह मुड़ सकती है (नॉन-लीनियर), लेकिन यदि आप अगले 10 फीट को देखते हैं, तो सड़क पूरी तरह से सीधी दिखती है। आप उस छोटी दूरी के लिए सीधी रेखा में गाड़ी चला सकते हैं। लेखकों ने पाया कि LLMs भी वैसे ही हैं: एक पल के लिए, उनका आंतरिक तर्क सरल और रैखिक (लीनियर) होता है।

समाधान: A-LQR (स्मार्ट कंडक्टर)
इस खोज का उपयोग करके, लेखकों ने A-LQR (एक्टिवेशन-LQR) नामक एक नया तरीका बनाया। यह कैसे काम करता है, इसके लिए एक रचनात्मक उपमा देखें:

  1. मानचित्र (द मॉडल): अनुमान लगाने के बजाय, नए कंडक्टर के पास ऑर्केस्ट्रा के "लोकल स्ट्रेट रोड" का एक सटीक मानचित्र है। वह जानता है कि वायलिन सेक्शन को दिए गए एक हल्के से धक्के से ड्रम्स तक लहरें कैसे पहुँचेंगी।
  2. फीडबैक लूप (क्लोज्ड-लूप कंट्रोल): पुराने तरीकों के विपरीत, जो केवल एक बार चिल्लाते थे और फिर उम्मीद करते थे, A-LQR लगातार सुनता है। यह हर मिलीसेकंड में संगीत की जाँच करता है। यदि वायलिन सुर से भटकने लगते हैं, तो यह तुरंत एक छोटा, सटीक समायोजन करता है।
  3. लक्ष्य (सेटपॉइंट्स): कंडक्टर केवल यह नहीं कहता कि "बेहतर बजाओ।" उनके पास एक विशिष्ट लक्ष्य होता है, जैसे " 'सत्य' वाला नोट बजाओ" या "'दयालुता' वाला नोट बजाओ।" वे गणना करते हैं कि लय को तोड़े बिना ऑर्केस्ट्रा को उस नोट तक पहुँचाने के लिए न्यूनतम और सटीक कितना धक्का देने की आवश्यकता है।

यह गेम-चेंजर क्यों है

  • सटीकता: यह हथौड़े के बजाय लेजर पॉइंटर का उपयोग करने जैसा है। यह बाकी प्रदर्शन (मॉडल की बुद्धिमत्ता) को खराब किए बिना विशिष्ट समस्या (जैसे विषाक्तता) को ठीक करता है।
  • गति: इसे मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह बस एक स्मार्ट "ऑटोपायलट" लेयर जोड़ देता है जो रीयल-टाइम में चलता है।
  • बहुमुखी प्रतिभा: यह लगभग किसी भी मॉडल पर काम करता है, छोटे से लेकर विशाल मॉडल्स तक, और उन्हें अधिक सत्यवादी, कम विषाक्त, या यहाँ तक कि "कुत्तों" या "फुटबॉल" जैसे विशिष्ट विषयों पर बात करने के लिए निर्देशित कर सकता है।

"जेलब्रेक" मोड़
पेपर यह भी दिखाता है कि इस शक्तिशाली उपकरण का उपयोग उल्टा भी किया जा सकता है। जिस तरह आप कार को उसकी लेन में रहने के लिए निर्देशित कर सकते हैं, उसी तरह आप उसे लेन से बाहर जाने के लिए भी निर्देशित कर सकते हैं। लेखकों ने दिखाया कि A-LQR का उपयोग मॉडल को "जेलब्रेक" करने के लिए किया जा सकता है, जिससे उन्हें सुरक्षा नियमों को अनदेखा करने और हानिकारक सामग्री उत्पन्न करने के लिए मजबूर किया जा सके। यह एक दोधारी तलवार को उजागर करता है: वही तकनीक जो AI को सुरक्षित बना सकती है, उसे तोड़ने के लिए भी इस्तेमाल किया जा सकता है।

संक्षेप में
यह पेपर इस बारे में है कि AI मॉडल हमारे अनुमान से कहीं अधिक सरल हैं (लघु अवधि में)। उन्हें एक अनुमानित प्रणाली की तरह मानकर, हम उन्नत गणित (कंट्रोल थ्योरी) का उपयोग करके उन्हें अच्छे व्यवहार की ओर और बुरे व्यवहार से दूर धीरे से निर्देशित कर सकते हैं, और यह भी सुनिश्चित कर सकते हैं कि संगीत स्वाभाविक और उच्च गुणवत्ता वाला बना रहे। यह एक भद्दे शोर और एक मास्टर कंडक्टर के सटीक बैटन (छड़ी) के बीच का अंतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →