← नवीनतम पेपर
💬 NLP

Beyond Steering Vector: Flow-based Activation Steering for Inference-Time Intervention

यह शोध पत्र FLAS को प्रस्तुत करता है, जो एक फ्लो-आधारित एक्टिवेशन स्टीयरिंग विधि है जो मॉडल एक्टिवेशन को ट्रांसपोर्ट करने के लिए एक सामान्य, कॉन्सेप्ट-कंडीशन्ड वेलोसिटी फील्ड को सीखता है, जिससे यह पूर्ववर्ती दृष्टिकोणों की प्रतिबंधात्मक धारणाओं को दूर करते हुए AxBench पर मौजूदा स्टीयरिंग तकनीकों और इन-कॉन्टेक्स्ट प्रॉम्प्टिंग दोनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Zehao Jin, Ruixuan Deng, Junran Wang, Xinjie Shen, Chao Zhang

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zehao Jin, Ruixuan Deng, Junran Wang, Xinjie Shen, Chao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, अविश्वसनीय रूप से प्रतिभाशाली शेफ के रूप में करें जिसने पहले से ही एक भव्य भोजन तैयार कर लिया है (मॉडल प्रशिक्षित और स्थिर है)। कभी-कभी, आप चाहते हैं कि शेफ परोसते समय ही डिश में एक विशिष्ट स्वाद जोड़ दे, बिना उसे दोबारा खाना बनाना सिखाए या उसकी रेसिपी बुक बदले।

लंबे समय तक, ऐसा करने का सबसे अच्छा तरीका एक्टिवेशन स्टीयरिंग (Activation Steering) था। इसे ऐसे समझें जैसे शेफ का सहायक (sous-chef) एक विशिष्ट क्षण में एक निश्चित मात्रा में मसाला डालने के लिए मसालों के जार को पकड़ता है।

  • पुराना तरीका (फिक्स्ड वेक्टर): सहायक का एक नियम था: "जब शेफ 'विनम्रता' के बारे में सोच रहा हो, तो ठीक यहाँ 'विनम्रता मसाला' के ठीक 5 ग्राम डालें।"
  • समस्या: यह सरल चीजों के लिए ठीक काम करता था, लेकिन अगर व्यंजन जटिल हो जाता, तो मसाला जार फिट नहीं बैठता। या तो स्वाद बहुत हल्का रह जाता, या वह पूरे भोजन को खराब कर देता (जिससे शेफ मूल निर्देशों को भूल जाता)। साथ ही, यदि आप कोई नया स्वाद चाहते थे जिसे शेफ ने पहले कभी चखा ही न हो, तो सहायक को एक नया मसाला जार खरीदना पड़ता और उसे शुरू से कैलिब्रेट करना पड़ता।

नया समाधान: FLAS (फ्लो-बेस्ड एक्टिवेशन स्टीयरिंग)

इस पेपर के लेखक, FLAS, शेफ को निर्देशित करने का एक स्मार्ट तरीका प्रस्तावित करते हैं। एक स्थिर मसाला जार के बजाय, वे एक गतिशील, बहते हुए स्वाद की नदी की कल्पना करते हैं।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. एक "कूद" (Jump) से एक "प्रवाह" (Flow) तक

  • पुराना तरीका: कल्पना करें कि शेफ के विचार एक सपाट फर्श पर लुढ़कती हुई गेंद की तरह हैं। स्वाद बदलने के लिए, पुराने तरीके ने बस गेंद को एक दिशा में एक बार लात मारी। यह एक एकल, कठोर उछाल (jump) था।
  • FLAS तरीका: FLAS महसूस करता है कि एक जटिल विचार को बदलना केवल एक उछाल नहीं है; यह एक यात्रा है। यह एक "हवा" (वेलोसिटी फील्ड) बनाता है जो गेंद को धीरे से धकेलती है। हवा की दिशा और शक्ति इस बात पर निर्भर करती है कि गेंद कहाँ है और आप कौन सा स्वाद चाहते हैं। गेंद एक वक्राकार पथ (curved path) का अनुसरण करती है, कई चरणों में सहजता से नए स्वाद में बदल जाती है।

2. "GPS" बनाम "कंपास"

  • पुराना तरीका: पुराना स्टीयरिंग एक कंपास की तरह था जो हमेशा उत्तर की ओर इशारा करता था, चाहे आप कहीं भी हों। उसे इस बात की परवाह नहीं थी कि आप जंगल में हैं या शहर में; वह समान बल लगाता था।
  • FLAS तरीका: FLAS एक स्मार्ट GPS की तरह है। यह शेफ के वर्तमान विचार (गेंद की स्थिति), विशिष्ट स्वाद (अवधारणा), और टाइम स्टेप को देखता है। यह गणना करता है कि अभी सटीक रूप से कितना धक्का देने की आवश्यकता है।
    • यदि शेफ एक वाक्य के बीच में है, तो "हवा" धीरे से धकेल सकती है।
    • यदि शेफ शुरुआत में है, तो हवा ज़ोर से धकेल सकती है।
    • यह उत्पन्न किए जा रहे प्रत्येक शब्द के अनुकूल होता है, जिसका अर्थ है कि "स्वाद" संदर्भ के अनुसार सटीक रूप से फिट होने के लिए शब्द-दर-शब्द थोड़ा बदल सकता है।

3. करके सीखना (कोई नकारात्मक उदाहरण नहीं)

  • पुराना तरीका: आपको सहायक को "विनम्रता" कैसे जोड़नी है, यह सिखाने के लिए, आपको आमतौर पर उसे अभद्र वाक्यों और विनम्र वाक्यों के उदाहरण दिखाने पड़ते थे और कहना पड़ता था, "विचार को अभद्र वाले से विनम्र वाले की ओर ले जाओ।" यह एक कुत्ते को इनाम और छड़ी दिखाकर प्रशिक्षित करने जैसा है।
  • FLAS तरीका: FLAS को केवल अच्छे उदाहरणों की आवश्यकता होती है। यह एक विनम्र वाक्य को देखता है और सीखता है, "ठीक है, यहाँ पहुँचने के लिए, विचार इस तरह से प्रवाहित होने चाहिए।" इसे यह जानने के लिए "अभद्र" संस्करण देखने की आवश्यकता नहीं है कि इसे कैसे ठीक किया जाए। यह सीधे अच्छे अनुभवों के "प्रवाह" को सीखता है।

यह एक बड़ी बात क्यों है?

लेखकों ने Axbench नामक एक विशाल चुनौती पर इसका परीक्षण किया, जिसमें मॉडल को हजारों अलग-अलग, अजीब और विशिष्ट चीजें करने के लिए कहा जाता है (जैसे "केवल संख्याओं का उपयोग करके कहानी लिखना" या "इमोजी का उपयोग करके भौतिकी समझाना")।

  • परिणाम: पुराने तरीके (और यहाँ तक कि केवल "प्रॉम्प्टिंग" के माध्यम से विनम्रता से पूछना भी) अक्सर विफल रहे या इससे शेफ रोबोटिक लगने लगा।
  • FLAS की जीत: FLAS पहला सीखा हुआ तरीका था जो लगातार "बस विनम्रता से पूछने" (प्रॉम्प्टिंग) के दृष्टिकोण को हरा सका। यह एक जटिल निर्देश को ले सकता था और नए स्वाद को स्वाभाविक रूप से बुन सकता था, बिना शेफ की मूल रेसिपी का पालन करने की क्षमता को तोड़े।

"सीक्रेट सॉस" (जो पेपर ने वास्तव में पाया)

जब लेखकों ने "ब्लैक बॉक्स" के अंदर झाँका कि FLAS कैसे काम कर रहा है, तो उन्हें कुछ आश्चर्यजनक मिला:

  • पथ वक्राकार है: विचार सीधी रेखा में नहीं चलते। वे मुड़ते और घूमते हैं।
  • यह चरणों में होता है: यह एक त्वरित सुधार नहीं है; यह एक बहु-चरणीय प्रक्रिया है।
  • यह व्यक्तिगत है: प्रत्येक शब्द के लिए "धक्का" अलग होता है।

सारांश

FLAS को एक सलेजहैमर (एक निश्चित बल के साथ मॉडल को एक बार मारना) से एक कुशल नृत्य प्रशिक्षक (मॉडल को चरण-दर-चरण मार्गदर्शन करना, वास्तविक समय में मॉडल की स्थिति और आपकी इच्छा के आधार पर चालों को समायोजित करना) के अपग्रेड के रूप में देखें।

यह मॉडल को नए व्यवहारों (जैसे अधिक रचनात्मक, अधिक तथ्यात्मक होना, या विशिष्ट फॉर्मेटिंग का उपयोग करना) को बहुत अधिक स्वाभाविक रूप से और विश्वसनीय रूप से अपनाने की अनुमति देता है, बिना पूरे मॉडल को फिर से प्रशिक्षित किए या हर बार सटीक प्रॉम्प्ट लिखे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →