← नवीनतम पेपर
💻 computer science

UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering

UniSteer एक टेक्स्ट-गाइडेड फ्लो मैचिंग मॉडल है जो व्यवहार नियंत्रण, सत्यता, अवधारणा हेरफेर और वर्गीकरण के लिए एक एकीकृत ढांचे के माध्यम से फ्रोजन लार्ज लैंग्वेज मॉडल्स के बहुमुखी, सूक्ष्म स्टीयरिंग को सक्षम करने के लिए एक्टिवेशन स्पेस में एक यूनिवर्सल कंडिशनल वेलोसिटी फील्ड सीखता है।

मूल लेखक: Yingdong Shi, Ruiming Zhang, Changming Li, Zhiyu Yang, Kaixing Zhang, Jingyi Yu, Kan Ren

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yingdong Shi, Ruiming Zhang, Changming Li, Zhiyu Yang, Kaixing Zhang, Jingyi Yu, Kan Ren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, जमी हुई ऑर्केस्ट्रा के रूप में करें। एक बार जब यह बन जाता है, तो आप पूरे ऑर्केस्ट्रा को फिर से बनाए बिना इसके वाद्य यंत्रों या संगीत की शीट (मॉडल के वेट्स) को आसानी से नहीं बदल सकते। आमतौर पर, यदि आप चाहते हैं कि ऑर्केस्ट्रा एक "डरावना" गाना बजाए या एक "मददगार" गाना बजाए, तो आपको उन्हें बहुत विशिष्ट, कठोर निर्देश (प्रॉम्प्ट्स) देने होते हैं या हर एक शैली के लिए एक अलग कंडक्टर (फाइन-ट्यूनिंग) किराए पर लेना पड़ता है।

UniSteer एक नया तरीका है जो एक यूनिवर्सल, टेक्स्ट-गाइडेड कंडक्टर की तरह काम करता है जो वाद्य यंत्रों को छुए बिना, प्रदर्शन के दौरान ही ऑर्केस्ट्रा के प्रदर्शन को तुरंत नया रूप दे सकता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "एक-आकार-सभी-के-लिए-नहीं" वाला दृष्टिकोण

वर्तमान में, यदि आप चाहते हैं कि एक AI "दुष्ट" हो, तो आपको एक विशिष्ट "दुष्ट वेक्टर" (एक गणितीय दिशा) की आवश्यकता होती है। यदि आप चाहते हैं कि यह "मददगार" हो, तो आपको एक "मददगार वेक्टर" की आवश्यकता होती है। यदि आप चाहते हैं कि यह "मददगार और दुष्ट और संक्षिप्त" हो, तो आपको उन तीनों अलग-अलग वेक्टर्स को एक साथ मिलाने की कोशिश करनी होगी। अक्सर, वे आपस में टकराते हैं, जैसे कि कार को आगे चलाने के साथ-साथ एक ही समय में ब्रेक मारना और स्टीयरिंग को बाईं ओर मोड़ना। यह अव्यवस्थित है और ठीक से काम नहीं करता है।

2. समाधान: संभावनाओं का एक "प्रवाह" (Flow)

UniSteer खेल बदल देता है। "दुष्ट" या "मददगार" के लिए एक एकल दिशा सीखने के बजाय, यह AI के मस्तिष्क के भीतर एक यूनिवर्सल मूवमेंट मैप (फ्लो फील्ड) सीखता है।

  • उपमा: कल्पना कीजिए कि AI के आंतरिक विचार एक नदी हैं।
    • पुराने तरीके एक डंडे से नाव को एक विशिष्ट दिशा में धकेलने की कोशिश करते हैं।
    • UniSteer नदी के पूरे प्रवाह को सीखता है। यह जानता है कि यदि आप कहते हैं "मददगार बनो," तो पानी स्वाभाविक रूप से मददगार होने की ओर बहता है। यदि आप कहते हैं "दुष्ट बनो," तो पानी दुष्टता की ओर बहता है।
    • महत्वपूर्ण बात यह है कि यह संयोजनों (combinations) को नेविगेट करना सीखता है। यदि आप कहते हैं "मददगर बनो लेकिन संक्षिप्त रहो," तो कंडक्टर जानता है कि दोनों शर्तों को एक साथ पूरा करने के लिए नदी को कैसे मोड़ना है, न कि दो अलग-अलग धाराओं से लड़ना है।

3. यह कैसे काम करता है: "टाइम-ट्रैवल" संपादन

पेपर एक प्रक्रिया का वर्णन करता है जिसे फ्लो इन्वर्जन (Flow Inversion) कहा जाता है। यहाँ स्टेप-बाय-स्टेप जादू है:

  1. स्रोत (The Source): AI एक वाक्य बनाना शुरू करता है (जैसे, "मुझे लगता है...")।
  2. वापस जाना (The Rewind/Inversion): UniSteer AI के वर्तमान विचार (एक्टिवेशन) को लेता है और उसे आंशिक रूप से एक धुंधली, तटस्थ स्थिति में वापस ले जाता है, जो इस आधार पर होता है कि AI मूल रूप से क्या करने की कोशिश कर रहा था।
  3. आगे बढ़ना (The Forward/Regeneration): फिर यह उस धुंधली स्थिति को लेता है और इसे फिर से "फास्ट-फॉरवर्ड" करता है, लेकिन इस बार यह आपके टेक्स्ट प्रॉम्प्ट (जैसे, "दुष्ट बनो") का पालन करता है।
  4. परिणाम: AI आगे निर्माण करना जारी रखता है, लेकिन अब इसके आंतरिक विचार आपके नए टेक्स्ट निर्देश के अनुरूप होने के लिए धीरे से निर्देशित किए गए हैं, और यह सब AI की स्थायी स्मृति को बदले बिना किया गया है।

4. दो सुपरपावर्स

पेपर का दावा है कि यह एकल मॉडल दो अलग-अलग काम करता है:

  • स्टीयरिंग (कंडक्टर): आप केवल एक टेक्स्ट कंडीशन टाइप करके AI को अपना व्यक्तित्व, शैली या सत्यनिष्ठा बदलने के लिए कह सकते हैं। यह सरल चीजों ("संक्षिप्त बनो") और जटिल चीजों ("एक मददगार डॉक्टर बनो जो मेडिकल शब्दावली से बचता है और मुस्कान के साथ समाप्त करता है") दोनों के लिए काम करता है।
  • वर्गीकरण (जासूस): आप इसका उपयोग AI के मन को पढ़ने के लिए भी कर सकते हैं। यदि आप AI को एक वाक्य देते हैं और पूछते हैं, "क्या यह विषाक्त (toxic) है?" या "क्या यह मददगार है?", तो UniSteer "विषाक्त" लेबल के तहत उस वाक्य को "पुनर्निर्मित" करने की कोशिश करता है और "मददगार" लेबल के तहत भी। जो लेबल वाक्य को सबसे स्वाभाविक बनाता है (जिसे पुनर्निर्माण के लिए सबसे कम "ऊर्जा" की आवश्यकता होती है) वही उत्तर है। यह एक जासूस से पूछने जैसा है कि कौन सी कहानी सुरागों के साथ सबसे अच्छी तरह फिट बैठती है।

5. प्रयोगों ने क्या दिखाया

शोधकर्ताओं ने तीन अलग-अलग AI मॉडलों (Llama और Qwen) पर इसका परीक्षण किया और पाया:

  • बहुमुखी प्रतिभा (Versatility): एक अकेला मॉडल AI को "दुष्ट" बनाने से लेकर उसे सच बोलने या एक साथ 10 नियमों का पालन करने तक सब कुछ संभाल सकता है।
  • सटीकता (Precision): जब कई नियमों (जैसे "एक विशिष्ट वाक्यांश के साथ शुरू करें और दूसरे के साथ समाप्त करें") का पालन करने के लिए कहा गया, तो UniSteer जानता था कि वाक्य में बदलाव कहाँ लागू करना है, बजाय इसके कि वह पूरे टेक्स्ट को बिगाड़ दे।
  • दक्षता (Efficiency): इसे हर नए व्यक्तित्व के लिए एक नए प्रशिक्षण सत्र की आवश्यकता नहीं थी; इसे बस एक नए टेक्स्ट विवरण की आवश्यकता थी।

सारांश

UniSteer एक ऐसा टूल है जो आपको प्राकृतिक भाषा का उपयोग करके एक फ्रीज किए गए AI मॉडल को नियंत्रित करने की अनुमति देता है। हर काम के लिए एक नया टूल बनाने के बजाय, यह यह सीखता है कि AI के विचार कैसे चलते हैं, जिसका एक यूनिवर्सल "फ्लो" है। आप फिर केवल टेक्स्ट में वर्णन करके उन विचारों को किसी भी व्यवहार, अवधारणा या नियमों के सेट की ओर मोड़ सकते हैं, और यह उसी ज्ञान का उपयोग यह पता लगाने के लिए भी कर सकता है कि AI क्या सोच रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →