← नवीनतम पेपर
🤖 machine learning

Conditional Optimal Bridge for Riemannian Activation Steering

यह शोध पत्र \textsc{Cobras} को प्रस्तुत करता है, जो एक नवीन एक्टिवेशन स्टीयरिंग विधि है जो एक सिद्धांतपूर्ण, क्वेरी-अनुकूलित स्टीयरिंग दिशा प्राप्त करने के लिए रेसिडुअल-स्ट्रीम हाइपरस्फीयर पर एक श्रोडिंगर ब्रिज (Schrödinger Bridge) के रूप में समस्या को सूत्रबद्ध करती है, जो मौजूदा बेसलाइनों से बेहतर प्रदर्शन करती है और आउट-ऑफ-डिस्ट्रीब्यूशन प्रदर्शन गिरावट से बचती है।

मूल लेखक: Seyed Arshan Dalili, Ajay Narayanan Sridhar, Vijaykrishnan Narayanan, Mehrdad Mahdavi

प्रकाशित 2026-07-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seyed Arshan Dalili, Ajay Narayanan Sridhar, Vijaykrishnan Narayanan, Mehrdad Mahdavi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दिमाग (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिख सकता है, सवालों के जवाब दे सकता है और आपसे चैट कर सकता है। लेकिन कभी-कभी, यह दिमाग थोड़ा चिड़चिड़ा हो जाता है, झूठ बोलता है, या बुरी बातें कहता है। इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर इस दिमाग को "फाइन-ट्यून" करने की कोशिश करते हैं, जो पूरे रोबोट को फिर से शुरू से प्रशिक्षित करने जैसा है। यह बहुत भारी, धीमा और महंगा काम है।

एक नया, हल्का विचार एक्टिवेशन स्टीयरिंग (Activation Steering) है। कल्पना कीजिए कि रोबोट का दिमाग एक विशाल, चमकता हुआ नक्शा है। जब रोबोट सोचता है, तो उस नक्शे पर एक छोटा सा चमकता हुआ बिंदु (एक "एक्टिवेशन") घूमता है। वैज्ञानिकों ने पाया कि यदि आप उस बिंदु को एक विशिष्ट दिशा में धकेलते हैं, तो रोबोट अचानक अधिक मददगार, सत्यवादी या अच्छा बन जाता है।

पुराने धक्कों (Nudges) के साथ समस्या
कुछ समय के लिए, शोधकर्ताओं ने एक "एक ही आकार सबके लिए" (one-size-fits-all) वाला धक्का इस्तेमाल किया। उन्होंने नक्शे पर एक एकल दिशा की गणना की और हर एक विचार को उसी दिशा में धकेला, चाहे सवाल कुछ भी हो।

  • दोष: यह कार को स्टीयर करने की कोशिश करने जैसा है जहाँ आप हमेशा पहिए को बाईं ओर मोड़ते हैं। यह तब काम कर सकता है जब आप पार्क जाने की कोशिश कर रहे हों, लेकिन अगर आप किराने की दुकान पर जाने की कोशिश कर रहे हैं, तो आप दुर्घटनाग्रस्त हो जाएंगे!
  • परिणाम: पेपर दिखाता है कि ये पुराने तरीके अक्सर उन चीजों में रोबोट को बदतर बना देते हैं जिनमें वह पहले से अच्छा था। यदि आप इसे "सत्यवादी" बनाने के लिए धकेलते हैं, तो यह गणित की समस्याओं या सामान्य ज्ञान के सवालों के जवाबों में बकवास (gibberish) देने लगेगा। रोबोट भ्रमित हो जाता है क्योंकि धक्का यह परवाह नहीं करता कि पूछा गया विशिष्ट प्रश्न क्या है।

नया समाधान: कोबरास (Cobras)
लेखक एक नया तरीका पेश करते हैं जिसे कोबरास (Cobras) (कंडीशनल ऑप्टिमल ब्रिज फॉर रीमानियन एक्टिवेशन स्टीयरिंग) कहा जाता है। एक कठोर, पूर्व-निर्धारित धक्के के बजाय, कोबरास एक स्मार्ट, अनुकूलन योग्य जीपीएस (GPS) की तरह कार्य करता है।

यह कैसे काम करता है, यहाँ एक मजेदार उपमा दी गई है:
कल्पना कीजिए कि रोबोट के विचार एक विशाल, घुमावदार गोले (जैसे एक बीच बॉल) पर चलने वाले यात्री हैं।

  1. पुराना तरीका: आपने हर यात्री को एक नक्शा दिया जिस पर एक एकल तीर बना था: "उत्तर की ओर चलो!" यदि यात्री पहले से ही उत्तर की ओर चल रहा था, तो बहुत अच्छा। यदि वह पूर्व की ओर जाने की कोशिश कर रहा था, तो तीर ने उसे उत्तर की ओर धकेल दिया, और वह रास्ता भटक गया।
  2. कोबरास का तरीका: कोबरास देखता है कि यात्री अभी वास्तव में कहाँ खड़ा है। यह "अच्छे व्यवहार" वाले क्षेत्र की ओर जाने के लिए एकदम सही, घुमावदार पथ की गणना करता है और साथ ही "बुरे व्यवहार" वाले क्षेत्र से बचता है। यह केवल धक्का नहीं देता; यह मार्गदर्शन करता है।

गुप्त सूत्र: श्रोडिंगर ब्रिज (The Schrödinger Bridge)
कोबरास कैसे जानता है कि सही पथ कौन सा है? लेखकों ने एक फैंसी गणितीय अवधारणा का उपयोग किया जिसे श्रोडिंगर ब्रिज कहा जाता है।

  • उपमा: कल्पना कीजिए कि आपके पास "अच्छे" यात्रियों का एक बादल है और "बुरे" यात्रियों का एक बादल है। आप कम से कम ऊर्जा का उपयोग करके "बुरे" बादल को "अच्छे" बादल की ओर ले जाना चाहते हैं।
  • जादू: पेपर सिद्ध करता है कि इस सबसे कुशल पथ को खोजना गणितीय रूप से वही है जो रोबोट को स्टीयर करने का सबसे अच्छा तरीका खोजना है। यह एक बड़ी बात है क्योंकि अब तक, अधिकांश स्टीयरिंग विधियाँ केवल अनुमान (heuristics) थीं। कोबरास पहला है जो यह दिखाता है कि लोकप्रिय "लॉग-डेंसिटी-रेशियो" विधि (यह कहने का एक फैंसी तरीका कि "अच्छे की ओर बढ़ो, बुरे से दूर") वास्तव में एक ठोस, कठोर गणितीय समस्या से आती है। यह केवल एक अनुमान नहीं है; यह एक समाधान है।

पेपर ने क्या पाया (प्रमाण)
लेखकों ने चार अलग-अलग रोबोट दिमागों (Falcon-7B, Mistral-7B, LLaMA3.1-8B, और Qwen2.5-7B) और तीन अलग-अलग लक्ष्यों पर कोबरास का परीक्षण किया: मददगार होना, सत्यवादी होना और सुरक्षित रहना (डिटॉक्सिफिकेशन)।

  • बेहतर परिणाम: कोबरास ने लगातार सभी अन्य तरीकों को पछाड़ दिया। उदाहरण के लिए, "TruthfulQA" टेस्ट पर, इसने Mistral-7B मॉडल की सत्यवादिता को 29.5 प्रतिशत अंक और LLaMA3.1-8B को 25.1 प्रतिशत अंक सुधारा।
  • कोई दुर्घटना नहीं (OOD प्रदर्शन): यह सबसे महत्वपूर्ण हिस्सा है। जब उन्होंने रोबोट का परीक्षण उन सवालों पर किया जिन्हें उसने पहले नहीं देखा था (आउट-ऑफ-डिस्ट्रीब्यूशन या OOD कार्य जैसे गणित या सामान्य ज्ञान), तो पुराने तरीकों ने अक्सर रोबط को विफल कर दिया। हालाँकि, कोबरास ने रोबोट को स्मार्ट बनाए रखा। इसने गणित कौशल को खराब किए बिना सत्यवादिता में सुधार किया।
  • "एब्स्टेन" (Abstain) गेट: कोबरास में एक सुरक्षा स्विच है। यदि रोबोट से ऐसा प्रश्न पूछा जाता है जो उससे बहुत अलग है (जैसे कि एक अजीब, आउट-ऑफ-डिस्ट्रीब्यूशन क्वेरी), तो कोबरास कहता है, "मुझे यकीन नहीं है, मैं आपको धक्का नहीं दूँगा।" यह रोबोट को अर्थहीन बातें बनाने से रोकता है।

यह पेपर क्या खारिज करता है
पेपर स्पष्ट रूप से इस विचार के विरुद्ध तर्क देता है कि एक फिक्स्ड, क्वेरी-इंडिपेंडेंट स्टीयरिंग वेक्टर सबसे अच्छा तरीका है। वे दिखाते हैं कि जबकि फिक्स्ड वेक्टर्स उन विशिष्ट प्रश्नों के लिए काम कर सकते हैं जिनके लिए उन्हें प्रशिक्षित किया गया था, वे नए, अनदेखे प्रश्नों पर प्रदर्शन को खराब कर देते हैं। पेपर सुझाव देता है कि "सभी के लिए एक ही दिशा" वाला दृष्टिकोण ही कारण है जिससे पिछले तरीके आउट-ऑफ-डिस्ट्रीब्यूशन कार्यों पर विफल हो जाते हैं।

वे कितने आश्वस्त हैं?
लेखक अपने परिणामों को लेकर बहुत आश्वस्त हैं, लेकिन वे अपनी भाषा के प्रति सावधान हैं।

  • उन्होंने चार मॉडलों और तीन कार्यों में इन परिणामों को मापा
  • उन्होंने गणितीय रूप से सिद्ध किया कि उनकी विधि एक अनुकूलन समस्या (श्रोडिंगर ब्रिज) का एक वैध समाधान है।
  • उन्होंने प्रदर्शन किया कि कोबरास उस "आउट-ऑफ-डिस्ट्रीब्यूशन डिग्रेडेशन" से बचता है जो अन्य तरीकों में देखा जाता है।
  • वे यह दावा नहीं करते हैं कि यह हर संभावित भविष्य के परिदृश्य के लिए एक पूर्ण, हल की गई समस्या है। वे सीमाओं को नोट करते हैं, जैसे कि यह विधि कम्प्यूटेशनल रूप से महंगी है (पथों की गणना करने में समय लगता है) और इस धारणा पर निर्भर करती है कि रोबोट के विचार एक गोले पर रहते हैं (जो उनके द्वारा परीक्षण किए गए लेयर्स के लिए सच है, लेकिन हर रोबोट के हर हिस्से के लिए नहीं हो सकता है)।

संक्षेप में
कोबरास एक अंधे होकर धक्का देने से एक गाइडेड टूर (निर्देशित यात्रा) में अपग्रेड करने जैसा है। यह एक उन्नत गणित का उपयोग करता है ताकि यह पता लगाया जा सके कि रोबोट को बिना उसके दिमाग को नुकसान पहुँचाए स्मार्ट और सुरक्षित बनाने के लिए सटीक, घुमावदार पथ क्या है। यह AI अलाइनमेंट को केवल एक अनुमान नहीं, बल्कि एक गणनात्मक, विश्वसनीय विज्ञान बनाने की दिशा में एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →