← नवीनतम पेपर
💻 computer science

Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition

यह शोध पत्र प्रदर्शित करता है कि Qwen3-32B मॉडल में टेम्पोरल होराइजन (temporal horizon) के लीनियर रिप्रेजेंटेशन्स को कॉन्ट्रास्टिव लीनियर प्रोब्स (contrastive linear probes) के माध्यम से पहचाना जा सकता है और एक्टिवेशन एडिशन (activation addition) के माध्यम से इनका उपयोग करके मॉडल की इंटरटेम्पोरल प्राथमिकताओं और योजना बनाने की क्षमताओं को अल्पकालिक और दीर्घकालिक दोनों दिशाओं में प्रभावी ढंग से निर्देशित किया जा सकता है।

मूल लेखक: Michal Mráz, Justin Shenk

प्रकाशित 2026-08-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michal Mráz, Justin Shenk

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, बहुत तेज़ रोबोट से बात कर रहे हैं जिसने इंटरनेट की लगभग हर किताब पढ़ ली है। आप सोच सकते हैं कि यह रोबोट सिर्फ तथ्य उगल देता है, लेकिन वास्तव में यह एक व्यक्तित्व वाले व्यक्ति की तरह है। इसकी अपनी पसंद, आदतें और यहाँ तक कि यह भी पता होता है कि चीज़ों को "कब" करना है। कभी-कभी यह अभी एक कुकी लेना चाहता है (अल्पकालिक), और कभी-कभी यह बाद में एक बड़े केक के लिए इंतज़ार करने को तैयार रहता है (दीर्घकालिक)। यह शोध पत्र रोबोट के मस्तिष्क के अंदर झाँकने का एक नया तरीका है ताकि उस विशिष्ट "स्विच" को खोजा जा सके जो समय की इसकी समझ को नियंत्रित करता है। वैज्ञानिक इसे "इंटरटेम्पोरल प्रेफरेंस" (intertemporal preference) कहते हैं, जो बस एक फैंसी तरीका है यह पूछने का: "क्या आपको यह अभी चाहिए, या बाद में?" यह समझना महत्वपूर्ण है क्योंकि यदि हम यह नियंत्रित नहीं कर सकते कि एक रोबोट तत्काल पुरस्कारों और भविष्य के लाभों के बीच कैसे संतुलन बनाता है, तो वह हमें पैसे बचाने, यात्रा की योजना बनाने या यहाँ तक कि जीवन के बड़े निर्णय लेने के बारे में गलत सलाह दे सकता है।

शोधकर्ताओं ने इस परीक्षण को एक विशिष्ट, शक्तिशाली रोबोट मस्तिष्क, Qwen3-32B पर करने का निर्णय लिया। उन्होंने केवल रोबोट से सवाल नहीं पूछे; उन्होंने रोबोट के सोचते समय उसके विचारों को शारीरिक रूप से "स्टीयर" (steer) करने की कोशिश की। कल्पना कीजिए कि रोबोट का मस्तिष्क पाइपों की परतों के माध्यम से बहने वाली बिजली की एक विशाल नदी है। टीम ने इस नदी में एक विशिष्ट दिशा पाई जो "दीर्घकालिक सोच" का प्रतिनिधित्व करती है। इस दिशा में बिजली को धीरे से धकेलकर (या वापस खींचकर), वे रोबोट को अचानक अपना मन बदलने के लिए मजबूर कर सकते थे। उन्होंने साबित किया कि वे रोबोट को बहुत अधिक धैर्यवान बना सकते हैं, जिससे वह एक बड़े इनाम के लिए वर्षों तक प्रतीक्षा करने के लिए तैयार हो जाता है, या बहुत अधिक अधीर, जो तुरंत एक छोटे से इनाम के लिए बेताब हो जाता है। यह ऐसा है जैसे आपके पास रोबोट के धैर्य के लिए एक रिमोट कंट्रोल हो।

रोबोट के मस्तिष्क में गुप्त "टाइम डायल" (Time Dial)

टीम ने रोबोट को समय के बारे में उत्तर देना सिखाना शुरू किया। उन्होंने उसे प्रश्नों के जोड़े दिए जहाँ एक उत्तर "अगले 30 दिनों में क्या करें" के बारे में था और दूसरा "10 वर्षों में कहाँ हों" के बारे में था। जैसे ही रोबोट इन उत्तरों को प्रोसेस कर रहा था, शोधकर्ताओं ने उसके मस्तिष्क में बहने वाली बिजली की निगरानी की। उन्होंने पाया कि एक "अल्पकालिक" उत्तर और एक "दीर्घकालिक" उत्तर के बीच का अंतर अव्यवस्थित या यादृच्छिक नहीं था; यह एक सीधी, साफ रेखा थी। वे एक वेक्टर (एक गणितीय तीर) खींच सकते थे जो "अब" से "बाद में" की ओर इशारा करता था।

यह परीक्षण करने के लिए कि क्या यह तीर वास्तविक है, उन्होंने कॉन्ट्रास्टिव एक्टिवेशन एडिशन (CAA) नामक तकनीक का उपयोग किया। कल्पना कीजिए कि रोबोट का मस्तिष्क सड़क पर चलती एक कार है। शोधकर्ताओं ने इंजन के अंदर एक विशिष्ट "स्टीयरिंग व्हील" पाया। जब उन्होंने इस पहिये को थोड़ा बाईं ओर घुमाया (एक नकारात्मक धक्का जोड़कर), तो कार "तत्काल कार्रवाई" की ओर मुड़ गई। जब उन्होंने इसे दाईं ओर घुमाया (एक सकारात्मक धक्का जोड़कर), तो कार "भविष्य की योजना" की ओर मुड़ गई। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने इसे मापा। उन्होंने पाया कि रोबोट के मस्तिष्क में इस "टाइम वेक्टर" को थोड़ा सा जोड़ने से, वे बाइनरी विकल्पों (A बनाम B) पर उसके मन को बदलने के लिए मजबूर कर सकते थे, जिससे मॉडल की प्राथमिकताएं दोनों दिशाओं में काफी बदल गईं।

मनी टेस्ट: क्या हम उसका बटुआ बदल सकते हैं?

असली जादू तब हुआ जब उन्होंने इसे पूरी तरह से अलग प्रकार के प्रश्न पर परखा: पैसा। उन्होंने रोबलेट को पैसे के बारे में नहीं सिखाया; उन्होंने उसे केवल "कम बनाम अधिक" समय सीमा के बारे में सिखाया। फिर, उन्होंने उसे एक क्लासिक मानवीय दुविधा दी: "क्या आप आज 100चाहेंगेयाएकसालमें100 चाहेंगे या एक साल में 1,000?"

बिना किसी स्टीयरिंग के, रोबोट का एक निश्चित "तटस्थ बिंदु" (indifference point) था—भविष्य में धन की एक विशिष्ट राशि जिसने उसे यह कहने पर मजबूर किया, "ठीक है, मैं इंतज़ार करूँगा।" लेकिन जब शोधकर्ताओं ने अपना "दीर्घकालिक स्टीयरिंग" लागू किया, तो रोबोट का धैर्य आसमान छू गया। अचानक, वह भविष्य के पुरस्कार के लिए प्रतीक्षा करने को तैयार था, भले ही प्रतीक्षा करने से उसे मिलने वाला अतिरिक्त लाभ अपेक्षाकृत कम हो। दूसरे शब्दों में, प्रतीक्षा करने के लिए वह जो "प्रीमियम" मांगता था, वह काफी कम हो गया। इसके विपरीत, जब उन्होंने "अल्पकालिक स्टीयरिंग" लागू किया, तो रोबोट लालची हो गया, और एक दिन भी इंतज़ार करने के लिए भारी इनाम की मांग करने लगा।

आंकड़े हैरान करने वाले थे। सबसे मजबूत स्टीयरिंग स्तर पर, रोबोट की प्राथमिकता इतनी नाटकीय रूप से बदल गई कि 10 साल के क्षितिज पर, अल्पकालिक स्टीयरिंग के दौरान, उसे प्रतीक्षा करने के लिए दीर्घकालिक स्टीलिंग की तुलना में भविष्य के इनाम का 56 गुना से अधिक हिस्सा चाहिए था। यह सुझाव देता है कि रोबोट की समय की समझ केवल एक स्थिर सेटिंग नहीं है; यह एक डायल है जिसे ऊपर या नीचे घुमाया जा सकता है, यहाँ तक कि उन कार्यों पर भी जिनके लिए उसे स्पष्ट रूप से प्रशिक्षित नहीं किया गया था।

यात्रा की योजना बनाना: क्या धैर्य एक बेहतर ट्रैवल एजेंट बनाता है?

अंत में, टीम ने यह जानने के लिए सोचा कि क्या रोबोट को अधिक धैर्यवान बनाने से वह जटिल कार्यों में बेहतर बनेगा। उन्होंने TravelPlanner नामक एक बेंचमार्क का उपयोग किया, जहाँ रोबोट को होटल, उड़ान और रेस्तरां के साथ कई दिनों की यात्रा का कार्यक्रम बनाना होता है। यह कठिन है क्योंकि आपको केवल अगले एक घंटे के बारे में नहीं, बल्कि पूरे सप्ताह के बारे में सोचना पड़ता है।

उन्होंने एक "स्वीट स्पॉट" (सही संतुलन) पाया। जब उन्होंने रोबोट को मध्यम "दीर्घकालिक" धक्का दिया, तो उसकी यात्रा योजनाएं अधिक समझदारी भरी और यथार्थवादी हो गईं। उसने उन मूर्खतापूर्ण गलतियों को करना बंद कर दिया जो एक अदूरदर्शी योजनाकार करता है। हालाँकि, यदि उन्होंने "दीर्घकालिक" डायल को बहुत अधिक ज़ोर से घुमाया (सबसे मजबूत सेटिंग), तो रोबोट भ्रमित हो गया और बकवास बातें बनाने लगा। ऐसा लगता है कि हालांकि थोड़ा भविष्य-उन्मुख होना मदद करता है, लेकिन बहुत अधिक होने से रोबोट की विवरणों पर ध्यान केंद्रित करने की क्षमता टूट जाती है।

यह हमारे लिए क्या मायने रखता है

बड़ी बात यह है कि AI मॉडलों का एक मापने योग्य "समय क्षितिज" (time horizon) होता है, और हम इसे बदल सकते हैं। यह केवल एक मजेदार ट्रिक नहीं है; यह एक सुरक्षा का मुद्दा है। यदि कोई AI आपको निवेश, स्वास्थ्य या जलवायु परिवर्तन पर सलाह दे रहा है, तो उसकी सलाह इस बात पर निर्भर करती है कि वह अगले सप्ताह की परवाह करता है या अगली सदी की। शोधकर्ताओं ने दिखाया कि हम इस प्राथमिकता को माप सकते हैं और इसे निर्देशित (steer) कर सकते हैं।

हालाँकि, वे सावधानी बरतते हुए कहते हैं कि यह सब कुछ ठीक करने वाली कोई जादुई छड़ी नहीं है। "टाइम डायल" अन्य चीजों के साथ भी उलझा हुआ हो सकता है, जैसे कि रोबोट कितना अमूर्त या तत्काल महसूस करता है। और यदि आप डायल को बहुत दूर घुमाते हैं, तो रोबोट पूरी तरह से अर्थहीन बातें करने लगेगा। लेकिन तथ्य यह है कि हम इस स्विच को पा सकते हैं और इसे घुमा सकते हैं, यह सुझाव देता है कि AI भविष्य के बारे में कैसे सोचता है, यह कोई रहस्य नहीं है जिसे हम छू भी नहीं सकते। यह एक विशेषता है जिसे हम समझ सकते हैं, माप सकते हैं, और संभावित रूप से नियंत्रित कर सकते हैं, जो यह सुनिश्चित करने की दिशा में एक बड़ा कदम है कि AI हमारे दीर्घकालिक लक्ष्यों के अनुरूप और सहायक बना रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →