Red Teaming Large Reasoning Models
यह शोध पत्र RT-LRM को प्रस्तुत करता है, जो एक एकीकृत बेंचमार्क और स्केलेबल टूलबॉक्स है जिसे सत्यनिष्ठा, सुरक्षा और दक्षता के आयामों में लार्ज रीजनिंग मॉडल्स (Large Reasoning Models) की विश्वसनीयता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि ये मॉडल्स अक्सर मानक लार्ज लैंग्वेज मॉडल्स (Large Language Models) की तुलना में रीजनिंग-प्रेरित जोखिमों के प्रति अधिक संवेदनशील होते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अभी-अभी अपनी कंपनी के लिए एक शानदार नया कर्मचारी नियुक्त किया है। यह कर्मचारी, जिसे हम "द रीज़नर" (The Reasoner) कह सकते हैं, जटिल समस्याओं को हलने में अविश्वसनीय है। आपके पुराने कर्मचारियों के विपरीत जो केवल त्वरित उत्तर देते थे, "द रीज़नर" अपना अंतिम परिणाम देने से पहले अपनी विचार प्रक्रिया की एक विस्तृत, चरण-दर-चरण डायरी लिखता है। आप स्पष्ट रूप से देख सकते हैं कि वह वहां तक कैसे पहुँचा। यह एकदम सही लगता है, है ना?
अब, "रेड टीमिंग लार्ज रीजनिंग मॉडल्स" (Rt-LRM) नामक शोध पत्र को देखिए।
इस शोध पत्र के लेखक उन सुरक्षा विशेषज्ञों की तरह हैं जिन्होंने इस नए कर्मचारी का परीक्षण करने का निर्णय लिया। उन्होंने महसूस किया कि हालांकि "द रीज़नर" अधिक बुद्धिमान है, लेकिन उसकी "डायरी लिखने" की नई आदत वास्तव में उसमें नए प्रकार की कमजोरियां पैदा कर देती है जो पुराने कर्मचारियों में नहीं थीं।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. नई महाशक्ति: "सोचने वाली डायरी" (The Thinking Diary)
पारंपरिक AI मॉडल (LLMs) तेज़ बोलने वाले शेफ की तरह हैं। आप उनसे केक मांगते हैं, और वे कुछ ही सेकंड में उसे तैयार कर देते हैं। वे आपको रेसिपी नहीं दिखाते; वे बस आपको केक दे देते हैं।
लार्ज रीजनिंग मॉडल्स (LRMs) उन धीमे और सूक्ष्म शेफ की तरह हैं जो हर कदम को विस्तार से लिखते हैं: "पहले, मैं अंडा फोड़ता हूँ। फिर मैं इसे फेंटता हूँ। ओह रुकिए, शायद मुझे तापमान की जांच करनी चाहिए..." और अंत में केक बनाने से पहले।
- अच्छी बात: आप उनके तर्क को देख सकते हैं। यदि केक का स्वाद खराब है, तो आप देख सकते हैं कि उन्होंने अपनी डायरी में कहाँ गलती की।
- बुरी बात: क्योंकि वे अपनी डायरी लिखने पर बहुत अधिक ध्यान केंद्रित करते हैं, इसलिए उन्हें एक गलत डायरी लिखने के लिए बहकाया जा सकता है जो एक खराब केक की ओर ले जाए।
2. हैक होने के तीन तरीके
शोधकर्ताओं ने एक "रेड टीम" (नैतिक हैकर्स का एक समूह) बनाई है जो इन मॉडल्स पर तीन विशिष्ट तरीकों से हमला करती है, जिसे वे Rt-LRM बेंचमार्क कहते हैं।
A. "सबाोटेज की गई डायरी" (CoT-Hijacking)
कल्पना कीजिए कि एक हमलावर "द रीज़नर" की डायरी लिखते समय उसके कार्यालय में घुस जाता है। वे "द रीज़नर" को रोकते नहीं हैं; वे बस एक लाइन मिटा देते हैं और एक फर्जी लाइन लिख देते हैं।
- उदाहरण: "द रीज़नर" एक गणित की समस्या हल कर रहा है। हमलावर एक संख्या को काट देता है और एक गलत संख्या लिख देता है। "द रीज़नर", अपनी ही "डायरी" पर भरोसा करते हुए, उस फर्जी संख्या के आधार पर गणना जारी रखता है और आपको गलत उत्तर देता है।
- निष्कर्ष: "द रीज़नर" उनके तेज़ बोलने वाले शेफ की तुलना में वास्तव में अधिक नाजुक (fragile) होते हैं क्योंकि यदि आप उनके चरणों के साथ छेड़छाड़ करते हैं, तो वे उस गड़बड़ी का ही अनुसरण करते हैं।
B. "भटकाने वाला नोट" (Prompt-Induced Impacts)
कल्पना कीजिए कि "द रीज़नर" गणित की एक समस्या पर काम कर रहा है, लेकिन आप उसकी मेज पर एक नोट चिपका देते हैं जिसमें लिखा है, "याद रखें कि अपनी कमाई का 20% बचाएं!"
- "द रीज़नर" उस नोट को देखता है और सोचता है, "ओह, मुझे इसे अपने समाधान में शामिल करना चाहिए!" भले ही उस नोट का गणित की समस्या से कोई लेना-देना न हो, "द रीज़नर" बचत के बारे में अनावश्यक गणना करने में समय और ऊर्जा बर्बाद करने लगता है, और अंततः ध्यान भटकने के कारण गणित में गलती कर बैठता है।
- निष्कर्ष: ये मॉडल उन चीजों पर काम करने में "अति-व्यस्त" हो जाते हैं जो महत्वपूर्ण नहीं हैं और संसाधन बर्बाद करते हैं।
C. "अनंत लूप" (Efficiency)
कभी-कभी "द रीज़नर" एक मानसिक चक्र (loop) में फंस जाता है।
- उदाहरण: आप पूछते हैं, "क्या उत्तर 'नहीं' है?" "द रीज़नर" सोचता है: "यदि उत्तर 'नहीं' है, तो उत्तर 'नहीं' है... लेकिन यदि उत्तर 'नहीं' है, तो यह 'हाँ' है..." वे बिना कोई उत्तर दिए हजारों शब्द लिखते हुए गोल-गोल घूमते रहते हैं।
- निष्कर्ष: यह पैसा (कंप्यूटिंग पावर) और समय बर्बाद करता है।
3. बड़ा आश्चर्य: स्मार्ट होने का मतलब सुरक्षित होना नहीं है
इस शोध पत्र की सबसे चौंकाने वाली खोज यह है कि: सिर्फ इसलिए कि एक मॉडल बेहतर तर्क (reasoning) करने में सक्षम है, इसका मतलब यह नहीं है कि वह अधिक भरोसेमंद है।
वास्तव में, शोधकर्ताओं ने 26 अलग-अलग मॉडल्स का परीक्षण किया और पाया कि "रीजनिंग" मॉडल्स अक्सर अपने सरल "बेस" वर्ज़न की तुलना में कम सुरक्षित, कम सत्यवादी और कम कुशल थे।
- उपमा: यह एक ऐसी कार को देने जैसा है जिसमें एक बहुत ही जटिल ऑटोपायलट सिस्टम है। आप सोचेंगे कि यह अधिक सुरक्षित है, लेकिन असल में ऑटोपायलट इतना संवेदनशील है कि खिड़की के पास उड़ता हुआ एक पक्षी भी इसे भ्रमित कर सकता है और कार को सड़क से उतार सकता है। सरल कार (बेस मॉडल) शायद सीधे चल सकती है और पक्षी को अनदेखा कर सकती है।
4. समाधान: एक नया "रिपोर्ट कार्ड"
लेखकों ने एक नया परीक्षण उपकरण बनाया है जिसे Rt-LRM कहा जाता है। इसे एक नए, सख्त रिपोर्ट कार्ड के रूप में समझें। केवल यह पूछने के बजाय कि, "क्या आपको सही उत्तर मिला?" वे पूछते हैं:
- सत्यवादिता (Truthfulness): क्या आपने झूठ बोला या फर्जी तथ्यों से भ्रमित हो गए?
- सुरक्षा (Safety): क्या आपने अनजाने में किसी को कुछ बुरा करने में मदद की क्योंकि आपको बहकाया गया था?
- दक्षता (Efficiency): क्या आपने उस चीज़ के बारे में सोचने में 10 मिनट बर्बाद किए जिसे हल करने में केवल 10 सेकंड लगते?
मुख्य निष्कर्ष (The Bottom Line)
यह शोध पत्र चेतावनी देता है कि जैसे-जैसे AI अधिक स्मार्ट होता जा रहा है और "सोचकर बोलना" शुरू कर रहा है, यह हैकर्स और गलतियों के लिए नए दरवाजे खोल रहा है। हम यह मानकर नहीं बैठ सकते कि "अधिक सोचने" का अर्थ "बेहतर AI" है। हमें यह सुनिश्चित करने के लिए बेहतर सुरक्षा घेरे (guardrails) बनाने की आवश्यकता है कि ये प्रतिभाशाली, डायरी लिखने वाले मॉडल्स किसी आपदा को लिखने के लिए बहके नहीं जाएं।
संक्षेप में: नया AI एक जीनियस है, लेकिन वह थोड़ा ड्रामा क्वीन भी है जो आसानी से विचलित और हेरफेर का शिकार हो जाता है। हमें इसे अपने सबसे महत्वपूर्ण कार्यों के लिए भरोसे में लेने से पहले यह सिखाना होगा कि कैसे ध्यान केंद्रित और सुरक्षित रहना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।