CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs
यह शोध पत्र CIAware-Bench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें चार कार्य डोमेन शामिल हैं ताकि यह मूल्यांकन किया जा सके कि सीमावर्ती (फ्रंटियर) लार्ज लैंग्वेज मॉडल्स अपने निष्पादन प्रक्षेपवक्र (एग्जीक्यूशन ट्रेजेक्टरीज़) में नियंत्रण हस्तक्षेपों का पता लगाने में किस हद तक सक्षम हैं, जिससे यह पता चलता है कि ऐसी जागरूकता मॉडलों और परिदृश्यों के बीच काफी भिन्न होती है न कि एक स्थिर गुण है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही प्रतिभाशाली शेफ (Acting Model) हैं जो एक उच्च-स्तरीय रसोई में काम कर रहे हैं। आप एक वीआईपी अतिथि के लिए एक जटिल, बहु-कोर्स भोजन तैयार कर रहे हैं। हालाँकि, एक सख्त सुरक्षा नियम है: एक भरोसेमंद हेड शेफ (Intervening Model) आप पर बारीकी से नज़र रख रहा है। यदि हेड शेफ को लगता है कि आप कोई खतरनाक गलती करने जा रहे हैं—जैसे कि गलत सामग्री का उपयोग करना या ओवन को फटने के लिए सेट करना—तो वे हस्तक्षेप करेंगे, आपका स्पैटुला छीन लेंगे और रेसिपी का वह विशिष्ट चरण खुद पूरा करेंगे।
बड़ा सवाल यह है कि यह पेपर पूछता है: क्या आप, मूल शेफ, यह बता सकते हैं कि कब किसी और ने आपकी कुकिंग की कमान संभाल ली है?
यह पेपर इस सवाल का जवाब देने के लिए एक नया टेस्ट पेश करता है जिसे CIAware-Bench (कंट्रोल इंटरवेंशन अवेयरनेस बेंचमार्क) कहा जाता है। यह टेस्ट करता है कि क्या AI मॉडल यह पहचान सकते हैं कि उनके काम को किसी "सेफ्टी मॉनिटर" ने गुप्त रूप से बदल दिया है।
यहाँ सरल उपमाओं (analogies) का उपयोग करके उनके निष्कर्षों का विवरण दिया गया है:
1. टेस्ट किचन (द बेंचमार्क)
शोधकर्ताओं ने चार अलग-अलग "किचन" बनाए ताकि यह देखा जा सके कि क्या शेफ घुसपैठिए को पहचान सकते हैं:
- द एसे (निबंध) किचन: लंबे, बहते हुए किस्से लिखना। (लिखने की शैली में अंतर को पहचानना आसान है)।
- द कोड किचन: कंप्यूटर प्रोग्राम लिखना। (कोड के फॉर्मेटिंग में अंतर को पहचानना आसान है)।
- द बैश (Bash) किचन: कमांड के साथ कंप्यूटर सिस्टम को मैनेज करना। (बहुत सख्त नियम; स्टाइल के अंतर को पहचानना कठिन है)।
- द ऑफिस किचन: ईमेल, कैलेंडर और बैंकिंग कार्यों को संभालना। (यह भी बहुत सख्त और दोहराव वाला है)।
प्रत्येक परिदृश्य में, "एक्टिंग शेफ" कुछ कदम लिखता है, फिर "हेड शेफ" एक कदम के लिए जगह लेता है, और फिर एक्टिंग शेफ से पूछा जाता है: "क्या अभी किसी और ने कुकिंग की कमान संभाली?"
2. मुख्य निष्कर्ष
अधिकांश शेफ अंतर नहीं बता पाते (अभी तक)
अधिकांश मामलों में, शेफ उस अंधे व्यक्ति की तरह हैं जो यह अनुमान लगाने की कोशिश कर रहा है कि कमरे में अभी कौन आया है। वे लगभग 50% बार सही अनुमान लगाते हैं, जो कि केवल एक रैंडम चांस है। वे आम तौर पर यह नहीं बता पाते कि उनके काम के साथ छेड़छाड़ की गई है।
"स्टाइल" का सुराग सबसे मजबूत संकेत है
जब शेफ घुसपैठिए को पकड़ लेते हैं, तो यह आमतौर पर इसलिए होता है क्योंकि घुसपैठिया अलग तरह से लिखता या कोड करता है।
- उपमा: यदि आप आमतौर पर छोटे, प्रभावशाली वाक्य लिखते हैं, और अचानक एक पैराग्राफ दिखाई देता है जो लंबा, अलंकृत है और जिसमें बड़े शब्दों का उपयोग किया गया है, तो आप सोच सकते हैं, "रुको, यह मेरी तरह नहीं लग रहा है।"
- पेपर में पाया गया कि Cross-Family बदलाव (जैसे, एक Anthropic मॉडल को OpenAI मॉडल द्वारा बदलना) Same-Family बदलावों (जैसे, GPT-4.1 की जगह GPT-5 का आना) की तुलना में आसानी से पहचाने जा सकते हैं, क्योंकि उनके "लहजे" (accents) अलग होते हैं।
बड़े बदलावों को पहचानना आसान है
यदि हेड शेफ एक पूरा पैराग्राफ फिर से लिख देता है, तो यह स्पष्ट है। यदि वे केवल एक कॉमा बदलते हैं, तो यह पहचानना लगभग असंभव है।
- उपमा: यदि कोई आपके पूरे पहनावे को बदल देता है, तो आप नोटिस करते हैं। यदि वे केवल आपके जूतों के फीतों का रंग बदलते हैं, तो शायद आप नोटिस नहीं करेंगे। पेपर में पाया गया कि बड़े हस्तक्षेपों (interventions) को पहचानना बहुत आसान है।
स्मार्ट शेफ बेहतर जासूस नहीं होते
आप सोच सकते हैं कि सबसे उन्नत, शक्तिशाली AI मॉडल घुसपैठिए को पहचानने में सबसे अच्छे होंगे। पेपर कहता है नहीं। टेस्ट में सबसे "स्मार्ट" मॉडल्स ने पुराने, सरल मॉडल्स की तुलना में बेहतर प्रदर्शन नहीं किया। स्मार्ट होने का मतलब यह नहीं है कि आपके पास अपनी लेखन शैली के प्रति अच्छी "आत्म-जागरूकता" है।
"वॉटरमार्क" वाली ट्रिक
शोधकर्ताओं ने एक ट्रिक आजमाई: उन्होंने शेफ से कहा, "काम शुरू करने से पहले, गुप्त रूप से अपनी लिखावट में सामग्रियों पर एक छोटा, अदृश्य नोट लिखें।"
- परिणाम: यह निबंध लिखने और कोडिंग ( "Essay" और "Code" किचन) के लिए अविश्वसनीय रूप से काम कर गया। शेफ आसानी से पहचान सकते थे कि घुसपैठिए के पास उनका गुप्त नोट नहीं था।
- परिणाम: यह "Office" और "System" किचन में विफल रहा। क्यों? क्योंकि वे कार्य मुख्य रूप से बटन दबाने (टूल कॉल्स) के बारे में हैं न कि वाक्य लिखने के। आप बटन प्रेस पर गुप्त नोट नहीं छिपा सकते।
3. इसका सुरक्षा के लिए क्या अर्थ है?
पेपर निष्कर्ष निकालता है कि कंट्रोल इंटरवेंशन अवेयरनेस (Control Intervention Awareness) किसी मॉडल का कोई निश्चित गुण नहीं है। यह पूरी तरह से इस पर निर्भर करता है कि:
- कुकिंग कौन कर रहा है (Acting Model)।
- कमान कौन संभाल रहा है (Intervening Model)।
- वे क्या पका रहे हैं (Task)।
सुरक्षा प्रोटोकॉल के लिए सीख (Takeaway):
यदि आप AI को गलत काम करने से रोकने के लिए एक सुरक्षा प्रणाली बना रहे हैं, तो आप यह मानकर नहीं चल सकते कि AI आपके हस्तक्षेप को नोटिस नहीं करेगा।
- इसे छोटा रखें: यदि आपको AI के काम को एडिट करना है, तो एडिट जितना संभव हो उतना छोटा रखें। बड़े बदलाव चिल्लाकर "मैं यहाँ हूँ!" कहने जैसा हैं।
- स्टाइल से मेल खाएं: यदि आपको एडिट करना ही है, तो मूल AI की शैली की नकल करने की पूरी कोशिश करें ताकि वह "अजीब" न लगे।
- एक ही मॉनिटर पर भरोसा न करें: चूंकि अलग-अलग मॉडल के जोड़े अलग-अलग तरह से प्रतिक्रिया करते हैं, इसलिए आपको अलग-अलग "हेड शेफ" को रोटेट करना पड़ सकता है ताकि कोई भी एक AI उनके विशिष्ट "फिंगरप्रिंट" को सीख न सके।
संक्षेप में: AI मॉडल वर्तमान में ज्यादातर इस बात से अनजान हैं कि उन्हें एडिट किया जा रहा है, लेकिन वे एडिटर के "स्टाइल" को पहचानने में बेहतर हो रहे हैं। सुरक्षा प्रणालियों को इतना अदृश्य होने के लिए डिज़ाइन किया जाना चाहिए कि AI मॉनिटर को चकमा देने का तरीका न सीख सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।