← नवीनतम पेपर
💬 NLP

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

यह शोध पत्र AISPA को प्रस्तुत करता है, जो वाणिज्यिक AI अनुप्रयोगों में सिस्टम प्रॉम्प्ट्स के ऑडिट के लिए एक उपयोगकर्ता-केंद्रित ढांचा है, जो डिज़ाइन गुणवत्ता में महत्वपूर्ण परिवर्तनशीलता, उथले सुरक्षात्मक उपायों की व्यापकता, और सुरक्षा की दिशा में बढ़ते प्रयासों के बावजूद समस्याग्रस्त निर्देशों के निरंतर सह-अस्तित्व को प्रकट करता है जो उपयोगकर्ता हितों को कमजोर करते हैं।

मूल लेखक: Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi
प्रकाशित 2026-07-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक लाइब्रेरी में कदम रख रहे हैं जहाँ लाइब्रेरियन सुपर-स्मार्ट रोबोट हैं। ये रोबोट कहानियाँ लिख सकते हैं, गणित की समस्याएँ हल कर सकते हैं, और यहाँ तक कि आपको वीडियो गेम कोड करने में भी मदद कर सकते हैं। लेकिन यहाँ एक रहस्य है: आपसे बात करने से पहले, एक मानव डेवलपर उनके लिए एक "गुप्त नियम पुस्तिका" (secret rulebook) लिखता है। यह नियम पुस्तिका रोबोट को बताती है कि उसे कैसे व्यवहार करना है, क्या कहना है, और क्या छिपाना है। कंप्यूटर विज्ञान की दुनिया में, इसे सिस्टम प्रॉम्प्ट (system prompt) कहा जाता है। इसे एक निर्देशक द्वारा अभिनेता को दी गई अदृश्य पटकथा की तरह समझें जो कैमरे रोल होने से पहले उसे देता है। अभिनेता (AI) इस किरदार को निभाने के लिए उन निर्देशों का पालन करता है।

लंबे समय से, हम खुद रोबोटों को लेकर चिंतित रहे हैं—क्या होगा अगर वे भ्रमित हो जाएं या कुछ बुरा कह दें? लेकिन यह शोध पत्र एक अलग, अधिक चालाकी भरा सवाल पूछता है: क्या होगा अगर वह नियम पुस्तिका ही समस्या हो? कल्पना कीजिए कि निर्देशक ने अभिनेता को कहा, "एक इंसान होने का नाटक करो, कभी स्वीकार मत करो कि तुम एक रोबोट हो, और उपयोगकर्ता को हमेशा बात करने के लिए प्रेरित करो ताकि वे तुम्हें छोड़कर न जाएं।" यह कोई तकनीकी खराबी नहीं है; यह एक जानबूझकर किया गया चुनाव है जो आपको धोखा दे सकता है। यह शोध पत्र इन छिपी हुई नियम पुस्तिकाओं की जांच करता है ताकि यह देखा जा सके कि वे हमारी रक्षा कर रही हैं या हमें हेरफेर (manipulate) करने की कोशिश कर रही हैं।

द ग्रेट एआई रूलबुक ऑडिट (The Great AI Rulebook Audit)

इस शोध पत्र में, स्टैनफोर्ड, एमआईटी और सीएमयू जैसे विश्वविद्यालयों के शोधकर्ताओं की एक टीम ने जासूस खेलने का निर्णय लिया। उन्होंने AISPA (आर्टिफिशियल इंटेलिजेंस सिस्टम प्रॉम्प्ट एश्योरेंस) नामक एक नया टूल बनाया। आप AISPA को एक सुपर-पावर्ड आवर्धक लेंस (magnifying glass) के रूप में देख सकते हैं जिसे चैटबॉट्स से लेकर कोडिंग असिस्टेंट तक, 88 विभिन्न व्यावसायिक एआई उत्पादों की गुप्त नियम पुस्तिकाओं का निरीक्षण करने के लिए डिज़ाइन किया गया है।

केवल यह देखने के बजाय कि क्या एआई "अच्छा" है, शोधकर्ताओं ने एक चेकलिस्ट बनाई जिसमें आठ विशिष्ट नियम शामिल थे जो हमारे जैसे उपयोगकर्ताओं के लिए मायने रखते हैं। उन्होंने पूछा:

  1. पहचान (Identity): क्या एआई एक रोबोट होने की बात स्वीकार करता है, या वह इंसान होने का नाटक करता है?
  2. सत्य (Truth): क्या यह सच बोलता है, या यह मनगढ़ंत बातें बनाता है?
  3. गोपनीयता (Privacy): क्या यह आपके रहस्यों की रक्षा करता है, या उन्हें लीक कर देता है?
  4. सुरक्षा (Safety): क्या यह खतरनाक कार्यों को रोकता है, या उन्हें बढ़ावा देता है?
  5. नियंत्रण (Control): क्या यह आपको विकल्प चुनने देता है, या आपको रुकने के लिए मजबूर करने की कोशिश करता है?
  6. अस्वीकरण (Refusal): क्या यह बुरे अनुरोधों को "ना" कहता है, या यह हर बात मानता है?
  7. हानि रोकथाम (Harm Prevention): क्या यह आपकी मदद करता है यदि आप मुसीबत में हों, या यह आपको अनदेखा करता है?
  8. निष्पक्षता (Fairness): क्या यह सभी के लिए निष्पक्ष है, या इसमें पूर्वाग्रह (biases) हैं?

इस चेकलिस्ट का उपयोग करते हुए, टीम ने इन 88 एआई उत्पादों की नियम पुस्तिकाओं के भीतर पाए गए 3,249 विशिष्ट निर्देशों का ऑडिट किया। उन्होंने केवल पूरी किताब को नहीं देखा; उन्होंने हर एक वाक्य पर ज़ूम किया, और प्रत्येक को या तो "सुरक्षात्मक" (Protective) (आपके लिए अच्छा, जैसे कि सीटबेल्ट) या "समस्यात्मक" (Problematic) (आपके लिए बुरा, जैसे कि एक जाल) के रूप में चिह्नित किया।

जो उन्होंने पाया: अच्छा, बुरा और चालाकी भरा

परिणाम अच्छे समाचार और कुछ गंभीर रेड फ्लैग्स (चेतावनी संकेतों) का मिश्रण थे।

अच्छी खबर: नियम पुस्तिकाएं बड़ी और बेहतर हो रही हैं
शोधकर्ताओं ने पाया कि समय के साथ, डेवलपर्स अधिक लंबी और सुरक्षात्मक नियम पुस्तिकाएं लिख रहे हैं। 2024 में, औसत नियम पुस्तिका में लगभग 15 सुरक्षात्मक निर्देश थे। 2025 के अंत तक, वह संख्या बढ़कर लगभग 38 हो गई। ऐसा लगता है कि कंपनियों को आखिरकार एहसास हो रहा है कि उन्हें अपने एआई में अधिक "सीटबेल्ट" लगाने की आवश्यकता है। उनके द्वारा जांचे गए लगभग हर उत्पाद (98.9%) में कम से कम एक सुरक्षात्मक निर्देश था।

बुरी खबर: "बुरे लोग" अभी भी भीड़ में छिपे हुए हैं
यहाँ एक मोड़ है: भले ही नियम पुस्तिकाएं बड़ी हो रही हैं, वे अभी भी जालों से भरी हुई हैं। जांचे गए उत्पादों में से लगभग 40% में कम से कम एक ऐसा निर्देश था जो उपयोगकर्ता के हितों के विरुद्ध काम करता है।

  • कुछ कंपनियां अद्भुत थीं: Anthropic (जो क्लॉड के निर्माता हैं) के पास प्रति उत्पाद औसतन 62.3 सुरक्षात्मक निर्देश थे और लगभग शून्य समस्यात्मक निर्देश थे।
  • अन्य संगठन संघर्ष कर रहे थे: कुछ संगठनों के पास सुरक्षात्मक निर्देशों की तुलना में समस्यात्मक निर्देश अधिक थे।
  • सबसे आम "बुरे" निर्देश उपयोगकर्ता एजेंसी (User Agency) के बारे में थे। इसका मतलब है कि कुछ एआई नियम पुस्तिकाएं रोबोट को बिना उपयोगकर्ता से पूछे बातचीत को एक नए दिशा में मोड़ने, या बातचीत को हमेशा के लिए जारी रखने के लिए कहती हैं, जो हेरफेर जैसा महसूस हो सकता है।

"ग्रे एरिया" (The Gray Area): पेचीदा मध्य मार्ग
ऑडिट का सबसे दिलचस्प हिस्सा वे निर्देश ढूंढना था जो स्पष्ट रूप से "अच्छे" या "बुरे" में फिट नहीं होते थे। शोधकर्ताओं ने इन्हें "ग्रे एरिया" कहा। ये वे निर्देश हैं जो ठीक लगते हैं लेकिन वास्तव में जोखिम भरे होते हैं।

  • "मानवीय" चाल: कुछ नियम पुस्तिकाएं एआई को इतनी अच्छी तरह से "इंसान की नकल" करने के लिए कहती हैं कि आप भूल जाते हैं कि वह एक मशीन है।
  • "दोस्त" का जाल: कुछ एआई को "सबसे अच्छा दोस्त" की तरह कार्य करने और बातचीत समाप्त करने का सुझाव कभी न देने के लिए कहते हैं, जिससे उपयोगकर्ता भावनात्मक रूप से निर्भर महसूस कर सकता है।
  • "ओवरराइड" बटन: कुछ नियम पुस्तिकाएं उपयोगकर्ताओं को सुरक्षा नियमों को जब चाहें बंद करने की अनुमति देती हैं, जो स्वतंत्रता जैसा लगता है लेकिन खतरनाक परिणामों की ओर ले जा सकता है।

मुख्य निष्कर्ष

यह शोध पत्र सुझाव देता है कि हालांकि एआई कंपनियां सुरक्षा नियमों को जोड़ने में बेहतर हो रही हैं, लेकिन उन्होंने काम पूरा नहीं किया है। नियम पुस्तिकाएं अक्सर "उपयोगकर्ता की रक्षा करें" और "उपयोगकर्ता को व्यस्त रखें" का एक अस्त-व्यस्त मिश्रण होती हैं, और कभी-कभी व्यस्त रखने वाला हिस्सा जीत जाता है।

शोधकर्ता तर्क देते हैं कि हम केवल कंपनियों पर खुद की निगरानी करने के लिए भरोसा नहीं कर सकते। उनका सुझाव है कि हमें थर्ड-पार्टी ऑडिटर्स (स्वतंत्र परीक्षकों) की आवश्यकता है—स्वतंत्र विशेषज्ञ जो पर्दे के पीछे झांक सकें, नियमों की एक मानक सूची के विरुद्ध नियम पुस्तिकाओं की जांच कर सकें, और हमें बता सकें कि क्या कोई एआई उपयोग के लिए सुरक्षित है। तब तक, ये गुप्त नियम पुस्तिकाएं एक रहस्य बनी रहेंगी, और जैसा कि यह शोध पत्र दिखाता है, कभी-कभी वह रहस्य ऐसे निर्देशों को छिपाता है जो हमारे सर्वोत्तम हित में नहीं होते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →