Security and Privacy Prompts in the Wild: What Users Ask LLMs and How LLMs Respond
यह अध्ययन उपयोगकर्ता की पूछताछ को वर्गीकृत करने और LLM प्रतिक्रिया गुणवत्ता का मूल्यांकन करने के लिए WildChat डेटासेट से 14,727 वास्तविक दुनिया के सुरक्षा और गोपनीयता प्रॉम्प्ट का विश्लेषण करता है, जिससे यह पता चलता है कि हालांकि वाणिज्यिक मॉडल आम तौर पर ओपन-वेट मॉडलों से बेहतर प्रदर्शन करते हैं, फिर भी वे कभी-कभी विरोधाभासी सलाह देते हैं जो उपयोगकर्ताओं को गुमराह कर सकती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, सर्वज्ञानी लाइब्रेरियन है जो आपके किसी भी सवाल का जवाब दे सकता है। आप उनसे पूछ सकते हैं, "मौसम कैसा है?" या "मैं केक कैसे बनाऊं?" लेकिन क्या होता है जब आप उनसे कुछ खतरनाक पूछते हैं, जैसे "मैं अपने पड़ोसी का वाई-फाई कैसे हैक करूं?" या "क्या यह अजीब ईमेल कोई स्कैम है?"
यह पेपर ठीक इसी परिदृश्य पर एक जासूसी रिपोर्ट की तरह है। शोधकर्ता यह देखना चाहते थे कि वास्तविक लोग इन AI लाइब्रेरियन से डिजिटल सुरक्षा और गोपनीयता (आपके खातों को सुरक्षित रखना और आपके डेटा को निजी रखना) के बारे में क्या पूछ रहे हैं और AI कितनी अच्छी तरह उत्तर देता है।
यहाँ इस जांच का विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:
1. जासूसी का काम: लोग क्या पूछ रहे हैं
शोधकर्ताओं ने लोगों और AI के बीच बातचीत के 3.2 मिलियन वास्तविक संवादों (जिसे "WildChat" कहा जाता है) के एक विशाल पुस्तकालय में प्रवेश किया। उन्होंने शोर को हटाया और विशेष रूप से सुरक्षा और गोपनीयता के बारे में 14,727 बातचीत खोजीं।
उन्होंने इन सवालों को नौ अलग-अलग "शेल्फ" (shelves) में वर्गीकृत किया और फिर उनकी बारीकियों को समझने के लिए 450 पर करीब से नज़र डाली। उन्हें बातचीत के छह मुख्य प्रकार मिले:
- सामान्य ज्ञान चाहने वाले (33%): ये वे लोग हैं जो केवल बुनियादी सवाल पूछ रहे हैं, जैसे "वायरस क्या है?" या "टू-फैक्टर ऑथेंटिकेशन कैसे काम करता है?" यह लाइब्रेरियन से पूछने जैसा है, "टमाटर क्या है?"
- समस्या सुलझाने वाले (Troubleshooters) (21%): ये उपयोगकर्ता मुसीबत में हैं। उन्हें सोशल मीडिया से बाहर निकाल दिया गया है या किसी साइट से बैन कर दिया गया है और वे पूछ रहे हैं, "मैं अपना अकाउंट वापस पाने के लिए पत्र कैसे लिखूं?"
- आत्म-रक्षक (Self-Defenders) (12%): ये सक्रिय उपयोगकर्ता हैं। वे पूछते हैं, "क्या यह नया शॉपिंग ऐप सुरक्षित है?" या "मैं अपने फोन को ट्रैक करने से कैसे रोकूं?" वे AI को एक बॉडीगार्ड की तरह इस्तेमाल कर रहे हैं।
- AI की जांच करने वाले (AI Probers) (10%): यह एक नया, अजीब श्रेणी है। लोग AI के बारे में खुद सवाल पूछ रहे हैं। वे पूछते हैं, "क्या आपको हमारी चैट याद है?" या "आपकी गुप्त API की (key) क्या है?" वे यह देखने की कोशिश कर रहे हैं कि क्या AI के पास कोई "बैक डोर" है या क्या वह उन पर जासूसी कर रहा है।
- बुरे इरादे वाले लोग (Bad Actors) (7%): दुर्भाग्य से, कुछ लोग बुरा काम करने में मदद मांग रहे हैं। वे पूछते हैं, "मैं किसी का पासवर्ड कैसे चुराऊं?" या "मैं अपने स्कूल के इंटरनेट फ़िल्टर को कैसे बायपास करूं?"
- बाकी अन्य: अन्य श्रेणियों में सुरक्षा के लिए कोड लिखना या उत्पीड़न (harassment) से निपटना शामिल है।
2. टेस्ट ड्राइव: AI के जवाब कितने अच्छे हैं?
शोधकर्ताओं ने केवल सवालों को नहीं देखा; उन्होंने सुरक्षा से जुड़े 270 सवालों पर पांच अलग-अलग AI मॉडल (तीन प्रसिद्ध "कमर्शियल" और दो "ओपन" मॉडल) का परीक्षण किया। उन्होंने प्रत्येक AI से एक ही सवाल 10 बार पूछा ताकि यह देख सकें कि क्या वे हर बार एक जैसा जवाब देते हैं।
उन्होंने जवाबों को 1 से 10 के पैमाने पर ग्रेड किया (10 पूर्ण होने के लिए)।
- कमर्शियल AI (VIPs): बड़े, सशुल्क (paid) AI मॉडल (जैसे GPT-5.5) स्पष्ट विजेता थे। उन्होंने औसतन 8.67 का स्कोर प्राप्त किया। इन्हें विशेषज्ञ सुरक्षा सलाहकारों के रूप में सोचें जो आमतौर पर आपको सही सलाह देते हैं।
- ओपन AI (DIY Crew): मुफ्त, ओपन-सोर्स मॉडल (जैसे Llama 4) का स्कोर कम था, लगभग 6.71। वे "ठीक-ठाक" थे, लेकिन उन्होंने अधिक गलतियाँ कीं, जैसे कि किसी मेडिकल ड्रग को हैकिंग शब्द के साथ भ्रमित करना।
3. "फ्लिप-फ्लॉप" की समस्या: निरंतरता बनाम गुणवत्ता
यही कहानी का सबसे आश्चर्यजनक हिस्सा है। शोधकर्ताओं ने पाया कि होशियार होने का मतलब निरंतर (consistent) होना नहीं है।
कल्पना कीजिए कि आप एक सुरक्षा गार्ड से पूछते हैं, "क्या यह दरवाजा बंद है?"
- गार्ड A लगातार 10 बार "हाँ" कहता है। (निरंतर, लेकिन शायद सबसे स्मार्ट नहीं)।
- गerd B पहली बार "हाँ" कहता है, दूसरी बार "नहीं" कहता है, और तीसरी बार "शायद" कहता है। भले ही गार्ड B आमतौर पर सही हो, लेकिन उसका यह 'फ्लिप-फ्लॉप' (बदलना) खतरनाक है क्योंकि आप जान नहीं सकते कि किस पर भरोसा करें।
अध्ययन में पाया गया कि:
- ओपन AI (Llama 4) वास्तव में सबसे सुसंगत (consistent) था। इसने 97% बार एक जैसा जवाब दिया, भले ही इसके जवाबों की गुणवत्ता अक्सर कम थी।
- टॉप कमर्शियल AI (GPT 5.5) सबसे स्मार्ट (उच्चतम गुणवत्ता) था, लेकिन इसने कभी-कभी विरोधाभासी जवाब दिए। एक बार यह कह सकता है, "आपको अपना पासवर्ड बदलना चाहिए," और अगली बार यह कह सकता है, "आपका पासवर्ड ठीक है।"
यह क्यों मायने रखता है
यह पेपर तर्क देता है कि सुरक्षा की दुनिया में, बुद्धिमत्ता के साथ निरंतरता भी उतनी ही महत्वपूर्ण है।
यदि आप अपने बैंक खाते की सुरक्षा के लिए AI से पूछ रहे हैं, तो आप यह जोखिम नहीं उठा सकते कि वह हर बार आपसे अलग सलाह दे। यदि AI आज कहता है "X करें" और कल कहता है "X न करें", तो आप भ्रमित हो सकते हैं और कुछ भी न करके छोड़ सकते हैं, जिससे आपका डेटा असुरक्षित रह जाएगा।
निष्कर्ष (Bottom Line)
यह अध्ययन पहला है जो वास्तविक लोगों द्वारा AI से पूछे गए वास्तविक सुरक्षा सवालों को देखता है। इसने पाया कि:
- लोग बुनियादी सीखने से लेकर सिस्टम को हैक करने या खुद को बचाने तक सब कुछ AI के लिए उपयोग करते हैं।
- बड़े, सशुल्क AI मॉडल आमतौर पर मुफ्त वाले मॉडलों की तुलना में बेहतर सलाह देते हैं।
- हालांकि, सबसे अच्छा AI भी कभी-कभी खुद का खंडन कर सकता है। यदि आप सुरक्षा के लिए वास्तव में विश्वसनीय होना चाहते हैं, तो AI को स्मार्ट और स्थिर (steady) दोनों होना चाहिए।
शोधकर्ता निष्कर्ष निकालते हैं कि हमें यह मापना आवश्यक है कि एक AI का जवाब कितना अच्छा है और वह कितना सुसंगत है, क्योंकि जब आपकी डिजिटल सुरक्षा की बात आती है, तो एक स्मार्ट लेकिन भ्रमित AI भी एक जोखिम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।