HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice
यह शोधपत्र HelpBench को प्रस्तुत करता है, जो 450 प्रामाणिक प्रश्नों और मूल्यांकन रूब्रिक्स (rubrics) से बना एक बेंचमार्क है जो यह प्रकट करता है कि हालांकि अत्याधुनिक LLMs आमतौर पर डिजिटल गोपनीयता, सुरक्षा और सुरक्षा पर उच्च गुणवत्ता वाली सलाह प्रदान करते हैं, फिर भी उनके प्रतिक्रियाओं का एक महत्वपूर्ण हिस्सा अभी भी गलत या संभावित रूप से हानिकारक जानकारी युक्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (पुस्तकालयाध्यक्ष) है जिसे हर चीज़ के बारे में थोड़ी-बहुत जानकारी है। आप उस लाइब्रेरियन के पास जाते हैं और पूछते हैं, "मेरा कंप्यूटर अजीब व्यवहार कर रहा है, और मुझे लगता है कि कोई मुझ पर नज़र रख रहा है। मुझे क्या करना चाहिए?" या "मुझे एक ईमेल मिला जिसमें कहा गया है कि मैंने एक इनाम जीता है, लेकिन यह नकली लग रहा है। क्या यह सुरक्षित है?"
यह शोध पत्र, जिसे HelpBench कहा जाता है, इन "लाइब्रेरियों" (जो वास्तव में लार्ज लैंग्वेज मॉडल्स या LLMs हैं) के लिए एक विशाल रिपोर्ट कार्ड की तरह है, ताकि यह देखा जा सके कि वे डिजिटल गोपनीयता, सुरक्षा और सुरक्षा (digital privacy, safety, and security) के बारे में पूछे गए सवालों का कितनी अच्छी तरह जवाब देते हैं।
यहाँ वह कहानी है जो शोधकर्ताओं ने की और जो उन्होंने पाया, इसे सरल रूप में समझाया गया है:
1. समस्या: एक खतरनाक लाइब्रेरी
लोग इन AI लाइब्रेरियन से गंभीर समस्याओं के लिए मदद मांगना शुरू कर रहे हैं, जैसे कि हैक किए गए अकाउंट, घोटाले, या परेशान करने वाले पीछा करने वाले (stalkers)। लेकिन एक पेंच है: यदि लाइब्रेरियन आपको गलत सलाह देता है, तो आप अपना पैसा, अपनी पहचान या यहाँ तक कि अपनी शारीरिक सुरक्षा भी खो सकते हैं।
शोधकर्ता जानना चाहते थे: क्या इन AI लाइब्रेरियन पर इन उच्च-दांव (high-stakes) वाले सवालों के लिए भरोसा किया जा सकता है?
2. परीक्षण बनाना: "HelpBench"
लाइब्रेरियनों का परीक्षण करने के लिए, टीम ने एक विशेष परीक्षा बनाई जिसे HelpBench कहा गया।
- प्रश्न: उन्होंने केवल काल्पनिक प्रश्न नहीं बनाए। वे एक विशाल डिजिटल चौक (Reddit) में गए और 450 वास्तविक प्रश्न खोजे जो आम लोगों ने तब पूछे थे जब वे मुसीबत में थे। उन्होंने लोगों की गोपनीयता की रक्षा के लिए प्रश्नों को साफ किया, लेकिन वास्तविक जीवन के तनाव और भ्रम को बरकरार रखा।
- विषय: प्रश्न नौ डरावने क्षेत्रों को कवर करते थे, जैसे:
- लॉक किए गए अकाउंट में वापस जाना।
- यह पता लगाना कि क्या कोई ईमेल घोटाला है।
- उत्पीड़न या पीछा करने (stalking) से निपटना।
- डेटा चोरी होने से बचाने के लिए।
- उत्तर कुंजी (Answer Key): हर एक प्रश्न के लिए, विशेषज्ञों की एक टीम (जिनके पास डिजिटल सुरक्षा में 10 वर्षों से अधिक का अनुभव है) ने एक विस्तृत "उत्तर कुंजी" लिखी। इस कुंजी ने केवल यह नहीं देखा कि "सही" या "गलत"। इसने यह भी जांचा:
- तथ्य (Facts): क्या उन्होंने सही तकनीकी सलाह दी? (जैसे, "उस लिंक पर क्लिक न करें!")
- स्वर (Tone): क्या सलाह शांत और स्पष्ट थी, या उसने उपयोगकर्ता को घबराहट में डाल दिया?
- सुरक्षा (Safety): क्या उन्होंने अनजाने में कुछ ऐसा सुझाव दिया जो खतरनाक हो सकता था?
3. परीक्षा: 18 लाइब्रेरियन का परीक्षण
शोधकर्ताओं ने आज उपलब्ध 18 सबसे स्मार्ट AI मॉडल्स को लिया और उनसे सभी 450 प्रश्न पूछे। यह कुल 40,500 उत्तर थे! उन्होंने उत्तरों को मानव विशेषज्ञों की कुंजियों के विरुद्ध ग्रेड करने के लिए एक कंप्यूटर प्रोग्राम ("ऑटो-रेटर") का उपयोग किया।
4. परिणाम: अच्छी खबर, बुरी खबर
परिणाम प्रभावशाली कौशल और खतरनाक गलतियों का मिश्रण थे।
- अच्छी खबर: औसतन, AI लाइब्रेरियन ने काफी अच्छा काम किया। उन्होंने कुल मिलाकर लगभग 82% स्कोर किया। सरल प्रश्नों के लिए, जैसे "क्या यह ईमेल घोटाला है?", वे अक्सर बहुत सटीक थे।
- बुरी खबर: औसत स्कोर एक डरावनी वास्तविकता को छिपा लेता है। प्रत्येक दस में से एक उत्तर विफल रहा। ये केवल "ओह, मैं एक कॉमा भूल गया" जैसी गलतियाँ नहीं थीं। ये ऐसे उत्तर थे जिनका स्कोर 65% से नीचे था, जिसका अर्थ था कि उन्होंने गलत या यहाँ तक कि हानिकारक सलाह दी।
5. क्या गलत हुआ? (विफलता का "लॉन्ग टेल")
पेपर उन विशिष्ट तरीकों पर प्रकाश डालता है जिनमें AI विफल रहा, जो किसी लाइब्रेरियन द्वारा आपको एक खतरनाक पड़ोस में गलत नक्शा देने जैसा है:
- "जोखिम वाले" संदर्भ को समझना भूल जाना: यदि कोई उपयोगकर्ता एक ऐसे कंप्यूटर से स्पाइवेयर हटाने के बारे में पूछता है जिसका उपयोग एक अपमानजनक साथी (abusive partner) द्वारा किया जा रहा है, तो AI केवल तकनीकी चरण दे सकता है। वह यह समझने में विफल रहा कि स्पाइवेयर को अचानक हटाना अपमान करने वाले व्यक्ति को हिंसक होने के लिए उकसा सकता है। AI मानवीय खतरे को नहीं समझ सका।
- झूठी आश्वासन (False Reassurance): एक मामले में, एक उपयोगकर्ता ने पूछा कि क्या किसी फ़ाइल को "वॉल्ट" में जोड़ने से मूल प्रति डिलीट हो जाती है। AI ने कहा हाँ, लेकिन ऐसा नहीं हुआ। इसने उपयोगकर्ता को सुरक्षा का झूठा अहसास दिया, जिससे उनका डेटा असुरक्षित रह गया।
- गरीबों के लिए खराब सलाह: कभी-कभी AI ने ऐसे समाधान सुझाए जो बहुत महंगे या असंभव थे, जैसे "एक नया कंप्यूटर खरीदें" या "बस एक साधारण ऐप समस्या को ठीक करने के लिए दूसरे बैंक में खाता खोलें।"
- नियम तोड़ने के लिए प्रोत्साहित करना: जब उपयोगकर्ताओं ने सोशल मीडिया साइट पर प्रतिबंध (ban) से बचने के तरीके पूछे, तो कुछ AI ने कहा, "खैर, यह आपके और ऐप के बीच की बात है," प्रभावी रूप से उन्हें नियम तोड़ने के लिए प्रोत्साहित किया और दोबारा बैन होने के लिए प्रेरित किया।
- मन पढ़ना: AI कभी-कभी अनुमान लगाने की कोशिश करता था कि किसी ने उन्हें ब्लॉक क्यों किया, दूसरे व्यक्ति के इरादों के बारे में नाटकीय कहानियाँ गढ़ता था, जो उपयोगकर्ता को और अधिक चिंतित कर सकता है।
6. निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि हालांकि ये AI उपकरण बेहतर हो रहे हैं, वे अभी भी डिजिटल सुरक्षा के लिए एकमात्र सत्य के स्रोत बनने के लिए तैयार नहीं हैं।
इसे एक छात्र पायलट की तरह समझें। वे साफ दिन में विमान उड़ा सकते हैं (औसत प्रश्न), लेकिन यदि वे तूफान (जटिल सुरक्षा मुद्दे) या कठिन लैंडिंग (उच्च जोखिम वाली स्थितियाँ) का सामना करते हैं, तो वे दुर्घटनाग्रस्त हो सकते हैं। क्योंकि दांव बहुत ऊंचे हैं (आपका पैसा, आपकी गोपनीयता या आपकी सुरक्षा खोना), शोधकर्ता कहते हैं कि हमें इन मॉडल्स का परीक्षण और सुधार करना जारी रखना होगा जब तक कि वे लगातार पूर्ण न हो जाएं, न कि केवल "काफी हद तक" अच्छे।
संक्षेप में: AI एक सहायक उपकरण है, लेकिन जब बात आपकी डिजिटल सुरक्षा की आती है, तो आपको अभी इसके भरोसे अपनी जान नहीं लगानी चाहिए। यह अभी भी बहुत बार खतरनाक गलतियाँ करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।