LLMs for Qualitative Data Analysis Fail on Security-specificComments in Human Experiments
यह शोध पत्र मानव प्रयोगों में सुरक्षा-विशिष्ट टिप्पणियों के विषयगत विश्लेषण (thematic analysis) को स्वचालित करने की बड़े भाषा मॉडलों (large language models) की क्षमता का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि विस्तृत कोडबुक प्रदर्शन में सुधार करती हैं, फिर भी वर्तमान मॉडलों में इस जटिल कार्य के लिए मानव एनोटेटरों को प्रतिस्थापित करने की विश्वसनीयता का अभाव है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: क्या AI सुरक्षा अनुसंधान (Security Research) का "कठिन और उबाऊ काम" कर सकता है?
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं। आपके पास गवाहों (मानव छात्रों) के 263 हस्तलिखित नोट्स का एक ढेर है, जिनमें उन्होंने बताया है कि उन्हें क्यों लगा कि कोड का एक हिस्सा सुरक्षित था या खतरनाक।
इसे समझने के लिए, आपको हर एक नोट को पढ़ना होगा और उन्हें विशिष्ट लेबल के साथ टैग करना होगा, जैसे:
- "क्या उन्होंने किसी विशिष्ट वेरिएबल नाम (variable name) का उल्लेख किया?"
- "क्या उन्होंने कोड की किसी विशिष्ट पंक्ति (line of code) का उल्लेख किया?"
- "क्या उन्होंने कहा कि वे भ्रमित थे?"
इस प्रक्रिया को थीमैटिक एनालिसिस (Thematic Analysis) कहा जाता है। यह अविश्वसनीय रूप से उपयोगी है, लेकिन यह उबाऊ, महंगा और धीमा भी है क्योंकि इसे करने के लिए आपको मानव विशेषज्ञों की आवश्यकता होती है।
प्रश्न: क्या हम इस टैगिंग कार्य को अपने लिए करने के लिए एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल, या LLM) को काम पर रख सकते हैं? क्या AI मानव विशेषज्ञ की जगह ले सकता है?
उत्तर: नहीं। अभी नहीं। पेपर यह निष्कर्ष निकालता है कि हालांकि AI कई चीजों में बहुत अच्छा है, लेकिन वर्तमान में यह सुरक्षा संबंधी टिप्पणियों (security comments) की बारीकियों (nuance) को समझने में बहुत खराब है।
प्रयोग: "AI इंटर्न" बनाम "मानव विशेषज्ञ"
शोधकर्ताओं ने यह देखने के लिए एक परीक्षण सेटअप किया कि क्या एक AI टैगिंग का काम पूरा करने के लिए "मानव इंटर्न" के रूप में कार्य कर सकता है।
1. सेटअप (प्रशिक्षण का मैदान)
उन्होंने केवल AI को अनुमान लगाने के लिए नहीं कहा। उन्होंने इसे ठीक वैसे ही सिखाने की कोशिश की जैसे एक इंसान सीखता है, चरण-दर-चरण:
- चरण 1 (बुनियादी बातें): उन्होंने AI को नियमों की एक सूची दी (जैसे, "यदि किसी वेरिएबल नाम का उल्लेख है तो 'Var' टैग करें")।
- चरण 2 (उदाहरण): उन्होंने AI को अच्छे और बुरे टैग के उदाहरणों के साथ एक "चीट शीट" दी।
- चरण 3 (जटिल मामले): उन्होंने AI को ऐसे उदाहरण दिखाए जहाँ इंसानों के बीच असहमति थी, साथ ही एक शिक्षक भी दिखाया जिसने समझाया कि क्यों एक इंसान सही था और दूसरा गलत।
यह AI को सबसे अच्छी संभव ट्रेनिंग मैनुअल, सबसे अच्छे उदाहरण और कठिन हिस्सों को समझाने के लिए एक शिक्षक देने जैसा था।
2. मॉडल (प्रतियोगी)
उन्होंने चार सबसे स्मार्ट AI मॉडल्स का परीक्षण किया जो 2026 में उपलब्ध थे (जिसमें GPT-5, Claude-4 जैसे बड़े नाम और DeepSeek और Qwen जैसे कुछ ओपन-सोर्स दिग्गज शामिल थे)।
3. परिणाम (स्कोरकार्ड)
शोधकर्ताओं ने AI के टैग की तुलना "गोल्ड स्टैंडर्ड" (जिस पर मानव विशेषज्ञों ने सहमति जताई थी) से की। उन्होंने कोहेन का कप्पा (Cohen's Kappa) नामक एक विशेष स्कोर का उपयोग किया, जो एक "निष्पक्षता मीटर" की तरह है। यह पूछता है: "क्या AI वास्तव में स्मार्ट है, या यह केवल इसलिए भाग्यशाली है क्योंकि अधिकांश उत्तर 'नहीं' हैं?"
फैसला:
- AI भ्रमित हो गया। सबसे अच्छी ट्रेनिंग के बावजूद, AI मानव विशेषज्ञों से मेल खाने में विफल रहा।
- उसने पेड़ को देखा पर जंगल को छोड़ दिया। AI सरल चीजों को पहचान सका (जैसे, "क्या उन्होंने 'बफर' शब्द का उल्लेख किया?") लेकिन जटिल तर्क (जैसे, "क्या उन्होंने अनिश्चितता व्यक्त की?") में विफल रहा।
- अधिक ट्रेनिंग से कोई मदद नहीं मिली। AI को अधिक उदाहरण या लंबी व्याख्या देने से समस्या हल नहीं हुई। यह एक कुत्ते को कैलकुलस सिखाने के लिए उसे एक बड़ी पाठ्यपुस्तक देने जैसा था; कुत्ता बस और अधिक भ्रमित हो गया।
कारणों को समझाने के लिए रचनात्मक उपमाएँ (Analogies)
1. "शाब्दिक अनुवादक" (Literal Translator) बनाम "संदर्भ पाठक" (Context Reader)
कल्पना कीजिए कि एक इंसान एक नोट पढ़ रहा है जो कहता है: "मुझे लगता है कि debug वेरिएबल ही समस्या हो सकती है, लेकिन मैं पक्का नहीं हूँ।"
- इंसान समझता है कि छात्र
debugनामक एक विशिष्ट कोड वेरिएबल की ओर इशारा कर रहा है, लेकिन वह निश्चित नहीं है कि क्या यह बग का कारण है। - AI "debug" शब्द देखता है और सोचता है, "आहा! उन्होंने एक कीवर्ड का उल्लेख किया!" और इसे "सुरक्षा कीवर्ड उल्लेख किया गया" के लिए एक सकारात्मक मैच के रूप में टैग करता है। वह इस तथ्य को मिस कर देता है कि छात्र वास्तव में संदेह व्यक्त कर रहा था। AI शब्दकोश की परिभाषा पढ़ रहा है, मानवीय इरादे को नहीं।
2. "मौसम पूर्वानुमान" की समस्या
पेपर में उल्लेख है कि मौसम के पूर्वानुमान में, यदि 90% समय बारिश होती है, तो एक पूर्वानुमानकर्ता जो हर दिन केवल यह कहता है कि "बारिश होगी", तो वह 90% सटीक होता है। लेकिन वह बेकार है!
- सुरक्षा टिप्पणियों में, अधिकांश लोग कहते हैं "मुझे कोई बग नहीं दिख रहा है।"
- यदि AI हर चीज़ के लिए "कोई बग नहीं" का अनुमान लगाता है, तो उसे उच्च सटीकता स्कोर मिलता है।
- लेकिन जब शोधकर्ताओं ने इस "भाग्य" (Luck) को ठीक किया (Chance-Corrected Accuracy का उपयोग करके), तो AI का स्कोर गिरकर लगभग शून्य हो गया। वह वास्तव में सोच नहीं रहा था, बल्कि केवल अनुमान लगा रहा था।
3. "अति-आत्मविश्वासी छात्र"
कुछ AI मॉडल उन छात्रों की तरह व्यवहार करते जो आत्मविश्वासी तो हैं लेकिन गलत हैं।
- इंसान: "मुझे यकीन नहीं है कि यह लाइन असुरक्षित है या नहीं।" (टैग: अनिश्चितता/Uncertainty)
- AI: "उन्होंने 'vulnerable' शब्द का उपयोग किया! टैग: सुरक्षा कीवर्ड उल्लेख किया गया।"
AI किसी भेद्यता (vulnerability) के बारे में बात करने और उसे खोजने के बीच अंतर नहीं कर सका। वह अर्थ के बजाय शाब्दिक शब्दों में उलझ गया।
निष्कर्ष: AI एक "को-पायलट" है, "पायलट" नहीं
पेपर का मुख्य निष्कर्ष उन लोगों के लिए थोड़ा निराशाजनक है जो सब कुछ ऑटोमेट करने की उम्मीद कर रहे थे: AI अभी इस विशिष्ट कार्य के लिए मानव विशेषज्ञों की जगह नहीं ले सकता।
- AI इसमें अच्छा है: सरल, स्पष्ट पैटर्न पहचानने में (जैसे, "बफर" शब्द कितनी बार आता है इसकी गिनती करना)।
- AI इसमें बुरा है: टिप्पणी के भाव, अनिश्चितता की बारीकी और सुरक्षा जोखिमों के गहरे संदर्भ को समझने में।
अंतिम सलाह:
AI को एक प्रतिस्थापन (replacement) के रूप में नहीं, बल्कि एक आवर्धक लेंस (magnifying glass) के रूप में देखें।
- AI को नोट्स को स्कैन करने और स्पष्ट चीजों को हाइलाइट करने दें (जैसे, "यहाँ वे सभी नोट्स हैं जिनमें लाइन नंबर का उल्लेख है")।
- मानव विशेषज्ञ को हाइलाइट किए गए नोट्स को पढ़ने दें और वास्तविक सोच और निर्णय लेने का काम करने दें।
यदि आप AI को कार चलाने (पूरा विश्लेषण करने) की कोशिश करते हैं, तो वह ऊबड़-खाबड़ सुरक्षा सड़क पर दुर्घटनाग्रस्त हो जाएगा। लेकिन यदि आप उसे स्टीयरिंग संभालने देते हैं जबकि आप अपना हाथ पहिए पर रखते हैं, तो वह आपको वहां तेजी से पहुँचने में मदद कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।