LLMs for Qualitative Data Analysis Fail on Security-specificComments in Human Experiments
यह शोध पत्र मानव प्रयोगों में सुरक्षा-विशिष्ट टिप्पणियों के विषयगत विश्लेषण (thematic analysis) को स्वचालित करने की बड़े भाषा मॉडलों (large language models) की क्षमता का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि विस्तृत कोडबुक प्रदर्शन में सुधार करती हैं, फिर भी वर्तमान मॉडलों में इस जटिल कार्य के लिए मानव एनोटेटरों को प्रतिस्थापित करने की विश्वसनीयता का अभाव है।