When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations
यह अध्ययन MedMCQA बेंचमार्क का उपयोग करके सामान्य-उद्देश्य और चिकित्सा-विशिष्ट लार्ज लैंग्वेज मॉडल्स की प्रॉम्प्ट विविधताओं के प्रति संवेदनशीलता का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि मामूली शाब्दिक या वाक्यात्मक परिवर्तन भी उनकी विश्वसनीयता को महत्वपूर्ण रूप से कम कर सकते हैं और हानिकारक नैदानिक आउटपुट उत्पन्न कर सकते हैं, जिससे स्वास्थ्य सेवा में उनकी तैनाती के लिए गंभीर सुरक्षा जोखिमों पर प्रकाश पड़ता है।