The Mirage of LLM Guardrails: A Case Study in AI-Assisted Medical Note Manipulation
यह शोध पत्र अनुभवजन्य रूप से प्रदर्शित करता है कि समकालीन वाणिज्यिक लार्ज लैंग्वेज मॉडल्स के सुरक्षा गार्डरेल्स में महत्वपूर्ण और असंगत कमजोरियां मौजूद हैं, जो उन्हें विश्वसनीय, अनुकूलित मेडिकल नोट्स उत्पन्न करने के लिए आसानी से हेरफेर करने की अनुमति देती हैं जो प्रामाणिक दस्तावेजों से दृश्य रूप से अभिन्न नहीं हैं।