Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats
यह शोध पत्र एक एकीकृत, सत्यापन-केंद्रित रक्षा ढांचे का प्रस्ताव करता है जो प्रतिकूल हमलों का प्रभावी ढंग से पता लगाने और उन्हें कम करने के लिए उपयोगकर्ता प्रॉम्प्ट के इरादे और मॉडल प्रतिक्रिया की हानि का संयुक्त रूप से मूल्यांकन करता है, जो कई खतरे की श्रेणियों में मौजूदा एकल-पक्षीय रक्षा प्रणालियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।