Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content
यह शोध पत्र ओपिर (Opir) को प्रस्तुत करता है, जो GLiClass आर्किटेक्चर पर निर्मित कुशल, मल्टी-टास्क एनकोडर-आधारित गार्डरेल मॉडलों का एक परिवार है, जो मौजूदा बड़े गार्डरेल सिस्टम की तुलना में काफी छोटा परिनियोजन फुटप्रिंट बनाए रखते हुए विषाक्तता (toxicity), जेलब्रेक और हानिकारक सामग्री का पता लगाने में प्रतिस्पर्धी सुरक्षा वर्गीकरण प्रदर्शन प्राप्त करता है।