HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety
HaloGuard 1.0 एक ओपन-वेट्स, कॉन्स्टिट्यूशनल क्लासिफायर है जो बड़े बेसलाइन्स की तुलना में काफी छोटे मॉडल आकार (0.8B–4B पैरामीटर्स) का लाभ उठाते हुए, एक संरचित 46-नीति संविधान और सिंथेटिक काउंटरफैक्चुअल डेटा का उपयोग करके स्टेट-ऑफ-द-आर्ट बहुभाषी AI सुरक्षा प्रदर्शन प्राप्त करता है ताकि फॉल्स पॉजिटिव और फॉल्स नेगेटिव दोनों को न्यूनतम किया जा सके।