SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety
SafeHarbor एक नवीन, प्रशिक्षण-मुक्त ढांचा है जो एक पदानुक्रमित स्मृति प्रणाली और सूचना एंट्रॉपी-आधारित स्व-विकास का उपयोग करके संदर्भ-जागरूक गार्डरेल्स को गतिशील रूप से इंजेक्ट करता है, जिससे LLM एजेंट सुरक्षा बढ़ती है, और उच्च सौहार्दपूर्ण उपयोगिता के साथ दुर्भावनापूर्ण हमलों के विरुद्ध मजबूत रक्षा को प्रभावी ढंग से संतुलित करता है।