An Embarrassingly Simple Detector for Model Extraction Attacks in Large Language Model API Traffic
यह शोध पत्र LLM मॉडल निष्कर्षण हमलों (extraction attacks) के लिए एक प्रभावी और सरल डिटेक्टर का प्रस्ताव और सत्यापन करता है जो यह परीक्षण करके कि क्या एक समय अंतराल (time window) में प्रश्नों का समग्र सिमेंटिक वितरण (semantic distribution) ऐतिहासिक सौहार्दपूर्ण ट्रैफ़िक से महत्वपूर्ण रूप से विचलित होता है, मैक्सिमम मीन डिसक्रीपेंसी (MMD) का उपयोग करता है और न्यूनतम गलत सकारात्मकता (false positives) के साथ लगभग पूर्ण डिटेक्शन दर प्राप्त करता है।