💻 computer science

Confidently Wrong: Severity-Aware Calibration of Prompt-Injection Detectors under Attack Shift

यह शोधपत्र प्रकट करता है कि वर्तमान प्रॉम्प्ट-इंजेक्शन डिटेक्टर, मानक बेंचमार्क पर सुव्यवस्थित दिखने के बावजूद, विस्थापित हमले के वितरण (shifted attack distributions) का सामना करते समय खतरनाक रूप से अति-आत्मविश्वासी हो जाते हैं, और संरचनात्मक विश्लेषण के बजाय कंटेंट-कीइंग (content-keying) पर निर्भरता के कारण छूटे हुए, उच्च-गंभीरता वाले हमलों को लगातार लगभग पूर्ण आत्मविश्वास स्कोर प्रदान करते हैं।

Md Anas Biswas2026-06-23
💻 computer science

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

यह शोध पत्र कॉन्ट्रास्टिव लॉजिट स्टीयरिंग (CLS) प्रस्तुत करता है, जो एक ज़ीरो-ऑप्टिमाइज़ेशन फ्रेमवर्क है जो LLMs में सुरक्षा संरेखण (सेफ्टी एलाइनमेंट) को एक हेरफेर योग्य रैखिक विशेषता (लीनियर फीचर) के रूप में प्रकट करता है, जो आउटपुट वितरणों को स्टीयर करके उच्च-सफलता वाले जेलब्रेक्स और बिना पुनरप्रशिक्षण के वेक्टर इनवर्जन के माध्यम से उन्नत रक्षा दोनों को सक्षम बनाता है।

Shivam Ratnakar, Kartikeya Vats2026-06-23
💬 NLP

Black-Box Forensics for Conversational LLM Agents

यह शोध पत्र संवादात्मक एलएलएम (LLM) एजेंटों के लिए एक ब्लैक-बॉक्स फॉरेंसिक फ्रेमवर्क प्रस्तुत करता है जो केवल कुछ गैर-प्रतिकूल (non-adversarial) संवादों का उपयोग करके बेस मॉडलों का उच्च-सटीक एट्रिब्यूशन और अनदेखे सिस्टम प्रॉम्प्ट्स की सुदृढ़ फिंगरप्रिंटिंग प्राप्त करता है, जिससे एआई-सक्षम घोटालों को उनके प्रदाताओं तक ट्रैक करने और आपराधिक नेटवर्क को जोड़ने में सक्षमता मिलती है।

Isadora White, Yasaman Jafari, Taylor Berg-Kirkpatrick2026-06-23
💻 computer science

SelPE: Progressive Selection for Private Structured Text Synthesis

SelPE एक नवीन ढांचा है जो एक चयन-निर्देशित प्रगतिशील विकास रणनीति (selection-guided progressive evolution strategy), एक दो-चरणीय पीढ़ी पाइपलाइन और एक बहु-चैनल दूरी कर्नेल (multi-channel distance kernel) का उपयोग करके सख्त विभेदक गोपनीयता (differential privacy) और सीमित डेटा के तहत निजी संरचित पाठ को संश्लेषित करने की चुनौती का समाधान करता है ताकि संरचनात्मक वैधता, निष्ठा और डाउनस्ट्रीम उपयोगिता सुनिश्चित की जा सके।

Xuancheng Zhu, Guoshun Nan, Han Zhang, Ben Niu, Yang Yue, Zixu Wang, Yilian Liu, Min Lei, Xiaofeng Tao2026-06-23
🤖 machine learning

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

यह शोध पत्र 'इमेजिन-देन-एक्ट' (imagine-then-act) वर्ल्ड मॉडल्स में "ट्रस्टेड इमेजिनेशन" (trusted imagination) को एक महत्वपूर्ण भेद्यता के रूप में पहचानता है जहाँ हमलावर सुरक्षा प्रणालियों को बायपास करने और कार्यों को विफल करने के लिए भविष्य के लेटेंट ट्रेजेक्टरीज (latent trajectories) को आसानी से दूषित कर सकते हैं, और साथ ही एक पैरामीटर-मुक्त डीनॉइज़र डिटेक्टर (denoiser detector) प्रस्तावित करता है जो ऐसे ऑफ-मैनिफोल्ड (off-manifold) व्यवधानों के विरुद्ध पूर्ण पहचान प्राप्त करता है।

Linghan Chen, Kaiyan Ji, Minyu Guo2026-06-23
💻 computer science

Understanding the Stealthy BGP Hijacking Risk in the ROV Era

यह शोध पत्र स्टील्थी बीजीपी हाइजैकिंग (stealthy BGP hijacking) की अवधारणा प्रस्तुत करता है, जो एक ऐसा खतरा है जहाँ दुर्भावनापूर्ण मार्ग आंशिक रूट ओरिजिन वैलिडेशन (ROV) परिनियोजन के कारण पीड़ितों द्वारा पहचान से बच निकलते हैं, और इसे वास्तविक दुनिया की घटनाओं के पहले अनुभवजन्य अध्ययन और SHAMAN के विकास के माध्यम से संबोधित करता है, जो एक उच्च-दक्षता वाला ढांचा है जो लक्षित हमलों के लिए 99.5% तक की सफलता की संभावना के साथ एक महत्वपूर्ण वैश्विक जोखिम को प्रकट करता है।

Yihao Chen, Qi Li, Ke Xu, Zhuotao Liu, Jianping Wu2026-06-23
💻 computer science

The EVerest Dataset for Secure Software Engineering

यह शोध पत्र EVerest डेटासेट प्रस्तुत करता है, जो एक अद्वितीय बहु-आर्टिफैक्ट संसाधन है जिसमें एक इलेक्ट्रिक वाहन चार्जिंग स्टैक से सुरक्षा आवश्यकताएं, आर्किटेक्चरल मॉडल और सोर्स कोड शामिल हैं, जो एंड-टू-एंड सुरक्षा सत्यापन अनुसंधान को सक्षम बनाता है और एक वास्तविक दुनिया की सुरक्षा भेद्यता (वल्नरेबिलिटी) की खोज और निवारण को सुगम बनाता है।

Sophie Corallo, Debora Grupp, Dominik Fuchß, Jan Keim, Frederik Reiche, Tobias Hey, Anne Koziolek2026-06-23
💻 computer science

TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger

यह शोधपत्र TooBad का प्रस्ताव करता है, जो डिफ्यूजन मॉडल्स के लिए एक नवीन बैकडोर फ्रेमवर्क है जो एक विशेष रूप से तैयार की गई ट्रिगर अनुकूलन तकनीक का उपयोग करता है ताकि अत्यंत कम पॉइजन दर (0.5%) और न्यूनतम प्रशिक्षण समय के साथ उच्च हमले की सफलता दर प्राप्त की जा सके, जबकि अदृश्यता बनी रहे और अत्याधुनिक सुरक्षा प्रणालियों से बचा जा सके।

Vu Tuan Truong, Long Bao Le2026-06-23
🤖 AI

Detecting Malicious Agent Skills in the Wild using Attention

यह शोध पत्र "लोकेट-एंड-जज" (Locate-and-Judge) को प्रस्तुत करता है, जो एक स्केलेबल, दो-चरणीय डिटेक्टर है जो अटेंशन मैकेनिज्म का लाभ उठाकर एलएलएम (LLM) एजेंट मार्केटप्लेस में दुर्भावनापूर्ण थर्ड-पार्टी स्किल्स की उच्च सटीकता के साथ और मौजूदा बेसलाइन्स की तुलना में काफी कम लागत पर कुशलतापूर्वक पहचान करता है।

Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé2026-06-23
🤖 machine learning

TROPT: An Open Framework for Unifying and Advancing Discrete Text Optimization

TROPT पहला ओपन-सोर्स फ्रेमवर्क है जो मॉडल्स, ऑब्जेक्टिव्स और ऑप्टिमाइज़र्स को बदलने के लिए एक मॉड्यूलर इंटरफ़ेस प्रदान करके डिस्क्रीट टेक्स्ट-ट्रिगर ऑप्टिमाइज़ेशन को एकीकृत और मानकीकृत करता है, जिससे अपनाने की बाधाएं कम होती हैं और जेलब्रेकिंग और कॉर्पस पॉइज़निंग जैसे क्रॉस-डोमेन अनुप्रयोगों और बड़े पैमाने पर तुलनात्मक अध्ययनों को सक्षम बनाया जाता है।

Matan Ben-Tov, Mahmood Sharif2026-06-23