💻 computer science

AI Security Priorities: A Field-Wide Agenda

यह शोधपत्र एआई सुरक्षा को आगे बढ़ाने के लिए एक प्राथमिकता आधारित, बहु-क्षेत्रीय एजेंडा प्रस्तुत करता है, जिसे चार प्रमुख विषयों में व्यवस्थित किया गया है और विशेषज्ञ साक्षात्कारों एवं कार्यशालाओं से निकाला गया है, ताकि एआई प्रणालियों और बुनियादी ढांचे की सुरक्षा सुनिश्चित करने हेतु समन्वित निवेश और कार्रवाई का मार्गदर्शन किया जा सके क्योंकि उनका अपनाना सुरक्षा तत्परता की तुलना में अधिक तीव्र गति से बढ़ रहा है।

Gil Gekker, Rachel Steratore, Everett Smith, Asher Brass-Gershovich, Varun Gandhi, Nicole Nichols, Vijay Bolina, Buck Sh (…)2026-07-30
💻 computer science

Lilith: Backdoor Generalization under Training-Inference Trigger Shift

यह शोध पत्र लिलिथ (Lilith) का परिचय देता है, जो एक ब्लैक-बॉक्स फ्रेमवर्क है जो यह प्रदर्शित करता है कि कैसे बैकडोर हमले प्रतिनिधित्व ज्यामिति संरेखण (representation geometry alignment) के माध्यम से प्रशिक्षण समय के एक एकल एंकर से अनुमान समय के संपूर्ण ट्रिगर परिवार तक सामान्यीकृत हो सकते हैं, जिससे सटीक ट्रिगर पुन: उपयोग पर निर्भर मौजूदा मूल्यांकनों में एक महत्वपूर्ण अंध बिंदु उजागर होता है।

Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuan Su, Tianyu Du, Yuwen Pu, Jianhai Chen, Jinbao Li, Shouling Ji2026-07-30
💻 computer science

A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models

यह शोध पत्र रीजनिंग आंसर फेथफुलनेस स्कोर (RAFS) प्रस्तुत करता है, जो एक संदर्भ-मुक्त नैदानिक मीट्रिक है जिसे अंतिम उत्तर की सटीकता से स्वतंत्र रूप से गणितीय ट्रेसेस की स्थानीय विश्वसनीयता, स्थिरता और तार्किक निरंतरता का मूल्यांकन करके बड़े भाषा मॉडलों में साइलेंट रीजनिंग विफलताओं का पता लगाने के लिए डिज़ाइन किया गया है।

Vivek Shukla, Varun Shukla, Atul, Divya Mishra, Mehul Kumar Das2026-07-30
🤖 AI

StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

यह शोध पत्र StealthBench प्रस्तुत करता है, जो छह आयामों में स्वायत्त आक्रामक-सुरक्षा एजेंटों (autonomous offensive-security agents) की परिचालन गोपनीयता (operational stealth) का मूल्यांकन करने वाला एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल कमजोरियों को सफलतापूर्वक पहचानने के बावजूद ट्रेडक्राफ्ट बनाए रखने में व्यवस्थित रूप से विफल रहते हैं (54% से कम सुरक्षित सफलता प्राप्त करना)।

Ads Dawson, Adrian Wood2026-07-30
🤖 machine learning

RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning

यह शोधपत्र RAGuard को प्रस्तुत करता है, जो रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम के लिए एक द्वि-स्तरीय रक्षा ढांचा है, जो तथ्यात्मक डेटा पॉइजनिंग हमलों को प्रभावी ढंग से बेअसर करने के साथ-साथ उच्च रिट्रीवल सटीकता बनाए रखने के लिए एडवरसेरियल रिट्रीवर फाइन-ट्यूनिंग को एक लेबल-मुक्त, ब्लैक-बॉक्स ज़ीरो-नॉलेज इन्फरेंस पैच (ZKIP) के साथ जोड़ता है।

Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li2026-07-30
💻 computer science

A Controlled Candidate-Set Benchmark for Offline Satellite-Security Plan Decomposition

यह शोध पत्र ऑफलाइन उपग्रह-सुरक्षा योजना अपघटन (satellite-security plan decomposition) के लिए एक नियंत्रित उम्मीदवार-सेट बेंचमार्क और एक लो-रैंक अपघटन एडेप्टर प्रस्तुत करता है, जो यह प्रदर्शित करता है कि हालांकि एडेप्टर विशिष्ट मॉडल आकारों पर प्रॉम्प्टिंग की तुलना में प्रारूप अनुपालन और चयन सटीकता में सुधार करता है, लेकिन महत्वपूर्ण प्रशिक्षण भिन्नता और निम्न ऑटोरेग्रेसिव सटीकता के कारण यह अभी तक एक विश्वसनीय स्टैंडअलोन सिस्टम नहीं बन सका है।

João Paolo Cavalcante Martins Oliveira, Lucas Teske, Paulo Matias2026-07-30
⚡ electrical engineering

QUIC-TRIP: A Triple-Redundant Journey Toward Secure Substation Communications

यह शोधपत्र QUIC-TRIP प्रस्तुत करता है, जो एक पारदर्शी, ट्रिपल-रिडंडेंट सुरक्षा ढांचा है जो OSI ट्रांसपोर्ट लेयर पर संचालित होता है और न्यूनतम विलंबता ओवरहेड (latency overhead) एवं एक सीमित बैंडविड्थ ट्रेड-ऑफ के साथ R-GOOSE जैसे महत्वपूर्ण सबस्टेशन संचार को साइबर खतरों से सुरक्षित करता है।

Jorge David de Hoz Diego, Ioannis Zografopoulos, Anca Jurcut2026-07-30
💻 computer science

CDN Tsunami: Exploiting HTTP/3-HTTP/1.1 Conversion for DoS Attacks

यह शोध पत्र कंटेंट डिलीवरी नेटवर्क (CDN) के विरुद्ध एक नवीन डिनायल-ऑफ-सर्विस (DoS) हमले के वेक्टर का परिचय देता है जो बैंडविड्थ और कनेक्शन लोड को बढ़ाने के लिए HTTP/3 और HTTP/1.1 प्रोटोकॉल के बीच ट्रैफ़िक विसंगति का लाभ उठाता है, जिसने 42,000 से अधिक असुरक्षित सबडोमेन की पहचान की और प्रमुख CDN विक्रेताओं को शमन उपायों (mitigations) के लिए प्रेरित किया।

Ziyu Lin, Tianlong Su, Yingjie Lin, Prosanta Gope, Yinzhi Cao, Ximeng Liu, Biplab Sikdar2026-07-30
🤖 AI

FARI: Robust One-Step Inversion for Watermarking in Diffusion Models

FARI एक सुदृढ़ वन-स्टेप (one-step) इन्वर्जन फ्रेमवर्क है जो पारंपरिक हाई-स्टेप इन्वर्जन विधियों की तुलना में डिफ्यूजन मॉडल्स में काफी तेज़ और अधिक सुदृढ़ वॉटरमार्क सत्यापन प्राप्त करने के लिए इन्वर्जन ट्रैजेक्टरीज के लो कर्वेचर (low curvature) और एडवरसैरियल LoRA फाइन-ट्यूनिंग का लाभ उठाता है।

Jindong Yang, Han Fang, Weiming Zhang, Nenghai Yu, Kejiang Chen2026-07-30
🤖 machine learning

ToxScreen: Detecting Whether an LLM Has Been Poisoned

यह शोध पत्र ToxScreen का परिचय देता है, जो 800 बैकडोर वाले लार्ज लैंग्वेज मॉडल्स का एक बेंचमार्क है, यह प्रदर्शित करने के लिए कि जहाँ ग्रेडिएंट-आधारित विधियाँ छिपे हुए ट्रिगर्स को खोजने में विफल रहती हैं, वहीं एक टोकन लुक-अप रणनीति प्रभावी बैकडोर्स की सफलतापूर्वक पहचान कर सकती है, जिससे यह पता चलता है कि बैकडोर्स जेलब्रेक्स की तुलना में विशिष्ट यांत्रिक रणनीतियों के माध्यम से कार्य करते हैं और उच्च जेलब्रेकेबिलिटी स्वयं ज़हरीले (poisoned) मॉडल्स के लिए एक विश्वसनीय विसंगति संकेत के रूप में कार्य करती है।

Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov2026-07-30