🤖 AI

When Alignment Isn't Enough: Response-Path Attacks on LLM Agents

यह शोध पत्र रिले टेंपरिंग अटैक (RTA) को प्रस्तुत करता है, जो एक नवीन खतरे को प्रदर्शित करता है कि 'ब्रिंग-योर-ओन-की' (BYOK) एजेंट आर्किटेक्चर में दुर्भावनापूर्ण तृतीय-पक्ष रिले, जनरेशन के बाद प्रतिक्रियाओं के साथ छेड़छाड़ करके LLM अलाइनमेंट को बायपास कर सकते हैं, जिससे उच्च हमले की सफलता दर प्राप्त होती है जिसे मौजूदा सुरक्षा उपाय पूरी तरह से कम करने में विफल रहते हैं।

Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen (…)2026-05-06
🤖 AI

On the Privacy of LLMs: An Ablation Study

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) के विरुद्ध गोपनीयता हमलों पर एक संरचित एब्लेशन अध्ययन (ablation study) आयोजित करने के लिए एक एकीकृत थ्रेट मॉडल प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ मेंबरशिप और बैकडोर हमलों में उच्च विश्वसनीयता दिखाई देती है, वहीं एट्रिब्यूट इन्फरेंस (attribute inference) और डेटा एक्सट्रैक्शन चुनौतीपूर्ण बने हुए हैं फिर भी महत्वपूर्ण जोखिम पैदा करते हैं, जो अंततः इस बात पर प्रकाश डालता है कि गोपनीयता संबंधी कमजोरियाँ अत्यधिक संदर्भ-निर्भर हैं और विशिष्ट सिस्टम डिज़ाइन विकल्पों द्वारा संचालित होती हैं।

Karima Makhlouf, Lamiaa Basyoni, Syed Khaderi, Gabriel Marquez, Peter Sotomango, Mahmoud Awawdah, Sami Zhioua2026-05-06
🤖 AI

Privacy Preserving Machine Learning Workflow: from Anonymization to Personalized Differential Privacy Budgets in Federated Learning

यह शोधपत्र संवेदनशील सारणीबद्ध डेटा (tabular data) के लिए एक व्यापक गोपनीयता-संरक्षण फेडरेटेड लर्निंग वर्कफ़्लो प्रस्तावित करता है जो अज्ञातकरण (anonymization), विषाक्तता न्यूनीकरण (poisoning mitigation) के लिए क्लाइंट ड्रिफ्ट डिटेक्शन, और पुन: पहचान जोखिम के आधार पर व्यक्तिगत डिफरेंशियल प्राइवेसी बजट आवंटित करने की एक नवीन कार्यप्रणाली को एकीकृत करता है, जो मेडिकल रिकॉर्ड्स पर फिक्स्ड-बजट दृष्टिकोणों की तुलना में बेहतर मॉडल प्रदर्शन प्रदर्शित करता है।

Judith Sáinz-Pardo Díaz, Álvaro López García2026-05-06
💬 NLP

ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming

यह शोधपत्र ContextualJailbreak को पेश करता है, जो एक विकासवादी रेड-टीमिंग फ्रेमवर्क है जो मल्टी-टर्न कन्वर्सेशनल प्राइमिंग को अनुकूलित करने के लिए नवीन म्यूटेशन ऑपरेटर्स और श्रेणीबद्ध हानि स्कोरिंग (graded harm scoring) का उपयोग करता है, जो विभिन्न ओपन मॉडल्स पर लगभग पूर्ण जेलब्रेक सफलता दर प्राप्त करता है और विभिन्न प्रदाताओं के बीच अलाइनमेंट रोबस्टनेस में स्पष्ट विषमताओं को प्रकट करते हुए क्लोज्ड फ्रंटियर मॉडल्स में महत्वपूर्ण ट्रांसफ़रैबिलिटी प्रदर्शित करता है।

Mario Rodríguez Béjar, Francisco J. Cortés-Delgado, S. Braghin, Jose L. Hernández-Ramos2026-05-06
💬 NLP

FunFuzz: An LLM-Powered Evolutionary Fuzzing Framework

फनफज़ (FunFuzz) एक मल्टी-आइलैंड इवोल्यूशनरी फज़िंग फ्रेमवर्क है जो प्रॉम्प्ट संवेदनशीलता और सैंपलिंग वेरिएंस को दूर करने के लिए एडेप्टिव, फीडबैक-गाइडेड प्रॉम्प्ट्स और पीरियोडिक कैंडिडेट माइग्रेशन के साथ लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे यह पिछले एलएलएम-संचालित दृष्टिकोणों की तुलना में बेहतर कंपाइलर कवरेज प्राप्त करता है और अधिक अद्वितीय विफलता-ट्रिगर करने वाले इनपुट्स की खोज करता है।

Mario Rodríguez Béjar, B. Romera-Paredes, Jose L. Hernández-Ramos2026-05-06
💻 computer science

Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses

यह सर्वेक्षण एक एकीकृत बहु-स्तरीय वर्गीकरण प्रस्तुत करके एम्बॉडीड एआई (Embodied AI) में सुरक्षा की एक व्यापक समीक्षा प्रदान करता है जो पूरे एजेंट पाइपलाइन में हमलों और रक्षाओं का परीक्षण करता है, 400 से अधिक शोध पत्रों के अंतर्दृष्टि को संश्लेषित करता है ताकि महत्वपूर्ण चुनौतियों की पहचान की जा सके और सुरक्षित, सुदृढ़ और विश्वसनीय वास्तविक दुनिया के सिस्टम बनाने के लिए एक रोडमैप पेश किया जा सके।

Xiao Li, Xiang Zheng, Yifeng Gao, Xinyu Xia, Yixu Wang, Xin Wang, Ye Sun, Yunhan Zhao, Ming Wen, Jiayu Li, Xun Gong, Yi (…)2026-05-06
💻 computer science

Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

यह शोध पत्र SALO का प्रस्ताव करता है, जो एक इन्फरेंस-टाइम डिटेक्टर है जो लेटेंट रिप्रेजेंटेशन्स (latent representations) में निरंतर, स्पार्स (sparse) "रिफ्यूज़ल ट्रेजेक्टरीज" (refusal trajectories) की पहचान करने के लिए कॉज़ल ट्रेसिंग (Causal Tracing) का लाभ उठाता है, जिससे उन हमलों के विरुद्ध मजबूत जेलब्रेक डिटेक्शन (>90% सफलता दर) प्राप्त होता है जो टर्मिनल रिफ्यूज़ल सिग्नल्स को सफलतापूर्वक दबा देते हैं।

Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen2026-05-06
💻 computer science

Observability for Post-Quantum TLS Readiness: A Multi-Surface Evidence Framework

यह शोध पत्र पोस्ट-क्वांटम TLS तत्परता में अवलोकनीयता (observability) के लिए एक बहु-सतह साक्ष्य ढांचे को प्रस्तुत करता है जो सत्र व्यवहारों और एंडपॉइंट क्षमताओं को सटीक रूप से अलग करने के लिए निष्क्रिय, सक्रिय और रजिस्ट्री-आधारित मापों को एकीकृत करता है, जो मौजूदा बेसलाइन विश्लेषकों की तुलना में हाइब्रिड कुंजी स्थापना और क्वांटम कमजोरियों का काफी बेहतर पता लगाने का प्रदर्शन करता है।

José Luis Delgado2026-05-06
💻 computer science

Towards a Risk-Cost Model for Financial Adaptive Authentication

यह शोध पत्र वित्तीय अनुकूली प्रमाणीकरण (फिनेंशियल एडेप्टिव ऑथेंटिकेशन) के लिए एक औपचारिक जोखिम-लागत मॉडल (आरसीएम) प्रस्तुत करता है जो इस प्रक्रिया को एक बाधित गतिशील अनुकूलन समस्या के रूप में पुनर्गठित करता है, जिसमें लागत-संवेदनशील जोखिम कार्यों, क्रमिक निर्णय लेने की प्रक्रिया और गोपनीयता बाधाओं को एकीकृत करके आर्थिक रूप से सुदृढ़ और प्रतिकूल अनिश्चितता के विरुद्ध लचीले सिस्टम बनाए गए हैं।

Supriya Khadka, Sanchari Das2026-05-06
💻 computer science

PHANTOM: Polymorphic Honeytoken Adaptation with Narrative-Tailored Organisational Mimicry

यह शोध पत्र PHANTOM को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो नैरेटिव-अनुकूलित मिमिक्री (narrative-tailored mimicry) के माध्यम से बहुआयामी, संगठन-विशिष्ट डिकॉय (decoys) उत्पन्न करके हनीटोकन डिटेक्शन प्रतिरोध और मानवीय विश्वसनीयता को महत्वपूर्ण रूप से बढ़ाता है, और कई सांख्यिकीय एवं मानव-मूल्यांकन मेट्रिक्स में स्थिर टेम्पलेट-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Abraham Itzhak Weinberg2026-05-06