🤖 machine learning

From Parameters to Feature Space: Task Arithmetic for Backdoor Mitigation in Model Merging

यह शोध पत्र लीनियर फीचर पाथ मिनिमाइजेशन (LFPM) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो एक एकीकृत फीचर-स्पेस परिप्रेक्ष्य के भीतर अनुकूलित एक एंटी-बैकडोर टास्क वेक्टर को पेश करके मॉडल मर्जिंग में बैकडोर हमलों को कम करता है ताकि क्लीन-टास्क प्रदर्शन को बनाए रखते हुए दुर्भावनापूर्ण ट्रिगर्स को प्रभावी ढंग से दबाया जा सके।

Zhenqian Zhu, Yamin Hu, Yiya Diao, Weixiang Li, Haodong Li, Wenjian Luo2026-06-12
💻 computer science

Amnesia: A Stealthy Replay Attack on Continual Learning Dreams

यह शोध पत्र एम्नेशिया (Amnesia) को प्रस्तुत करता है, जो निरंतर सीखने वाले (continual learning) सिस्टम पर एक गुप्त रीप्ले हमला है जहाँ एक सीमित-विशेषाधिकार प्राप्त इनसाइडर केवल प्रदर्शन में गिरावट को अधिकतम करने के लिए रीप्ले सैंपल चयन में हेरफेर करता है और ऑडिट योग्य सांख्यिकीय सीमाओं के भीतर रहता है, जिससे इंडेक्स-नियंत्रित लर्निंग पाइपलाइनों में एक व्यावहारिक खतरे की सतह उजागर होती है।

Ahmed Sharshar, Naveen Kumar Kummari, Mohsen Guizani2026-06-12
⚡ electrical engineering

Fed-FBD: Federated Functional Block Diversification for Isolation, Privacy, and Surgical Unlearning

Fed-FBD एक मॉड्यूलर फेडरेटेड लर्निंग आर्किटेक्चर है जो न्यूरल नेटवर्क को स्वतंत्र रूप से ट्रैक किए जाने वाले कार्यात्मक ब्लॉकों में विघटित करता है ताकि मेडिकल और सामान्य इमेज डेटासेट्स पर प्रतिस्पर्धी सटीकता बनाए रखते हुए, प्रतिकूल क्लाइंट्स के विरुद्ध आर्किटेक्चरल रूप से गारंटीकृत अलगाव, मेंबरशिप इन्फरेंस के विरुद्ध अंतर्निहित गोपनीयता, और प्रस्थान करने वाले प्रतिभागियों के लिए सब-सेकंड सर्जिकल अनलर्निंग प्रदान की जा सके।

Weijie Chen, Alan B. McMillan2026-06-12
🤖 AI

SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems

यह शोध पत्र SMSR को प्रस्तुत करता है, जो निरंतर (persistent) LLM एजेंट प्रणालियों में मल्टी-सेशन मेमोरी पॉइजनिंग (MSMP) के विरुद्ध प्रमाणित सुदृढ़ता (certified robustness) प्रदान करने वाला पहला रक्षा तंत्र है, जो अनसाइंड (unsigned) और ऑथेंटिकेटेड (authenticated) दोनों प्रकार के मेमोरी इंजेक्शन हमलों को प्रभावी ढंग से बेअसर करने के लिए HMAC-आधारित प्रोवेनेंस वेरिफिकेशन को रैंडमाइज्ड मेमोरी एब्लेशन और वर्डिक्ट-आधारित मेजॉरिटी वोटिंग के साथ जोड़ता है।

Tarun Sharma2026-06-12
🤖 machine learning

Smarter Saboteurs, Better Fixers: Scaling & Security in Linear Multi-Agent Workflows

यह शोध पत्र यह प्रदर्शित करता है कि जहाँ लीनियर मल्टी-एजेंट वर्कफ़्लो में बड़े लैंग्वेज मॉडल्स एडवरसेरियल प्रॉम्प्ट इंजेक्शन के प्रति तेजी से संवेदनशील होते जाते हैं, वहीं एक हल्का टर्मिनल "फिक्सर" चरण जोड़ना इस भेद्यता को प्रभावी रूप से बेअसर कर देता है, जिससे कंट्रोल कंडीशंस के साथ सुरक्षा समानता बहाल होती है और लीनियर कोलैबोरेशन स्ट्रक्चर्स की लचीलापन सिद्ध होता है।

Timothy McAllister, Sina Abdidizaji, Ivan Garibay, Ozlem Ozmen Garibay2026-06-12
🤖 AI

PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

यह शोध पत्र PI-Hunter को पेश करता है, जो एक स्वचालित एजेंटिक ऑडिटिंग फ्रेमवर्क है जो यथार्थवादी परीक्षण मामले (test cases) निर्मित करता है और उन्हें पुनरावृत्ति के साथ विकसित करता है ताकि LLM एजेंटों में अंतर्निहित प्रॉम्प्ट इंजेक्शन कमजोरियों को सक्रिय रूप से उजागर किया जा सके और उन्हें स्थानीयकृत किया जा सके, जो मौजूदा रेड-टीमिंग विधियों और सुरक्षा उपायों की तुलना में बेहतर भेद्यता प्रकटीकरण और अटैक-सरफेस कवरेज प्रदर्शित करता है।

Pengfei He, Lesly Miculicich, Vishesh Sharma, Ash Fox, George Lee, Jiliang Tang, Tomas Pfister, Long T. Le2026-06-12
💬 NLP

Detecting Functional Memorization in Code Language Models

यह शोध पत्र एक काउंटरफैक्टुअल मूल्यांकन ढांचे (counterfactual evaluation framework) को प्रस्तुत करता है जो यह प्रदर्शित करता है कि कोड लैंग्वेज मॉडल शाब्दिक टेक्स्ट ओवरलैप से परे कार्यात्मक तर्क (functional logic) को याद कर सकते हैं, जिससे नए ऑडिटिंग मेट्रिक्स की आवश्यकता होती है जो केवल टेक्स्ट मिलान के बजाय निष्पादन-आधारित समानता (execution-based similarity) का आकलन करते हैं।

Matthieu Meeus, Anil Ramakrishna, Matthew Grange, Zheng Xu, Luca Melis2026-06-12
🤖 AI

MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems

यह शोध पत्र MAStrike प्रस्तुत करता है, जो एक क्लोज्ड-लूप रेड-टीमिंग फ्रेमवर्क है जो समन्वयित, भूमिका-जागरूक प्रतिकूल हमलों के माध्यम से असुरक्षित एजेंट गठबंधनों की पहचान करने और उनका शोषण करने के लिए एजेंट-स्तरीय शापली वैल्यू विश्लेषण का उपयोग करता है, जिससे पदानुक्रमित मल्टी-एजेंट सिस्टम में उन महत्वपूर्ण सुरक्षा कमजोरियों का अनावरण होता है जिन्हें मौजूदा ह्यूरिस्टिक विधियाँ अनदेखा कर देती हैं।

Chejian Xu, Zhaorun Chen, Jingyang Zhang, Freddy Lecue, Avni Kothari, Sarah Tan, Wenbo Guo, Bo Li2026-06-12
🤖 AI

Efficient, Robust, and Anti-Collusion Fingerprinting of Image Diffusion Models

यह शोध पत्र टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स के लिए एक सुदृढ़, कुशल और एंटी-कोल्यूजन फिंगरप्रिंटिंग विधि प्रस्तावित करता है जो एक व्यक्तिगत सामान्यीकरण मॉड्यूल (पर्सनलाइज्ड नॉर्मलाइजेशन मॉड्यूल) में उपयोगकर्ता-विशिष्ट पहचानकर्ताओं को एम्बेड करता है, जिससे अनधिकृत पुनर्वितरण को रोकने के लिए कोल्यूडेड मॉडल्स की गुणवत्ता को कम करते हुए विश्वसनीय निष्कर्षण सक्षम होता है।

Jianwei Fei, Yunshu Dai, Zhihua Xia, Xiaochun Cao, Jiantao Zhou, Alessandro Piva, Benedetta Tondi2026-06-12
💻 computer science

Split Tallies: A Discrete Certificate Calculus for Auditing Dynamic Ordered Sets in Constant Memory

यह शोध पत्र "स्प्लिट टैलीज़" (Split Tallies) को प्रस्तुत करता है, जो एक निरंतर-मेमोरी ऑडिटिंग योजना है जो एक डिस्क्रीट सर्टिफिकेट कैलकुलस के माध्यम से अधिकतम अंतराल (maximal gaps) को ट्रैक करके एक अविश्वसनीय पक्ष द्वारा बनाए गए गतिशील क्रमबद्ध सेटों को सत्यापित करती है, जो कम्प्यूटेशनल रूप से असीमित विरोधियों के विरुद्ध उच्च-संभाव्यता सुरक्षा प्राप्त करती है और यह सिद्ध करती है कि छिपे हुए यादृच्छिकता (randomness) या टाइमस्टैम्प के बिना ऐसी दक्षता असंभव है।

Faruk Alpay, Levent Sarioglu2026-06-12