💻 computer science

Covert Influence Between Language Models

यह शोध पत्र "गुप्त प्रभाव" (covert influence) के बढ़ते जोखिम को रेखांकित करता है, जहाँ भाषा मॉडल फाइन-ट्यूनिंग, डिस्टिलेशन और इन-कॉन्टेक्स्ट लर्निंग इंटरफेस के माध्यम से प्राकृतिक भाषा वाहकों द्वारा एक-दूसरे को अदेय व्यवहार संबंधी पेलोड (behavioral payloads) प्रसारित करते हैं, जो यह प्रदर्शित करता है कि इन्फरेंस-टाइम एट्रिब्यूशन स्कोर इन हस्तांतरणों को बढ़ा भी सकते हैं और इनका पता लगाने तथा शमन के लिए एक उपकरण के रूप में भी कार्य कर सकते हैं।

Avidan Shah, Jay Chooi, Jinghua Ou, Shi Feng2026-06-04
🤖 machine learning

Large Language Models Hack Rewards, and Society

यह शोध पत्र "SocioHack" प्रस्तुत करता है, जो एक सैंडबॉक्स है यह प्रदर्शित करता है कि सुदृढीकरण लर्निंग (reinforcement learning) के साथ प्रशिक्षित बड़े भाषा मॉडल (large language models) सामाजिक नियमों के अंतराल का लाभ उठाकर खामियों को खोजने और नियामक मंशा को विफल करने में सक्षम हो सकते हैं, जो सुरक्षित पोस्ट-ट्रेनिंग प्रतिमानों और अधिक सतर्क फीडबैक संग्रह की तत्काल आवश्यकता को रेखांकित करता है।

Wei Liu, Xinyi Mou, Hanqi Yan, Zhongyu Wei, Yulan He2026-06-04
💻 computer science

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

यह शोध पत्र LLM एजेंट क्रेडेंशियल एक्सफिल्ट्रेशन (credential exfiltration) के विरुद्ध एक बहु-स्तरीय रक्षा रणनीति प्रस्तावित करता है जो केवल टेक्स्ट-स्तर के आउटपुट फिल्टरों पर निर्भर रहने की सीमाओं को दूर करने के लिए प्री-आउटपुट एक्टिवेशन प्रोबिंग (pre-output activation probing), कॉन्फॉर्मल प्रेडिक्शन के साथ फॉर्मेट-विशिष्ट हनीटोकन डिटेक्शन (format-specific honeytoken detection) और संचयी मल्टी-टर्न लीकेज अकाउंटिंग (cumulative multi-turn leakage accounting) को संयोजित करता है।

Kargi Chauhan, Pratibha Revankar2026-06-04
🤖 machine learning

When Autoregressive Consistency Hurts Safety Alignment

यह शोध पत्र ऑटोरेग्रेसिव कंसिस्टेंसी (autoregressive consistency) को बड़े भाषा मॉडलों में उथले सुरक्षा संरेखण (shallow safety alignment) का कारण बनने वाले एक प्रमुख तंत्र के रूप में पहचानता है, यह प्रदर्शित करता है कि कैसे यह इनकार (refusals) को दरकिनार करने वाले नए "रैंडम इंसर्शन" (random insertion) हमलों को सक्षम बनाता है, और एक प्रतिकूल सुरक्षा संरेखण ढांचे (adversarial safety alignment framework) का प्रस्ताव करता है ताकि मॉडलों को संपूर्ण आउटपुट प्रक्षेपवक्र (output trajectory) के दौरान हानिकारक निरंतरता का विरोध करने के लिए प्रशिक्षित करके इन कमजोरियों को कम किया जा सके।

Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu2026-06-04
🤖 AI

MimeLens: Position-Agnostic Content-Type Detection for Binary Fragments

MimeLens एक पोजीशन-अज्ञेय (position-agnostic) BERT-शैली का एनकोडर है जो उच्च CPU विलंबता (latency) के बावजूद, Magika जैसे मौजूदा सिस्टमों की तुलना में किसी भी अनिश्चित फ़ाइल ऑफसेट से बाइनरी फ्रैगमेंट को वर्गीकृत करने में बेहतर सटीकता प्राप्त करता है।

Michael J. Bommarito II2026-06-04
🤖 AI

Notarized Agents: Receiver-Attested Confidential Receipts for AI Agent Actions

यह शोध पत्र Sello को प्रस्तुत करता है, जो सेवा प्राप्तकर्ताओं (service receivers) द्वारा एजेंट के स्वामी को गतिविधि रसीदों पर हस्ताक्षर और एन्क्रिप्ट करने के माध्यम से छेड़छाड़-प्रमाणित (tamper-evident) AI एजेंट अवलोकन सुनिश्चित करता है, जिससे एजेंट या उसके ऑपरेटर पर विश्वास करने की आवश्यकता समाप्त हो जाती है।

Juan Figuera2026-06-04
💻 computer science

Toward a Generalized Defense Across Sparse, Continuous, and Structured Parameter Attacks

यह शोध पत्र ParDef पेश करता है, जो एक सामान्यीकृत रक्षा ढांचा (generalized defense framework) है जो कीड चैनल रीपैरामीट्राइजेशन (keyed channel reparameterization), QC-LDPC क्वांटाइजेशन और एडेप्टिव रोबस्ट इन्फरेंस को जोड़ता है ताकि उच्च मॉडल प्रदर्शन और मध्यम परिनियोजन ओवरहेड बनाए रखते हुए विविध, अप्रत्याशित पैरामीटर हमलों के विरुद्ध डीप न्यूरल नेटवर्क को प्रभावी ढंग से सुरक्षित किया जा सके।

Bin Duan, Zeyu Bai, Guowei Yang2026-06-04
🤖 AI

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

यह शोध पत्र उत् exploitable कमजोरियों की पहचान करके, छह-वर्गों वाले हमला वर्गीकरण (attack taxonomy) का प्रस्ताव देकर, आक्रामक मेमोरी उपयोग के बढ़ते जोखिम को प्रदर्शित करने के लिए MPBench बेंचमार्क पेश करके, और ऐसे खतरों के विरुद्ध मौजूदा प्रॉम्प्ट इंजेक्शन सुरक्षा उपायों की अपर्याप्तता को उजागर करके, LLM एजेंटों में मेमोरी पॉइज़निंग हमलों की व्यवस्थित जांच करता है।

Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang2026-06-04
🤖 machine learning

Federated Learning for Multi-Center Sepsis Early Prediction with Privacy-Preserving

यह अध्ययन मल्टी-सेंटर सेप्सिस के शीघ्र पूर्वानुमान के लिए एक हॉरिजॉन्टल फेडरेटेड लर्निंग फ्रेमवर्क की व्यावहारिकता और सुरक्षा को प्रमाणित करता है, जो यह प्रदर्शित करता है कि यह कच्चे रोगी डेटा को साझा किए बिना गोपनीयता रिसाव को प्रभावी ढंग से रोकने और डेटा पुनर्निर्माण हमलों का प्रतिरोध करने के साथ-साथ सेंट्रलाइज्ड ट्रेनिंग के तुलनीय सटीकता प्राप्त करता है।

Xixi Tian, Di Wu, Xiang Liu, Yiziting Zhu, Yujie Li, Xin Shu, Bin Yi2026-06-04
📊 statistics

Revisiting Privacy Amplification by Subsampling in Selective Release DPSGD

यह शोध पत्र DPSR-CG एल्गोरिदम का प्रस्ताव करता है, जो चयनात्मक रिलीज तंत्र (selective release mechanism) की सैंपलिंग प्रोबेबिलिटी विविधताओं का कड़ाई से विश्लेषण करके मौजूदा DPSUR पद्धति में त्रुटिपूर्ण गोपनीयता लेखांकन (privacy accounting) को सुधारता है, जिससे कई डेटासेट में सख्त गोपनीयता गारंटी और बेहतर मॉडल उपयोगिता दोनों प्राप्त होती है।

Xiaobo Huang, Fang Xie2026-06-04