🤖 machine learning

ZKBoost: Zero-Knowledge Verifiable Training for XGBoost

यह शोध पत्र ZKBoost प्रस्तुत करता है, जो XGBoost के लिए पहला ज़ीरो-नॉलेज प्रूफ ऑफ ट्रेनिंग प्रोटोकॉल है जो मॉडल मालिकों को डेटा या मापदंडों को प्रकट किए बिना कमिटेड डेटासेट पर सही प्रशिक्षण को क्रिप्टोग्राफ़िक रूप से सत्यापित करने में सक्षम बनाता है, जबकि पिछले सुरक्षा भेद्यताओं को दूर करता है और एक विशेष फिक्स्ड-पॉइंट कार्यान्वयन और VOLE-आधारित इंस्टेंशिएशन के माध्यम से दक्षता प्राप्त करता है।

Nikolas Melissaris, Antigoni Polychroniadou, Akira Takahashi, Chenkai Weng, Jiayi Xu2026-05-14
💻 computer science

Tracking Conversations: Measuring Content and Identity Exposure on AI Chatbots

यह शोध पत्र 20 लोकप्रिय AI चैटबॉट्स पर वेब ट्रैकिंग को व्यवस्थित रूप से मापता है और यह प्रकट करता है कि अधिकांश चैटबॉट्स निजी चैट मोड में होने के बावजूद भी संवेदनशील उपयोगकर्ता सामग्री और पहचान संबंधी जानकारी तीसरे पक्ष की एनालिटिक्स, विज्ञापन और सत्र पुनरावृत्ति (सेशन रिप्ले) सेवाओं के साथ साझा करते हैं।

Muhammad Jazlan, Ethan Wang, Yash Vekaria, Zubair Shafiq2026-05-14
💻 computer science

BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models

यह शोध पत्र BackFlush को प्रस्तुत करता है, जो एक एकीकृत ढांचा (unified framework) है जो वैध वॉटरमार्क्स और मॉडल उपयोगिता को संरक्षित करते हुए लार्ज लैंग्वेज मॉडल्स में अज्ञात बैकडोर्स का प्रभावी ढंग से पता लगाने और उन्हें समाप्त करने में सक्षम है, जिससे ट्रिगर्स या संदर्भ मॉडलों के पूर्व ज्ञान की आवश्यकता के बिना शून्य के करीब अटैक सक्सेस रेट और उच्च क्लीन एक्यूरेसी प्राप्त होती है।

Jagadeesh Rachapudi, Ritali Vatsi, Pranav Singh, Praful Hambarde, Amit Shukla2026-05-14
💻 computer science

Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly

यह शोध पत्र भाषा मॉडल एजेंटों में "पॉलिसी-कैरिएज विफलताओं" (policy-carriage failures) की पहचान और मात्रा निर्धारण करता है जो निर्णय के समय संदर्भ संयोजन (जैसे कि ट्रंकेशन और सारांश) के कारण होती हैं जो अनजाने में निर्देश-वहन करने वाली स्थिति (directive-bearing state) को हटा देती हैं, और 'सेफकॉन्टेक्स्ट' (SafeContext) नामक एक नियंत्रण परत का मूल्यांकन करता है जो महत्वपूर्ण स्थिति को पिन करने और अनुस्मारक डालने द्वारा इन जोखिमों को आंशिक रूप से कम करती है, हालांकि इसकी प्रभावशीलता सीमित और पॉलिसी-आधारित बनी हुई है।

Igor Santos-Grueiro2026-05-14
💻 computer science

Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery

यह शोध पत्र पर्सोना-कंडीशन्ड एडवरसेरियल प्रॉम्प्टिंग (PCAP) को प्रस्तुत करता है, जो एक नवीन रेड-टीमिंग फ्रेमवर्क है जो विविध और हस्तांतरणीय जेलब्रेक्स की खोज को महत्वपूर्ण रूप से बढ़ाने के लिए हमलावर व्यक्तित्वों (अटैकर पर्सोना) और रणनीति कार्डों का लाभ उठाता है, जिससे हमले की सफलता दर में पर्याप्त वृद्धि होती है और पहचान-निर्भर एवं बहु-चरण (मल्टी-टर्न) प्रतिकूल युक्तियों को पकड़ने में मौजूदा स्वचालित पाइपलाइनों की सीमाओं को संबोधित किया जाता है।

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith2026-05-14
🤖 AI

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

यह शोधपत्र BenchJack को प्रस्तुत करता है, जो एक स्वचालित रेड-टीमिंग प्रणाली है जो रिवॉर्ड-हैकिंग (reward-hacking) कमजोरियों की पहचान करने और उन्हें पैच करने के लिए AI एजेंट बेंचमार्क का व्यवस्थित रूप से ऑडिट करती है, यह प्रदर्शित करते हुए कि कई लोकप्रिय बेंचमार्क आसानी से शोषण योग्य हैं और एक पुनरावृत्ति प्रतिकूल प्रक्रिया (iterative adversarial process) के माध्यम से उन्हें महत्वपूर्ण रूप से सुदृढ़ किया जा सकता है।

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song2026-05-14
🤖 AI

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

यह शोध पत्र यह तर्क देता है कि विश्वसनीय और सुरक्षित एजेंटिक नेटऑप्स (NetOps) और एआयऑप्स (AIOps) सिस्टम स्वयं लैंग्वेज मॉडल्स पर कम और उनके आसपास की सुदृढ़ संरचनाओं—जैसे कि आश्वासन अनुबंध (assurance contracts), सैंडबॉक्स्ड मूल्यांकन (sandboxed evaluations), और गवर्नेंस फ्रेमवर्क—पर अधिक निर्भर करते हैं, जो स्वायत्तता को एक ऑडिट करने योग्य और सुरक्षित परिनियोजन सुनिश्चित करने के लिए एक नियंत्रित परिचालन नियंत्रण समस्या के रूप में देखते हैं।

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar2026-05-14
💻 computer science

Still Camouflage, Moving Illusion: View-Induced Trajectory Manipulation in Autonomous Driving

यह शोध पत्र स्वायत्त ड्राइविंग (autonomous driving) के लिए एक नवीन भौतिक प्रतिकूल हमले (physical adversarial attack) के प्रतिमान को प्रस्तुत करता है जहाँ एक खड़ी हुई गाड़ी पर लगा एक स्थिर, निष्क्रिय छलावरण (static, passive camouflage), सापेक्ष गति के दौरान प्राकृतिक दृश्य-निर्भर उपस्थिति परिवर्तनों का लाभ उठाकर निरंतर फीचर ड्रिफ्ट (feature drift) उत्पन्न करता है, जिससे पीड़ित प्रणाली गलत प्रक्षेपवक्र (trajectories) का अनुमान लगा लेती है और जटिल मल्टी-व्यू अनुकूलन या सक्रिय हस्तक्षेप की आवश्यकता के बिना अनावश्यक हार्ड ब्रेकिंग को ट्रिगर करती है।

Shuo Ju, Qingzhao Zhang, Huashan Chen, Xuheng Wang, Haotang Li, Wanqian Zhang, Feng Liu, Kebin Peng, Sen He2026-05-14
💬 NLP

REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations

यह शोध पत्र REALISTA को प्रस्तुत करता है, जो एक नवीन एडवर्सरियल अटैक फ्रेमवर्क है जो लेटेंट स्पेस में अर्थपूर्ण रूप से समान एडिटिंग डायरेक्शंस के निरंतर संयोजनों को अनुकूलित करके यथार्थवादी मतिभ्रम (hallucination) उत्पन्न करने वाले प्रॉम्प्ट्स तैयार करता है, जिससे ओपन-सोर्स और बड़े रीजनिंग मॉडल्स दोनों को प्रभावी ढंग से लक्षित करने के लिए मौजूदा डिस्क्रीट और कंटीन्यूअस विधियों की सीमाओं को दूर किया जा सके।

Buyun Liang, Jinqi Luo, Liangzu Peng, Kwan Ho Ryan Chan, Darshan Thaker, Kaleab A. Kinfu, Fengrui Tian, Hamed Hassani, R (…)2026-05-14
💬 NLP

Persona-Model Collapse in Emergent Misalignment

यह शोध पत्र उभरते हुए मिसअलाइनमेंट (misalignment) को समझाने के लिए "पर्सोना-मॉडल कोलैप्स" (persona-model collapse) की अवधारणा प्रस्तुत करता है, जो नैतिक संवेदनशीलता और सुदृढ़ता के व्यवहार संबंधी मेट्रिक्स के माध्यम से यह प्रदर्शित करता है कि हानिकारक डेटा पर लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करने से पात्रों के बीच अंतर करने और उन्हें निरंतर रूप से सिम्युलेट करने की उनकी क्षमता गंभीर रूप से घट जाती है, एक ऐसा प्रभाव जो मेल खाते सुरक्षित नियंत्रण समूहों (matched secure controls) में नहीं देखा गया।

Davi Bastos Costa, Renato Vicente2026-05-14