🤖 AI

LLM agent safety, multi-turn red-teaming, jailbreak benchmarks, adversarial robustness, safety-critical systems

यह शोध पत्र NRT-Bench प्रस्तुत करता है, जो एक सिम्युलेटेड न्यूक्लियर पावर प्लांट कंट्रोल रूम में मल्टी-टर्न रेड-टीमिंग LLM एजेंटों के लिए एक नया बेंचमार्क है, जो यह प्रकट करता है कि एडेप्टिव एडवरसैरियल हमले विश्वसनीय रूप से सुरक्षा-महत्वपूर्ण कार्यों से समझौता कर सकते हैं और मॉडल की कमजोरियां एवं रक्षा प्रभावशीलता अत्यधिक विलगित और मॉडल-विशिष्ट हैं।

Hanwool Lee, Dasol Choi, Bokyeong Kim, Seung Geun Kim, Haon Park2026-06-19
🤖 AI

Multi-View Decompilation for LLM-Based Malware Classification

यह शोध पत्र यह प्रदर्शित करता है कि कई डिकंपाइलर्स (Ghidra और Retdec) से पूरक pseudo-C दृश्यों (views) का उपयोग करके उन्हें लार्ज लैंग्वेज मॉडल्स के इनपुट के रूप में लेने से सिंगल-व्यू दृष्टिकोणों की तुलना में मैलवेयर वर्गीकरण रिकॉल (recall) और F1 स्कोर में महत्वपूर्ण सुधार होता है, जो उन्नत मैलवेयर ट्राइएज (triage) के लिए एक सरल, प्रशिक्षण-मुक्त रणनीति प्रदान करता है।

Bercan Turkmen, Vyas Raina2026-06-19
🤖 AI

Interpretable Sperm Morphology Classification via Attention-Guided Deep Learning

यह अध्ययन नैदानिक निर्णय लेने के लिए दृश्य स्पष्टीकरण प्रदान करते हुए, उच्च-सटीक शुक्राणु आकृति विज्ञान वर्गीकरण प्राप्त करने के लिए EfficientNet-B0 और CBAM को संयोजित करने वाला एक व्याख्यात्मक, अटेंशन-गाइडेड डीप लर्निंग फ्रेमवर्क प्रस्तावित करता है।

Zahra Asghari Varzaneh, Reza Khoshkangini, Thomas Ebner, Lars Johansson2026-06-19
🤖 AI

Context-Aware Hierarchical Bayesian Modeling of IVF Laboratory Environmental Conditions

यह शोध पत्र यह प्रदर्शित करता है कि उच्च-रिज़ॉल्यूशन प्रयोगशाला पर्यावरणीय डेटा से 55 संदर्भ-जागरूक (context-aware) टेम्पोरल फीचर्स को इंजीनियर करना और एक पदानुक्रमित बेयस मॉडल (hierarchical Bayesian model) लागू करना, कच्चे सेंसर औसत का उपयोग करने वाली पारंपरिक विधियों की तुलना में, IVF गर्भधारण दर भविष्यवाणी की सटीकता में महत्वपूर्ण सुधार करता है और एशियाई एवं उत्तरी यूरोपीय क्लीनिकों के बीच प्रभावी ज्ञान हस्तांतरण को सक्षम बनाता है।

Zahra Asghari Varzaneh, Reza Khoshkangini, Pia Saldeen, Lars Johansson, Thomas Ebner2026-06-19
🌀 nonlinear sciences

Optimal Order of Multi-Agent and General Many-Body Systems

यह शोध पत्र एजेंट-स्तरीय शक्ति और प्रतिक्रिया फलनों से स्थूल गुणों को व्युत्पन्न करके मल्टी-एजेंट और मेनी-बॉडी प्रणालियों के विश्लेषण के लिए एक सामान्य रूपरेखा प्रस्तावित करता है, जो अंततः एक जोखिम-प्राचलीकृत उपयोगिता फलन के माध्यम से उत्पादकता, स्थिरता और अनुकूलन क्षमता के बीच संतुलन बनाने वाले व्यवस्था के इष्टतम स्तर की पहचान करता है।

Jake J. Xia2026-06-19
🤖 machine learning

Contagion Networks: Evaluator Bias Propagation in Multi-Agent LLM Systems

यह शोध पत्र 'कंटेजन नेटवर्क' (Contagion Networks) ढांचे को पेश करता है जो यह मापने के लिए है कि मल्टी-एजेंट एलएलएम (LLM) प्रणालियों के माध्यम से मूल्यांकनकर्ता पूर्वाग्रह कैसे प्रसारित होते हैं, जो यह प्रकट करता है कि जबकि पूर्वाग्रह लगातार फैलते हैं, सजातीय मॉडल क्रॉस-मॉडल सेटअप की तुलना में काफी कमजोर संक्रामकता प्रदर्शित करते हैं और मूल्यांकनकर्ता समिति का आकार बढ़ाना एक प्रभावी शमन रणनीति प्रदान करता है।

Zewen Liu2026-06-19
🤖 AI

Efficient and Sound Probabilistic Verification for AI Agents

यह शोध पत्र वितरण रूप से सुदृढ़ अनुकूलन (डिस्ट्रीब्यूशनली रोबस्ट ऑप्टिमाइज़ेशन) पर आधारित एक सुदृढ़ और कुशल ढांचे को प्रस्तुत करता है जो स्वतंत्रता संबंधी धारणाओं पर निर्भर रहे बिना नीति उल्लंघन की संभावनाओं पर कठोर ऊपरी सीमाएँ कंप्यूट करके एआई एजेंटों के संभाव्य सत्यापन को सक्षम बनाता है, जिससे सुरक्षा-उपयोगिता व्यापार-समझौतों (सिक्योरिटी-यूटिलिटी ट्रेड-ऑफ) में पूर्ववर्ती विधियों से बेहतर प्रदर्शन होता है।

Alaia Solko-Breslin, Pramod Kaushik Mudrakarta, Mihai Christodorescu, Somesh Jha, Krishnamurthy Dj Dvijotham2026-06-19
🤖 AI

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

यह शोध पत्र Multi-LCB प्रस्तुत करता है, जो एक संदूषण-जागरूक (contamination-aware) बेंचमार्क है जो पायथन कार्यों को रूपांतरित करके LiveCodeBench डेटासेट को बारह प्रोग्रामिंग भाषाओं तक विस्तारित करता है, जिससे बड़े भाषा मॉडलों की क्रॉस-लैंग्वेज कोड जनरेशन क्षमताओं के कठोर मूल्यांकन को सक्षम बनाया जा सके और महत्वपूर्ण प्रदर्शन असमानताओं तथा पायथन ओवरफिटिंग को उजागर किया जा सके।

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Bab (…)2026-06-19
🤖 AI

FlowEdit: Associative Memory for Lifelong Pronunciation Adaptation in Flow-Matching TTS

FlowEdit एक फ्रोजन फ्लो-मैचिंग TTS सिस्टम के लिए एक लाइफलॉन्ग अडैप्टेशन फ्रेमवर्क है जो मॉडर्न हॉपफील्ड नेटवर्क में संग्रहीत टोकन-लेवल लेटेंट एडिट्स को सीखकर आउट-ऑफ-वोकैबुलरी उच्चारण त्रुटियों को हल करता है, जिससे सामान्य स्पीच क्वालिटी को बनाए रखते हुए फोनम एरर रेट्स में 92.7% की कमी आती है।

Harshit Singh, Ayush Pratap Singh, Nityanand Mathur2026-06-19
🤖 machine learning

Sovereign Execution Brokers: Enforcing Certificate-Bound Authority in Agentic Control Planes

यह शोध पत्र सोवरेन एक्जीक्यूशन ब्रोकर (SEB) को प्रस्तुत करता है, जो एक रनटाइम प्रवर्तन सीमा (runtime enforcement boundary) है जो एक्शन प्रस्तावों को निष्पादन से अलग करके एजेंटिक इंफ्रास्ट्रक्चर को सुरक्षित करती है, यह सुनिश्चित करते हुए कि सभी प्रोडक्शन म्यूटेशन को एक अल्पकालिक, ऑडिट योग्य पहचान द्वारा निष्पादित किए जाने से पहले प्रमाणित अधिकार, नीति बाधाओं और लाइव-स्टेट स्थितियों के विरुद्ध कड़ाई से मान्य किया जाए।

Jun He, Deying Yu2026-06-19