💻 computer science

DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models

यह शोध पत्र DarkLLM को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो विविध विजन और मल्टीमॉडल फाउंडेशन मॉडल्स में हमलों को एकीकृत और स्केल करने के लिए, प्राकृतिक भाषा के निर्देशों को बहुमुखी, उच्च-प्रभावकारिता वाले एडवरसैरियल परटर्बेशन्स (adversarial perturbations) में अनुवादित करने हेतु 1B-पैरामीटर वाले लार्ज लैंग्वेज मॉडल का लाभ उठाता है।

Ye Sun, Xin Wang, Jiaming Zhang, Yifeng Gao, Yixu Wang, Yifan Ding, Qixian Zhang, Henghui Ding, Xingjun Ma, Yu-Gang Jian (…)2026-05-20
🤖 machine learning

MO-CAPO: Multi-Objective Cost-Aware Prompt Optimization

MO-CAPO एक नवीन बहु-उद्देश्यीय प्रॉम्प्ट अनुकूलन एल्गोरिदम है जो कुशल बजट आवंटन के माध्यम से लार्ज लैंग्वेज मॉडल के प्रदर्शन और अनुमान लागत (इन्फरेंस कॉस्ट) को संयुक्त रूप से अनुकूलित करता है, जो लागत-दक्षता बनाए रखते हुए विविध और सुदृढ़ प्रदर्शन-लागत ट्रेड-ऑफ की खोज करके मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Jan Büssing, Moritz Schlager, Timo Heiß, Tom Zehle, Matthias Feurer2026-05-20
🤖 machine learning

Multi-Headed Transformer Architectures as Time-dependent Wasserstein Gradient Flows

यह शोध पत्र उनके डेटा प्रवाह को समय-निर्भर वासेरस्टीन ग्रेडिएंट फ्लो (Wasserstein gradient flows) के रूप में मॉडल करके सैद्धांतिक मॉडलों और वास्तविक मल्टी-हेडेड ट्रांसफार्मर आर्किटेक्चर के बीच के अंतर को पाटता है, जिससे सैद्धांतिक प्रमाणों और संख्यात्मक प्रयोगों के माध्यम से स्टेशनरी बिंदुओं पर अभिसरण (convergence), विक्षोभ के तहत स्थिरता और अनंत व्यवहार (asymptotic behavior) पर कठोर परिणाम स्थापित होते हैं।

Alex Massucco, Leonardo Del Grande, Marcello Carioni, Christoff Brune, Carola-Bibiane Schönlieb2026-05-20
💬 NLP

ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models

ZeroUnlearn एक फ्यू-शॉट नॉलेज अनलर्निंग फ्रेमवर्क है जो मॉडल एडिटिंग के माध्यम से इस कार्य को एक सटीक ज्ञान री-मैपिंग समस्या के रूप में पुनर्गठित करता है, जो समग्र मॉडल उपयोगिता को संरक्षित करते हुए संवेदनशील जानकारी को कुशलतापूर्वक हटाने के लिए मल्टीप्लिकेटिव पैरामीटर अपडेट का उपयोग करता है।

Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su2026-05-20
🧬 biology

A Multi-Dimensional Clustering Approach for Identifying Inborn Errors of Immunity

यह शोध पत्र एक मशीन लर्निंग पाइपलाइन का प्रस्ताव करता है जो इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड से कच्चे इम्यूनोलॉजिकल डेटा को अनसुपरवाइज्ड क्लस्टरिंग के लिए वेक्टर्स में क्यूरेट और रूपांतरित करता है, जिसका उद्देश्य इनबोरन एरर्स ऑफ इम्युनिटी के नवीन पैटर्न और विशेषताओं की पहचान करना है ताकि शीघ्र निदान की सुविधा मिल सके और दुर्लभ रोगों के विश्लेषण में सुधार किया जा सके।

Nishad Kulkarni, Alexandra K. Martinson, Nicholas L. Rider, Michael Keller, Syed Muhammad Anwar2026-05-20
🤖 machine learning

To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents

यह शोध पत्र LLM एजेंटों में अंतर्निहित ओवर-कॉलिंग बायस (over-calling bias) की पहचान और यांत्रिक रूप से स्पष्टीकरण करता है, जहाँ मॉडल अनावश्यक होने पर भी टूल इनवोकेशन (tool invocation) को प्राथमिकता देते हैं, और यह प्रदर्शित करता है कि कॉल प्रदर्शन से समझौता किए बिना समग्र निर्णय सटीकता में सुधार करने के लिए स्पार्स ऑटोएनकोडर्स (Sparse Autoencoders) का उपयोग करके इस बायस को कारणत्मक रूप से सुधारा जा सकता है।

Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou2026-05-20
🤖 machine learning

Prediction Is Not Physics: Learning and Evaluating Conserved Quantities in Neural Simulators

यह शोध पत्र प्रदर्शित करता है कि जबकि मानक न्यूरल सिम्युलेटर सटीक प्रक्षेपवक्र (ट्रैजेक्टरी) भविष्यवाणियों के बावजूद भौतिक संरक्षण नियमों को बनाए रखने में अक्सर विफल रहते हैं, संरक्षण खोज नेटवर्क (कन्ज़र्वेशन डिस्कवरी नेटवर्क्स) जैसे विशिष्ट आर्किटेक्चर हैमिल्टोनियन प्रक्षेपवक्रों से वैश्विक संरक्षित मात्राओं को सफलतापूर्वक सीख सकते हैं, हालांकि उनका प्रदर्शन टेम्पोरल कंसिस्टेंसी (सामयिक निरंतरता) और प्रारंभिक स्थितियों के साथ संरेखण जैसी प्रशिक्षण रणनीतियों पर महत्वपूर्ण रूप से निर्भर करता है।

Andrew Bukowski, Aditya Kothari, Simba Shi, Ishir Rao2026-05-20
🤖 machine learning

Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries

यह शोध पत्र यह प्रदर्शित करता है कि अनलर्निंग (unlearning) मूल्यांकनों में "बायपास पैटर्न" (bypass pattern), जहाँ तर्क के निशान (reasoning traces) विस्मृत सामग्री को बनाए रखते हैं जबकि उत्तर अनलर्न (unlearned) प्रतीत होते हैं, छिपे हुए वेट-लेवल मेमोराइजेशन (weight-level memorization) का एक विश्वसनीय संकेतक नहीं है क्योंकि इस घटना को सरल डिकोड-टाइम टेम्पलेट स्वैप (decode-time template swaps) द्वारा दोहराया या उलट दिया जा सकता है, जो भविष्य के ऑडिट के लिए ऐसे स्वैप को एक सैनिटी चेक (sanity check) के रूप में आवश्यक बनाता है।

Yanhang Li, Zhichao Fan, Zexin Zhuang2026-05-20
⚡ electrical engineering

Cross-Subject Intracranial EEG Reconstruction from Scalp Recordings Using Multi-Scale Cross-Attention Transformers

यह शोध पत्र CAST को प्रस्तुत करता है, जो एक मल्टी-स्केल क्रॉस-अटेंशन ट्रांसफॉर्मर फ्रेमवर्क है जो दो-चरणीय ट्रांसफर लर्निंग रणनीति का उपयोग करके गैर-आक्रामक स्कैल्प रिकॉर्डिंग से अनदेखे विषयों के इंट्राक्रानियल EEG संकेतों के पुनर्निर्माण को सक्षम बनाता है, और न्यूनतम विषय-विशिष्ट अंशांकन (कैलिब्रेशन) के साथ कॉर्टिकल क्षेत्रों में उच्च सहसंबंध प्राप्त करता है।

Tien-Dat Pham, Xuan-The Tran2026-05-20
🤖 machine learning

A Two-Parameter Weibull Framework for Diagnosing Transformer Weight Distributions

यह शोध पत्र ट्रांसफार्मर वेट मैग्नीट्यूड (transformer weight magnitudes) के निदान के लिए एक टू-पैरामीटर वेइबुल डिस्ट्रीब्यूशन फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि फीड-फॉरवर्ड और आउटपुट प्रोजेक्शन लेयर्स आर्किटेक्चर की परवाह किए बिना लगातार एक विशिष्ट शेप पैरामीटर (k ≈ 1.20) पर अभिसरित होते हैं, जबकि इनपुट प्रोजेक्शन स्टोरेज मैकेनिज्म के आधार पर विचलित होते हैं और स्केल पैरामीटर (lambda) प्रशिक्षण की प्रगति को ट्रैक करता है।

Tiexin Ding2026-05-20