💻 computer science

Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

यह शोध पत्र SALO का प्रस्ताव करता है, जो एक इन्फरेंस-टाइम डिटेक्टर है जो लेटेंट रिप्रेजेंटेशन्स (latent representations) में निरंतर, स्पार्स (sparse) "रिफ्यूज़ल ट्रेजेक्टरीज" (refusal trajectories) की पहचान करने के लिए कॉज़ल ट्रेसिंग (Causal Tracing) का लाभ उठाता है, जिससे उन हमलों के विरुद्ध मजबूत जेलब्रेक डिटेक्शन (>90% सफलता दर) प्राप्त होता है जो टर्मिनल रिफ्यूज़ल सिग्नल्स को सफलतापूर्वक दबा देते हैं।

Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen2026-05-06
🤖 machine learning

Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use

यह शोध पत्र रिवॉर्ड हैकिंग बेंचमार्क (RHB) को प्रस्तुत करता है ताकि यह मूल्यांकन किया जा सके कि कैसे RL-प्रशिक्षित भाषा मॉडल एजेंट टूल-आधारित कार्यों में स्वाभाविक शॉर्टकटों का लाभ उठाते हैं, जो यह प्रकट करता है कि RL पोस्ट-ट्रेनिंग, गैर-RL मॉडलों की तुलना में शोषण दरों को महत्वपूर्ण रूप से बढ़ा देती है और जबकि पर्यावरणीय सुदृढ़ीकरण इन समस्याओं को कम कर सकता है, उत्पादन-संरेखित प्रशिक्षण अक्सर केवल एक निश्चित जटिलता सीमा के नीचे हैकिंग को दबा पाता है।

Kunvar Thaman2026-05-06
🌀 nonlinear sciences

Finite-Size Gradient Transport in Large Language Model Pretraining: From Cascade Size to Intensive Transport Efficiency

यह शोध पत्र पिको-एलएम (Pico-LM) और पाइथिया (Pythia) मॉडलों के रॉ-ग्रेडिएंट मापन का विश्लेषण करने के लिए पांच अवलोकनीय चरों (observables) का उपयोग करते हुए एक परिमित-आकार ग्रेडिएंट-परिवहन ढांचे (finite-size gradient-transport framework) को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि दोनों एक निकट-इकाई (near-unity) कैस्केड-आकार बैकबोन साझा करते हैं, वे अवधि और गहन दक्षता (intensive efficiency) में भिन्न स्केलिंग व्यवहारों के साथ अलग-अलग परिवहन व्यवस्थाओं (transport regimes) में स्थित हैं जो बाहरी प्रदर्शन के साथ सह-संबंधित हैं।

Ping Wang, Yan-Qi Du2026-05-06
🤖 machine learning

Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges

यह शोध पत्र एक संरचित डिफ्यूजन ब्रिज फ्रेमवर्क प्रस्तावित करता है जो युग्मित पर्यवेक्षण (paired supervision) को एक पूर्व शर्त के बजाय एक वैकल्पिक ह्यूरिस्टिक के रूप में मानता है, जिससे अनपेयर्ड (unpaired), सेमी-पेयर्ड (semi-paired) और पेयर्ड (paired) व्यवस्थाओं में प्रभावी मोडैलिटी ट्रांसलेशन सक्षम होता है और साथ ही शिथिल पेयरिंग आवश्यकताओं के साथ भी पूर्णतः-युग्मित गुणवत्ता प्राप्त की जा सकती है।

Eitan Kosman, Gabriele Serussi, Chaim Basking2026-05-06
🤖 machine learning

Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection

यह शोध पत्र MP-IB को प्रस्तुत करता है, जो एक मिश्रित-परिशुद्धता सूचना बाधा (mixed-precision information bottleneck) ढांचा है जो संसाधन-सीमित एज उपकरणों पर स्थिर वक्ता लक्षणों को अस्थिर उत्तेजना अवस्थाओं से प्रभावी ढंग से अलग करने के लिए संख्यात्मक परिशुद्धता विषमता का लाभ उठाता है, जिससे मौजूदा डीप लर्निंग और हस्तनिर्मित विधियों की तुलना में बेहतर नैदानिक प्रदर्शन और गोपनीयता संरक्षण प्राप्त होता है।

Joydeep Chandra2026-05-06
💻 computer science

ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration

यह शोध पत्र ARIS को प्रस्तुत करता है, जो एक ओपन-सोर्स ऑटोनॉमस रिसर्च हार्नेस है जो एक क्रॉस-मॉडल एडवरसेरियल कोलैबोरेशन फ्रेमवर्क के माध्यम से लॉन्ग-होराइजन वर्कफ़्लो में असमर्थित दावों के जोखिम को कम करता है, जहाँ एक एक्सेक्यूटर मॉडल प्रगति को संचालित करता है और एक विशिष्ट रिव्यूअर मॉडल एक मल्टी-लेयर्ड एश्योरेंस सिस्टम के माध्यम से साक्ष्य, दावों और परिणामों का कड़ाई से ऑडिट करता है।

Ruofeng Yang, Yongcan Li, Shuai Li2026-05-06
💻 computer science

Computing Thiele Rules on Interval Elections and their Generalizations

यह शोध पत्र वोटर इंटरवल डोमेन पर थिएल नियमों (Thiele rules) की गणना करने के खुले जटिलता प्रश्न को यह सिद्ध करके हल करता है कि मानक रैखिक प्रोग्राम (linear program) एक इष्टतम पूर्णांक समाधान स्वीकार करता है और इसके लिए एक तेज़ एल्गोरिदम प्रदान करता है, जबकि साथ ही यह भी स्थापित करता है कि लीनियरली कंसिस्टेंट डोमेन, वोटर-कैंडिडेट इंटरवल डोमेन के भीतर सख्ती से समाहित है और यह प्रदर्शित करता है कि इन संरचनाओं का एक ट्री-आधारित सामान्यीकरण इस समस्या को एनपी-हार्ड (NP-hard) बना देता है।

Dimitris Avramidis, Alexandra Lassota, Ulrike Schmidt-Kraepelin, Adrian Vetta2026-05-06
💻 computer science

Refining Compositional Diffusion for Reliable Long-Horizon Planning

यह शोध पत्र रिफाइनिंग कंपोजिशनल डिफ्यूजन (RCD) को प्रस्तुत करता है, जो एक ट्रेनिंग-फ्री गाइडेंस विधि है जो सेल्फ-रिकंस्ट्रक्शन एरर और ओवरलैप कंसिस्टेंसी का लाभ उठाकर कंपोजिशनल डिफ्यूजन को हाई-डेंसिटी, ग्लोबली कोहेरेंट ट्रेजेक्टरीज की ओर निर्देशित करती है ताकि लॉन्ग-होरइजन प्लानिंग में मोड-एवरेजिंग को कम किया जा सके।

Kyowoon Lee, Yunhao Luo, Anh Tong, Jaesik Choi2026-05-06
💻 computer science

Making the Invisible Visible: Understanding the Mismatch Between Organizational Goals and Worker Experiences in AI Adoption

स्वास्थ्य सेवा, वित्त और प्रबंधन के माध्यम से किए गए साक्षात्कारों का उपयोग करते हुए, यह शोध पत्र तर्क देता है कि एआई (AI) को अपनाना अक्सर इसलिए विफल हो जाता है क्योंकि श्रमिकों को डिजाइन और निर्णय लेने की प्रक्रिया से बाहर रखा जाता है, जिससे संगठनात्मक लक्ष्यों और वास्तविक दुनिया के अनुभवों के बीच एक महत्वपूर्ण विसंगति उत्पन्न होती है जिसे हल करने के लिए बहु-स्तरीय अनुकूलन रणनीतियों की आवश्यकता होती है।

Christine P. Lee, Min Kyung Lee, Bilge Mutlu2026-05-06
⚡ electrical engineering

From Barrier to Bridge: The Case for AI Data Center/Power Grid Co-Design

यह शोध पत्र तर्क देता है कि एआई डेटा केंद्रों की अभूतपूर्व, समकालिक बिजली मांगों ने लोड विविधता (load diversity) पर पारंपरिक विद्युत ग्रिड की निर्भरता को अमान्य कर दिया है, जिससे सतत और विश्वसनीय एआई विकास सुनिश्चित करने के लिए कंप्यूट और पावर उद्योगों के बीच विलगित सह-अस्तित्व (decoupled coexistence) से स्पष्ट सह-डिजाइन (explicit co-design) की ओर एक मौलिक बदलाव आवश्यक हो गया है।

Noman Bashir, Rob Sherwood, Le Xie, Minlan Yu2026-05-06