🤖 AI

Distributionally Robust Listwise Preference Optimization

यह शोध पत्र एक प्लैकेट-लूस (Plackett-Luce) उद्देश्य पर आधारित एक सुलभ, वितरण रूप से सुदृढ़ (distributionally robust) लिस्टवाइज प्रेफरेंस ऑप्टिमाइज़ेशन फ्रेमवर्क प्रस्तावित करता है जो सबसे खराब स्थिति के सुधार (worst-case correction) को O(KlogK)O(K\log K) जटिलता तक कम करके रैंकिंग-लेबल अनिश्चितता को कुशलतापूर्वक संभालता है, जिससे ऑफलाइन और ऑनलाइन दोनों भाषा मॉडल संरेखण (language model alignment) में मजबूती और प्रदर्शन में सुधार होता है।

Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen2026-07-03
🤖 AI

DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning

यह शोध पत्र DRL-CLBA का प्रस्ताव करता है, जो स्पीच क्लासिफिकेशन के लिए एक नवीन क्लीन लेबल बैकडोर अटैक है, जो सैंपल-विशिष्ट ट्रिगर्स को एम्बेड करने और विभिन्न डिफेंस मैकेनिज्म से बचने के साथ-साथ उच्च अटैक सक्सेस रेट प्राप्त करने के लिए डीप ऑडियो स्टेग्नोग्राफी को डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट (DDPG) सुदृढीकरण लर्निंग के साथ जोड़ता है।

Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen2026-07-03
🤖 AI

Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation

Phi-Nav एक एकीकृत ऑन-पॉलिसी फ्रेमवर्क है जो एक तीन-चरणीय ड्यूल-सप्रेशन चक्र को नियोजित करके विजन-लैंग्वेज नेविगेशन में सिमेंटिक मिसमैच को संबोधित करता है, जहाँ एक हिंडसाइट स्पीकर एजेंट के वास्तविक अन्वेषण पथ के साथ संरेखित पथ-स्तरीय निर्देशों को संश्लेषित करता है, जिससे काफी कम विशेषज्ञ प्रदर्शनों के साथ सुदृढ़ प्रशिक्षण सक्षम होता है।

Sung June Kim, Sangpil Kim, Honglak Lee2026-07-03
🤖 AI

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

यह शोध पत्र मास्टरमाइंड (Mastermind) को प्रस्तुत करता है, जो एक ड्यूल-लूप फ्रेमवर्क है जो एक प्लानर को उच्च-स्तरीय रणनीतियों को सीखने और स्थानांतरित करने के लिए प्रशिक्षित करके रिपॉजिटरी-स्केल भेद्यता पुनरुत्पादन (vulnerability reproduction) में सुधार करता है, जिससे साइबरजिम (CyberGym) पर 84.5% पास रेट प्राप्त होता है और कई फ्रोजन एलएलएम (LLM) निष्पादकों (executors) के विरुद्ध मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन होता है।

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng2026-07-03
🤖 AI

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

यह शोध पत्र SimWorlds को प्रस्तुत करता है, जो एक बहु-एजेंट फ्रेमवर्क है जो एक संरचित प्लानर-कोडर-रिव्यूअर वर्कफ़्लो और एक नियत (deterministic) वेरीफायर के माध्यम से स्थानिक लेआउट, भौतिकी और टेम्पोरल अनुक्रमण (temporal sequencing) को समन्वित करके टेक्स्ट से गतिशील, संपादन योग्य 4D दृश्य उत्पन्न करता है, साथ ही ऐसे प्रक्रियात्मक आउटपुट का मूल्यांकन करने के लिए नए 4DBuildBench बेंचमार्क को भी पेश करता है।

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni2026-07-03
🤖 AI

Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts

यह शोधपत्र WM-SAR प्रस्तुत करता है, जो एक वर्ल्ड-मॉडल करेक्टर (world-model corrector) है जो पारंपरिक लक्षण-स्कैनिंग (symptom-scanning) दृष्टिकोणों से बेहतर प्रदर्शन करता है, क्योंकि यह बड़े एजेंट प्लानिंग ग्राफ में त्रुटियों को बढ़ाने वाले विशिष्ट कारण उप-ग्राफ (causal subgraph) की पहचान करता है और उन्हें ठीक करता है, जिससे पूर्ण-ग्राफ रीप्लानिंग की कम्प्यूटेशनल लागत के बिना कुशल इन-प्लेस स्थिरीकरण (in-place stabilization) सक्षम होता है।

Xinyuan Song, Zekun Cai2026-07-03
🤖 AI

Verifiable Knowledge Expansion through Retrieval-Grounded Formal Concept Analysis

यह शोध पत्र एक रिट्रीवल-ऑगमेंटेड स्मॉल लैंग्वेज मॉडल फ्रेमवर्क प्रस्तावित करता है जो ऑन्टोलॉजिकल ज्ञान को मान्य और विस्तारित करने के लिए सिम्बोलिक वेरिफिकेशन लूप के रूप में फॉर्मल कॉन्सेप्ट एनालिसिस को एकीकृत करता है, जो पुनरावृत्त सीड-आधारित अन्वेषण और काउंटरएग्जांपल डिटेक्शन के माध्यम से एक दुर्लभ अटाक्सिया डोमेन में संबंध और निहितार्थ सटीकता में सुधार प्रदर्शित करता है।

Yujin Yang, Heejung Lee2026-07-03
🤖 AI

Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

यह शोध पत्र प्रदर्शित करता है कि डिफ्यूजन लैंग्वेज मॉडल्स (Diffusion Language Models), स्पष्ट टाइमस्टेप कंडीशनिंग के अभाव के बावजूद, अपने रेसिडुअल स्ट्रीम्स (residual streams) के भीतर डीनॉइजिंग प्रोग्रेस (denoising progress) का एक डिकोडेबल लेटेंट रिप्रेजेंटेशन (decodable latent representation) आंतरिक रूप से एनकोड करते हैं—विशेष रूप से एक्टिवेशन hn,th_{n,t} के भीतर, जहाँ nn लेयर इंडेक्स को और tt डीनॉइजिंग टाइमस्टेप को दर्शाता है—जिसे मॉडल कॉन्फिडेंस (confidence) और एंट्रॉपी (entropy) को व्यवस्थित रूप से नियंत्रित करने के लिए हेरफेर किया जा सकता है, जिसमें KL डाइवर्जेंस (KL divergence), अनुमानित और वास्तविक टाइमस्टेप्स के बीच की दूरी के साथ एक नॉन-लीनियर (non-linear) संबंध प्रदर्शित करता है।

Maximo Rulli (Sapienza University of Rome), Thomas Fontanari (Sapienza University of Rome), Simone Petruzzi (Sapienza Un (…)2026-07-03
🤖 AI

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

यह शोध पत्र वेरा (Vera) को प्रस्तुत करता है, जो एक एंड-टू-एंड स्वचालित सुरक्षा परीक्षण ढांचा है जो जोखिमों की खोज करने, साक्ष्य-आधारित सत्यापन के साथ निष्पादन योग्य सुरक्षा मामले उत्पन्न करने और आइसोलेटेड सैंडबॉक्स में एलएलएम (LLM) एजेंटों का मूल्यांकन करने के लिए एक तीन-चरणीय, स्व-सुदृढ़ीकरण पाइपलाइन का उपयोग करता है, जो उत्पादन प्रणालियों में महत्वपूर्ण कमजोरियों को उजागर करता है और एजेंटिक सुरक्षा के लिए एक स्केलेबल एवं रखरखाव योग्य बेंचमार्क प्रदान करता है।

Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Yunhao Chen, Xiaohu Du, J (…)2026-07-03
🤖 machine learning

Single-Channel EEG-Based Cognitive Load Assessment in Online Learning: A Hybrid Deep Learning Approach

यह व्यवहार्यता अध्ययन यह प्रदर्शित करता है कि एक सिंगल-चैनल कंज्यूमर-ग्रेड ईईजी (EEG) डिवाइस का उपयोग करने वाला एक हाइब्रिड CNN+LSTM+Attention मॉडल, विषय-विशिष्ट (within-subject) सेटिंग्स में 78.5% तक की सटीकता के साथ आसान और कठिन शैक्षिक वीडियो सामग्री के बीच अंतर कर सकता है, जबकि यह विषय-स्वतंत्र (subject-independent) मूल्यांकन की आवश्यकता पर जोर देता है और ऑनलाइन लर्निंग में वास्तविक समय में संज्ञानात्मक भार (cognitive load) के दृश्यता (visualization) के लिए एक ओपन-सोर्स टूल प्रदान करता है।

Rowan Hussein, Mohamed Ouf2026-07-03