💬 NLP

Implicit Reasoning for Large Language Model-based Generative Recommendation

यह शोध पत्र PauseRec का प्रस्ताव करता है, जो LLM-आधारित जनरेटिव रिकमेंडेशन के लिए एक हल्का (lightweight) निहित तर्क (implicit reasoning) प्रतिमान है, जो महंगी तर्क व्याख्या (rationale generation) को टालकर स्पष्ट तर्क पाइपलाइनों की सीमाओं से बचता है, जिससे काफी कम प्रशिक्षण लागत और तेज़ अनुमान गति के साथ बेहतर प्रदर्शन प्राप्त होता है।

Yinhan He, Liam Collins, Bhuvesh Kumar, Jundong Li, Neil Shah, Donald Loveland2026-06-15
🤖 machine learning

Learning High Coverage Discriminative Parsimonious Rulesets

यह शोधपत्र CDPR प्रस्तुत करता है, जो दो सबमॉड्यूलर मैक्सिमाइजेशन-आधारित एल्गोरिदम का उपयोग करने वाला एक नवीन ढांचा है, जो अत्यधिक सटीक, विभेदक और संक्षिप्त IF-THEN नियम सेट उत्पन्न करता है जो भविष्य कहनेवाला प्रदर्शन और कवरेज दर दोनों में मौजूदा विधियों से काफी बेहतर प्रदर्शन करते हैं।

Mariamma Antony, Raman Sankaran, Chiranjib Bhattacharyya, Uma Satya Ranjan2026-06-15
🤖 machine learning

Learning Urban Access Costs from Origin-Destination Flows via Inverse Optimal Transport

यह शोध पत्र देखे गए उद्गम-गंतव्य प्रवाह (origin-destination flows) से अंतर्निहित शहरी पहुंच लागतों का अनुमान लगाने के लिए इनवर्स ऑप्टिमल ट्रांसपोर्ट मॉडल का उपयोग करने वाले एक ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि फिलीपींस में स्कूल नामांकन डेटा का उपयोग सब्सिडी प्रभावशीलता को मात्रात्मक रूप देने और शहरी सेवा नियोजन को निर्देशित करने के लिए कैसे किया जा सकता है।

Paula Joy B. Martinez2026-06-15
⚡ electrical engineering

Robustness without Wrinkles: Parallel Simulation and Robust MPC for Certified Deformable Manipulation

यह शोध पत्र CORD-SLS प्रस्तुत करता है, जो एक वास्तविक समय (real-time) नियंत्रण ढांचा है जो अनिश्चितता के तहत रस्सी और कपड़े जैसी विरूपण योग्य वस्तुओं (deformable objects) के सुरक्षित, उच्च-गति और प्रमाणित हेरफेर को प्राप्त करने के लिए एक GPU-समानांतर विभेदनीय सिम्युलेटर (differentiable simulator) को सुदृढ़ मॉडल प्रेडिक्टिव कंट्रोल और कॉन्फॉर्मल प्रेडिक्शन के साथ जोड़ता है।

Wei-Chen Li, Jeffrey Fang, Sasanka Polisetti, Yuexi Song, Glen Chou2026-06-15
🤖 AI

Closing the Reflection Gap: A Free Calibration Bonus for Agentic RL

यह शोध पत्र RefGRPO को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो स्व-चिंतन (self-reflection) और वास्तविक परिवेश फीडबैक के बीच अंतर के आधार पर प्राप्त एक मुक्त अंशांकन बोनस (free calibration bonus) का उपयोग करके LLM एजेंटों में प्रतिबिंब अंतराल (reflection gap) को समाप्त करती है, जिससे बिना किसी बाहरी पुरस्कार मॉडल (external reward model) की आवश्यकता के आत्म-मूल्यांकन सटीकता और कार्य प्रदर्शन दोनों में महत्वपूर्ण सुधार होता है।

Yinglun Zhu2026-06-15
🤖 AI

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit एक ग्राउंड-ट्रुथ-मुक्त (ground-truth-free) ढांचा है जो कैंडिडेट स्किल्स के साथ और उनके बिना युग्मित प्रक्षेप पथों (paired trajectories) का पुनरावृत्ति द्वारा ऑडिट करके एजेंट कौशल को विकसित करता है, जिसमें व्यवहार संबंधी विचलन का निदान करने के लिए प्रोसेस-अलाइन्ड कॉन्ट्रास्टिव इवैल्यूएशन (Process-Aligned Contrastive Evaluation) और बाहरी रिवार्ड्स या छिपे हुए टेस्ट परिणामों पर निर्भर किए बिना स्किल डॉक्यूमेंट्स को सुरक्षित रूप से परिष्कृत या मरम्मत करने के लिए एक स्ट्रक्चरल वेरिफायर का उपयोग किया जाता है।

Haowen Gao, Haoran Chen, Can Wang, Shasha Guo, Liang Pang, Zhaoyang Liu, Huawei Shen, Xueqi Cheng2026-06-15
🤖 AI

HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry

HarnessX एक कंपोजेबल (composable) और एडेप्टिव (adaptive) फाउंड्री पेश करता है जो सब्स्टीट्यूशन अलजेब्रा (substitution algebra) और ट्रेस-ड्रिवन मल्टी-एजेंट इवोल्यूशन (trace-driven multi-agent evolution) के माध्यम से AI एजेंट रनटाइम इंटरफेस को व्यवस्थित रूप से विकसित करता है, जिससे केवल मॉडल स्केलिंग पर निर्भर हुए बिना विविध बेंचमार्क में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Tingyang Chen, Shuo Lu, Kang Zhao, Weicheng Meng, Hanlin Teng, Tianhao Li, Chao Li, Xule Liu, Jian Liang, Zhizhong Zhang (…)2026-06-15
🤖 AI

Robust Fall Recovery for Armless Bipedal-Wheeled Robots Via Force-Guided Learning

यह शोधपत्र FTSR प्रस्तुत करता है, जो एक फोर्स-गाइडेड टीचर-स्टूडेंट सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो सिमुलेशन-आधारित सहायक बलों और चरण-वार पुरस्कारों का उपयोग करके बिना किसी बाहरी सहायता के आंतरिक स्थिरीकरण रणनीतियों को विकसित करने के लिए बांहहीन द्विपाद-पहिए वाले रोबोटों को मजबूत रूप से गिरने से उबरने और निरंतर गतिमान होने में सक्षम बनाता है।

Haidong Hou, Zhangguo Yu, Tao Han, Hengbo Qi, Khaleel Ghazal, Yu Zhang, Yidong Du, Xuechao Chen, Fei Meng2026-06-15
🤖 AI

AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges

यह शोधपत्र AgentCyberRange का परिचय देता है, जो एक खुला, मल्टी-होस्ट इंफ्रास्ट्रक्चर है जिसे यथार्थवादी वेब एक्सप्लोइटेशन और पोस्ट-एक्सप्लोइटेशन परिदृश्यों में फ्रंटियर एआई सिस्टम की स्वायत्त आक्रामक क्षमताओं को बेंचमार्क करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल सीमित सफलता दिखाते हैं, फिर भी वे यथार्थवादी स्थितियों के तहत अज्ञात कमजोरियों का पता लगा सकते हैं और सुरक्षा प्रणालियों को बायपास कर सकते हैं।

Fengyu Liu, Jiarun Dai, Yihe Fan, Wuyuao Mai, Ziao Li, Bofei Chen, Jie Zhang, Zheng Lou, Bocheng Xiang, Qiyi Zhang, Xudo (…)2026-06-15
🤖 AI

I'm Sorry Driver, I'm Afraid I Can't Do That: Appraising the Safety of LLMs within Automotive Contexts

यह शोध पत्र ऑटोमोटिव नियंत्रण प्रणालियों में लार्ज लैंग्वेज मॉडल्स (LLMs) को एकीकृत करने की सुरक्षा आश्वासन का मूल्यांकन करता है, जो अपस्ट्रीम-डाउनस्ट्रीम संरेखण, विलंबता (latency), और नवीन संरेखण संबंधी मुद्दों जैसे महत्वपूर्ण वैचारिक और इंजीनियरिंग चुनौतियों की पहचान करता है, साथ ही 'Talk2Drive' फ्रेमवर्क के एक केस स्टडी के आधार पर भविष्य के आश्वासन तंत्रों का प्रस्ताव करता है।

Shaun Feakins, Ibrahim Habli, Kim Littler, Robert Palin2026-06-15