🤖 AI

PathISE: Learning Informative Path Supervision for Knowledge Graph Question Answering

PathISE एक नवीन ढांचा है जो उत्तर-स्तर के लेबल से उच्च-गुणवत्ता वाले मध्यवर्ती पथ पर्यवेक्षण (intermediate path supervision) को सीखने के लिए एक हल्के ट्रांसफॉर्मर एस्टिमेटर का उपयोग करके एक LLM पाथ जनरेटर को प्रशिक्षित करता है, जिससे महंगी, मैन्युअल रूप से एनोटेट की गई पाथ डेटा पर निर्भर किए बिना प्रतिस्पर्धी नॉलेज ग्राफ क्वेश्चन आंसरिंग प्रदर्शन प्राप्त किया जाता है।

Shengxiang Gao, Chao Lei, Jey Han Lau, Jianzhong Qi2026-05-12
🤖 AI

Interpretable Machine Learning for Football Performance Analysis: Evidence of Limited Transferability from Elite Leagues to University Competition

यह अध्ययन प्रदर्शित करता है कि जबकि विशिष्ट यूरोपीय फुटबॉल डेटा पर प्रशिक्षित मशीन लर्निंग मॉडल स्थिर और सुसंगत प्रदर्शन व्याख्याएँ प्रदान करते हैं, ये अंतर्दृष्टि विश्वविद्यालय-स्तर की प्रतिस्पर्धा में विश्वसनीय रूप से स्थानांतरित होने में विफल रहती हैं, जो यह प्रकट करता है कि व्याख्यात्मक सुदृढ़ता (interpretability robustness) डोमेन-निर्भर है और स्पष्टीकरण अस्थिरता (explanation instability) प्रतिस्पर्धा स्तरों के बीच संरचनात्मक अंतर के लिए एक नैदानिक संकेत के रूप में कार्य कर सकती है।

Yu-Fang Tsai, Yu-Jen Chen, Kok-Hua Tan, Sheng-Chieh Huang, You-Ying Ji, Yu-Lun Chen, Chun-Yi Wang, Chien-Ming Hsu2026-05-12
📊 statistics

Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge

यह शोध पत्र RACER को प्रस्तुत करता है, जो एक वितरण रूप से सुदृढ़ अनुकूलन (distributionally robust optimization) समस्या को हल करके एक निश्चित बजट के तहत रीजनिंग और नॉन-रीजनिंग LLM जजों के बीच गतिशील रूप से चयन करने वाला एक सुदृढ़ अनुकूली रूटिंग ढांचा है, जिससे वितरण बदलावों (distribution shifts) को ध्यान में रखते हुए बेहतर सटीकता-लागत संतुलन प्राप्त होता है।

Wenbo Zhang, Lijinghua Zhang, Liner Xiang, Hengrui Cai2026-05-12
🤖 AI

PhyGround: Benchmarking Physical Reasoning in Generative World Models

यह शोध पत्र PhyGround को प्रस्तुत करता है, जो 250 क्यूरेटेड प्रॉम्प्ट्स, एक 13-नियम वर्गीकरण (taxonomy) और एक विशेषीकृत VLM जज (PhyJudge-9B) से युक्त एक व्यापक बेंचमार्क है, जो बड़े पैमाने पर, गुणवत्ता-नियंत्रित मानव एनोटेशन के माध्यम से जनरेटिव वीडियो मॉडल्स की भौतिक तर्क क्षमताओं का कठोरता से मूल्यांकन और निदान करता है।

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, E (…)2026-05-12
🤖 AI

Threat Modelling using Domain-Adapted Language Models: Empirical Evaluation and Insights

यह शोध पत्र 5G STRIDE थ्रेट मॉडलिंग के लिए डोमेन-अनुकूलित (domain-adapted) बड़े और छोटे भाषा मॉडलों का एक व्यापक अनुभवजन्य मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि न तो डोमेन अनुकूलन और न ही मॉडल स्केलिंग लगातार विश्वसनीय प्रदर्शन सुनिश्चित करती है, जिससे संरचित सुरक्षा कार्यों के लिए वर्तमान LLMs की मौलिक सीमाओं और उन्नत तर्क एवं ग्राउंडिंग की आवश्यकता पर प्रकाश पड़ता है।

Saba Pourhanifeh, AbdulAziz AbdulGhaffar, Ashraf Matrawy2026-05-12
🤖 machine learning

Policy Gradient Methods for Non-Markovian Reinforcement Learning

यह शोधपत्र एक गैर-मार्कोवियन सुदृढीकरण शिक्षण (नॉन-मार्कोवियन रीइन्फोर्समेंट लर्निंग) के लिए एक रिवॉर्ड-केंद्रित ढांचे को प्रस्तुत करता है जो एजेंट स्टेट डायनेमिक्स और कंट्रोल पॉलिसी को संयुक्त रूप से अनुकूलित करता है, एक नवीन पॉलिसी ग्रेडिएंट थ्योरम और ASMPG एल्गोरिदम को स्थापित करता है जिसमें सैद्धांतिक अभिसरण गारंटी और प्रेडिक्टिव बेसलाइन्स की तुलना में बेहतर अनुभवजन्य प्रदर्शन है।

Avik Kar, Siddharth Chandak, Rahul Singh, Soumitra Sinhahajari, Eric Moulines, Shalabh Bhatnagar, Nicholas Bambos2026-05-12
🤖 AI

MaD Physics: Evaluating information seeking under constraints in physical environments

यह शोध पत्र MaD Physics को प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे परिवर्तित भौतिक नियमों वाले वातावरण में परीक्षण करके एआई एजेंटों की भौतिक नियमों को अनुमान लगाने और संसाधन संबंधी बाधाओं के तहत मापन की योजना बनाने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिससे वर्तमान जेमिनी (Gemini) मॉडलों की वैज्ञानिक तर्क और संरचित अन्वेषण क्षमताओं की सीमाओं का पता चलता है।

Moksh Jain, Mehdi Bennani, Johannes Bausch, Yuri Chervonyi, Bogdan Georgiev, Simon Osindero, Nenad Tomašev2026-05-12
🤖 AI

The First Drop of Ink: Nonlinear Impact of Misleading Information in Long-Context Reasoning

यह शोध पत्र लॉन्ग-कॉन्टेक्स्ट रीजनिंग (long-context reasoning) में एक "फर्स्ट ड्रॉप ऑफ इंक" (First Drop of Ink) प्रभाव की पहचान करता है, जो यह प्रदर्शित करता है कि कठिन डिस्ट्रैक्टर्स (distractors) के एक छोटे से अनुपात के कारण भी प्रदर्शन में भारी गिरावट आती है क्योंकि वे ध्यान के अनुचित रूप से अधिक हिस्से को ग्रहण कर लेते हैं, जिससे यह संकेत मिलता है कि पर्याप्त सुधार के लिए केवल कॉन्टेक्स्ट लेंथ (context length) को कम करने के बजाय डिस्ट्रैक्टर्स के अनुपात को लगभग शून्य के करीब लाना आवश्यक है।

Muhan Gao, Zih-Ching Chen, Kuan-Hao Huang2026-05-12
🤖 machine learning

SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing

यह शोध पत्र SLIM को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो स्पार्स ऑटोएन्कोडर (Sparse Autoencoder) के माध्यम से हिडन स्टेट्स को स्पार्स, व्याख्या योग्य फीचर्स में विघटित करके लार्ज लैंग्वेज मॉडल्स में प्रॉपर्टी-डायरेक्टेड मॉलिक्यूलर एडिटिंग को बेहतर बनाता है, जिससे मॉडल के पैरामीटर्स को संशोधित किए बिना सटीक स्टीयरिंग संभव होती है जो एडिटिंग की सफलता दर को महत्वपूर्ण रूप से बढ़ा देती है।

Mingxu Zhang, Yuhan Li, Lujundong Li, Dazhong Shen, Hui Xiong, Ying Sun2026-05-12
🤖 AI

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

यह शोध पत्र MMVIAD प्रस्तुत करता है, जो औद्योगिक विसंगति पहचान (industrial anomaly detection) के लिए पहला निरंतर मल्टी-व्यू वीडियो डेटासेट और बेंचमार्क है, और VISTA का प्रस्ताव करता है, जो एक नवीन दो-चरणीय पोस्ट-ट्रेनिंग पाइपलाइन के माध्यम से प्रशिक्षित एक मॉडल है जो चार प्रमुख औद्योगिक निरीक्षण कार्यों में मौजूदा वीडियो MLLMs और मानव-स्तरीय बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu2026-05-12