🤖 AI

LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

यह शोध पत्र एक पाठ्यक्रम-आधारित, कॉन्फ़िगर करने योग्य LLM-as-Judge पाइपलाइन प्रस्तुत करता है जो व्यवस्थित रूप से स्वचालित प्रश्न-स्तरीय अंकन को अधिकृत शैक्षिक मानकों और पाठ्यक्रम संबंधी कलाकृतियों के साथ संरेखित करता है, जिससे परीक्षा की तैयारी के लिए अधिक पता लगाने योग्य औचित्य प्रदान करते हुए मानव ट्यूटरों के तुलनीय निरंतरता प्राप्त होती है।

Xiwei Xu, Chen Wang, Jacky Jiang, Phil Yang, Qian Fu, Mohan Dhall, Wenjie Zhang, Liming Zhu2026-06-17
🤖 machine learning

Geometry-Aware Post-Hoc Uncertainty Quantification in Operator Learning

यह शोध पत्र REEF-GP को प्रस्तुत करता है, जो एक स्केलेबल पोस्ट-हॉक अनिश्चितता परिमाणीकरण ढांचा (uncertainty quantification framework) है जो प्रेडिक्शन रेसिडुअल्स (prediction residuals) पर गाऊसी प्रोसेस (Gaussian Process) को फिट करने के लिए एक न्यूरल ऑपरेटर के अंतर्निहित ज्यामिति-जागरूक एम्बेडिंग्स (geometry-aware embeddings) का लाभ उठाता है, जिससे डीप एन्सेम्बल्स की तुलना में बहुत कम लागत पर विभिन्न PDE ज्यामितिओं में कैलिब्रेटेड और सुदृढ़ अनिश्चितता अनुमान प्राप्त होते हैं।

Oriol Vendrell-Gallart, Nima Negarandeh, Ramin Bostanabad2026-06-17
📊 statistics

FoundCause: Causal Discovery with Latent Confounders from Observational Data

FoundCause एक नवीन एमोर्टाइज्ड (amortized) कॉज़ल डिस्कवरी मॉडल है जो विशेष इंडक्टिव बायस (inductive biases) के साथ एक ट्रांसफार्मर आर्किटेक्चर का लाभ उठाता है ताकि एकल फॉरवर्ड पास में अवलोकन संबंधी डेटा से लेटेंट कन्फाउंडर्स (latent confounders) सहित कॉज़ल ग्राफ को सीधे निष्कर्ष निकाला जा सके, जो विविध वास्तविक दुनिया के डेटासेट पर शास्त्रीय और मौजूदा एमोर्टाइज्ड विधियों दोनों से बेहतर प्रदर्शन करता है।

Patrick Blöbaum, Krishnakumar Balasubramanian, Shiva Prasad Kasiviswanathan2026-06-17
💬 NLP

Scaling Enterprise Agent Routing: Degradation, Diagnosis, and Recovery

यह शोध पत्र इस बात की जांच करता है कि कैसे एंटरप्राइज एलएलएम (LLM) असिस्टेंट्स में टूल कैटलॉग के आकार 10 से बढ़कर 110 एजेंटों तक होने पर रूटिंग सटीकता कम हो जाती है, जिसमें रिट्रीवल (retrieval) और कन्फ्यूजन (confusion) अंतराल को विफलता के प्राथमिक कारणों के रूप में पहचाना गया है और यह प्रदर्शित किया गया है कि एम्बेडिंग-आधारित शॉर्टलिस्टिंग (embedding-based shortlisting) कई फ्रंटियर मॉडल्स (frontier models) में महत्वपूर्ण एफ1 (F1) प्रदर्शन को प्रभावी ढंग से पुनः प्राप्त करती है।

Kellen Gillespie, Robyn Perry2026-06-17
🤖 AI

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

यह शोध पत्र DRIVE-CHOREO को प्रस्तुत करता है, जो एक LLM-कोरियोग्राफ्ड मल्टी-एजेंट वर्ल्ड मॉडल है जो एक साझा लेटेंट टोकन सीक्वेंस और को-कंप्रेशन रणनीति के माध्यम से विषम ड्राइविंग नियंत्रणों और मल्टी-व्यू ज्योमेट्री को एकीकृत करता है, जिससे अत्याधुनिक निरंतरता (state-of-the-art consistency) प्राप्त होती है और स्वायत्त ड्राइविंग कार्यों के लिए महत्वपूर्ण डाउनस्ट्रीम उपयोगिता प्रदर्शित होती है।

Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan (…)2026-06-17
🤖 machine learning

Offline Preference-Based Trajectory Evaluation

यह शोध पत्र एक प्राथमिकता-आधारित प्रक्षेपवक्र मूल्यांकन पद्धति प्रस्तावित करता है जो एजेंटिक प्रणालियों की तुलना टेम्पोरल प्रोग्रेस (सामयिक प्रगति) और टाइम-टू-रिटर्न प्रोफाइल के माध्यम से करता है, जो पारंपरिक टर्मिनल-सफलता मेट्रिक्स की तुलना में तुलनात्मक बराबरी (टाइज) को काफी कम करता है और सांख्यिकीय दक्षता में सुधार करता है, जो अक्सर बेंचमार्क संतृप्ति (सैचुरेशन) का कारण बनते हैं।

Fernando Diaz2026-06-17
🤖 AI

An AI Security Agent for Banking: Multi-Vector Fraud and AML Detection Across Retail and Corporate Accounts

यह शोध पत्र बैंकिंग के लिए एक मल्टी-वेक्टर एआई सुरक्षा एजेंट प्रस्तुत करता है जो सिग्नेचर-आधारित धोखाधड़ी और व्यवहार संबंधी वित्तीय अपराधों का एक साथ पता लगाने के लिए एलएसटीएम (LSTM) अनुक्रम मॉडल, सांख्यिकीय मॉनिटर और ग्राफ नेटवर्क के हाइब्रिड आर्किटेक्चर का उपयोग करके ट्रांजैक्शन और सेशन डेटा स्ट्रीम को फ्यूज करता है, जिससे नियम-आधारित या सिंगल-मॉडल बेसलाइन की तुलना में काफी उच्च एफ1 (F1) स्कोर प्राप्त होता है और साथ ही कम-विलंबता वाली स्वचालित प्रतिक्रियाएं और विश्लेषक सहायता प्रदान की जाती है।

Joseph Walusimbi, Joshua Benjamin Ssentongo2026-06-17
🤖 AI

DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack

DeepInsight एक एकीकृत मूल्यांकन अवसंरचना है जो तीन मुख्य अमूर्तताओं (कार्य, संसाधन और परिणाम) के माध्यम से शासन विषमता (regime heterogeneity) को संरक्षित रखते हुए पूरे फिजिकल एआई स्टैक को एक एकल रनटाइम पर फैलाता है, जिससे स्केलेबल बेंचमार्किंग और क्रॉस-लेयर रिग्रेशन डायग्नोसिस सक्षम होता है जिसे खंडित, मल्टी-हार्नेस दृष्टिकोण प्राप्त नहीं कर सकते हैं।

Siyi Li, Chunyu Sun, Jiahao Zhang, Yuchen Kang, Wuliang Wang, Yu Qiu, Rui Jiang, Haitao Cui, Jie Chen2026-06-17
🤖 AI

Surrogate Assisted Pedestrian Protection Design via a Foundation Model Orchestrated Workflow

यह शोध पत्र पैदल यात्री सुरक्षा डिज़ाइन के लिए पहला फाउंडेशन मॉडल-संचालित वर्कफ़्लो प्रस्तुत करता है जो एक उच्च-सटीक सरोगेट मॉडल, इवोल्यूशनरी सर्च और जनरेटिव एआई को एकीकृत करता है ताकि तेजी से सुरक्षा-अनुपालक ऑटोमोटिव बंपर विकल्प तैयार किए जा सकें, जिससे मूल्यांकन का समय हफ्तों से घटकर सेकंडों में आ जाता है।

Osamu Ito, Akihiko Katagiri, Yoshikazu Nakagawa, Shin Saeki, Jun Shiraishi, Masato Sasaki2026-06-17
🤖 machine learning

LLM Features Can Hurt GNNs: Concatenation Interference on Homophilous Graph Benchmarks

यह शोध पत्र यह प्रकट करता है कि केवल LLM-जनित नोड विशेषताओं (node features) को GNN इनपुट के साथ जोड़ने से होमोफिलस (homophilous) बेंचमार्क पर प्रदर्शन व्यवस्थित रूप से घट सकता है, एक ऐसी घटना जो ग्राफ होमोफिली के बजाय LLM की स्टैंडअलोन डिस्क्रिमिनेबिलिटी (discriminability) द्वारा संचालित होती है, और यह भविष्यवाणी करने के लिए एक डिस्क्रिमिनेबिलिटी थ्रेशोल्ड (discriminability threshold) प्रस्तावित करता है कि कब ऐसा संयोजन हानिकारक होगा।

Zhongyuan Wang, Pratyusha Vemuri2026-06-17