🤖 machine learning

When LLM Judge Scores Look Good but Best-of-N Decisions Fail

यह शोध पत्र यह प्रदर्शित करता है कि बेस्ट-ऑफ-एन (best-of-n) चयन कार्यों के लिए एलएलएम (LLM) जजों का मूल्यांकन करने हेतु वैश्विक सहसंबंध मेट्रिक्स (global correlation metrics) पर निर्भर रहना भ्रामक है, क्योंकि उच्च वैश्विक स्कोर अक्सर खराब इन-प्रॉम्प्ट रैंकिंग प्रदर्शन और अत्यधिक टाई दरों को छिपा देते हैं, जिन्हें स्पष्ट युग्मवार निर्णय (explicit pairwise judging) का उपयोग करके महत्वपूर्ण रूप से सुधारा जा सकता है।

Eddie Landesberg2026-03-16
💬 NLP

LLM BiasScope: A Real-Time Bias Analysis Platform for Comparative LLM Evaluation

LLM BiasScope एक ओपन-सोर्स, रियल-टाइम वेब प्लेटफॉर्म है जो उपयोगकर्ता के प्रॉम्प्ट और मॉडल की प्रतिक्रियाओं दोनों में पूर्वाग्रह (bias) के पैटर्न का स्वचालित रूप से पता लगाकर, उन्हें वर्गीकृत करके और दृश्य रूप में प्रस्तुत करके कई लार्ज लैंग्वेज मॉडल्स के आमने-सामने तुलनात्मक मूल्यांकन को सक्षम बनाता है।

Himel Ghosh, Nick Elias Werner2026-03-16
🤖 machine learning

Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages

यह शोध पत्र डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को प्रस्तुत करता है जो जनरेशन को एक सटीक, निष्पक्ष पॉलिसी ग्रेडिएंट के साथ एक मार्कोव निर्णय प्रक्रिया के रूप में स्वरूपित करके और कोडिंग, तार्किक और गणितीय तर्क संबंधी बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एंट्रॉपी-गाइडेड स्टेप सिलेक्शन और वन-स्टेप डिनोइजिंग रिवार्ड्स का उपयोग करके अव्यवहारिकता (intractable likelihoods) पर विजय प्राप्त करता है।

Vishnu Teja Kunde, Fatemeh Doudi, Mahdi Farahbakhsh, Dileep Kalathil, Krishna Narayanan, Jean-Francois Chamberland2026-03-16
💬 NLP

Literary Narrative as Moral Probe : A Cross-System Framework for Evaluating AI Ethical Reasoning and Refusal Behavior

यह शोध पत्र 13 प्रणालियों में एआई (AI) नैतिक तर्क का मूल्यांकन करने के लिए अनसुलझाने योग्य साहित्यिक आख्यानों का उपयोग करने वाले एक नवीन ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि परिष्कृत मॉडल विशिष्ट परावर्तक विफलता मोड प्रदर्शित करते हैं और प्रदर्शन किए गए तथा वास्तविक नैतिक तर्क के बीच का अंतर मापने योग्य और उच्च-जोखिम वाले परिनियोजन के लिए महत्वपूर्ण है।

David C. Flynn2026-03-16
💬 NLP

Using a Human-AI Teaming Approach to Create and Curate Scientific Datasets with the SCILIRE System

यह शोध पत्र SCILIRE को प्रस्तुत करता है, जो एक मानव-AI टीमिंग सिस्टम है जो शोधकर्ताओं को AI द्वारा निकाले गए वैज्ञानिक डेटा को पुनरावृत्ति के माध्यम से सत्यापित, सुधार और क्यूरेट करने में सक्षम बनाता है, जिससे निष्कर्षण की सटीकता (extraction fidelity) में सुधार होता है और कई डोमेन में कुशल डेटासेट निर्माण की सुविधा मिलती है।

Necva Bölücü, Jessica Irons, Changhyun Lee, Brian Jin, Maciej Rybinski, Huichen Yang, Andreas Duenser, Stephen Wan2026-03-16
⚡ electrical engineering

Self-Supervised Speech Models Encode Phonetic Context via Position-dependent Orthogonal Subspaces

यह शोध पत्र यह प्रदर्शित करता है कि ट्रांसफॉर्मर-आधारित स्व-पर्यवेक्षित (self-supervised) स्पीच मॉडल पड़ोसी फोन्स के वेक्टर्स को स्थिति-निर्भर ऑर्थोगोनल सबस्पेस (position-dependent orthogonal subspaces) में सुपरपोज़ करके एकल फ्रेम-स्तरीय निरूपणों (frame-level representations) के भीतर ध्वन्यात्मक संदर्भ (phonetic context) को एनकोड करते हैं, जिससे यह स्पष्ट होता है कि ये मॉडल किस प्रकार अतीत, वर्तमान और भविष्य की ध्वन्यात्मक सूचनाओं को संरचनात्मक रूप से एकीकृत करते हैं।

Kwanghee Choi, Eunjung Yeo, Cheol Jun Cho, David R. Mortensen, David Harwath2026-03-16
💬 NLP

From Text to Forecasts: Bridging Modality Gap with Temporal Evolution Semantic Space

यह शोध पत्र TESS का प्रस्ताव करता है, जो एक 'टेम्पोरल इवोल्यूशन सिमेंटिक स्पेस' (Temporal Evolution Semantic Space) को पेश करके इवेंट-ड्रिवन टाइम-सीरीज फोरकास्टिंग में मोडैलिटी गैप को पाटने वाला एक नवीन ढांचा है, जो गुणात्मक पाठ्य विवरणों को व्याख्यात्मक, मात्रात्मक टेम्पोरल प्रिमिटिव्स में अनुवादित करता है और अत्याधुनिक बेसलाइन की तुलना में त्रुटियों में महत्वपूर्ण कमी लाता है।

Lehui Li, Yuyao Wang, Jisheng Yan, Wei Zhang, Jinliang Deng, Haoliang Sun, Zhongyi Han, Yongshun Gong2026-03-16
💬 NLP

MetaKE: Meta-learning Aligned Knowledge Editing via Bi-level Optimization

यह शोध पत्र MetaKE का प्रस्ताव करता है, जो एक नवीन ढांचा है जो ज्ञान संपादन (knowledge editing) को एक सीखने योग्य संपादन लक्ष्य (learnable edit target) और एक संरचनात्मक ग्रेडिएंट प्रॉक्सी (structural gradient proxy) के साथ द्वि-स्तरीय अनुकूलन समस्या के रूप में पुनर्गठित करता है ताकि अर्थ संबंधी-निष्पादन विच्छेद (semantic-execution disconnect) को हल किया जा सके, जिससे मौजूदा विधियों की तुलना में संपादन सफलता दर और मॉडल प्रदर्शन में महत्वपूर्ण सुधार होता है।

Shuxin Liu, Ou Wu2026-03-16
🤖 AI

AI Planning Framework for LLM-Based Web Agents

यह शोध पत्र एक एआई प्लानिंग फ्रेमवर्क प्रस्तावित करता है जो सिद्धांतों के आधार पर विफलता निदान (failure diagnosis) को सक्षम करने के लिए एलएलएम-आधारित वेब एजेंट आर्किटेक्चर को पारंपरिक खोज प्रतिमानों (बीएफएस, डीएफएस, बेस्ट-फर्स्ट) के साथ मैप करता है, और यह प्रदर्शित करने के लिए नए मूल्यांकन मेट्रिक्स और एक मानव-लेबल वाले डेटासेट को पेश करता है कि विभिन्न एजेंट रणनीतियाँ कार्य निष्पादन के विशिष्ट पहलुओं, जैसे कि मानव-समान प्रक्षेपवक्र संरेखण बनाम तकनीकी तत्व सटीकता में उत्कृष्ट होती हैं।

Orit Shahnovsky, Rotem Dror2026-03-16
💬 NLP

MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization

यह शोध पत्र MoKus को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो विविध टेक्स्टुअल ज्ञान को विजुअल कॉन्सेप्ट्स के साथ प्रभावी ढंग से एकीकृत करके कॉन्सेप्ट कस्टमाइजेशन में दुर्लभ-टोकन बाइंडिंग (rare-token binding) की सीमाओं को संबोधित करने के लिए क्रॉस-मोडल नॉलेज ट्रांसफर का लाभ उठाता है, जिसके साथ मूल्यांकन के लिए नया KnowCusBench बेंचमार्क भी दिया गया है।

Chenyang Zhu, Hongxiang Li, Xiu Li, Long Chen2026-03-16