💬 NLP

The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning

यह शोध पत्र HEG-TKG को प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो नैदानिक AI (clinical AI) में "प्रूवेनेंस गैप" (Provenance Gap) को दूर करने के लिए पदानुक्रमित साक्ष्य-आधारित टेम्पोरल नॉलेज ग्राफ्स (hierarchical evidence-grounded temporal knowledge graphs) का उपयोग करता है, ताकि दुर्लभ रोगों के तर्क के लिए 100% सत्यापन योग्य उद्धरण और त्रुटियों के प्रति उच्च प्रतिरोध सुनिश्चित किया जा सके, जो फ्रंटियर लार्ज लैंग्वेज मॉडल्स द्वारा संदर्भों को गढ़ने की प्रवृत्ति को संबोधित करता है।

Md Shamim Ahmed, Maja Dusanic, Moritz Nikolai Kirschner, Elisabeth Nyoungui, Jana Zschüntzsch, Lukas Galke Poech, Richar (…)2026-04-21
💬 NLP

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

यह शोध पत्र एडेप्टिव कॉन्ट्रास्टिव डिकोडिंग (AdaCD) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त और मॉडल-अज्ञेय विधि है जो चरम सुरक्षा प्रॉम्प्ट्स के साथ तुलना के आधार पर टोकन चयन की संभावनाओं को गतिशील रूप से समायोजित करके सुरक्षा-संरेखित लार्ज लैंग्वेज मॉडल्स में अत्यधिक इनकार (over-refusal) को कम करती है, जिससे हानिकारक प्रश्नों के लिए इनकार को कम किया जा सके बिना दुर्भावनापूर्ण प्रश्नों के विरुद्ध सुरक्षा से समझौता किए।

Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia2026-04-21
💬 NLP

The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration

यह शोध पत्र मल्टी-एजेंट एलएलएम (LLMs) में एक महत्वपूर्ण भेद्यता की पहचान करता है जहाँ बहुमत मतदान (majority voting) मध्यवर्ती तर्क के प्रति अपनी अंधापन के कारण प्रतिकूल बहुलकों (adversarial majorities) के विरुद्ध विफल हो जाता है, और एक टोकन-लेवल राउंड-रॉबिन सहयोग पद्धति का प्रस्ताव करता है जो सैद्धांतिक और अनुभवजन्य रूप से यह प्रदर्शित करती है कि इंटरलीविंग जनरेशन के माध्यम से ईमानदार एजेंटों को भ्रष्ट तर्क को सुधारने की अनुमति दी जाती है, भले ही वे संख्या में कम हों।

Jiayuan Liu, Shiyi Du, Weihua Du, Mingyu Guo, Vincent Conitzer2026-04-21
💬 NLP

A Multi-Agent Approach for Claim Verification from Tabular Data Documents

यह शोध पत्र MACE को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो टेबुलर डेटा से स्टेट-ऑफ-द-आर्ट और व्याख्या योग्य क्लेम वेरिफिकेशन प्राप्त करने के लिए प्लानर (Planner), एक्जीक्यूटर (Executor) और वेरिफायर (Verifier) एजेंटों के माध्यम से ज़ीरो-शॉट चेन-ऑफ-थॉट रीजनिंग का उपयोग करता है, जो मौजूदा दृष्टिकोणों की तुलना में काफी छोटे मॉडल्स का उपयोग करता है।

Rudra Ranajee Saha, Laks V. S. Lakshmanan, Raymond T. Ng2026-04-21
💬 NLP

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

DORA Explorer एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो विविध एक्शन उम्मीदवारों को उत्पन्न करके और एक ट्यूनेबल पैरामीटर के माध्यम से उन्हें चुनकर क्रमिक निर्णय लेने वाले कार्यों में LLM एजेंटों की अन्वेषण क्षमताओं को बढ़ाता है, जिससे बिना किसी अतिरिक्त मॉडल प्रशिक्षण के मौजूदा डिकोडिंग रणनीतियों और प्रॉम्प्टिंग विधियों की सीमाओं को दूर किया जा सकता है।

Priya Gurjar, Md Farhan Ishmam, Kenneth Marino2026-04-21
💬 NLP

Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents

यह शोध पत्र एस्टीमेट-वेरिफाई-अपडेट (EVU) तंत्र को प्रस्तुत करता है, जो एक सक्रिय विश्वास हस्तक्षेप ढांचा (active belief intervention framework) है जो एम्बोडीड एजेंटों (embodied agents) को पर्यावरणीय अवलोकनों के विरुद्ध अपने आंतरिक विश्वासों का अनुमान लगाने, सत्यापन करने और उन्हें अपडेट करने में सक्षम बनाता है, जिससे विश्वास जड़ता (belief inertia) को प्रभावी रूप से कम किया जा सकता है और कई बेंचमार्क में कार्य सफलता दरों में महत्वपूर्ण सुधार किया जा सकता है।

Hanlin Wang, Chak Tou Leong, Jian Wang, Wenjie Li2026-04-21
💬 NLP

REZE: Representation Regularization for Domain-adaptive Text Embedding Pre-finetuning

यह शोध पत्र REZE का प्रस्ताव करता है, जो एक प्रतिनिधित्व नियमितीकरण (representation regularization) ढांचा है जो आइजनस्पेस (eigenspace) में एंकर-पॉजिटिव संबंधों को विघटित करके और शोर को दबाने तथा सिमेंटिक संरचना को संरक्षित करने के लिए अनुकूली सॉफ्ट-श्रिंकेज (adaptive soft-shrinkage) लागू करके डोमेन-अनुकूली टेक्स्ट एम्बेडिंग प्री-फाइनट्यूनिंग के दौरान कार्य-प्रेरित पूर्वाग्रह और अनियंत्रित प्रतिनिधित्व बदलावों को कम करता है।

Seungmin Lee, Jeonghwan Lee, Hyunkuk Lim, Sejoon Kim, Mingi Sung2026-04-21
💬 NLP

HORIZON: A Benchmark for In-the-wild User Behaviour Modeling

यह शोध पत्र HORIZON को प्रस्तुत करता है, जो 54 मिलियन उपयोगकर्ताओं और 35 मिलियन वस्तुओं से निर्मित एक नया बड़े पैमाने का, क्रॉस-डोमेन बेंचमार्क है, जो मौजूदा संकीर्ण बेंचमार्क की सीमाओं को संबोधित करने और वास्तविक दुनिया के परिनियोजन परिदृश्यों को बेहतर ढंग से प्रतिबिंबित करने के लिए नवीन कार्यों और मूल्यांकन मेट्रिक्स के माध्यम से उपयोगकर्ता व्यवहार मॉडलिंग को पुनर्गठित करता है।

Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma2026-04-21
💬 NLP

MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning

यह शोध पत्र MedPRMBench प्रस्तुत करता है, जो चिकित्सा क्षेत्र में प्रोसेस रिवॉर्ड मॉडल्स (Process Reward Models) के लिए पहला सूक्ष्म-स्तरीय (fine-grained) बेंचमार्क है, जो नैदानिक तर्क (clinical reasoning) में त्रुटि पहचान को विकसित करने और सुधारने के लिए एक नवीन चार-स्तरीय गंभीरता ग्रेडिंग प्रणाली और व्यापक स्टेप-लेवल लेबल का उपयोग करता है, जिससे अंततः डाउनस्ट्रीम मेडिकल क्यू एंड ए (QA) की सटीकता में वृद्धि होती है।

Lingyan Wu, Xiang Zheng, Weiqi Zhai, Wei Wang, Xuan Ren, Zifan Zhang, Hu Wei, Bing Zhao2026-04-21
💬 NLP

HorizonBench: Long-Horizon Personalization with Evolving Preferences

यह शोधपत्र HorizonBench प्रस्तुत करता है, जो विकसित होती प्राथमिकताओं के लिए ग्राउंड-ट्रुथ प्रोवेनेंस (ground-truth provenance) के साथ 6-महीने की सिम्युलेटेड उपयोगकर्ता बातचीत वाला एक नवीन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल मुख्य रूप से समय के साथ उपयोगकर्ता अवस्थाओं (user states) को ट्रैक करने और अपडेट करने में विफलता के कारण लॉन्ग-होरिज़न पर्सनलाइजेशन (long-horizon personalization) के साथ काफी संघर्ष करते हैं।

Shuyue Stella Li, Bhargavi Paranjape, Kerem Oktar, Zhongyao Ma, Gelin Zhou, Lin Guan, Na Zhang, Sem Park, Lin Chen, Diyi (…)2026-04-21