💬 NLP

DecoupleSearch: Decouple Planning and Search via Hierarchical Reward Modeling

यह शोध पत्र DecoupleSearch का प्रस्ताव करता है, जो एक नवीन ढांचा है जो स्टेप सुपरविजन और कैंडिडेट स्पेस कॉम्प्लेक्सिटी की चुनौतियों को संबोधित करने के लिए ड्यूल वैल्यू मॉडल्स और हायरार्किकल बीम सर्च के माध्यम से प्लानिंग और सर्च प्रक्रियाओं को अलग करके एजेंटिक RAG को उन्नत करता है।

Hao Sun, Zile Qiao, Bo Wang, Guoxin Chen, Yingyan Hou, Yong Jiang, Pengjun Xie, Fei Huang, Yan Zhang2026-05-19
⚛️ high-energy experiments

Spatially Aware Linear Transformer (SAL-T) for Particle Jet Tagging

यह शोध पत्र स्पेशियली अवेयर लीनियर ट्रांसफॉर्मर (SAL-T) को प्रस्तुत करता है, जो एक भौतिकी-प्रेरित आर्किटेक्चर है जो लीनियर अटेंशन को स्थानिक रूप से जागरूक विभाजन और कनवल्शनल परतों के साथ जोड़ता है ताकि पार्टिकल जेट टैगिंग में ट्रांसफॉर्मर-स्तर की सटीकता प्राप्त करते हुए कम्प्यूटेशनल जटिलता और इन्फरेंस लेटेंसी को काफी कम किया जा सके।

Aaron Wang, Zihan Zhao, Subash Katel, Vivekanand Gyanchand Sahu, Elham E Khoda, Abhijith Gandrakota, Jennifer Ngadiuba (…)2026-05-19
💬 NLP

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

यह शोध पत्र Evo-Memory प्रस्तुत करता है, जो एक व्यापक स्ट्रीमिंग बेंचमार्क और फ्रेमवर्क है जिसे निरंतर, गतिशील कार्य परिवेशों में LLM एजेंटों की स्व-विकसित होने वाली मेमोरी क्षमताओं का मूल्यांकन करने और उन्हें बढ़ाने के लिए डिज़ाइन किया गया है, जिसमें प्रस्तावित ReMem पाइपलाइन शामिल है जो निरंतर सुधार के लिए तर्क (reasoning), क्रियाओं (actions) और मेमोरी अपडेट को एकीकृत करती है।

Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui H (…)2026-05-19
💬 NLP

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

SignRoundV2 एक पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो एक एडेप्टिव मिक्स्ड-प्रिसिजन रणनीति और हल्के स्टेबिलाइजेशन तकनीकों का उपयोग करता है ताकि क्वांटाइज्ड और फुल-प्रिसिजन लार्ज लैंग्वेज मॉडल्स के बीच के प्रदर्शन अंतराल को महत्वपूर्ण रूप से कम किया जा सके, जिससे मिक्स्ड MXFP सेटिंग्स में लगभग लॉसलेस परिणाम और चुनौतीपूर्ण 2-बिट वेट-ओनली क्वांटाइजेशन में पर्याप्त सुधार प्राप्त होता है।

Wenhua Cheng, Weiwei Zhang, Heng Guo, Haihao Shen, Zaner Ma2026-05-19
💬 NLP

ShareChat: A Dataset of Chatbot Conversations in the Wild

यह शोध पत्र ShareChat को प्रस्तुत करता है, जो 142,808 वास्तविक दुनिया के चैटबॉट संवादों का एक बड़े पैमाने का, बहु-प्लेटफ़ॉर्म डेटासेट है जो 95 भाषाओं में मूल इंटरफ़ेस विशेषताओं (native interface affordances) को संरक्षित करता है ताकि केवल समान, टेक्स्ट-ओनली बेंचमार्क से परे लार्ज लैंग्वेज मॉडल्स के अधिक प्रामाणिक मूल्यांकन को सक्षम बनाया जा सके।

Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le2026-05-19
💬 NLP

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

यह शोध पत्र "जेनरेटिव मोंटाज" (Generative Montage) को पेश करता है, जो एक नवीन संज्ञानात्मक मिलीभगत हमला (cognitive collusion attack) है जहाँ स्वायत्त एजेंट सार्वजनिक रूप से उपलब्ध सत्य साक्ष्यों से भ्रामक आख्यानों को संश्लेषित करके विश्वासों में हेरफेर करने के लिए LLMs की तर्क संबंधी प्रवृत्तियों का लाभ उठाते हैं, यह प्रकट करते हुए कि उन्नत मॉडल भी इस प्रकार के सत्य-आधारित हेरफेर के प्रति अत्यधिक संवेदनशील हैं।

Jinwei Hu, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang2026-05-19
🤖 machine learning

The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models

यह शोध पत्र इस प्रचलित धारणा को चुनौती देता है कि मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) मॉडल स्पार्स रूटिंग (sparse routing) के माध्यम से डोमेन विशेषज्ञता प्राप्त करते हैं, और विशेषज्ञों की एक डोमेन-अपरिवर्तनीय "स्टैंडिंग कमेटी" (Standing Committee) के अस्तित्व को प्रदर्शित करता है जो लगातार रूटिंग मास के बहुमत को संभालती है, जिससे केंद्रीकृत कंप्यूटेशन की ओर एक संरचनात्मक पूर्वाग्रह का पता चलता है जो प्रशिक्षण दक्षता में बाधा डाल सकता है।

Yan Wang, Yitao Xu, Nanhan Shen, Jinyan Su, Jimin Huang, Zining Zhu2026-05-19
💬 NLP

KASER: Knowledge-Aligned Student Error Simulator for Open-Ended Coding Tasks

यह शोध पत्र KASER प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) आधारित दृष्टिकोण है जो विविध और सटीक छात्र कोडिंग त्रुटियों को प्रभावी ढंग से सिम्युलेट करने के लिए त्रुटि उत्पादन को छात्र के ज्ञान के साथ संरेखित करता है, और वास्तविक दुनिया के डेटासेट पर त्रुटि भविष्यवाणी और कोड विविधता दोनों में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Zhangqi Duan, Nigel Fernandez, Andrew Lan2026-05-19
💬 NLP

Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence

यह शोधपत्र DoublyCal को प्रस्तुत करता है, जो एक हल्के प्रॉक्सी मॉडल का उपयोग करके कैलिब्रेटेड कॉन्फिडेंस के साथ नॉलेज ग्राफ एविडेंस (ज्ञान ग्राफ साक्ष्य) उत्पन्न करता है, जिससे ब्लैक-बॉक्स LLMs की सटीकता और विश्वसनीयता बढ़ती है, और इस प्रकार LLM को ऐसे सुव्यवस्थित (वेल-कैलिब्रेटेड) पूर्वानुमान उत्पन्न करने में सक्षम बनाता है जो सहायक साक्ष्य की अनिश्चितता तक वापस जाते हैं।

Yuyin Lu, Ziran Liang, Yanghui Rao, Wenqi Fan, Fu Lee Wang, Qing Li2026-05-19
💻 computer science

Agentic AI Governance and Lifecycle Management in Healthcare

यह शोध पत्र एक यूनिफाइड एजेंट लाइफसाइकिल मैनेजमेंट (UALM) फ्रेमवर्क प्रस्तावित करता है, जिसमें पांच-स्तरीय कंट्रोल-प्लेन आर्किटेक्चर और एक मैच्योरिटी मॉडल शामिल है, ताकि ऑडिट-रेडी ओवरसाइट और एजेंटिक एआई वर्कफ़्लो के सुरक्षित स्केलिंग को सक्षम बनाकर स्वास्थ्य सेवा में एजेंट स्प्रावल और जवाबदेही की चुनौतियों का समाधान किया जा सके।

Chandra Prakash, Mary Lind, Avneesh Sisodia2026-05-19