💬 NLP

KASER: Knowledge-Aligned Student Error Simulator for Open-Ended Coding Tasks

यह शोध पत्र KASER प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) आधारित दृष्टिकोण है जो विविध और सटीक छात्र कोडिंग त्रुटियों को प्रभावी ढंग से सिम्युलेट करने के लिए त्रुटि उत्पादन को छात्र के ज्ञान के साथ संरेखित करता है, और वास्तविक दुनिया के डेटासेट पर त्रुटि भविष्यवाणी और कोड विविधता दोनों में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Zhangqi Duan, Nigel Fernandez, Andrew Lan2026-05-19
💬 NLP

Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence

यह शोधपत्र DoublyCal को प्रस्तुत करता है, जो एक हल्के प्रॉक्सी मॉडल का उपयोग करके कैलिब्रेटेड कॉन्फिडेंस के साथ नॉलेज ग्राफ एविडेंस (ज्ञान ग्राफ साक्ष्य) उत्पन्न करता है, जिससे ब्लैक-बॉक्स LLMs की सटीकता और विश्वसनीयता बढ़ती है, और इस प्रकार LLM को ऐसे सुव्यवस्थित (वेल-कैलिब्रेटेड) पूर्वानुमान उत्पन्न करने में सक्षम बनाता है जो सहायक साक्ष्य की अनिश्चितता तक वापस जाते हैं।

Yuyin Lu, Ziran Liang, Yanghui Rao, Wenqi Fan, Fu Lee Wang, Qing Li2026-05-19
💻 computer science

Agentic AI Governance and Lifecycle Management in Healthcare

यह शोध पत्र एक यूनिफाइड एजेंट लाइफसाइकिल मैनेजमेंट (UALM) फ्रेमवर्क प्रस्तावित करता है, जिसमें पांच-स्तरीय कंट्रोल-प्लेन आर्किटेक्चर और एक मैच्योरिटी मॉडल शामिल है, ताकि ऑडिट-रेडी ओवरसाइट और एजेंटिक एआई वर्कफ़्लो के सुरक्षित स्केलिंग को सक्षम बनाकर स्वास्थ्य सेवा में एजेंट स्प्रावल और जवाबदेही की चुनौतियों का समाधान किया जा सके।

Chandra Prakash, Mary Lind, Avneesh Sisodia2026-05-19
💻 computer science

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

यह अध्ययन प्रकट करता है कि RL-प्रशिक्षित लीन (Lean) प्रमेय सिद्ध करने वाले (theorem provers) इन्फरेंस-टाइम मोड कोलैप्स (inference-time mode collapse) से ग्रस्त होते हैं, जिसे विविध टैक्टिक स्केलेटन (diverse tactic skeletons) के एक निश्चित शेड्यूल को लागू करके प्रभावी ढंग से कम किया जा सकता है जिससे महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं, जबकि प्रॉम्प्ट पैराफ्रेसिंग (prompt paraphrasing) और अप्रासंगिक टिप्पणियाँ अप्रभावी या हानिकारक सिद्ध होती हैं।

Zachary Burton2026-05-19
🤖 machine learning

PyHealth 2.0: A Comprehensive Open-Source Toolkit for Accessible and Reproducible Clinical Deep Learning

PyHealth 2.0 एक उन्नत ओपन-सोर्स टूलकिट है जो विविध डेटासेट्स, मॉडल्स और कार्यों को एक एकल, अत्यधिक कुशल फ्रेमवर्क में एकीकृत करके क्लिनिकल डीप लर्निंग रिसर्च का लोकतंत्रीकरण करता है, जो केवल सात लाइनों के कोड में प्रेडिक्टिव मॉडलिंग को सक्षम बनाता है और साथ ही कंप्यूटेशनल लागतों और डोमेन विशेषज्ञता की बाधाओं को महत्वपूर्ण रूप से कम करता है।

John Wu, Yongda Fan, Zhenbang Wu, Paul Landes, Eric Schrock, Sayeed Sajjad Razin, Arjun Chatterjee, Naveen Baskaran, Jos (…)2026-05-19
💻 computer science

Enhancing Table Reasoning with Deterministic Table-State Rewards

यह शोध पत्र 'लॉन्गेस्ट कॉमन सबसीक्वेंस' (Longest Common Subsequence) पर आधारित एक प्रशिक्षण-मुक्त नियतात्मक रिवॉर्ड मेट्रिक, TABROUGE, और RE-TAB फ्रेमवर्क को प्रस्तुत करता है, जो बिना किसी सीखे हुए मॉडल या बाहरी निष्पादक (external executor) पर निर्भर रहे, मध्यवर्ती अवस्थाओं के लिए स्केलेबल और क्वेरी-आधारित फीडबैक प्रदान करके लार्ज लैंग्वेज मॉडल्स की बहु-चरणीय तालिका तर्क (multi-step table reasoning) सटीकता को महत्वपूर्ण रूप से बढ़ाता है।

Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying (…)2026-05-19
🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

यह शोध पत्र LaDi-RL का प्रस्ताव करता है, जो एक सुव्यवस्थित तर्क प्रक्षेप पथ (reasoning trajectories) उत्पन्न करने के लिए लेटेंट डिफ्यूजन मॉडल का उपयोग करता है और पदानुक्रमित लेटेंट-टेक्स्ट रोलआउट्स (hierarchical latent-text rollouts) को नियोजित करता है ताकि लेटेंट प्लानिंग की गुणवत्ता को टेक्स्ट डिकोडिंग त्रुटियों से अलग किया जा सके, जिससे एंट्रॉपी कोलैप्स (entropy collapse) को रोका जा सके और कोड एवं गणितीय तर्क कार्यों पर पारंपरिक टोकन-स्तरीय RL की तुलना में काफी बेहतर प्रदर्शन किया जा सके।

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin2026-05-19
💬 NLP

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

यह शोध पत्र डीप डेटा रिसर्च (DDR) और इसके संगत बेंचमार्क, DDR-Bench को प्रस्तुत करता है, जो कच्चे डेटा से स्वायत्त रूप से अंतर्दृष्टि निकालने में एजेंटिक लार्ज लैंग्वेज मॉडल्स की खोजी बुद्धिमत्ता का मूल्यांकन करता है, और यह प्रकट करता है कि जबकि फ्रंटियर मॉडल्स उभरती हुई एजेंसी प्रदर्शित करते हैं, प्रभावी लॉन्ग-होरिजन अन्वेषण के लिए केवल स्केलिंग या स्कैफोल्डिंग से परे आंतरिक रणनीतियों की आवश्यकता होती है।

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He2026-05-19
💻 computer science

CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability

यह शोध पत्र CVE-Factory को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो स्पार्स (sparse) CVE मेटाडेटा को उच्च-गुणवत्ता वाले, निष्पादन योग्य सुरक्षा कार्यों में स्वचालित रूप से परिवर्तित करता है ताकि LiveCVEBench बेंचमार्क और एक बड़े पैमाने के प्रशिक्षण डेटासेट का निर्माण किया जा सके, जिससे कोड एजेंटों की भेद्यता (vulnerability) का पता लगाने की क्षमताओं में महत्वपूर्ण सुधार होता है।

Xianzhen Luo, Jingyuan Zhang, Shiqi Zhou, Rain Huang, Chuan Xiao, Qingfu Zhu, Zhiyuan Ma, Xing Yue, Yang Yue, Wencong Ze (…)2026-05-19
🤖 machine learning

Mitigating Conversational Inertia in Multi-Turn Agents

यह शोधपत्र मल्टी-टर्न एलएलएम (LLM) एजेंटों में "कन्वर्सेशनल इनर्शिया" (संवादात्मक जड़ता) की पहचान करता है, जहाँ मॉडल त्रुटिवश अपनी ही पिछली प्रतिक्रियाओं की नकल करते हैं, और एक 'कॉन्टेक्स्ट प्रेफरेंस लर्निंग' (संदर्भ प्राथमिकता शिक्षण) ढांचे का प्रस्ताव करता है जो मॉडल को कम-जड़ता वाले कार्यों को प्राथमिकता देने के लिए कैलिब्रेट करता है, जिससे विभिन्न एजेंटिक वातावरणों में प्रदर्शन सुधारने के लिए अन्वेषण (exploration) और दोहन (exploitation) के बीच संतुलन बनाया जा सके।

Yang Wan, Zheng Cao, Zhenhao Zhang, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu2026-05-19