💻 computer science

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

यह अध्ययन प्रकट करता है कि RL-प्रशिक्षित लीन (Lean) प्रमेय सिद्ध करने वाले (theorem provers) इन्फरेंस-टाइम मोड कोलैप्स (inference-time mode collapse) से ग्रस्त होते हैं, जिसे विविध टैक्टिक स्केलेटन (diverse tactic skeletons) के एक निश्चित शेड्यूल को लागू करके प्रभावी ढंग से कम किया जा सकता है जिससे महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं, जबकि प्रॉम्प्ट पैराफ्रेसिंग (prompt paraphrasing) और अप्रासंगिक टिप्पणियाँ अप्रभावी या हानिकारक सिद्ध होती हैं।

Zachary Burton2026-05-19
🤖 machine learning

PyHealth 2.0: A Comprehensive Open-Source Toolkit for Accessible and Reproducible Clinical Deep Learning

PyHealth 2.0 एक उन्नत ओपन-सोर्स टूलकिट है जो विविध डेटासेट्स, मॉडल्स और कार्यों को एक एकल, अत्यधिक कुशल फ्रेमवर्क में एकीकृत करके क्लिनिकल डीप लर्निंग रिसर्च का लोकतंत्रीकरण करता है, जो केवल सात लाइनों के कोड में प्रेडिक्टिव मॉडलिंग को सक्षम बनाता है और साथ ही कंप्यूटेशनल लागतों और डोमेन विशेषज्ञता की बाधाओं को महत्वपूर्ण रूप से कम करता है।

John Wu, Yongda Fan, Zhenbang Wu, Paul Landes, Eric Schrock, Sayeed Sajjad Razin, Arjun Chatterjee, Naveen Baskaran, Jos (…)2026-05-19
💻 computer science

Enhancing Table Reasoning with Deterministic Table-State Rewards

यह शोध पत्र 'लॉन्गेस्ट कॉमन सबसीक्वेंस' (Longest Common Subsequence) पर आधारित एक प्रशिक्षण-मुक्त नियतात्मक रिवॉर्ड मेट्रिक, TABROUGE, और RE-TAB फ्रेमवर्क को प्रस्तुत करता है, जो बिना किसी सीखे हुए मॉडल या बाहरी निष्पादक (external executor) पर निर्भर रहे, मध्यवर्ती अवस्थाओं के लिए स्केलेबल और क्वेरी-आधारित फीडबैक प्रदान करके लार्ज लैंग्वेज मॉडल्स की बहु-चरणीय तालिका तर्क (multi-step table reasoning) सटीकता को महत्वपूर्ण रूप से बढ़ाता है।

Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying (…)2026-05-19
🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

यह शोध पत्र LaDi-RL का प्रस्ताव करता है, जो एक सुव्यवस्थित तर्क प्रक्षेप पथ (reasoning trajectories) उत्पन्न करने के लिए लेटेंट डिफ्यूजन मॉडल का उपयोग करता है और पदानुक्रमित लेटेंट-टेक्स्ट रोलआउट्स (hierarchical latent-text rollouts) को नियोजित करता है ताकि लेटेंट प्लानिंग की गुणवत्ता को टेक्स्ट डिकोडिंग त्रुटियों से अलग किया जा सके, जिससे एंट्रॉपी कोलैप्स (entropy collapse) को रोका जा सके और कोड एवं गणितीय तर्क कार्यों पर पारंपरिक टोकन-स्तरीय RL की तुलना में काफी बेहतर प्रदर्शन किया जा सके।

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin2026-05-19
💬 NLP

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

यह शोध पत्र डीप डेटा रिसर्च (DDR) और इसके संगत बेंचमार्क, DDR-Bench को प्रस्तुत करता है, जो कच्चे डेटा से स्वायत्त रूप से अंतर्दृष्टि निकालने में एजेंटिक लार्ज लैंग्वेज मॉडल्स की खोजी बुद्धिमत्ता का मूल्यांकन करता है, और यह प्रकट करता है कि जबकि फ्रंटियर मॉडल्स उभरती हुई एजेंसी प्रदर्शित करते हैं, प्रभावी लॉन्ग-होरिजन अन्वेषण के लिए केवल स्केलिंग या स्कैफोल्डिंग से परे आंतरिक रणनीतियों की आवश्यकता होती है।

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He2026-05-19
💻 computer science

CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability

यह शोध पत्र CVE-Factory को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो स्पार्स (sparse) CVE मेटाडेटा को उच्च-गुणवत्ता वाले, निष्पादन योग्य सुरक्षा कार्यों में स्वचालित रूप से परिवर्तित करता है ताकि LiveCVEBench बेंचमार्क और एक बड़े पैमाने के प्रशिक्षण डेटासेट का निर्माण किया जा सके, जिससे कोड एजेंटों की भेद्यता (vulnerability) का पता लगाने की क्षमताओं में महत्वपूर्ण सुधार होता है।

Xianzhen Luo, Jingyuan Zhang, Shiqi Zhou, Rain Huang, Chuan Xiao, Qingfu Zhu, Zhiyuan Ma, Xing Yue, Yang Yue, Wencong Ze (…)2026-05-19
🤖 machine learning

Mitigating Conversational Inertia in Multi-Turn Agents

यह शोधपत्र मल्टी-टर्न एलएलएम (LLM) एजेंटों में "कन्वर्सेशनल इनर्शिया" (संवादात्मक जड़ता) की पहचान करता है, जहाँ मॉडल त्रुटिवश अपनी ही पिछली प्रतिक्रियाओं की नकल करते हैं, और एक 'कॉन्टेक्स्ट प्रेफरेंस लर्निंग' (संदर्भ प्राथमिकता शिक्षण) ढांचे का प्रस्ताव करता है जो मॉडल को कम-जड़ता वाले कार्यों को प्राथमिकता देने के लिए कैलिब्रेट करता है, जिससे विभिन्न एजेंटिक वातावरणों में प्रदर्शन सुधारने के लिए अन्वेषण (exploration) और दोहन (exploitation) के बीच संतुलन बनाया जा सके।

Yang Wan, Zheng Cao, Zhenhao Zhang, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu2026-05-19
💻 computer science

Position: Universal Time Series Foundation Models Rest on a Category Error

यह स्थिति पत्र (position paper) यह तर्क देता है कि सार्वभौमिक टाइम सीरीज़ फाउंडेशन मॉडल्स की खोज मौलिक रूप से त्रुटिपूर्ण है क्योंकि यह संरचनात्मक कंटेनरों (structural containers) और अर्थपूर्ण मोडैलिटीज़ (semantic modalities) के बीच एक श्रेणी संबंधी त्रुटि (category error) है, और इसके बजाय एक 'कॉज़ल कंट्रोल एजेंट' (Causal Control Agent) प्रतिमान का समर्थन करता है जो वितरण संबंधी विचलन (distributional drift) और हस्तक्षेप-संचालित शासन परिवर्तनों (intervention-driven regime shifts) को प्रभावी ढंग से संभालने के लिए विशिष्ट सॉल्वर्स (specialized solvers) को व्यवस्थित करता है।

Xilin Dai, Wanxu Cai, Zhijian Xu, Qiang Xu2026-05-19
🤖 machine learning

SuReNav: Superpixel Graph-based Constraint Relaxation for Navigation in Over-constrained Environments

SuReNav एक सुपरपिक्सेल ग्राफ-आधारित फ्रेमवर्क है जो अर्ध-स्थिर (semi-static) वातावरणों में मानव प्रदर्शनों पर प्रशिक्षित ग्राफ न्यूरल नेटवर्क का उपयोग करके क्षेत्रीय बाधाओं को शिथिल करता है, जिससे सिमुलेटेड और वास्तविक दुनिया के शहरी परिवेशों में सुरक्षित, कुशल और मानव-समान पथ नियोजन सक्षम होता है, और यह अर्ध-प्रतिबंधित नेविगेशन की समस्या का समाधान करता है।

Keonyoung Koh, Moonkyeong Jung, Samuel Seungsup Lee, Daehyung Park2026-05-19
🤖 AI

The Laplacian Keyboard: Beyond the Linear Span

यह शोध पत्र लैपलेसियन कीबोर्ड (Laplacian Keyboard) का परिचय देता है, जो एक पदानुक्रमित ढांचा (hierarchical framework) है जो लैपलेसियन आइजनवेक्टर्स (Laplacian eigenvectors) से व्यवहारों का एक कार्य-अज्ञेय लाइब्रेरी (task-agnostic library) निर्मित करता है और उन्हें गतिशील रूप से जोड़ने के लिए एक मेटा-पॉलिसी सीखता है, जिससे रैखिक विस्तार-आधारित (linear span-based) ज़ीरो-शॉट नियंत्रण की अभिव्यक्ति संबंधी सीमाओं को पार करने और सुदृढीकरण शिक्षण (reinforcement learning) में बेहतर नमूना दक्षता (sample efficiency) प्राप्त करने में सफलता मिलती है।

Siddarth Chandrasekar, Marlos C. Machado2026-05-19