🤖 machine learning

LEAD: Length-Efficient Adaptive and Dynamic Reasoning for Large Language Models

यह शोध पत्र LEAD को प्रस्तुत करता है, जो एक नवीन विधि है जो सुदृढीकरण शिक्षण (reinforcement learning) के दौरान शुद्धता और दक्षता को गतिशील रूप से संतुलित करने के लिए ऑनलाइन, स्व-अनुकूली तंत्रों का उपयोग करती है, जिससे बड़े रीजनिंग मॉडल को विविध गणितीय बेंचमार्क में सटीकता से समझौता किए बिना काफी छोटे चेन-ऑफ-थॉट (Chain-of-Thought) आउटपुट उत्पन्न करने में सक्षम बनाया जा सके।

Songtao Wei, Yi Li, Zhikai Li, Xu Hu, Yuede Ji, Guanpeng Li, Feng Chen, Carl Yang, Zhichun Guo, Bingzhe Li2026-05-12
🤖 machine learning

Learning to Compress Time-to-Control: A Reinforcement Learning Framework for Chronic Disease Management

यह शोध पत्र क्रोनिक रोग प्रबंधन के लिए एक नवीन टू-लूप सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो नियंत्रण-तक-समय (टाइम-टू-कंट्रोल) को संकुचित करने के उद्देश्य को औपचारिक रूप देता है और नैदानिक क्षमता एवं निष्पादन तीव्रता की बाधाओं को एकीकृत करता है, जो उच्च रक्तचाप और टाइप 2 मधुमेह के सिमुलेशन में मानक दृष्टिकोणों की तुलना में बेहतर प्रदर्शन और सामान्यीकरण प्रदर्शित करता है।

Prabhjot Singh, Abhishek Gupta, Chris Betz, Abe Flansburg, Brett Ives, Sudeep Lama, Jung Hoon Son2026-05-12
🤖 machine learning

Pretraining large language models with MXFP4

यह शोध पत्र यह पहचान करता है कि वेट ग्रेडिएंट्स (Wgrad) का क्वांटाइजेशन बड़े भाषा मॉडलों के फुल-पाइपलाइन FP4 प्रशिक्षण में अस्थिरता का प्राथमिक कारण है और यह प्रदर्शित करता है कि अभिसरण स्थिरता (convergence stability) को बहाल करने के लिए स्टोकेस्टिक राउंडिंग के बजाय डिटरमिनिस्टिक हेडामार्ड रोटेशन आवश्यक हैं।

Musa Cim, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir2026-05-12
🤖 machine learning

Modeling Atomic Conformational Ensembles of Proteins via Test-Time Supervision of Boltz-2 on Cryo-EM Density Maps

यह शोध पत्र CryoSampler को प्रस्तुत करता है, जो एक नवीन विधि है जो सटीक परमाणु संरचनात्मक एंसेम्बल (conformational ensembles) उत्पन्न करने के लिए टेस्ट-टाइम सुपरविजन के माध्यम से कच्चे क्रायो-ईएम (cryo-EM) डेंसिटी मैप्स पर सीधे Boltz-2 जैसे प्री-ट्रेंड स्टैटिक स्ट्रक्चर प्रेडिक्शन मॉडल्स को फाइन-ट्यून करता है, जिससे पारंपरिक दो-चरणीय मॉडल बिल्डिंग को दरकिनार किया जा सके और इन-डोमेन सामान्यीकरण (in-domain generalization) की क्षमता प्रदर्शित की जा सके।

Jay Shenoy, Miro Astore, Axel Levy, Frédéric Poitevin, Sonya M. Hanson, Gordon Wetzstein2026-05-12
🔢 mathematics

Cross-Domain Lossy Compression via Constrained Minimum Entropy Coupling

यह शोध पत्र रेट और वर्गीकरण बाधाओं के तहत स्रोत-पुनर्निर्माण युग्मन शक्ति को अधिकतम करने वाले सीमित न्यूनतम एंट्रॉपी युग्मन पर आधारित एक क्रॉस-डोमेन लॉस्य संपीड़न ढांचे का प्रस्ताव करता है, जो सैद्धांतिक विश्लेषण और तंत्रिका प्रयोगों दोनों के माध्यम से यह प्रदर्शित करता है कि उच्च दर वर्गीकरण सटीकता और पुनर्निर्माण गुणवत्ता में सुधार करती है।

Nam Nguyen, Hassan Tavakoli, An Vuong, Thinh Nguyen, Bella Bose2026-05-12
📊 statistics

Supercharging Bayesian Inference with Reliable AI-Informed Priors

यह शोध पत्र सिंथेटिक डेटा उत्पन्न करने के लिए उपयोग किए जाने वाले AI-प्रेरित नियम को सुधारकर विश्वसनीय AI-सूचित प्रायों (priors) के निर्माण के लिए एक रूपरेखा प्रस्तावित करता है, जिससे मॉडल त्रुटि प्रसार को कम किया जा सके, पूर्वाग्रह को घटाया जा सके और डेटा-सीमित सेटिंग्स में अनुमान प्रदर्शन में सुधार किया जा सके।

Jongwoo Choi, Sean O'Hagan2026-05-12
🤖 machine learning

Free Energy Manifold: Score-Based Inference for Hybrid Bayesian Networks

यह शोधपत्र फ्री एनर्जी मैनिफोल्ड (FEM) को प्रस्तुत करता है, जो एक स्कोर-प्रशिक्षित कंडीशनल एनर्जी मॉडल है जो कंडीशनल फैक्टर्स को एनर्जी लैंडस्केप के रूप में निरूपित करके और मल्टीमॉडल एवं कंपोजिशनल सेटिंग्स में पोस्टीरियर सटीकता में उल्लेखनीय सुधार करने के लिए वैली रेगुलराइजेशन के माध्यम से "मोड-ब्रिज आर्टिफैक्ट" को संबोधित करके हाइब्रिड बायेसियन नेटवर्क में प्रभावी इन्फरेंस को सक्षम बनाता है।

Cheol Young Park, Shou Matsumoto2026-05-12
🤖 AI

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

यह शोध पत्र 'मेटाकॉग्निटिव प्रोब' (Metacognitive Probe) को प्रस्तुत करता है, जो एक पांच-कार्य वाला नैदानिक उपकरण है जो पांच अलग-अलग आयामों में LLMs के आत्मविश्वास व्यवहारों का मूल्यांकन करता है ताकि अति-आत्मविश्वास के उन छिपे हुए क्षेत्रों को उजागर किया जा सके जिन्हें एग्रीगेट बेंचमार्क छोड़ देते हैं, जो एक मॉडल की कार्य-विशिष्ट अंशांकन (calibration) और उसकी क्रॉस-टास्क कठिनाई भविष्यवाणी क्षमताओं के बीच 47-अंकों का महत्वपूर्ण विचलन प्रदर्शित करता है।

Rafael C. T. Oliveira2026-05-12
🤖 machine learning

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

यह शोध पत्र एक्सप्लोरेशन-ड्रिवन ऑप्टिमाइजेशन (EDO) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो iDPO और GRPO जैसी पुनरावृत्ति पोस्ट-ट्रेनिंग विधियों में विविधता-बढ़ाने वाले एक्सप्लोरेशन उद्देश्यों को एकीकृत करता है ताकि इन्फरेंस-टाइम सैंपलिंग विविधता और RL-प्रेरित वितरण शार्पनिंग के बीच के तनाव को हल किया जा सके, जिससे इन-डिस्ट्रीब्यूशन और आउट-ऑफ-डिस्ट्रीब्यूशन दोनों कार्यों में LLM रीजनिंग प्रदर्शन और स्थिरता को बढ़ाया जा सके।

Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai2026-05-12
📊 statistics

Unified Approach for Weakly Supervised Multicalibration

यह शोध पत्र एक एकीकृत ढांचे का प्रस्ताव करके उन कमजोर रूप से पर्यवेक्षित शिक्षण (weakly supervised learning) परिवेशों में मल्टीकैलिब्रेशन की चुनौती को संबोधित करता है जहाँ स्वच्छ लेबल उपलब्ध नहीं होते हैं, जो मल्टीकैलिब्रेशन त्रुटियों का अनुमान लगाने और उन्हें सुधारने के लिए कंटैमिनेशन-मैट्रिक्स रिराइट्स (contamination-matrix rewrites) को विटनेस-आधारित बाधाओं (witness-based constraints) के साथ जोड़ता है, और साथ ही 'वीक-लेबल मल्टीकैलिब्रेशन बूस्ट' (WLMC) नामक एक जेनेरिक पोस्ट-हॉक एल्गोरिदम प्रदान करता है जो परिमित-नमूना गारंटी (finite-sample guarantees) देता है।

Futoshi Futami, Takashi Ishida2026-05-12