💬 NLP

Process Rewards with Learned Reliability

यह शोधपत्र BetaPRM को प्रस्तुत करता है, जो एक वितरण संबंधी प्रोसेस रिवॉर्ड मॉडल (distributional Process Reward Model) है जो स्टेप-लेवल सफलता की संभावनाओं और उनकी विश्वसनीयता दोनों का पूर्वानुमान लगाता है ताकि एडेप्टिव कंप्यूटेशन एलोकेशन (Adaptive Computation Allocation) को सक्षम बनाया जा सके, जो भविष्यवाणी के आत्मविश्वास के आधार पर गणना को गतिशील रूप से समायोजित करके बेस्ट-ऑफ-एन (Best-of-N) रीजनिंग में सटीकता-टोकन ट्रेडऑफ़ में महत्वपूर्ण सुधार करता है।

Jinyuan Li, Langlin Huang, Chengsong Huang, Shaoyang Xu, Donghong Cai, Yuyi Yang, Wenxuan Zhang, Jiaxin Huang2026-05-18
🤖 machine learning

DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation

यह शोध पत्र डेल्टाप्रॉम्प्ट्स (DeltaPrompts) का परिचय देता है, जो एक चरणबद्ध पाइपलाइन द्वारा निर्मित 200k सिंथेटिक रीजनिंग समस्याओं का एक डेटासेट है जो "ज़ीरो-डेल्टा" प्रॉम्प्ट्स को लक्षित करता है जहाँ शिक्षक और छात्र मॉडल सहमत होते हैं, जिससे लर्निंग सिग्नल अधिकतम होता है और विविध मल्टीमॉडल डिस्टिलेशन परिदृश्यों में 15% तक सापेक्ष प्रदर्शन सुधार प्राप्त होता है।

Jaehun Jung, Hyunwoo Kim, Brandon Cui, Ximing Lu, David Acuna, Prithviraj Ammanabrolu, Yejin Choi2026-05-18
🤖 machine learning

Characterizing Learning in Deep Neural Networks using Tractable Algorithmic Complexity Analysis

यह शोध पत्र क्वांटाइज्ड ब्लॉक डिकंपोजिशन (QuBD) पद्धति को प्रस्तुत करता है, जो डीप न्यूरल नेटवर्क वेट्स की कोलमोगोरोव-चैटिन-सोलोमोनल जटिलता का अनुमान लगाने के लिए एक स्केलेबल एल्गोरिदम है, जो यह प्रकट करता है कि लर्निंग के दौरान एल्गोरिद्मिक जटिलता घटती है, जनरलाइजेशन के साथ सह-संबंध रखती है, और प्रभावी मॉडल क्वांटाइजेशन के लिए महत्वपूर्ण बिट-प्लेन की पहचान करती है।

Pedram Bakhtiarifard, Sophia N. Wilson, Mahmoud Afifi, Jonathan Wenshøj, Raghavendra Selvan2026-05-18
💬 NLP

When Latent Geometry Is Not Enough: Draft-Conditioned Latent Refinement for Non-Autoregressive Text Generation

यह शोध पत्र यह तर्क देता है कि नॉन-ऑटोरेग्रेसिव टेक्स्ट जनरेशन के लिए केवल लेटेंट ज्योमेट्री (latent geometry) अपर्याप्त है, यह प्रदर्शित करते हुए कि फुल-डायमेंशनल BERT लेटेंट्स और डिकोडर-अवेयर इवैल्यूएशन मेट्रिक्स के साथ ड्राफ्ट-कंडीशन्ड लेटेंट रिफाइनमेंट, केवल ज्यामितीय संरेखण या संकुचित निरूपणों पर निर्भर दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है।

De Shuai Zhang2026-05-18
⚡ electrical engineering

CrystalBoltz: End-to-End Protein Structure Determination via Experiment-Guided Diffusion for X-Ray Crystallography

क्रिस्टलबोल्ट्ज़ (CrystalBoltz) एक जनरेटिव फ्रेमवर्क है जो एक्स-रे क्रिस्टलोग्राफी में 'फेज प्रॉब्लम' को हल करने के लिए एक्सपेरिमेंट-गाइडेड पोस्टीरियर सैंपलिंग का लाभ उठाता है, जिससे मौजूदा रिफाइनमेंट विधियों की तुलना में बेहतर संरचनात्मक सटीकता और काफी तेज़ रनटाइम प्राप्त होता है।

Minseo Kim, Huanghao Mai, Jay Shenoy, Alec Follmer, Gordon Wetzstein, Frederic Poitevin2026-05-18
📊 statistics

MaxSketch: Robust Distinct Counting in Streams via Random Projections

यह शोधपत्र MaxSketch प्रस्तुत करता है, जो एक रैंडम प्रोजेक्शन-आधारित एल्गोरिदम है जो शोर वाले, उच्च-आयामी डेटा स्ट्रीम्स में विशिष्ट गणनाओं (distinct counts) का मजबूती से अनुमान लगाने के लिए सीखे गए निरूपणों (learned representations) में ज्यामितीय संरचना का लाभ उठाता है, ताकि शास्त्रीय स्केच और पूर्ववर्ती वर्स्ट-केस सीमाओं की सीमाओं को पार करते हुए निकट-इष्टतम लघुगणकीय मेमोरी जटिलता प्राप्त की जा सके।

Nikos Tsikouras, Constantine Caramanis, Christos Tzamos2026-05-18
💬 NLP

Calibrating LLMs with Semantic-level Reward

यह शोध पत्र कैलिब्रेशन विद सिमेंटिक रिवॉर्ड (CSR) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो असंगत मौखिक रूप से व्यक्त किए गए आत्मविश्वास स्कोर के स्थान पर एक अर्थगत-स्तर (semantic-level) के रिवॉर्ड का उपयोग करके लार्ज लैंग्वेज मॉडल्स के अनिश्चितता कैलिब्रेशन में सुधार करता है, जो सही आउटपुट्स के बीच सहमति को प्रोत्साहित करता है और गलत आउटपुट्स के बीच बना हुआ बनावटी सामंजस्य को हतोत्साहित करता है, जिससे विभिन्न बेंचमार्क पर काफी कम त्रुटि दर और उच्च विश्वसनीयता प्राप्त होती है।

Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu2026-05-18
🤖 machine learning

CM-EVS: Sparse Panoramic RGB-D-Pose Data for Complete Scene Coverage

यह शोध पत्र CM-EVS को प्रस्तुत करता है, जो विविध 3D एसेट्स से प्राप्त एक स्पार्स पैनोरमिक RGB-D-pose डेटासेट है, जिसे प्रशिक्षण-मुक्त COVER एल्गोरिदम का उपयोग करके तैयार किया गया है, जो 3D विजुअल लर्निंग के लिए न्यूनतम रेडंडेंसी और ऑडिट करने योग्य प्रोवेनेंस के साथ पूर्ण दृश्य कवरेज सुनिश्चित करने हेतु ज्यामितीय रूप से सुसंगत व्यू पॉइंट्स को कुशलतापूर्वक क्यूरेट करता है।

Jiale Liu, Jungang Li, Jieming Yu, Xinglin Yu, Zihao Dongfang, Zongjian Ding, Kaifeng Ding, Yi Yang, Lidong Chen, Yang Z (…)2026-05-18
💬 NLP

VSPO: Vector-Steered Policy Optimization for Behavioral Control

यह शोध पत्र वेक्टर-स्टीयर्ड पॉलिसी ऑप्टिमाइज़ेशन (VSPO) को प्रस्तुत करता है, जो एक नवीन विधि है जो रोलआउट सैंपलिंग के दौरान व्यवहारिक तीव्रता को नियंत्रित करने के लिए स्टीयरिंग वेक्टर्स का उपयोग करने हेतु GRPO को संशोधित करती है, जिससे स्पार्स रिवॉर्ड बॉटलनैक्स (sparse reward bottlenecks) कम होते हैं और कई रीजनिंग बेंचमार्क पर बेहतर व्यवहारिक नियंत्रण और कार्य सटीकता प्राप्त करने के लिए पॉलिसी ऑप्टिमाइज़ेशन को प्रमाणित रूप से त्वरित किया जाता है।

Xuechen Zhang, Zijian Huang, Kai Yang, Weijia Zhang, Jiasi Chen, Samet Oymak2026-05-18
🤖 machine learning

Neutral-Reference Prompting for Vision-Language Models

यह शोध पत्र NeRP का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले प्रॉम्प्टिंग सुधार रणनीति है जो न्यूट्रल टेक्स्ट प्रॉम्प्ट्स और रेफरेंस इमेजेस का लाभ उठाकर विजन-लैंग्वेज मॉडल्स में बेस-न्यू ट्रेड-ऑफ को कम करती है, ताकि बिना मॉडल पैरामीटर्स को संशोधित किए अनदेखी क्लासेज पर पूर्व-प्रधान (prior-dominated) गलत भविष्यवाणियों को सुधारा जा सके।

Senmao Tian, Xiang Wei, Shunli Zhang2026-05-18