🤖 machine learning

Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards

यह शोध पत्र "कॉन्टेक्स्टुअल रोलआउट बैंडिट्स" (Contextual Rollout Bandits) का प्रस्ताव करता है, जो एक एकीकृत न्यूरल शेड्यूलिंग फ्रेमवर्क है जो रोलआउट्स को कॉन्टेक्स्टुअल बैंडिट आर्म्स के रूप में मानता है ताकि उच्च-मूल्य वाले ऐतिहासिक डेटा को अनुकूल रूप से चुनने और पुन: उपयोग करने के लिए, बड़े भाषा मॉडलों के लिए सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (Reinforcement Learning with Verifiable Rewards - RLVR) में सैंपल दक्षता और प्रदर्शन में सुधार किया जा सके।

Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang2026-05-26
📊 statistics

Why Agentic Theorem Prover Works: A Statistical Provability Theory of Mathematical Reasoning Models

यह शोध पत्र एक सांख्यिकीय प्रमाणयोग्यता सिद्धांत स्थापित करता है जो औपचारिक प्रमाण खोज (formal proof search) को एक परिमित-क्षितिज MDP के रूप में मॉडल करता है ताकि यह प्रदर्शित किया जा सके कि कैसे रिट्रीवल (retrieval) और वेरिफिकेशन (verification) जैसे एजेंटिक घटक ऑक्यूपेंसी-वेटेड एक्शन-वैल्यू त्रुटियों को न्यूनतम करके प्रमाण सफलता में सुधार करते हैं, जिससे शास्त्रीय वर्स्ट-केस हार्डनेस (worst-case hardness) का खंडन किए बिना वास्तविक दुनिया के वर्कलोड पर उनकी प्रभावशीलता स्पष्ट होती है।

Sho Sonoda, Shunta Akiyama, Yuya Uezato2026-05-26
🤖 machine learning

LT2: Linear-Time Looped Transformers

यह शोध पत्र LT2 को प्रस्तुत करता है, जो लीनियर-टाइम लूप्ड ट्रांसफॉर्मर्स का एक परिवार है जो क्वाड्रेटिक अटेंशन को कुशल लीनियर या स्पार्स वेरिएंट से बदल देता है, यह प्रदर्शित करते हुए कि लूपिंग इन तंत्रों के साथ मिलकर भाषा मॉडलिंग कार्यों में बेहतर प्रदर्शन और स्केलेबिलिटी प्राप्त करने के लिए तालमेल बिठाती है।

Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu, Jiarui Liu, T. S. Eugene Ng, Hanjie Chen2026-05-26
🤖 AI

Confidence Calibration in Large Language Models

यह शोध पत्र एक पूर्व-पंजीकृत अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) में समग्र रूप से अति-आत्मविश्वास की प्रवृत्ति होती है, जो एक 'हार्ड-ईज़ी' प्रभाव द्वारा नियंत्रित होती है जहाँ कठिन कार्यों पर अति-आत्मविश्वास चरम पर होता है जबकि सरल कार्यों पर अल्प-आत्मविश्वास होता है, जिससे विभिन्न कठिनाई स्तरों पर अंशांकन (कैलिब्रेशन) के आकलन के लिए लाइफइवल (LifeEval) बेंचमार्क का विकास होता है।

Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore2026-05-26
🤖 machine learning

The Model Parking Tax: Quantifying the Hidden Energy Cost of Always-On GPU Model Deployment

यह शोध पत्र अनुभवजन्य रूप से यह प्रदर्शित करता है कि AI मॉडलों को GPU मेमोरी में रखे रखने की ऊर्जा लागत मुख्य रूप से VRAM अधिभोग (occupancy) के बजाय CUDA कॉन्टेक्स्ट के DVFS ट्रांज़िशन से होने वाली विवेकी (discrete) शक्ति वृद्धि द्वारा संचालित होती है, जो यह प्रकट करता है कि मॉडल परिनियोजन (deployment) के लिए ऊर्जा-इष्टतम रणनीति मॉडल के आकार के बजाय अनुरोध आगमन दरों और कोल्ड-स्टार्ट विलंबता (latency) पर निर्भर करती है।

Sai Sathvik Vadari2026-05-26
🤖 AI

High-Risk AI Systems and the Problem of Identity in the European AI Act

यह शोध पत्र यह तर्क देता है कि उच्च-जोखिम वाले एआई (AI) सिस्टम के लिए अस्पष्ट पहचान संबंधी निर्णयों पर यूरोपीय एआई (AI) अधिनियम की निर्भरता को "फंक्शन+" (function+) ढांचे को लागू करके हल किया जा सकता है, जो नियामक और शासन संदर्भों में सिंक्रोनिक पहचान (synchronic identity) के लिए एक ऑडिट योग्य, परिचालन मानक बनाने हेतु इच्छित कार्य (intended function) और विश्वसनीयता प्रोफाइल (trustworthiness profiles) के माध्यम से सिस्टम को विशिष्ट बनाता है।

Andrea Ferrario2026-05-26
🤖 AI

Quantum Frog: Emergent Cooperation and Difficulty Scaling in a Quantized-Time Cooperative Game

यह शोध पत्र "क्वांटम फ्रॉग" (Quantum Frog) प्रस्तुत करता है, जो एक क्वांटाइज्ड-टाइम सहकारी खेल है जहाँ सुदृढीकरण लर्निंग (reinforcement learning) यह प्रकट करती है कि सिंक्रोनाइज्ड रशिंग (synchronized rushing) ही इष्टतम रणनीति है, जो यह प्रदर्शित करता है कि सहकारी प्रशिक्षण, एपिसोड की लंबाई को कम करके और अनकॉर्डिनेटेड मल्टी-एजेंट इंटरेक्शन के गंभीर कठिनाई दंड (difficulty penalty) पर विजय प्राप्त करके, स्वतंत्र खेल की तुलना में काफी बेहतर प्रदर्शन करता है।

Saad Mankarious2026-05-26
🤖 AI

QUIVER: A Formal Framework for Quantifying Perturbation Propagation and Bifurcation in Compound AI Systems

यह शोध पत्र QUIVER को प्रस्तुत करता है, जो संवेदनशीलता मैट्रिसेस (sensitivity matrices), प्रक्षेप विक्षेपण मेट्रिक्स (trajectory divergence metrics) और द्विभाजन थ्रेशोल्ड (bifurcation thresholds) को परिभाषित करके कंपाउंड AI सिस्टम में विक्षोभ प्रसार (perturbation propagation) और संरचनात्मक द्विभाजन (structural bifurcation) को परिमाणित करने वाला एक औपचारिक ढांचा है, जिसे विविध प्रोडक्शन और पब्लिक पाइपलाइनों में मान्य किया गया है ताकि विशिष्ट संवेदनशीलता प्रोफाइल को प्रकट किया जा सके और मूल्यांकन आर्टिफैक्ट्स (evaluation artifacts) को स्थानीयकृत किया जा सके।

Prashanti Nilayam, Sankalp Nayak2026-05-26
🤖 AI

Low-Cost Labels, Reliable Choices: Rollout-Calibrated Hyper-Heuristics for Job Shop Scheduling

यह शोध पत्र जॉब शॉप शेड्यूलिंग के लिए एक विश्वसनीय, कम लागत वाले लर्निंग-असिस्टेड हाइपर-ह्यूरिस्टिक का प्रस्ताव करता है जो रिग्रेट-नॉर्मलाइज्ड रोलआउट लेबल्स, कॉन्टेक्स्टुअल KNN अनसर्टेन्टी एस्टीमेट्स और एक गेटेड डिसीजन मैकेनिज्म को जोड़कर महंगे लेबल जनरेशन को कम करता है और चयन स्थिरता सुनिश्चित करता है।

Junhao Wei, Yanxiao Li, Yifu Zhao, Zhenhong Peng, Baili Lu, Dexing Yao, Haochen Li, Qinbin He, Sio-Kei Im, Yapeng Wang (…)2026-05-26
🧬 biology

Learning Protein Structure-Function Relationships through Knowledge-guided Representation Decomposition

यह शोध पत्र ProtDiS को प्रस्तुत करता है, जो एक ज्ञान-निर्देशित ढांचा (knowledge-guided framework) है जो सूचना अवरोध सिद्धांत (information bottleneck principle) का उपयोग करके उलझे हुए प्रोटीन एम्बेडिंग को जैविक रूप से आधारित, स्वतंत्र आयामों में विघटित करता है, जिससे विविध डाउनस्ट्रीम कार्यों में प्रोटीन संरचना-कार्य मॉडलिंग की व्याख्यात्मकता और प्रदर्शन में वृद्धि होती है।

Mingqing Wang, Zhiwei Nie, Athanasios V. Vasilakos, Yonghong He, Zhixiang Ren2026-05-26