🤖 AI

Robust Shielding for Safe Reinforcement Learning

यह शोध पत्र रोबस्ट मार्कोव निर्णय प्रक्रियाओं (Markov decision processes) के लिए एक नवीन, सुदृढ़ और इष्टतम शिल्डिंग फ्रेमवर्क प्रस्तुत करता है जो सैंपलिंग विधियों के साथ संयोजन करते हुए, सीखी गई मॉडलों के लिए प्रोबेबली एप्रोक्सिमेटली करेक्ट (PAC) सुरक्षा गारंटी प्रदान करने के लिए, सबसे खराब स्थिति वाली ट्रांज़िशन अनिश्चितताओं के तहत सुदृढीकरण लर्निंग (reinforcement learning) एजेंटों की सुरक्षा सुनिश्चित करता है।

Edwin Hamel-De le Court, Thom Badings, Alessandro Abate, Francesco Belardinelli, Francesco Fabiano2026-06-02
🤖 machine learning

Bit-Exact AI Inference Verification Without Performance Tradeoffs

यह शोध पत्र यह प्रदर्शित करता है कि नियत (deterministic) आउटपुट को पुन: गणना करने के लिए केवल सॉफ्टवेयर-आधारित इम्यूलेशन का लाभ उठाकर, बिना किसी प्रदर्शन संबंधी समझौते के बिट-सटीक (bit-exact) AI इन्फरेंस सत्यापन प्राप्त किया जा सकता है, जिससे संचित राउंडिंग त्रुटियों को ऑडिट योग्य हस्ताक्षरों में परिवर्तित किया जा सके जो गुप्त विरोधियों को GPU गैर-नियतता (non-determinism) का लाभ उठाने से रोकते हैं।

Naci Cankaya2026-06-02
🔬 physics

Flow Matching for Convective-Scale Precipitation Downscaling

यह शोध पत्र प्रदर्शित करता है कि सिंगापुर के ऊपर 8 किमी से 2 किमी तक डाउनस्केलिंग करते समय एक फ्लो मैचिंग मॉडल, संवहनी-पैमाने की वर्षा की स्थानिक संरचना को पकड़ने में स्कोर-आधारित डिफ्यूजन मॉडल से बेहतर प्रदर्शन करता है, हालांकि यह वर्षा वितरण के ऊपरी छोर (upper tail) में एक शुष्क पूर्वाग्रह (dry bias) प्रदर्शित करता है।

Tom Wetherell2026-06-02
🤖 machine learning

The Representation-Rationalizability Tradeoff in Reward Learning

यह शोध पत्र विषम युग्म-आधारित प्राथमिकताओं (heterogeneous pairwise preferences) से सुसंगत रिवॉर्ड लर्निंग की सामाजिक चयन असंभवता (social choice impossibility) को आधुनिक RLHF पाइपलाइनों में एक मौलिक ट्रेड-ऑफ के रूप में पुनर्गठित करता है, जो यह प्रदर्शित करता है कि समृद्ध प्रतिक्रिया प्रतिनिधित्व (richer response representations) प्रतिनिधित्व त्रुटि (representational error) को कम करते हैं, जबकि साथ ही अधिक असंगत तुलनाओं को उजागर करके एकत्रीकरण त्रुटि (aggregation error) को बढ़ाते हैं जिन्हें कोई भी स्केलर रिवॉर्ड हल नहीं कर सकता।

Jing Dong, Yaoliang Yu, Pascal Pourpart2026-06-02
📊 statistics

Is Zero-Shot Super-Resolution Possible in Operator Learning?

यह शोध पत्र ऑपरेटर लर्निंग में ज़ीरो-शॉट सुपर-रिज़ॉल्यूशन का एक व्यवस्थित सैद्धांतिक अध्ययन प्रदान करता है, जो यह प्रदर्शित करता है कि हालांकि कुछ सेटिंग्स में यह सूचनात्मक रूप से असंभव हो सकता है, आउटपुट फलनों की हॉल्डर स्मूथनेस (Hölder smoothness) इसकी सफलता के लिए एक पर्याप्त स्थिति के रूप में कार्य करती है, एक ऐसा निष्कर्ष जिसे प्राप्त जनरलाइजेशन बाउंड्स और प्रयोगात्मक सत्यापन दोनों द्वारा समर्थित किया गया है।

Unique Subedi, Ambuj Tewari2026-06-02
🤖 machine learning

FLaG: Fine-Grained Latent Grouping for Hallucination Detection

FLaG एक हल्का, फ्रोजन-मॉडल फ्रेमवर्क है जो ऊर्जा-आधारित लेटेंट एविडेंस ग्रुपिंग और सिद्धांत-आधारित लॉग-मार्जनल एग्रीगेशन के माध्यम से उन्हें विषम विफलता तंत्रों के रूप में मॉडल करके LLM मतिभ्रम (hallucinations) का पता लगाता है, जो अंतर्निहित मॉडल को संशोधित किए बिना विविध बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Wentao Ye, Liyao Li, Zhiqing Xiao, Muzhi Zhu, Jiaqi Hu, Zhanming Shen, Xiaomeng Hu, Sean Du, Haobo Wang2026-06-02
🤖 machine learning

Rethinking the Role of Temperature in Large Language Model Distillation

यह शोध पत्र यह प्रदर्शित करके LLM डिस्टिलेशन में रिवर्स KL डाइवर्जेंस (Reverse KL divergence) के प्रति प्रचलित प्राथमिकता को चुनौती देता है कि टेम्परेचर स्केलिंग (temperature scaling) को शामिल करना प्रदर्शन परिदृश्य को मौलिक रूप से बदल देता है, जिससे फॉरवर्ड KL (Forward KL), उच्च तापमान पर लगातार रिवर्स KL से बेहतर प्रदर्शन करने में सक्षम होता है और सरल KL-आधारित तरीकों को अत्याधुनिक दृष्टिकोणों के बराबर लाने में सक्षम बनाता है।

Hoang-Chau Luong, Lingwei Chen2026-06-02
🔢 mathematics

Stochastic Rounding Increases Small Singular Values

यह शोध पत्र प्रदर्शित करता है कि स्टोकेस्टिक राउंडिंग (stochastic rounding) एक सामान्य स्पेक्ट्रल रेगुलराइज़र (spectral regularizer) के रूप में कार्य करती है, जो अत्यधिक और स्थिर पहलू अनुपात (aspect ratios) वाली मैट्रिसेस में न केवल सबसे छोटे सिंगुलर मान (singular value) को, बल्कि पूंछ वाले सिंगुलर मानों (tail singular values) के संपूर्ण क्लस्टर्स को भी ऊपर उठाती है।

Linkai Ma, Tingzhou Yu, Petros Drineas2026-06-02
🤖 machine learning

Adversarially Robust Control of Conditional Value-at-Risk via Rockafellar-Uryasev Conformal Inference

यह शोधपत्र रॉकैफेल-उर्यासेव वेरिएशनल रिप्रजेंटेशन और कॉन्फॉर्मल इन्फरेंस का लाभ उठाकर गैर-स्थिर (non-stationary) और प्रतिकूल वातावरण में कंडीशनल वैल्यू-एट-रिस्क (CVaR) को नियंत्रित करने के लिए एक ऑनलाइन, डिस्ट्रीब्यूशन-फ्री फ्रेमवर्क प्रस्तुत करता है, जो स्टेशनैरिटी मान्यताओं पर निर्भर किए बिना प्रमाणित सुरक्षा गारंटी प्रदान करता है।

Catherine Chen, Jingyan Shen, Zhun Deng, Lihua Lei2026-06-02
📊 statistics

Cluster Analysis with Resampling for Validation and Exploration (CARVE)

यह शोध पत्र CARVE को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन और आर पैकेज है जो जटिल, उच्च-आयामी बायोमेडिकल डेटा पर पारंपरिक ज्यामितीय सत्यापन सूचकांकों से बेहतर प्रदर्शन करने के लिए रीसैंपलिंग-आधारित स्थिरता और सामान्यीकरण निदान का उपयोग करके क्लस्टरिंग में पुनरुत्पादकता संकट को संबोधित करता है।

Kai R. Wycik, Tiffany M. Tang, Tarek M. Zikry, Genevera I. Allen2026-06-02