🤖 AI

From Static Context to Calibrated Interactive RL: Mitigating Distribution Shift in Multi-turn Dialogue with Aligned Simulator

यह शोध पत्र कैलिब्रेटेड इंटरैक्टिव आरएल (Calibrated Interactive RL) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो सिम्युलेटर्स को मानवीय संवाद पैटर्न के साथ संरेखित करके मल्टी-टर्न डायलॉग में संचयी वितरण बदलाव (compounding distribution shift) को कम करता है, जिससे स्टेटिक कॉन्टेक्स्ट और अनकैलिब्रेटेड इंटरैक्टिव बेसलाइन्स की तुलना में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xiaohua Wang, Jiakang Yuan, Zisu Huang, Muzhao Tian, Changze Lv, Kaitao Song, Tao Chen, Xiaoqing Zheng2026-05-27
📊 statistics

Confounder Detection via Treatment Intent: A New Observational Study Design

यह शोध पत्र "उपचार के इरादे के माध्यम से कन्फाउंडर का पता लगाना" (confounder detection via treatment intent) नामक एक नवीन अवलोकन संबंधी अध्ययन डिजाइन प्रस्तुत करता है, जो अनअवगत कन्फाउंडर्स को उजागर करने के लिए मेल किए गए रोगी युग्मों के विशेषज्ञ तुलनाओं का लाभ उठाता है, और चिकित्सक के ज्ञान के प्रॉक्सी के रूप में आईसीयू इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड में नैदानिक पाठ नोट्स का उपयोग करके छिपे हुए पूर्वाग्रहों की पहचान करने में इसकी प्रभावकारिता को प्रमाणित करता है।

Drago Plecko, Patrik Okanovic, Torsten Hoefler, Elias Bareinboim2026-05-27
🤖 machine learning

When Does Deep RL Beat Calibrated Baselines? A Benchmark Study on Adaptive Resource Control

यह शोध पत्र RLScale-Bench प्रस्तुत करता है, जो एक पुनरुत्पादक बेंचमार्क है जो यह प्रदर्शित करता है कि एक उचित रूप से कैलिब्रेटेड नियम-आधारित ऑटोस्केलर विविध वर्कलोड्स में लागत दक्षता के मामले में छह मुख्यधारा के डीप रिइन्फोर्समेंट लर्निंग एल्गोरिदम को लगातार पीछे छोड़ देता है, जो इस धारणा को चुनौती देता है कि एडेप्टिव रिसोर्स कंट्रोल के लिए DRL स्वाभाविक रूप से श्रेष्ठ है।

Guilin Zhang, Chuanyi Sun, Kai Zhao, Shahryar Sarkani, John Fossaceca2026-05-27
🤖 AI

Uniboost: Global Coordination with Value Alignment for Fair and Efficient Traffic Allocation

Uniboost बड़े पैमाने के अनुशंसा तंत्र (recommendation systems) के लिए एक एकीकृत ट्रैफ़िक आवंटन ढांचा है जो मॉडल स्कोर को व्यावसायिक अर्थों (business semantics) के साथ कैलिब्रेट करने के लिए एक पोस्टीरियर वैल्यू एलाइनमेंट मैकेनिज्म और जटिल वेटिंग स्कीम्स को अलग करने के लिए एक स्वतंत्र लीनियर बूस्टिंग प्रतिमान (paradigm) पेश करके निष्पक्षता और दक्षता को बढ़ाता है।

Ge Fan, Nan Zhao, Kai Meng, Cong Luo, Yang Fu, Huiping Chu, Jialin Liu, Yuning Jiang, Bo Zheng2026-05-27
💬 NLP

LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness

यह शोध पत्र LURE को प्रस्तुत करता है, जो एजेंटिक इंटरेक्शन ट्राजेक्टरीज (agentic interaction trajectories) को पुन: प्रस्तुत करके यथार्थवादी, परिनियोजन-समान (deployment-like) मूल्यांकन का निर्माण करके AI सुरक्षा बेंचमार्क की वैधता को बढ़ाता है, जिससे मूल्यांकन जागरूकता के कारण मॉडलों के अपने व्यवहार को बदलने की समस्या को कम किया जा सके।

Igor Ivanov, David Demitri Africa2026-05-27
🤖 AI

Cross-scale Aligned Supervision for Training GANs

यह शोध पत्र CAT (क्रॉस-स्केल अलाइन्ड ट्रांसफॉर्मर) को प्रस्तुत करता है, जो एक नवीन GAN प्रशिक्षण ढांचा है जो मध्यवर्ती आउटपुट को अंतिम छवि के साथ संरेखित करने के लिए निरंतरता नियमितीकरण (consistency regularization) जोड़कर क्रॉस-स्केल प्रक्षेपवक्र मिसअलाइनमेंट (cross-scale trajectory misalignment) की समस्या को हल करता है, जिससे ImageNet-256 पर अत्याधुनिक एक-चरण अनुमान (one-step inference) प्रदर्शन प्राप्त होता है।

Sangeek Hyun, MinKyu Lee, Jae-Pil Heo2026-05-27
💬 NLP

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

यह शोध पत्र Verus-SpecGym प्रस्तुत करता है, जो Rust सत्यापन के लिए अनौपचारिक प्रोग्रामिंग समस्याओं को निष्ठावान औपचारिक विनिर्देशों (formal specifications) में अनुवादित करने की LLMs की क्षमता का मूल्यांकन करने के लिए एक एजेंटिक वातावरण और बेंचमार्क है, जो यह प्रकट करता है कि जहाँ फ्रंटियर मॉडल आशाजनक दिखते हैं, वहीं उनके आउटपुट अभी भी नाजुक हैं और सूक्ष्म त्रुटियों के प्रति संवेदनशील हैं जिन्हें मानक LLM जज अक्सर अनदेखा कर देते हैं।

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parn (…)2026-05-27
💬 NLP

Towards Error-Free EHRs: Reasoning-Intensive Consistency Verification Between Clinical Notes and Structured Tables in Electronic Health Records

यह शोध पत्र EHR-ReasonCon प्रस्तुत करता है, जो इलेक्ट्रॉनिक हेल्थ रिकॉर्ड्स में क्लिनिकल नोट्स और स्ट्रक्चर्ड टेबल्स के बीच तर्क-गहन निरंतरता सत्यापन (reasoning-intensive consistency verification) के लिए एक नया विशेषज्ञ-एनोटेटेड बेंचमार्क है, साथ ही EHR-Inspector भी प्रस्तुत करता है, जो एक LLM-आधारित फ्रेमवर्क है जो सतही मिलान की सीमाओं को दूर करने के लिए टेम्पोरल रीजनिंग और टेबल-एक्सप्लोरेशन टूल्स का लाभ उठाकर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Yeonsu Kwon, Jiho Kim, Junseong Choi, Paloma Rabaey, Minseo Kim, Sujeong Im, Jeewon Yang, Jun-Min Lee, Sangji Lee, Jiwon (…)2026-05-27
🤖 machine learning

Diffuse to Detect: Generative Diffusion Models for Unsupervised IC Anomaly Detection

यह शोध पत्र एकीकृत परिपथों (इंटीग्रेटेड सर्किट्स) के लिए पहले अनसुपरवाइज्ड एनोमली डिटेक्शन फ्रेमवर्क का प्रस्ताव करता है जो दुर्लभ लेटेंट दोषों की पहचान करने के लिए लेबल किए गए उदाहरणों या मैनुअल फीचर इंजीनियरिंग की आवश्यकता के बिना, संकुचित, टोकनाइज्ड टेस्ट डेटा पर डिफ्यूजन ट्रांसफॉर्मर का लाभ उठाकर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Yuxuan Yin, Chen He, Todd Jacobs, Jialei He, Boxun Xu, Robert Jin, Peng Li2026-05-27
💬 NLP

Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories

यह शोध पत्र प्रकट करता है कि LLM-जनित कहानियों में विविधता आश्चर्यजनक रूप से कम है, जहाँ "Elias" और "lighthouse" जैसे टोकन का एक छोटा समूह आउटपुट पर हावी रहता है क्योंकि वे प्री-ट्रेनिंग डेटा के बजाय प्रेफरेंस अलाइनमेंट डेटासेट्स में अपनी व्यापकता के कारण प्रमुख हैं, जो मॉडल व्यवहार पर छोटे, उच्च-गुणवत्ता वाले डेटासेट्स के असंगत प्रभाव को उजागर करता है।

Sil Hamilton, David Mimno2026-05-27