🤖 AI

Completion vs Optimality: Policy Gradient in Long-Horizon Cumulative-Damage Problems

यह शोध पत्र लॉन्ग-होरिज़न संचयी-क्षति (cumulative-damage) समस्याओं के लिए पॉलिसी-ग्रेडिएंट विधियों में दो ऑर्थोगोनल विफलता मोड—पूर्णता (completion) और इष्टतमता (optimality)—की पहचान और अपघटन करता है, और ब्रिकलेयर तथा एनबीए करियर सिमुलेशन में अनुभवजन्य सत्यापन के माध्यम से यह प्रदर्शित करता है कि जबकि एक्शन-स्पेस प्रतिबंध कार्य पूर्णता को सक्षम करते हैं, वे अक्सर प्रारंभिक लालची प्रतिबद्धताओं (early greedy commitments) के कारण एक महत्वपूर्ण इष्टतमता अंतराल छोड़ देते हैं।

Wolfgang Maass, Sabine Janzen2026-05-27
🤖 AI

Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models

यह शोध पत्र एक ऑनलाइन छद्म-पर्यवेक्षित (pseudo-supervised) ढांचे का प्रस्ताव करता है जो टेक्स्ट और विज़ुअल रिप्रजेंटेशन के बीच के अंतर्निहित मोडैलिटी अंतराल को पाटने के लिए अनलेबल टेस्ट डेटा से विज़ुअल क्लास प्रोटोटाइप सीखता है, जिससे इन-डिस्ट्रीब्यूशन ट्रेनिंग डेटा की आवश्यकता के बिना स्टेट-ऑफ-द-आर्ट पोस्ट-हॉक आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन प्राप्त होता है।

Yuanwei Hu, Bo Peng, Yadan Luo, Zhen Fang, Ling Chen, Jie Lu2026-05-27
💰 quantitative finance

AI evaluation may bias perceptions: The importance of context in interpreting academic writing

यह शोध पत्र यह प्रदर्शित करता है कि शैक्षणिक लेखन में एआई-जनित पाठ का पता लगाने के लिए पूल्ड बेंचमार्क (pooled benchmarks) का उपयोग करना विभिन्न देशों और क्षेत्रों में महत्वपूर्ण पूर्वाग्रह उत्पन्न करता है, और सटीक एवं न्यायसंगत मूल्यांकन के लिए संदर्भ-विशिष्ट बेंचमार्क आवश्यक होने का तर्क देता है।

Shang Wu, Randol Yao2026-05-27
🤖 AI

MemFail: Stress-Testing Failure Modes of LLM Memory Systems

यह शोधपत्र MemFail को प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जो विशिष्ट विफलता मोड को अलग करने और उनका मूल्यांकन करने के लिए LLM मेमोरी सिस्टम को सारांशीकरण (summarization), भंडारण (storage) और पुनर्प्राप्ति (retrieval) कार्यों में विभाजित करता है, जो समग्र सटीकता मेट्रिक्स से आगे बढ़कर सिस्टम डिज़ाइन के समझौतों (trade-offs) में सूक्ष्म अंतर्दृष्टि प्रदान करता है।

Ishir Garg, Neel Kolhe, Dawn Song, Xuandong Zhao2026-05-27
🤖 AI

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame एक अनुकूलन योग्य मल्टीमॉडल फ्रेमवर्क है जो कुशल, बहु-स्तर (multi-granularity) वीडियो साक्ष्य पुनर्प्राप्ति और सटीक क्रेडिट असाइनमेंट को सक्षम करने के लिए एक सीखने योग्य, टोकनाइज्ड फ्रेम सैंपलिंग डेंसिटी और एक सेगमेंट-डिकपल्ड GRPO प्रशिक्षण रणनीति पेश करता है, जिससे जटिल वीडियो समझ में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Ha (…)2026-05-27
🧬 biology

Self-Improvement Imitation with Biologically Guided Search for Protein Design Under Oracle Budgets

यह शोध पत्र SILO को प्रस्तुत करता है, जो एक प्रक्षेपवक्र-स्तरीय (trajectory-level) स्व-सुधार अनुकरण ढांचा है जो मौजूदा सुदृढीकरण शिक्षण (reinforcement learning) और जनरेटिव बेसलाइनों की तुलना में सीमित ओरेकल बजट के तहत बेहतर प्रोटीन अनुक्रम अनुकूलन प्राप्त करने के लिए पदानुक्रमित संपादन नीतियों (hierarchical edit policies), स्टोकेस्टिक बीम सर्च (stochastic beam search) और एलेनिन-स्कैन फिटनेस स्कोर (alanine-scan fitness score) को संयोजित करता है।

Ashima Khanna, Dominik Grimm2026-05-27
🤖 AI

Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation

यह शोध पत्र \texttt{CUDAnalyst} को प्रस्तुत करता है, जो एक एकीकृत विश्लेषण ढांचा है जो CUDA कर्नेल जनरेशन के लिए स्व-विकसित (self-evolving) LLM एजेंटों में नियोजन निर्णयों (planning decisions) पर विषम फीडबैक संकेतों के प्रभाव को अलग करता है और उसका श्रेय देता है, यह प्रकट करते हुए कि स्पष्ट नियोजन केवल तभी फायदेमंद होता है जब फीडबैक संरेखित हो और प्रभावी नियोजन संरचित बहु-फीडबैक अंतःक्रियाओं से उभरता है।

Yee Hin Chong, Jiaming Wu, Youhui Zhang, Peng Qu2026-05-27
🤖 AI

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

यह शोध पत्र इस धारणा का खंडन करता है कि इष्टतम हार्नेस जटिलता (harness complexity) मॉडल क्षमता के साथ निरंतर घटती है, जो 432-रन प्रयोग के माध्यम से यह प्रकट करता है कि हार्नेस संवेदनशीलता गैर-एकदिष्ट (non-monotone) है और मॉडल के प्रकार पर महत्वपूर्ण रूप से निर्भर करती है, जहाँ विस्तृत संरचनाएं (verbose structures) फ्रंटियर चैट मॉडल्स में बाधा डालती हैं जबकि सख्त मार्गदर्शन फ्रंटियर रीजनिंग मॉडल्स को लाभ पहुँचाता है।

Yong-eun Cho2026-05-27
🤖 machine learning

Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models

यह शोध पत्र STARS को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण ढांचा (training framework) है जो जैकोबियन स्पेक्ट्रल रेडियस रेगुलराइजेशन (Jacobian Spectral Radius Regularization) के माध्यम से लेटेंट स्टेट्स को एसिम्प्टोटिकली स्टेबल फिक्स्ड पॉइंट्स तक सीमित करके लूप्ड लैंग्वेज मॉडल्स में रिकरेंट डायनेमिक्स को स्थिर करता है, जिससे विश्वसनीय टेस्ट-टाइम स्केलिंग और जटिल तर्क कार्यों पर बेहतर प्रदर्शन सक्षम होता है।

Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li2026-05-27
🤖 AI

A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing Tasks

यह शोध पत्र MeDial-Speech को प्रस्तुत करता है, जो चार विशिष्ट स्वास्थ्य स्थितियों को कवर करने वाले रोबोट-रोगी और डॉक्टर-रोगी के चिकित्सा संवादों का एक अभिनव 111+ घंटे का स्पीच डेटासेट है, साथ ही एक वाक्य चयन बेंचमार्क भी प्रस्तुत करता है जो यह प्रकट करता है कि अत्याधुनिक LLMs मध्यम सटीकता प्राप्त करते हैं लेकिन अपने भविष्यवाणियों में महत्वपूर्ण अतिआत्मविश्वास प्रदर्शित करते हैं।

Heriberto Cuayahuitl, Grace Jang2026-05-27