🤖 AI

Evidence-State Rewards for Long-Context Reasoning

यह शोध पत्र मेवेन (Maven) को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो साक्ष्य अवस्था परिवर्तनों—जैसे कि जानकारी जोड़ने, जोड़ने या हटाने—को क्रिया-स्तर के पुरस्कारों को सौंपकर दीर्घ-संदर्भ तर्क (long-context reasoning) को बढ़ाता है, जिससे कई बेंचमार्क पर पारंपरिक केवल-परिणाम (outcome-only) विधियों से बेहतर प्रदर्शन करता है।

Ya Gao, Pekka Marttinen2026-07-03
💬 NLP

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0 एक ओपन-वेट्स, कॉन्स्टिट्यूशनल क्लासिफायर है जो बड़े बेसलाइन्स की तुलना में काफी छोटे मॉडल आकार (0.8B–4B पैरामीटर्स) का लाभ उठाते हुए, एक संरचित 46-नीति संविधान और सिंथेटिक काउंटरफैक्चुअल डेटा का उपयोग करके स्टेट-ऑफ-द-आर्ट बहुभाषी AI सुरक्षा प्रदर्शन प्राप्त करता है ताकि फॉल्स पॉजिटिव और फॉल्स नेगेटिव दोनों को न्यूनतम किया जा सके।

Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin2026-07-03
🤖 AI

SUNTA: Hierarchical Video Prediction with Surprise-based Chunking

SUNTA एक पदानुक्रमित (hierarchical) वीडियो प्रेडिक्शन विधि है जो प्रशिक्षण और अनुमान संबंधी चुनौतियों को दूर करने के लिए प्रेडिक्शन एरर और आंतरिक विसंगति द्वारा संचालित 'सरप्राइज-आधारित चंकिंग' का उपयोग करती है, जिससे 250 टाइमस्टेप्स से अधिक की सटीक लंबी अवधि की भविष्यवाणियां संभव हो पाती हैं जहाँ मौजूदा बेसलाइन 10 के भीतर विफल हो जाते हैं।

Tomoshi Iiyama, Masahiro Suzuki, Yutaka Matsuo2026-07-03
💬 NLP

ESC: Emotional Self-Correction for Reliable Vision-Language Models

यह शोध पत्र ESC (इमोशनल सेल्फ-करेक्शन) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो विजन-लैंग्वेज मॉडल्स में लेटेंट सेल्फ-करेक्शन व्यवहारों को ट्रिगर करने के लिए इमोशनल क्यूज़ को एक कंट्रोल सिग्नल के रूप में उपयोग करता है, जिससे बिना किसी अतिरिक्त फाइन-ट्यूनिंग के उनकी विश्वसनीयता और तर्क क्षमता में सुधार होता है।

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan (…)2026-07-03
🤖 machine learning

Ask the Right Comparison:Bias-Aware Bayesian Active Top-kk Ranking with LLM Judges

यह शोध पत्र एक बायस-अवेयर (bias-aware) बेयसियन फ्रेमवर्क को टॉप-kk-फोकस्ड एक्टिव एक्विजिशन रणनीति के साथ प्रस्तावित करता है ताकि शोरयुक्त और पक्षपाती (biased) एलएलएम (LLM) जजों से सर्वश्रेष्ठ kk वस्तुओं की सटीक पहचान की जा सके, जो यह प्रदर्शित करता है कि जज-विशिष्ट पूर्वाग्रहों (जैसे वर्बोसिटी और पोजीशन इफेक्ट्स) को स्पष्ट रूप से मॉडल करना, नैइव एग्रीगेशन या मानक एक्टिव लर्निंग विधियों की तुलना में रैंकिंग गुणवत्ता और दक्षता में महत्वपूर्ण सुधार करता है।

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao2026-07-03
⚡ electrical engineering

Population-Scale Segmentation of Penile Tissue in DIXON MRI using Deep Learning for Quantitative Phenotyping in Male Reproductive Health

यह अध्ययन DIXON MRI में संपूर्ण-लिंग ऊतक (whole-penis tissue) के स्वचालित, प्रेक्षक-स्तर (observer-level) की सटीक सेग्मेंटेशन को प्राप्त करने के लिए एक 3D nnU-Net आर्किटेक्चर का उपयोग करते हुए एक डीप लर्निंग फ्रेमवर्क प्रस्तुत करता है, जो पुनरुत्पादक पुरुष प्रजनन स्वास्थ्य फेनोटाइपिंग के लिए 34,412 UK बायोबैंक प्रतिभागियों में आंतरिक और बाहरी लिंग शरीर रचना विज्ञान (anatomy) को मापने के लिए इस पद्धति को सफलतापूर्वक स्केल करता है।

Jan Ernsting, Gunnar Paul Kordes, Nils Johannaber, Lynn Ogoniak, Wolfgang Roll, Tim Hahn, Alexander Siegfried Busch, Ben (…)2026-07-03
🤖 machine learning

AbsoluteDegradation: A Physics-Inspired Synthetic Film-Degradation Pipeline and Archival Film Restoration Benchmark

यह शोधपत्र AbsoluteDegradation को प्रस्तुत करता है, जो एक भौतिकी-प्रेरित सिंथेटिक पाइपलाइन और एक बड़े पैमाने का वास्तविक-विश्व बेंचमार्क है जिसे आर्काइवल फिल्म बहाली (archival film restoration) में युग्मित प्रशिक्षण डेटा (paired training data) और मानकीकृत मूल्यांकन की कमी को दूर करने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि इस दृष्टिकोण के साथ प्रशिक्षित मॉडल वास्तविक फुटेज के प्रति बेहतर सामान्यीकरण प्राप्त करते हैं।

Mikołaj Jastrzębski, Dawid Glinkowski, Dawid Zieliński, Daniel Borkowski, Wojciech Kozłowski, Kamil Adamczewski2026-07-03
⚡ electrical engineering

ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning

यह शोध पत्र एडेप्टिव रीपैरामीटराइज्ड टाइम (ART) और इसके रीइन्फोर्समेंट लर्निंग-आधारित सॉल्वर ART-RL का प्रस्ताव करता है, जो एक निरंतर-समय नियंत्रण ढांचा (continuous-time control framework) है जो डिफ्यूजन सैंपलिंग के लिए इष्टतम, एडेप्टिव टाइमस्टेप शेड्यूल्स को सीखता है ताकि अंतर्निहित मॉडल को संशोधित किए बिना विभिन्न बजटों और पाइपलाइनों में सैंपल गुणवत्ता और सामान्यीकरण (generalization) में महत्वपूर्ण सुधार किया जा सके।

Yilie Huang, Wenpin Tang, Xun Yu Zhou2026-07-03
🤖 machine learning

Tight Lower Bounds for the Multi-Secretary Problem via Bellman Certificates

यह शोध पत्र यह स्थापित करता है कि सपोर्ट अंतराल (support gaps) वाले सीमित-घनत्व वितरणों (bounded-density distributions) वाले मल्टी-सेक्रेटरी समस्या के रिग्रेट (regret) में अतिरिक्त लॉगरिदमिक कारक आवश्यक है, जो बेलमैन प्रमाणपत्रों (Bellman certificates) का उपयोग करके स्पष्ट प्रति-उदाहरणों (counterexamples) का निर्माण करके ऐसे अंतराल वाले उदाहरणों के लिए एक सटीक Ω((logT)2)\Omega((\log T)^2) निचली सीमा (lower bound) को सिद्ध करता है।

Jiawei Zhang2026-07-03
🤖 AI

A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

यह शोध पत्र पांच कठिन नैदानिक परिदृश्यों के एक छोटे, विशेषज्ञ-लिखित डेटासेट को प्रस्तुत करता है जिसका परमाणु, भारित रूब्रिक्स (atomic, weighted rubrics) के माध्यम से मूल्यांकन किया गया है, जो यह प्रकट करता है कि फ्रंटियर लैंग्वेज मॉडल्स (GPT-5.4, Claude Opus 4.7, और Gemini 3.1 Pro) कम जोखिम वाले मदों पर मजबूत प्रदर्शन के बावजूद उच्च-जोखिम वाले नैदानिक मानदंडों के साथ महत्वपूर्ण रूप से संघर्ष करते हैं, जबकि ऐसे मूल्यांकनों के लिए विश्वसनीय स्वचालित ग्रेडर के रूप में LLMs के उपयोग की व्यवहार्यता को प्रदर्शित करते हैं।

Samiha A. Ismail, Fan X. Chen, Ali Merali2026-07-03