🤖 AI

SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

यह शोध पत्र "सेफ्टी सेंट्री" (Safety Sentry) को प्रस्तुत करता है, जो एक हल्का गार्ड मॉडल है जो सुरक्षा और उपयोगकर्ता स्वायत्तता के बीच संतुलन बनाने के लिए एक संदर्भ-जागरूक, प्रति-इन्स्टेंस तीन-तरफा रूटिंग सिस्टम (EXECUTE, ASK, REFUSE) को लागू करके बाइनरी सुरक्षा जांच में सुधार करता है, साथ ही एक एकल डिकोडिंग थ्रेशोल्ड के माध्यम से समायोज्य जोखिम सहनशीलता की अनुमति देता है।

Tianyu Chen, Chujia Hu, Wenjie Wang2026-07-16
🤖 AI

Semantic Anchoring for Robotic Action Representations

यह शोध पत्र एक प्लग-एंड-प्ले विधि पेश करके फाइन-ट्यूनिंग के दौरान विजन-लैंग्वेज-एक्शन मॉडल्स में सिमेंटिक संरचना के क्षरण को संबोधित करता है, जो तैनात मॉडल को बदले बिना इन-डिस्ट्रीब्यूशन टास्क सफलता और आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण दोनों में महत्वपूर्ण सुधार करता है।

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang2026-07-16
🤖 machine learning

The SIGReg Objective as Variational Free Energy: A Theoretical Active-Inference Account of JEPA World Models

यह शोध पत्र जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (JEPAs) के लिए एक सैद्धांतिक एक्टिव इन्फरेंस फ्रेमवर्क स्थापित करता है, यह सिद्ध करते हुए कि SIGReg रेगुलराइज़र पूर्व-मिसकैलिब्रेशन अंतराल (prior-miscalibration gap) को समाप्त करके प्रशिक्षण उद्देश्य को एक वैध वेरिएशनल फ्री एनर्जी में अनन्य रूप से रूपांतरित करता है, जबकि अन्य सामान्य रेगुलराइज़र आवश्यक सरप्राइज बाउंड्स को बनाए रखने में विफल रहते हैं।

Fabio Arnez, Alexandra Gomez-Villa2026-07-16
🤖 AI

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

यह शोध पत्र STOCKTAKE को प्रस्तुत करता है, जो एक 26-सप्ताह का आपूर्ति-श्रृंखला बेंचमार्क है जिसमें एक निष्पक्ष ओरेकल (oracle) शामिल है जो अवस्था अनुमान (state estimation) को नियंत्रण कार्यों (control actions) से अलग करता है, यह प्रकट करते हुए कि जहाँ उन्नत LLM एजेंट छिपी हुई विफलताओं का सटीक निदान कर सकते हैं, वहीं वे अक्सर इस ज्ञान को प्रभावी निर्णयों में बदलने में विफल रहते हैं, जिसके परिणामस्वरूप प्रदर्शन अंतराल उत्पन्न होता है जहाँ कुछ मॉडल बेहतर पहचान क्षमताओं के बावजूद एक लक्षण-अंध (symptom-blind) बेसलाइन से भी कम प्रदर्शन करते हैं।

Sagar Deb, Ashwanth Krishnan2026-07-16
🤖 AI

UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following

यह शोध पत्र UESF-Bench प्रस्तुत करता है, जो एकीकृत एम्बोडीड ह्यूमन सीकिंग एंड फॉलोइंग (unified embodied human seeking and following) के लिए एक बड़े पैमाने का बेंचमार्क है, जो मौजूदा मूल्यांकनों की सीमाओं को संबोधित करता है क्योंकि यह एजेंटों से भाषा-वर्णित लक्ष्य को पहले खोजने और फिर निरंतर उनका पीछा करने की मांग करता है, और इन दोनों चरणों के बीच संक्रमण को प्रभावी ढंग से प्रबंधित करने के लिए SeekFollow-VLA फ्रेमवर्क का प्रस्ताव करता है।

Kun Yu, Jianhua Yang, Yixiang Chen, Changwei Wang, Hongyuan Yu, Yan Huang, Fushuo Huo, Ya Jing, Zhumin Chen, Keji He2026-07-16
🤖 AI

OvisOCR2 Technical Report

OvisOCR2 एक 0.8B एंड-टू-एंड डॉक्यूमेंट पार्सिंग मॉडल है जो दस्तावेज़ पृष्ठों के सीधे मार्कडाउन निरूपण (Markdown representations) उत्पन्न करने के लिए एक नवीन डेटा इंजन और सुदृढीकरण शिक्षण (reinforcement learning) एवं डिस्टिलेशन (distillation) से युक्त एक बहु-चरणीय प्रशिक्षण रेसिपी का लाभ उठाकर बेंचमार्क डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li (…)2026-07-16
🤖 machine learning

Consensus as Privileged Context for Label-Free Self-Distillation

यह शोध पत्र CANON को प्रस्तुत करता है, जो एक लेबल-मुक्त स्व-डिस्टिलेशन (self-distillation) विधि है जो सघन, टोकन-स्तरीय पर्यवेक्षण प्रदान करने के लिए कई मॉडल आउटपुट के बीच सर्वसम्मति का लाभ उठाती है, जिससे तर्क सटीकता में महत्वपूर्ण सुधार होता है और यह मौजूदा लेबल-मुक्त दृष्टिकोणों से बेहतर प्रदर्शन करते हुए गोल्ड-लेबल प्रशिक्षण के प्रदर्शन के करीब पहुँच जाता है।

John Gkountouras, Josip Jukić, Ivan Titov2026-07-16
🤖 AI

Explaining Reinforcement Learning Agents via Inductive Logic Programming

यह शोध पत्र इंडक्टिव लॉजिक प्रोग्रामिंग का उपयोग करके प्रतीकात्मक नीति निरूपण (symbolic policy representations) निकालने और एकल एवं बहु-एजेंट डोमेन में आरएल (RL) एजेंटों की व्याख्यात्मकता, शिक्षण गतिकी (learning dynamics) और समन्वय पैटर्न को व्यवस्थित रूप से मापने और विश्लेषण करने के लिए नए उद्देश्य मेट्रिक्स पेश करके व्याख्यात्मक सुदृढीकरण लर्निंग (Explainable Reinforcement Learning) को आगे बढ़ाता है।

Celeste Veronese, Edoardo Zorzi, Daniele Meli, Alessandro Farinelli2026-07-16
🤖 AI

When Bots Join the Team: Bot Adoption and the Institutional Fabric of Open-Source Software Projects

लगभग 3,000 ओपन-सोर्स परियोजनाओं के इस अध्ययन से पता चलता है कि स्वचालित बॉट्स को अपनाना बार-बार होने वाले सहयोग, सामाजिक स्मृति और भूमिका विभेदीकरण को बढ़ाकर समुदाय के संस्थागत ढांचे को मजबूत करता है, जो बदले में संघर्षों की निरंतरता (कॉन्फ्लिक्ट कैस्केड्स) को कम करता है और आउटपुट की विशिष्टता को बढ़ाता है, जिससे यह संकेत मिलता है कि बॉट्स केवल उपकरणों के रूप में कार्य करने के बजाय ऐसे पूर्वानुमानित एजेंट के रूप में कार्य करते हैं जो किसी समुदाय के सामाजिक बुनियादी ढांचे का अभिन्न अंग बन जाते हैं।

Yongren Shi, Wenyi Gong2026-07-16
🤖 AI

Barnamala: Parameter-Efficient Handwritten Devanagari Recognition at Benchmark Saturation

यह शोध पत्र 'बर्णमाला' (Barnamala) का परिचय देता है, जो एक अत्यंत सघन 1.11M-पैरामीटर वाला कनवोल्यूशनल नेटवर्क है, जो हस्तलिखित देवनागरी पहचान पर 99.73% की अत्याधुनिक सटीकता प्राप्त करता है, और प्रभावी रूप से प्रदर्शन संतृप्ति (performance saturation) तक पहुँचता है जहाँ यह काफी बड़े मॉडलों के बराबर या उनसे बेहतर प्रदर्शन करता है और साथ ही उत्कृष्ट सुदृढ़ता और अंतरणीयता (transferability) प्रदर्शित करता है।

Ashish Thapa, Samrat Karki2026-07-16