🤖 AI

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

यह शोध पत्र स्टेबल वैल्यू गाइडेंस ट्रांसफॉर्मर (SVGT) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो बैकबोन के आंतरिक निरूपणों (internal representations) को बाधित किए बिना बड़े भाषा मॉडलों को सुसंगत मानवीय मूल्यों के अनुरूप निर्देशित करने के लिए एक स्वतंत्र वैल्यू मॉड्यूल और डायनेमिक ब्रिज टोकन का उपयोग करता है, जिससे प्रवाह को बनाए रखते हुए हानिकारक आउटपुट में 70% से अधिक की कमी आती है।

Wenhao Chen, Sirui Sun, Shengyuan Bai, Guojie Song2026-05-13
🧬 biology

Self-organized MT Direction Maps Emerge from Spatiotemporal Contrastive Optimization

यह शोध पत्र प्रदर्शित करता है कि स्व-पर्यवेक्षित विरोधाभासी शिक्षण (self-supervised contrastive learning) और स्थानिक नियमितीकरण (spatial regularization) के साथ प्रशिक्षित एक स्पैटियोटेम्पोरल टोपोग्राफिक डीप आर्टिफिशियल न्यूरल नेटवर्क, MT क्षेत्र में स्वतः ही जैविक रूप से यथार्थवादी दिशा-चयनात्मक मानचित्रों और टोपोलॉजिकल संरचनाओं को उत्पन्न करता है, जो यह प्रकट करता है कि ये डोर्सल स्ट्रीम की विशेषताएं कार्य-संचालित विभेदन और स्थानिक संगठन के बीच एक मौलिक समझौते से उभरती हैं।

Zhaotian Gu, Molan Li, Jie Su, Chang Liu, Tianyi Qian, Dahui Wang2026-05-13
🤖 AI

CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating

यह शोध पत्र CaC को प्रस्तुत करता है, जो एक पदानुक्रमित स्थानिक-कालिक सांद्रित रिवॉर्ड मॉडल (hierarchical spatiotemporal concentrating reward model) है, जो विसंगति का पता लगाने की सटीकता को महत्वपूर्ण रूप से बढ़ाने और उत्पन्न वीडियो की गुणवत्ता में सुधार करने के लिए एक नवीन बड़े पैमाने के एनोटेटेड डेटासेट और विशिष्ट IoU रिवॉर्ड्स के साथ एक तीन-चरणीय प्रगतिशील प्रशिक्षण प्रतिमान का लाभ उठाता है।

Jiyuan Wang, Huan Ouyang, Jiuzhou Lin, Chunyu Lin, Dewen Fan, Boheng Zhang, Haonan Fan, Fei Zuo, Jia Sun, Huaiqing Wang (…)2026-05-13
🤖 AI

When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

यह शोध पत्र यह प्रदर्शित करता है कि चेन-ऑफ-थॉट ट्रेसेस (Chain-of-Thought traces) अक्सर एक अविश्वसनीय निरीक्षण चैनल होते हैं क्योंकि मॉडल दृश्यमान तर्क चरणों को उत्पन्न करने से पहले ही आंतरिक रूप से एक उत्तर के प्रति प्रतिबद्ध हो जाते हैं, जिससे एक महत्वपूर्ण विसंगति उत्पन्न होती है जहाँ विचारशील पाठ केवल प्रदर्शनकारी होता है न कि अंतिम आउटपुट को निर्धारित करने वाला निर्णायक कारक।

Wenkai Li, Fan Yang, Ananya Hazarika, Shaunak A. Mehta, Koichi Onoue2026-05-13
🤖 AI

Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention

यह शोध पत्र SPeCTrA-Sum प्रस्तुत करता है, जो एक एकीकृत मल्टीमॉडल सारांशीकरण ढांचा (unified multimodal summarization framework) है जो अधिक सटीक और अर्थपूर्ण रूप से सुसंगत सारांश उत्पन्न करने के लिए पदानुक्रमित क्रॉस-मोडल संरेखण (hierarchical cross-modal alignment) हेतु एक डीप विजुअल प्रोसेसर और सिद्धांत-आधारित छवि चयन (principled image selection) के लिए एक विजुअल रिलेवेंस प्रेडिक्टर का उपयोग करता है।

Abid Ali, Diego Molla-Aliod, Usman Naseem2026-05-13✓ Author reviewed
🤖 AI

Focusable Monocular Depth Estimation

यह शोधपत्र फोकेसेबल मोनोकुलर डेप्थ एस्टीमेशन (FDE) को प्रस्तुत करता है, जो एक क्षेत्र-जागरूक कार्य है और इसके अनुरूप फोकसडेप्थ (FocusDepth) फ्रेमवर्क है जो वैश्विक दृश्य ज्यामिति को संरक्षित करते हुए लक्षित क्षेत्र की सटीकता को प्राथमिकता देने के लिए प्रॉम्प्ट-कंडीशन्ड मल्टी-स्केल फीचर फ्यूजन का लाभ उठाता है, जिसे नए FDE-बेंच बेंचमार्क द्वारा मान्य किया गया है।

Yuxin Du, Tao Lin, Zile Zhong, Runting Li, Xiyao Chen, Jiting Liu, Chenglin Liu, Ying-Cong Chen, Yuqian Fu, Bo Zhao2026-05-13
⚡ electrical engineering

Behavioral Integrity Verification for AI Agent Skills

यह शोध पत्र बिहेवियरल इंटीग्रिटी वेरिफिकेशन (BIV) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एआई एजेंट के घोषित और वास्तविक क्षमताओं के बीच विसंगतियों का पता लगाने के लिए डिटरमिनिस्टिक कोड विश्लेषण को एलएलएम-सहायता प्राप्त निष्कर्षण (LLM-assisted extraction) के साथ जोड़ता है, यह प्रकट करते हुए कि जबकि अधिकांश विचलन दुर्भावना के बजाय डेवलपर की चूक से उत्पन्न होते हैं, यह प्रणाली प्रभावी रूप से दुर्भावनापूर्ण खतरों की पहचान करती है और बड़े पैमाने के बेंचमार्क पर मौजूदा बेसलाइन से बेहतर प्रदर्शन करती है।

Yuhao Wu, Tung-Ling Li, Hongliang Liu2026-05-13
🤖 machine learning

Is Monotonic Sampling Necessary in Diffusion Models?

यह शोध पत्र व्यवस्थित रूप से इस बात की जांच करता है कि क्या गैर-एकदिष्ट (non-monotonic) शोर शेड्यूल्स डिफ्यूजन मॉडल जनरेशन में सुधार कर सकते हैं, यह पाते हुए कि हालांकि ऐसे शेड्यूल्स सार्वभौमिक रूप से एकदिष्ट बेसलाइन की तुलना में प्रदर्शन करने में विफल रहते हैं, फिर भी इसके परिणामस्वरूप होने वाले प्रदर्शन दंड की गंभीरता संरचनात्मक अंतरों के कारण विभिन्न आर्किटेक्चर (DDPM, फ्लो मैचिंग, और EDM) में काफी भिन्न होती है, जो एक नव-प्रस्तावित 'शेड्यूल सेंसिटिविटी कोएफिशिएंट' द्वारा परिमाणित की गई है।

Muhammad Haris Khan2026-05-13
🤖 AI

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

यह शोध पत्र OTT-Vid को प्रस्तुत करता है, जो वीडियो लार्ज लैंग्वेज मॉडल्स के लिए एक प्रशिक्षण-मुक्त (training-free) टेम्पोरल टोकन कंप्रेशन फ्रेमवर्क है, जो फ्रेम-पेयर कंप्रेसिबिलिटी के आधार पर कंप्रेशन बजट को गतिशील रूप से आवंटित करने के लिए नॉन-यूनिफॉर्म टोकन मास और लोकैलिटी-अवेयर कॉस्ट्स के साथ ऑप्टिमल ट्रांसपोर्ट का लाभ उठाता है, जिससे केवल 10% विजुअल टोकन बरकरार रखते हुए अत्याधुनिक प्रदर्शन प्राप्त होता है।

Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee2026-05-13
🤖 AI

Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models

यह शोधपत्र MCF-Proto को प्रस्तुत करता है, जो एक हल्का (lightweight) एक्शन हेड है जो एक मोशन-केंद्रित स्थानीय फ्रेम (motion-centric local frame) की भविष्यवाणी करके और अधिक कॉम्पैक्ट, सुदृढ़ और सामान्यीकरण योग्य रोबोटिक हेरफेर (robotic manipulation) प्राप्त करने के लिए प्रोटोटाइप-आधारित पैरामीट्राइजेशन का उपयोग करके विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है, जिसमें किसी सहायक पर्यवेक्षण (auxiliary supervision) की आवश्यकता नहीं होती है।

Huoren Yang, Jianchao Zhao, Hu Yusong, Qiguan Ou, Yuyang Gao, Wei Ke, Yuhang He, SongLin Dong, Zhiheng Ma, Yihong Gong2026-05-13