🤖 AI

Activation-Deactivation: A General Framework for Robust Post-hoc Explainable AI

यह शोध पत्र एक्टिवेशन-डीएक्टिवेशन (AD) को प्रस्तुत करता है, जो एक नवीन पोस्ट-हॉक व्याख्यात्मकता ढांचा (explainability framework) है जो अधिक सुदृढ़ और हस्तांतरणीय स्पष्टीकरण उत्पन्न करने के लिए इनपुट गड़बड़ी (input perturbations) के स्थान पर आंतरिक मॉडल निष्क्रियता (internal model deactivation) का उपयोग करता है, जिसमें अतिरिक्त प्रशिक्षण की आवश्यकता नहीं होती है।

Akchunya Chanchal, David A. Kelly, Hana Chockler2026-07-07
💻 computer science

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo एक बहुमुखी द्वैध-प्रवाह (dual-stream) ढांचा है जो एक एकल मल्टीमॉडल निर्देश प्रतिमान के तहत वीडियो समझ, निर्माण और संपादन को एकीकृत करता है, जिससे अत्याधुनिक प्रदर्शन प्राप्त होता है और कार्य संयोजन (task composition) तथा इमेज एडिटिंग डेटा से ज़ीरो-शॉट ट्रांसफर जैसी नवीन क्षमताओं को सक्षम बनाया जाता है।

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen2026-07-07
🤖 AI

SilvaScenes: Tree Detection and Species Classification from Under-Canopy Images in Natural Forests

यह शोध पत्र SilvaScenes को प्रस्तुत करता है, जो प्राकृतिक वनों में 28 वृक्ष प्रजातियों वाली 1,421 अंडर-कैनोपी छवियों का एक व्यापक बेंचमार्क डेटासेट है, ताकि यह प्रदर्शित करके वानिकी स्वचालन (फॉरेस्ट्री ऑटोमेशन) में वर्तमान अंतराल को संबोधित किया जा सके कि जहाँ ट्रंक सेगमेंटेशन (तने का विभाजन) व्यवहार्य है, वहीं अवरोध (ऑक्लूजन) और प्रजातियों के असंतुलन के कारण सूक्ष्म-स्तरीय प्रजाति वर्गीकरण एक महत्वपूर्ण चुनौती बनी हुई है।

David-Alexandre Duclos, William Guimont-Martin, Gabriel Jeanson, Arthur Larochelle-Tremblay, Martine Lapointe, Théo Defo (…)2026-07-07
💬 NLP

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

SpatialThinker एक नवीन मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो डेंस स्पेशियल रिवॉर्ड्स के साथ ऑनलाइन रीइन्फोर्समेंट लर्निंग का उपयोग करके एक ही पास में सीन ग्राफ जनरेशन और विजुअल रीजनिंग को एकीकृत करता है, जिससे सीमित प्रशिक्षण डेटा के साथ भी स्थानिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark2026-07-07
💻 computer science

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में विजुअल नॉलेज अंडरस्टैंडिंग के मूल्यांकन के लिए एक व्यापक बेंचमार्क, VKnowU पेश करता है, और VideoKnow+ प्रस्तावित करता है, जो एक सुदृढीकरण लर्निंग-आधारित मॉडल है जो संरचित विजुअल नॉलेज को स्पष्ट रूप से शामिल करके इस बेंचमार्क और अन्य वीडियो अंडरस्टैंडिंग कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang2026-07-07
🤖 AI

Motion Attribution for Video Generation

यह शोधपत्र Motive को प्रस्तुत करता है, जो एक स्केलेबल, मोशन-केंद्रित डेटा एट्रिब्यूशन फ्रेमवर्क है जो उच्च-प्रभाव वाले प्रशिक्षण क्लिप्स की पहचान करने के लिए टेम्पोरल डायनेमिक्स को अलग करता है, जिससे वीडियो जनरेशन मॉडल्स में मोशन स्मूथनेस और फिजिकल प्लाउज़िबिलिटी में महत्वपूर्ण सुधार करने वाला डेटा क्यूरेशन सक्षम होता है।

Xindi Wu, Despoina Paschalidou, Jun Gao, Antonio Torralba, Laura Leal-Taixé, Olga Russakovsky, Sanja Fidler, Jonathan Lo (…)2026-07-07
💻 computer science

Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation

यह शोध पत्र रिकंस्ट्रक्शन-एंकोर्ड डिफ्यूजन मॉडल (RAM) का प्रस्ताव करता है, जो लेटेंट अलाइनमेंट के लिए मोशन रिकंस्ट्रक्शन ब्रांच को सह-प्रशिक्षित करके और डीनोइजिंग प्रक्रिया के दौरान सेल्फ-करेक्शन का लाभ उठाने के लिए रिकंस्ट्रक्टिव एरर गाइडेंस (REG) को पेश करके टेक्स्ट-टू-मोशन जनरेशन में रिप्रेजेंटेशनल गैप्स और एरर प्रोपेगेशन को संबोधित करता है, जिससे स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

Yifei Liu, Changxing Ding, Ling Guo, Huaiguang Jiang, Qiong Cao2026-07-07
💻 computer science

SharpNet: Enhancing MLPs to Represent Functions with Controlled Non-differentiability

शार्पनेट (SharpNet) एक संशोधित एमएलपी (MLP) आर्किटेक्चर है जो पॉइसन के समीकरण (Poisson's equation) से व्युत्पन्न एक सहायक फीचर फंक्शन के साथ नेटवर्क को संवर्धित करके नियंत्रित गैर-अवकलनीयता (non-differentiability) के साथ फलनों के सटीक प्रतिनिधित्व को सक्षम बनाता है, जिससे फीचर लोकेशन्स और नेटवर्क मापदंडों के संयुक्त अनुकूलन की अनुमति मिलती है ताकि बिना धुंधलापन के तीखे किनारों और कोनों को सटीक रूप से रिकवर किया जा सके।

Hanting Niu, Junkai Deng, Fei Hou, Wencheng Wang, Ying He2026-07-07
🤖 AI

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything एक स्केलेबल प्रीट्रेनिंग फ्रेमवर्क पेश करता है जो 2 करोड़ शोर वाले, विषम (heterogeneous) 3D स्रोतों से मेट्रिक डेप्थ सीखने के लिए एक नवीन "स्पार्स मेट्रिक प्रॉम्प्ट" का लाभ उठाता है, जो मेट्रिक डेप्थ में पहला स्पष्ट स्केलिंग ट्रेंड स्थापित करता है और मोनोक्यूलर एस्टीमेशन, 3D रिकंस्ट्रक्शन और मल्टीमॉडल मॉडल्स में स्थानिक बुद्धिमत्ता (spatial intelligence) सहित विविध कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen2026-07-07
📊 statistics

A Random Matrix Theory Perspective on the Consistency of Diffusion Models

यह शोध पत्र एक रैंडम मैट्रिक्स थ्योरी फ्रेमवर्क का उपयोग करके यह प्रदर्शित करता है कि गैर-अतिव्यापी (non-overlapping) डेटा स्प्लिट्स के बीच डिफ्यूजन मॉडल्स की निरंतरता साझा गॉसियन सांख्यिकी (Gaussian statistics) से उत्पन्न होती है, जो यह प्रकट करता है कि कैसे सीमित डेटासेट का आकार और स्पेक्ट्रल गुण उत्पन्न नमूनों के प्रत्याशा (expectation) और विचरण (variance) को व्यवस्थित रूप से आकार देते हैं।

Binxu Wang, Jacob Zavatone-Veth, Cengiz Pehlevan2026-07-07