💬 NLP

Test-Time Training for Modality Order Consistency in Vision-Language Models

यह शोध पत्र इमेज और टेक्स्ट इनपुट के क्रम के कारण विजन-लैंग्वेज मॉडल्स में एक सुसंगत प्रदर्शन अंतराल की पहचान करता है, और एक टेस्ट-टाइम ट्रेनिंग विधि प्रस्तावित करता है जो न केवल इस मोडैलिटी-ऑर्डर गैप को भरती है बल्कि विभिन्न प्रॉम्प्ट अनुक्रमों के बीच आंतरिक निरूपणों (इंटरनल रिप्रेजेंटेशन्स) को संरेखित करके समग्र सटीकता में भी सुधार करती है।

Aditi Gupta, Yossi Gandelsman2026-07-23
💻 computer science

Self Gradient Forcing: Native Long Video Extrapolation

यह शोध पत्र सेल्फ ग्रेडिएंट फोर्सिंग (SGF) का प्रस्ताव करता है, जो एक टू-पास ट्रेनिंग रणनीति है जो ऑटोरेग्रेसिव वीडियो डिफ्यूजन में ऐतिहासिक संदर्भ-ग्रेडिएंट अंतराल को पाटता है, जिससे भविष्य के नुकसानों (losses) को यह पर्यवेक्षण करने में सक्षम बनाया जाता है कि शुरुआती जनरेटेड लेटेंट्स को कॉज़ल मेमोरी में कैसे एनकोड किया जाता है, जिससे विषय की पहचान, निरंतरता और टेम्पोरल स्थिरता में नेटिव लॉन्ग-वीडियो एक्सट्रपलेशन में महत्वपूर्ण सुधार होता है।

Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuy (…)2026-07-23
💻 computer science

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

PercepCap एक नवीन वीडियो कैप्शनिंग फ्रेमवर्क है जो अंतिम कैप्शन उत्पन्न करने से पहले ऑब्जेक्ट ट्रैजेक्टरीज और घटनाओं का एक धारणात्मक ट्रेस (perception trace) स्पष्ट रूप से बनाकर स्थानिक-कालिक समझ (spatio-temporal understanding) को बढ़ाता है, जिसे धारणात्मक साक्ष्य और वर्णनात्मक आउटपुट के बीच संरेखण सुनिश्चित करने के लिए एक दो-चरणीय प्रशिक्षण रणनीति और एक कैप्शन-एंकरित डेटा निर्माण पाइपलाइन द्वारा समर्थित किया गया है।

Yifan Xu, Zihao Wang, Zhixiao Wang, Jiaming Zhang, Yichun Yang, Desen Meng, Yuanxing Zhang, Pengfei Wan, Limin Wang2026-07-23
💻 computer science

ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion

ATSplat एक फीड-फॉरवर्ड 3D गॉसियन स्प्लेटिंग फ्रेमवर्क है जो एक एडेप्टिव टोकन एक्सपेंशन मॉड्यूल के माध्यम से एडेप्टिव कैपेसिटी एलोकेशन को पुनर्स्थापित करता है, जिससे यह मौजूदा डेंस मेथड्स की तुलना में काफी कम गॉसियंस और तेज़ इन्फरेंस स्पीड के साथ कॉम्पैक्ट, उच्च-गुणवत्ता वाले 3D पुनर्निर्माण उत्पन्न करने में सक्षम होता है।

Cho In, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, Seon Joo Kim2026-07-23
🤖 machine learning

Learning to Assess Danger from Movies for Cooperative Escape Planning in Hazardous Environments

यह शोध पत्र आपदा डेटासेट बनाने के लिए मूवी डेटा का लाभ उठाकर और खतरे के अनुमान तथा सहयोगात्मक पलायन योजना में सुधार करने के लिए विजुअल और लैंग्वेज इनपुट को फ्यूज करने वाले एक मल्टी-मोडल बेयसियन फ्रेमवर्क का प्रस्ताव देकर, खतरनाक वातावरण के लिए रोबोटों को प्रशिक्षित करने की चुनौतियों का समाधान करता है।

Vikram Shree, Sarah Allen, Beatriz Asfora, Jacopo Banfi, Mark Campbell2026-07-22
💻 computer science

Denoising Monte Carlo Renders with Diffusion Models

यह शोध पत्र प्रदर्शित करता है कि डिफ्यूजन मॉडल, जब प्राकृतिक रेंडर जानकारी पर आधारित होते हैं, तो एक इमेज प्रायर का लाभ उठाकर लो-फिडेलिटी मोंटे कार्लो रेंडर्स को प्रभावी ढंग से डिनॉयज़ करते हैं जो सीधी छाया और सुचारू स्पेकुलैरिटी जैसी यथार्थवादी विशेषताओं को उत्पन्न करता है, जिससे विभिन्न सैंपलिंग दरों में अत्याधुनिक विधियों के प्रतिस्पर्धी प्रदर्शन को प्राप्त किया जाता है।

Vaibhav Vavilala, Rahul Vasanth, David Forsyth2026-07-22
⚡ electrical engineering

FE-MCFormer: a novel time-frequency interpretable architecture for machinery fault diagnosis under strong noise environments

यह शोध पत्र FE-MCFormer का प्रस्ताव करता है, जो एक नवीन समय-आवृत्ति व्याख्यात्मक (time-frequency interpretable) आर्किटेक्चर है, जिसमें -10 dB SNR तक के गंभीर शोर की स्थितियों में भी सुदृढ़ और व्याख्यात्मक मशीनरी दोष निदान प्राप्त करने के लिए एक आवृत्ति अनुकूलन शिक्षण परत (frequency adaptive learning layer) और बहु-पैमाने वाले संलयन तंत्र (multiscale fusion mechanism) की विशेषताएँ हैं।

Yuhan Yuan, Xiaomo Jiang, Haibin Yang, Haixin Zhao, Shengbo Wang, Xueyu Cheng, Jigang Meng2026-07-22
🤖 machine learning

Pain in 3D: Generating Controllable Synthetic Faces for Automated Pain Assessment

यह शोध पत्र 3DPain प्रस्तुत करता है, जो 82,500 फ्रेमों वाला एक बड़े पैमाने का सिंथेटिक डेटासेट और एक संगत ViTPain फ्रेमवर्क है, जिसका उद्देश्य विविध, नैदानिक रूप से मान्य और पहचान-जागरूक चेहरे के दर्द के भाव उत्पन्न करके स्वचालित दर्द मूल्यांकन में डेटा की कमी और नियंत्रण सीमाओं को दूर करना है।

Xin Lei Lin, Soroush Mehraban, Abhishek Moturu, Babak Taati2026-07-22
🤖 AI

Kontinuous Kontext: Continuous Strength Control for Instruction-based Image Editing

यह शोध पत्र 'कॉन्टिनुअस कॉन्टेक्स्ट' (Kontinuous Kontext) का परिचय देता है, जो एक निर्देश-आधारित इमेज एडिटिंग मॉडल है जो एक हल्के प्रोजेक्टर को मॉडल के मॉड्यूलेशन स्पेस में एक स्केलर स्ट्रेंथ वैल्यू और टेक्स्ट निर्देश को मैप करने के लिए प्रशिक्षित करके, एडिट की स्ट्रेंथ पर सुचारू और निरंतर नियंत्रण सक्षम करता है, जिससे उपयोगकर्ता विभिन्न ऑपरेशन्स में सूक्ष्म से लेकर पूरी तरह से साकार किए गए बदलावों को बिना किसी एट्रिब्यूट-विशिष्ट प्रशिक्षण के समायोजित कर सकते हैं।

Rishubh Parihar, Or Patashnik, Daniil Ostashev, R. Venkatesh Babu, Daniel Cohen-Or, Kuan-Chieh Wang2026-07-22
🤖 AI

An Experimental Study of Trojan Vulnerabilities in UAV Autonomous Landing

यह अध्ययन अर्बन एयर मोबिलिटी वाहनों के स्वायत्त लैंडिंग सिस्टम पर ट्रोजन हमलों द्वारा उत्पन्न महत्वपूर्ण सुरक्षा जोखिमों को प्रदर्शित करता है, जो यह प्रकट करता है कि जब डीप लर्निंग मॉडल प्रशिक्षण डेटा में गुप्त ट्रिगर्स से समझौता किए जाते हैं, तो सटीकता में 96.4% से 73.3% तक की भारी गिरावट आती है।

Reza Ahmari, Ahmad Mohammadi, Vahid Hemmati, Mohammed Mynuddin, Mahmoud Nabil Mahmoud, Parham Kebria, Abdollah Homaifar (…)2026-07-22