🤖 AI

DramaDirector: Geometry-Guided Short Drama Generation

यह शोध पत्र DramaDirector प्रस्तुत करता है, जो एक ज्यामिति-निर्देशित (geometry-guided) ढांचा है जो शॉट्स को स्थिर और गतिशील स्थितियों में विभाजित करके, वास्तविक सिनेमैटोग्राफी से डेप्थ-पोज़ रिट्रीवल का लाभ उठाकर, और स्कीमा-प्रतिबंधित प्रशिक्षण का उपयोग करके दृश्य रूप से आधारित लघु नाटक उत्पन्न करता है, साथ ही व्यापक मूल्यांकन के लिए नए DramaBoard बेंचमार्क का भी उपयोग करता है।

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie2026-06-24
💻 computer science

An LMM for Precisely Grounding Elements in Documents

यह शोधपत्र PreciseDoc को प्रस्तुत करता है, जो एक लार्ज मल्टीमॉडल मॉडल है जिसे बड़े पैमाने पर उत्पादित सिंथेटिक प्रशिक्षण डेटा और एक संयुक्त सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) प्रतिमान के उपयोग के माध्यम से टेक्स्ट-समृद्ध दस्तावेजों में विजुअल ग्राउंडिंग की सटीकता में सुधार करने के लिए डिज़ाइन किया गया है, जो ग्राउंडिंग को रीजनिंग के साथ एकीकृत करता है।

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Juanzi Li, Ji Qi2026-06-24
💻 computer science

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

यह शोध पत्र PriorTR को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) टोकन रिडक्शन विधि है जो एकल फॉरवर्ड पास के भीतर एक नल टोकन प्रोब (null token probe) का उपयोग करके टास्क-कंडीशन्ड अटेंशन को मॉडल-प्रेरित प्रायर्स (model-induced priors) से स्पष्ट रूप से अलग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को त्वरित करती है, जिससे आक्रामक टोकन बजट के तहत सटीकता-दक्षता संतुलन में सुधार होता है।

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen2026-06-24
💻 computer science

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

यह शोध पत्र CLSE का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) टोकन प्रूनिंग फ्रेमवर्क है जो अर्थपूर्ण रूप से सक्रिय विजुअल टोकन की पहचान करने और उन्हें संरक्षित करने के लिए फ्रीक्वेंसी डोमेन में क्रॉस-लेयर स्पेक्ट्रल इवोल्यूशन को परिमाणित करता है, जिससे रीजनिंग प्रदर्शन को बनाए रखते हुए या सुधारते हुए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को त्वरित किया जा सके।

Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen2026-06-24
💻 computer science

Tri-Efficient Transfer Learning for Point Cloud Videos

यह शोध पत्र PoinTriE को प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो स्व-पर्यवेक्षित प्री-ट्रेनिंग के लिए छद्म-गति प्रक्षेप पथों (pseudo-motion trajectories) को संश्लेषित करके और फाइन-ट्यूनिंग के लिए एक हल्के, ग्रेडिएंट-मास्क्ड स्पैटियो-टेम्पोरल साइड नेटवर्क का उपयोग करके पॉइंट क्लाउड वीडियो के लिए डेटा-, पैरामीटर-, और मेमोरी-कुशल ट्रांसफर लर्निंग प्राप्त करता है, जिससे एनोटेशन और मेमोरी बाधाओं को दूर करते हुए नए अत्याधुनिक परिणाम स्थापित होते हैं।

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen2026-06-24
🤖 AI

Deep Learning Approaches for 3D Medical Scene Completion: From Geometric Modeling to Generative Paradigms

यह शोध पत्र 2016 से 2026 तक 3D मेडिकल सीन कंप्लीशन के लिए डीप लर्निंग दृष्टिकोणों की एक व्यवस्थित समीक्षा प्रस्तुत करता है, जो वोक्सेल-आधारित विधियों से लेकर जनरेटिव डिफ्यूजन और गॉसियन स्प्लेटिंग प्रतिमानों तक क्षेत्र के विकास को रेखांकित करता है, साथ ही एक वर्गीकरण, चुनौतियों का विश्लेषण और भविष्य के सिस्टम के लिए एक अनुसंधान एजेंडा भी प्रदान करता है।

Afifa Khaled, Said Jadid Abdulkadir, Majdy Mohamed Eltayeb Eltahir2026-06-24
💻 computer science

MorVess: Morphology-Aware Pulmonary Vessel Segmentation Network

MorVess एक मॉर्फोलॉजी-अवेयर सेगमेंटेशन फ्रेमवर्क है जो पल्मोनरी सीटी स्कैन में सूक्ष्म संवहनी विवरणों और टोपोलॉजिकल अखंडता की बेहतर रिकवरी प्राप्त करने के लिए सेगमेंट एनीथिंग मॉडल के साथ डिफरेंशिएबल ज्योमेट्रिक प्रायर्स को 2.5D एडेप्टर के साथ एकीकृत करता है ताकि वे संयुक्त रूप से वेसल मास्क, डिस्टेंस मैप्स और थिकनेस मैप्स की भविष्यवाणी कर सकें।

Fuyou Mao, Yifei Chen, Beining Wu, Lixin Lin, Jinnan Dai, Zhiling Li, Yilei Chen, Yaqi Wang, Hao Zhang, Yan Tang, Huiyu (…)2026-06-24
💻 computer science

Geometry-Instructed Video Editing

यह शोध पत्र GIVE को प्रस्तुत करता है, जो एक ज्यामिति-निर्देशित (geometry-instructed) वीडियो संपादन ढांचा है जो विश्वसनीय, टेम्पोरल रूप से सुसंगत ऑब्जेक्ट-स्तरीय ज्यामितीय संपादन प्राप्त करने के लिए एकीकृत ऑब्जेक्ट-स्टेट सूत्रीकरणों और डेप्थ/ओरिएंटेशन-बॉक्स स्ट्रीम्स का उपयोग करता है, जिसमें छाया और प्रतिबिंब जैसे सुसंगत माध्यमिक प्रभाव भी शामिल हैं।

Chirui Chang, Xiaoyang Lyu, Yi-Hua Huang, Haoru Tan, Shizhen Zhao, Yikang Ding, Jianmin Bao, Xin Tao, Pengfei Wan, Xiaoj (…)2026-06-24
💻 computer science

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA एक फीड-फॉरवर्ड पाइपलाइन है जो विजन फाउंडेशन मॉडल्स, एक डिफ्यूजन-आधारित मेश रिकन्स्ट्रक्शन नेटवर्क और एक रिफाइनमेंट मॉड्यूल को संयोजित करके, एकल पोर्ट्रेट इमेज से फोटोरियलिस्टिक, रियल-टाइम ड्राइव करने योग्य 3D गॉसियन अवतार उत्पन्न करती है, जिससे व्यक्ति-विशिष्ट टेस्ट-टाइम ऑप्टिमाइज़ेशन की आवश्यकता समाप्त हो जाती है।

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-H (…)2026-06-24
💻 computer science

From Open Waters to Enclosed Cabins: ProteusVPR for Cross-Scene Visual Place Recognition in Maritime Perception and Cabin Inspection

यह शोध पत्र प्रोटियसवीपीआर (ProteusVPR) को प्रस्तुत करता है, जो एक दो-चरणीय रिट्रीवल-रिफाइनमेंट फ्रेमवर्क है जिसे समुद्री वातावरण में क्रॉस-सीन धारणा संबंधी चुनौतियों को दूर करने के लिए डिज़ाइन किया गया है, जो नए प्रस्तावित एक्सएचजेड (XHZ) डेटासेट द्वारा समर्थित, खुले डेक और बंद केबिनों के बीच संक्रमण करने वाले स्वायत्त रोबोटों के लिए विजुअल प्लेस रिकग्निशन की सटीकता में महत्वपूर्ण सुधार करता है।

Zexi Chena, Zitai Huang, Qiwen Gu, Zhiqi Li, Shengli Dong, Chenlei Wang, Junqiao Zhao, Hongdong Wang, Bing Han2026-06-24