💻 computer science

Structured 4D Latent Predictive Model for Robot Planning

यह शोध पत्र एक स्ट्रक्चर्ड 4D लेटेंट प्रेडिक्टिव मॉडल पेश करता है जो मौजूदा वीडियो-आधारित प्लानर्स की 2D सीमाओं को पार करने के लिए एक स्ट्रक्चर्ड लेटेंट स्पेस में 3D दृश्य विकास (scene evolution) का पूर्वानुमान लगाता है, जिससे जटिल रोबोटिक मैनिपुलेशन कार्यों के लिए बेहतर 3D निरंतरता, दृश्य गुणवत्ता और सुदृढ़ सामान्यीकरण प्राप्त होता है।

Zhiyi Li, Peilin Wu, Xiaoshen Han, Ruojin Cai, Yilun Du2026-07-02
💻 computer science

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

यह शोध पत्र पर्सीव-टू-रीज़न (P2R) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो सूक्ष्म दृश्य तर्क (fine-grained visual reasoning) को विशिष्ट धारणा (perception) और तर्क (reasoning) चरणों में अलग करता है, जिसे विभिन्न मॉडल पैमानों और उच्च-रिज़ॉल्यूशन बेंचमार्क पर प्रदर्शन को महत्वपूर्ण रूप से बढ़ाने के लिए एक भूमिका-जागरूक सुदृढीकरण शिक्षण रणनीति (PRA-GRPO) द्वारा संवर्धित किया गया है।

Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huan (…)2026-07-02
🤖 AI

World from Motion: Generative Dynamic Gaussian Reconstruction from Monocular Video

"वर्ल्ड फ्रॉम मोशन" नामक शोध पत्र एक ऐसी नवीन विधि प्रस्तुत करता है जो सिंगल-व्यू वीडियो से प्रारंभिक 3D गॉसियन पुनर्निर्माणों को परिष्कृत करने के लिए सिम्युलेटेड मोनोकुलर आर्टिफैक्ट्स पर प्रशिक्षित एक वीडियो मॉडल का लाभ उठाती है, जिसके परिणामस्वरूप बेहतर मोशन कंसिस्टेंसी और नोवेल-व्यू सिंथेसिस के साथ उच्च-गुणवत्ता वाले, स्वतंत्र रूप से रेंडर करने योग्य डायनेमिक 3D दृश्य प्राप्त होते हैं।

Liyuan Zhu, Shengyu Huang, Amrita Mazumdar, Tianye Li, Zan Gojcic, Gordon Wetzstein, Iro Armeni, Shalini De Mello, Alex (…)2026-07-02
💻 computer science

Linkify: Learning from Interface-Augmented Assembly Graphs

यह शोध पत्र Linkify को प्रस्तुत करता है, जो एक ऐसा ढांचा (framework) है जो घटकों के बीच उच्च-सटीकता वाले संपर्क ज्यामिति (high-fidelity contact geometry) को स्पष्ट रूप से मॉडल करने के लिए इंटरफ़ेस-संवर्धित असेंबली ग्राफ और ग्राफ अटेंशन नेटवर्क का लाभ उठाता है ताकि यांत्रिक असेंबली में संदर्भ-जागरूक भाग पुनर्प्राप्ति (context-aware part retrieval) में सुधार किया जा सके।

Anushrut Jignasu, Daniele Grandi2026-07-02
💻 computer science

PoseGravity: Pose Estimation from Points and Lines with Axis Prior

यह शोध पत्र पोज़ग्रेविटी (PoseGravity) को प्रस्तुत करता है, जो एक कुशल एल्गोरिदम है जो एक अक्ष पूर्वधारणा (axis prior) का लाभ उठाकर बिंदु और रेखा विशेषताओं से पूर्ण कैमरा पोज़ का अनुमान लगाता है ताकि इस समस्या को एक अतिपरवलय (hyperbola) और एक इकाई वृत्त (unit circle) के प्रतिच्छेदन के रूप में हल किया जा सके, साथ ही यह समतलीय और न्यूनतम विन्यासों के लिए सरलीकृत बंद-रूप समाधान भी प्रदान करता है।

Akshay Chandrasekhar2026-07-01
💻 computer science

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman एक नवीन फ्रेमवर्क है जो विस्तृत, पहचान-संरक्षित दृश्य संश्लेषण के लिए क्रॉस-स्केल मल्टीव्यू डिफ्यूजन को शारीरिक निरंतरता और उच्च-सटीक ज्यामिति सुनिश्चित करने के लिए SMPL-X-कंडीशन्ड एक्सप्लिसिट रिमेशिंग के साथ जोड़कर, एकल RGB इमेज से फोटो-यथार्थवादी 3D मानव पुनर्निर्माण प्राप्त करता है।

Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, We (…)2026-07-01
💻 computer science

Stealthy Multi-Task Adversarial Attacks

यह शोध पत्र स्टेल्थी मल्टी-टास्क एडवरसेरियल अटैक (SMTA2^{2}) का प्रस्ताव करता है, जो एक नवीन ढांचा है कि जो कन्सट्रेंड ऑप्टिमाइज़ेशन और ऑटोमेटेड लॉस-वेट ट्यूनिंग के माध्यम से गैर-लक्षित कार्यों के प्रदर्शन को सख्ती से सुरक्षित रखते हुए मल्टी-टास्क डीप न्यूरल नेटवर्क्स में लक्षित कार्यों को चुनिंदा रूप से कम करता है।

Jiacheng Guo, Tianyun Zhang, Lei Li, Haochen Yang, Hongkai Yu, Minghai Qin2026-07-01
💻 computer science

Improved Immiscible Diffusion: Accelerate Diffusion Training by Reducing Its Miscibility

यह शोध पत्र "इम्प्रूव्ड इमिस्सिबल डिफ्यूजन" (Improved Immiscible Diffusion) प्रस्तुत करता है, जो KNN नॉइज़ सिलेक्शन और इमेज स्केलिंग जैसे बहुमुखी कार्यान्वयन के माध्यम से ट्रैजेक्टरी मिक्सिंग (मिसिबिलिटी) को कम करके डिफ्यूजन मॉडल प्रशिक्षण को त्वरित करता है, जिससे डीनॉइजिंग प्रक्रिया सरल हो जाती है और जनरेटिव विविधता को बनाए रखते हुए विविध कार्यों में 4 गुना तक तेज़ प्रशिक्षण प्राप्त होता है।

Yiheng Li, Feng Liang, Dan Kondratyuk, Masayoshi Tomizuka, Kurt Keutzer, Chenfeng Xu2026-07-01
⚡ electrical engineering

Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance

यह शोध पत्र एक चरण-दर-चरण वीडियो-से-ऑडियो संश्लेषण विधि का प्रस्ताव करता है जो महंगी मल्टी-रेफरेंस डेटासेट की आवश्यकता के बिना, विशिष्ट और यथार्थवादी ध्वनि घटनाओं को क्रमिक रूप से उत्पन्न करने के लिए नेगेटिव ऑडियो गाइडेंस का लाभ उठाता है, जिससे ध्वनि की पृथक्करणीयता और समग्र ऑडियो गुणवत्ता में वृद्धि होती है।

Akio Hayakawa, Masato Ishii, Takashi Shibuya, Yuki Mitsufuji2026-07-01
💻 computer science

Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples

यह शोध पत्र फ्यू-शॉट एट्रिब्यूशन प्रतिमान (few-shot attribution paradigm), बड़े पैमाने के OmniFake डेटासेट और OmniDFA मॉडल को पेश करते हुए, सीमित नमूनों के साथ अनदेखे AI-जनित छवि स्रोतों की पहचान करने की चुनौती का समाधान करता है, जो डिटेक्शन और एट्रिब्यूशन दोनों में अत्याधुनिक सामान्यीकरण (state-of-the-art generalization) प्राप्त करता है।

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang2026-07-01