🤖 AI

Li-ViP3D++: Query-Gated Deformable Camera-LiDAR Fusion for End-to-End Perception and Trajectory Prediction

Li-ViP3D++ एक क्वेरी-गेटेड डिफॉर्मेबल फ्यूजन फ्रेमवर्क पेश करता है जो एंड-टू-एंड धारणा और प्रक्षेपवक्र भविष्यवाणी (ट्रैजेक्टरी प्रेडिक्शन) को संयुक्त रूप से अनुकूलित करने के लिए क्वेरी स्पेस में मल्टी-व्यू कैमरा और LiDAR डेटा को पूर्णतः डिफरेंशियल रूप से एकीकृत करता है, जिससे पूर्ववर्ती विधियों की तुलना में nuScenes बेंचमार्क पर बेहतर सटीकता और दक्षता प्राप्त होती है।

Matej Halinkovic, Nina Masarykova, Alexey Vinel, Marek Galinski2026-07-21
🔬 applied physics

SoMA: A Real-to-Sim Neural Simulator for Robotic Soft-body Manipulation

यह शोध पत्र SoMA को प्रस्तुत करता है, जो एक 3D गॉसियन स्प्लेट-आधारित न्यूरल सिम्युलेटर है जो पूर्व-निर्धारित भौतिक मॉडलों पर निर्भर किए बिना सटीक, स्थिर और सामान्यीकरण योग्य रियल-टू-सिम सॉफ्ट-बॉडी मैनिपुलेशन प्राप्त करने के लिए लेटेंट स्पेस में डिफॉर्मेबल डायनेमिक्स, पर्यावरणीय बलों और रोबोटिक क्रियाओं को एकीकृत करता है।

Mu Huang, Hui Wang, Kerui Ren, Linning Xu, Yunsong Zhou, Mulin Yu, Bo Dai, Jiangmiao Pang2026-07-21
🧬 biology

Quantifying Avian Morphological Evolution through Deep Representation Learning

यह शोध पत्र एक स्केलेबल, लैंडमार्क-मुक्त डीप लर्निंग फ्रेमवर्क प्रस्तुत करता है जो 10,000 से अधिक पक्षी प्रजातियों से उच्च-आयामी दृश्य विशेषताओं (विजुअल फीचर्स) को निकालता है ताकि फाइलोगेनेटिक संबंधों और पारिस्थितिक लक्षणों का पुनर्निर्माण किया जा सके, जो K-Pg सामूहिक विलुप्ति के बाद रूपात्मक विषमता (मॉर्फोलॉजिकल डिसपैरिटी) के एक स्पष्ट "अर्ली-बर्स्ट" पैटर्न को प्रकट करता है।

Jiao Sun2026-07-21
💻 computer science

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

Hierarchical Memory System को पेश करके, MemVLN ओपन-सोर्स ज़ीरो-शॉट विज़न-एंड-लैंग्वेज नेविगेशन में "नेविगेशन एम्नेशिया" (Navigation Amnesia) की समस्या का समाधान किया है, जो दीर्घकालिक स्थानीयकरण (long-term localization) और विज़ुअल रिकॉल को महत्वपूर्ण रूप से बढ़ाता है, जिससे मौजूदा अत्याधुनिक ओपन-सोर्स विधियों के प्रदर्शन को लगभग दोगुना कर दिया गया है।

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan (…)2026-07-21
💻 computer science

Geometrically Consistent Multi-View Scene Generation from Freehand Sketches

यह शोध पत्र एक नए क्यूरेटेड डेटासेट, समानांतर कैमरा-अवेयर अटेंशन एडेप्टर और स्पार्स कॉरेस्पोंडेंस सुपरविजन का लाभ उठाकर, विकृत 2D इनपुट और प्रशिक्षण डेटा की कमी की चुनौतियों को दूर करने के लिए, एक एकल फ्रीहैंड स्केच से ज्यामितीय रूप से सुसंगत मल्टी-व्यू 3D दृश्य उत्पन्न करने के लिए एक नवीन ढांचे (फ्रेमवर्क) को प्रस्तुत करता है, जो मौजूदा विधियों की तुलना में बेहतर यथार्थवाद, निरंतरता और अनुमान गति प्राप्त करता है।

Ahmed Bourouis, Savas Ozkan, Andrea Maracani, Yi-Zhe Song, Mete Ozay2026-07-21
🤖 AI

When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation

यह शोध पत्र MAVEN को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो विशेष प्रॉम्प्ट रिफाइनमेंट के माध्यम से टेक्स्ट-टू-वीडियो जनरेशन में सांस्कृतिक निष्ठा (cultural fidelity) को बढ़ाता है, जिसे चीनी, अमेरिकी और रोमानियाई संदर्भों में 243 सांस्कृतिक रूप से आधारित प्रॉम्प्ट और 972 वीडियो के एक नए बेंचमार्क द्वारा सत्यापित किया गया है।

Shuowei Li, Yuming Zhao, Parth Bhalerao, Oana Ignat2026-07-21
💻 computer science

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

यह शोध पत्र मेमोबेंच (MemoBench) प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जिसमें 360 ग्राउंड-ट्रुथ क्लिप्स और एक बहुआयामी मूल्यांकन सूट शामिल है, जिसका उद्देश्य गतिशील रूप से बदलते परिवेश में छिपे रहने के दौरान भौतिक परिवर्तन से गुजरने वाली वस्तुओं के लिए वीडियो जेनरेशन मॉडल्स की मेमोरी कंसिस्टेंसी (स्मृति निरंतरता) बनाए रखने की क्षमता का आकलन करना है।

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyu (…)2026-07-21
🤖 AI

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

ResearchStudio-Reel एक नेटिव-एडिटेबल प्रसार वर्कस्पेस है जो शोध पत्रों को इंटरैक्टिव, मल्टी-फॉर्मेट डिलिवरेबल्स (पोस्टर, वीडियो और ब्लॉग) में रूपांतरित करने को स्वचालित करता है, जो संपादन योग्य आर्टिफ़ेक्ट्स को एक एकीकृत व्यूअर में बांधकर, Paper2Poster बेंचमार्क पर सौंदर्य और सूचनात्मक गुणवत्ता दोनों में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Lingao Xiao, Yalun Dai, Yangyu Huang, Qihao Zhao, Wenshan Wu, Hugo He, Ruishuo Chen, Jin Jiang, Qianli Ma, Jiahuan Zhang (…)2026-07-21
💻 computer science

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoE एक खुला, समुदाय-संचालित डेटासेट और टूलचेन है जो 2,000 घंटों के संरचित हेरफेर (manipulation) डेटा के साथ-साथ विभिन्न रोबोट लर्निंग मॉडल्स को प्रोसेस करने, रिटारगेटिंग करने और प्रशिक्षित करने के लिए एक व्यापक पाइपलाइन प्रदान करके, स्केलेबल स्मार्टफोन-आधारित एर्गोसेंट्रिक (egocentric) वीडियो कैप्चर और एम्बॉडीड एआई (embodied AI) प्रशिक्षण के बीच के अंतर को पाटता है।

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Z (…)2026-07-21
🤖 AI

VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

यह शोध पत्र VideoSEMA को प्रस्तुत करता है, जो एक स्केलेबल और कुशल वीडियो वर्गीकरण मॉडल है जो सॉफ्टमैक्स टेम्पोरल अटेंशन के साथ एक मांबा-जैसे (Mamba-like) स्प्लिट स्पेस-टाइम अटेंशन मैकेनिज्म को जोड़ता है, जो K400 और SSv2 बेंचमार्क पर मौजूदा विजन ट्रांसफॉर्मर और मांबा मॉडलों की तुलना में बेहतर सटीकता और रिज़ॉल्यूशन मजबूती प्रदर्शित करता है।

Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin2026-07-21