💻 computer science

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

यह शोध पत्र Wan-Dancer को प्रस्तुत करता है, जो एक नवीन पदानुक्रमित ढांचा (hierarchical framework) है जो वैश्विक कीफ्रेम योजना (global keyframe planning) को स्थानीय टेम्पोरल रिफाइनमेंट (local temporal refinement) से अलग करके, संगीत से सीधे मिनट-स्तर के, उच्च-परिभाषा (720p/30fps), और लयबद्ध रूप से सुसंगत नृत्य वीडियो उत्पन्न करने के लिए मौजूदा डिफ्यूजन मॉडल्स की टेम्पोरल सीमाओं को दूर करता है।

Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang2026-07-13
💻 computer science

The Effects of Synthetic Data and Label Distribution on Canola Branch Counting

यह अध्ययन प्रदर्शित करता है कि एक कैलिब्रेटेड L-सिस्टम मॉडल द्वारा जनरेट किए गए सिंथेटिक डेटा के साथ कैनोला शाखा गणना के लिए ResNet-18 मॉडल को प्रशिक्षित करने से प्रदर्शन में महत्वपूर्ण सुधार होता है, जब सिंथेटिक-टू-रियल इमेज अनुपात को 1:7 के अनुकूलित किया जाता है और सिंथेटिक लेबल वितरण को वास्तविक डेटा से मेल खाने के लिए स्मूथ किया जाता है, जिससे केवल वास्तविक डेटा का उपयोग करने की तुलना में माध्य पूर्ण अंतर (mean absolute difference) में 14.7% की कमी आती है।

Amirsalar Darvishpour, Mikolaj Cieslak, Adam Runions2026-07-13
🤖 AI

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

यह शोध पत्र एक दशक के विजन-लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए कॉम्प्लेक्स सोशल बिहेवियर (CSB) डेटासेट प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) ने अधिकांश त्रुटि प्रकारों को काफी हद तक समाप्त करके जटिल सामाजिक दृश्यों पर मानव-स्तर की सटीकता प्राप्त कर ली है, फिर भी वे स्थानिक निर्भरता (spatial dependence) में कभी-कभी मनुष्यों से भिन्न होते हैं।

Shravan Murlidaran, Miguel P. Eckstein2026-07-13
💻 computer science

OpenLongTail: Generative Scaling of Long-Tail Driving Data

OpenLongTail एक ओपन-सोर्स जनरेटिव इंजन है जो विषम मोनोकुलर स्रोतों से व्यू-अलाइन्ड (view-aligned), टेम्पोरली कोहेरेंट (temporally coherent) मल्टी-व्यू एसेट्स को सिंथेसाइज करके लॉन्ग-टेल ड्राइविंग डेटा की कमी को संबोधित करता है, जिससे एज केसेस (edge cases) में ऑटोनॉमस ड्राइविंग पॉलिसियों की मजबूती में महत्वपूर्ण सुधार होता है।

Lulin Liu, Nuo Chen, Yan Wang, Bangya Liu, Wenyan Cong, Hezhen Hu, Boris Ivanovic, Hao Wang, Ziyao Zeng, Xinyu Gong, Yan (…)2026-07-13
🤖 AI

Scalable Visual Pretraining for Language Intelligence

यह शोध पत्र फाउंडेशन मॉडल प्रीट्रेनिंग के केवल-टेक्स्ट प्रतिमान को चुनौती देता है, यह प्रदर्शित करते हुए कि कच्चे दृश्य दस्तावेजों (raw visual documents) पर अनसुपरवाइज्ड विजुअल प्रीट्रेनिंग, जो आकृतियों और लेआउट जैसी समृद्ध जानकारी को संरक्षित करता है, लगातार केवल-टेक्स्ट दृष्टिकोणों से बेहतर प्रदर्शन करता है और उन्नत भाषा बुद्धिमत्ता के लिए एक स्केलेबल मार्ग प्रदान करता है।

Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye (…)2026-07-13
🤖 machine learning

Computation, Condensation, and the Incompleteness Between Them: A Coupled Foundation of Intelligence

यह शोधपत्र तर्क देता है कि वास्तविक बुद्धिमत्ता के लिए विविक्त प्रतीकात्मक तर्क (discrete symbolic logic) और निरंतर ज्यामितीय अवतरण (continuous geometric descent) की विशिष्ट अपूर्णताओं को दूर करने हेतु गणना और स्मृति का बाध्यकारी युग्मन आवश्यक है, जो संदर्भ पहचान के बिंदु पर एक अपरिहार्य त्रुटि तल (irreducible error floor) को अनिवार्य रूप से प्रस्तुत करता है।

Xin Li2026-07-10
💻 computer science

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो पूर्व-प्रशिक्षित इमेज-टू-वीडियो डिफ्यूजन मॉडल्स, कॉन्फिडेंस-गाइडेड LLM रीजनिंग और डिफरेंशियल फिजिक्स सिमुलेशन को एकीकृत करके एक एकल छवि से भौतिक रूप से सुसंगत 3D मोशन उत्पन्न करता है ताकि अत्याधुनिक वीडियो जनरेटर्स में सामान्य भौतिक अस्वाभाविकता को दूर किया जा सके।

Siwei Meng, Yawei Luo, Ping Liu2026-07-10
💻 computer science

LlamaSeg: Image Segmentation via Autoregressive Mask Generation

LlamaSeg एक विजुअल ऑटोरेग्रेसिव फ्रेमवर्क है जो मास्क को नेक्स्ट-टोकन प्रेडिक्शन के लिए विजुअल टोकन के रूप में एनकोड करके कई इमेज सेगमेंटेशन कार्यों को एकीकृत करता है, जिसे बेहतर मास्क सटीकता और ओपन-वोकैबुलरी लोकलाइजेशन प्राप्त करने के लिए एक नए 2M-स्केल SA-OVRS डेटासेट और एक नवीन हॉसरडॉर्फ-आधारित मीट्रिक द्वारा समर्थित किया गया है।

Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang2026-07-10
🤖 machine learning

MultiFair: Multimodal Balanced Fairness-Aware Medical Classification with Dual-Level Gradient Modulation

यह शोध पत्र MultiFair को प्रस्तुत करता है, जो एक नवीन मल्टीमॉडल मेडिकल क्लासिफिकेशन फ्रेमवर्क है जो डेटा मोडैलिटी और ग्रुप दोनों स्तरों पर प्रशिक्षण ग्रेडिएंट्स को गतिशील रूप से समायोजित करके मोडैलिटी लर्निंग असंतुलन और जनसांख्यिकीय निष्पक्षता के मुद्दों को एक साथ संबोधित करने के लिए ड्यूल-लेवल ग्रेडिएंट मॉड्यूलेशन का उपयोग करता है।

Md Zubair, Hao Zheng, Grayson W. Armstrong, Lucy Q. Shen, Gabriela Wilson, Yu Tian, Xingquan Zhu2026-07-10
🧬 biology

TrackStudio: An Integrated Toolkit for Markerless Tracking

ट्रैकस्टूडियो (TrackStudio) एक सुलभ, GUI-आधारित टूलकिट है जो ओपन-सोर्स टूल्स को एकीकृत करके मार्करलेस 2D और 3D मोशन ट्रैकिंग के लिए एक पूर्ण, प्रोग्रामिंग-मुक्त पाइपलाइन प्रदान करता है, जिसे शोधकर्ताओं और गैर-विशेषज्ञों दोनों के लिए विश्वसनीय प्रदर्शन देने हेतु विविध वातावरणों में मान्य किया गया है।

Hristo Dimitrov, Viktorija Pavalkyte, Giulia Dominijanni, Tamar R. Makin2026-07-10