💻 computer science

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Z-Image एक कुशल 6B-पैरामीटर वाला ओपन-सोर्स इमेज जनरेशन फाउंडेशन मॉडल है जो एक स्केलेबल सिंगल-स्ट्रीम डिफ्यूजन ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित है और जो फोटोरियलिज्म एवं टेक्स्ट रेंडरिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है, जिससे काफी कम कम्प्यूटेशनल लागत के साथ उच्च-गुणवत्ता वाली जनरेशन उपभोक्ता-ग्रेड हार्डवेयर पर भी सुलभ हो जाती है।

Image Team, Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Aiming Hao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jian (…)2026-06-23
💻 computer science

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld एक नवीन रूपरेखा (framework) प्रस्तुत करता है जो एक विज़न-लैंग्वेज मॉडल का लाभ उठाकर इमेज-कैप्शन युग्मों को स्वायत्त रूप से अमूर्त, ग्राउंडेड सीन रिप्रजेंटेशन में संकुचित (distill) करता है और उपयुक्त भौतिकी सिम्युलेटरों का चयन करता है, जिससे इंटरैक्टिव कंट्रोल, काउंटरफैक्चुअल जनरेशन और फिजिकल रीजनिंग में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए जेनेरेटिव वीडियो मॉडल्स की सीमाओं को दूर किया जा सके।

Felix O'Mahony, Roberto Cipolla, Ayush Tewari2026-06-23
🧬 biology

Region-Specific Calibration Achieves Excellent Inter-Device Reliability for Smartphone Dermatology: A Multi-Device Benchmark on Korean Facial Skin

यह अध्ययन प्रदर्शित करता है कि जबकि मानक वैश्विक रंग सुधार स्मार्टफोन डर्मेटोलॉजी के लिए अंतर-डिवाइस विश्वसनीयता में महत्वपूर्ण सुधार करता है, कोरियाई चेहरे की त्वचा पर क्षेत्र-विशिष्ट अंशांकन (कैलिब्रेशन) को लागू करने से मेलानिन और स्किन टाइप इंडेक्स के लिए उत्कृष्ट विश्वसनीयता प्राप्त होती है, जो उपभोक्ता उपकरणों को त्वचा कलरिमेट्री के लिए नैदानिक रूप से व्यवहार्य उपकरण के रूप में स्थापित करता है।

Sungwoo Kang2026-06-23
💻 computer science

360Anything: Geometry-Free Lifting of Images and Videos to 360°

360Anything एक ज्यामिति-मुक्त (geometry-free) फ्रेमवर्क है जो पर्सपेक्टिव छवियों और वीडियो को शुद्ध रूप से डेटा-संचालित तरीके से 360° पैनोरमा में उन्नत करने के लिए प्री-ट्रेंड डिफ्यूजन ट्रांसफॉर्मर्स का लाभ उठाता है, जो कैमरा मेटाडेटा की आवश्यकता को समाप्त करते हुए अत्याधुनिक प्रदर्शन प्राप्त करता है और एक नवीन सर्कुलर लेटेंट एनकोडिंग तकनीक के माध्यम से बाउंड्री आर्टिफैक्ट्स को हल करता है।

Ziyi Wu, Daniel Watson, Andrea Tagliasacchi, David J. Fleet, Marcus A. Brubaker, Saurabh Saxena2026-06-23
🤖 machine learning

Robust Representation Learning in Masked Autoencoders

यह शोध पत्र मास्क्ड ऑटोएनकोडर्स (MAEs) के सुदृढ़ प्रतिनिधित्व शिक्षण (robust representation learning) की जांच करता है, जो यह प्रकट करता है कि उनका मजबूत डाउनस्ट्रीम वर्गीकरण प्रदर्शन प्रगतिशील वर्ग-जागरूक लेटेंट स्पेस निर्माण, निरंतर वैश्विक ध्यान (global attention), और नवीन संवेदनशीलता संकेतकों द्वारा परिमाणित छवि क्षरण के प्रति अंतर्निहित लचीलेपन से उत्पन्न होता है।

Anika Shrivastava, Renu Rameshan, Samar Agnihotri2026-06-23
📊 statistics

Training-Free Zero-Shot Anomaly Detection in 3D Brain MRI with 2D Foundation Models

यह शोध पत्र एक पूर्णतः प्रशिक्षण-मुक्त ढांचे को प्रस्तुत करता है जो शून्य-शून्य (zero-shot) विसंगति का पता लगाने के लिए मल्टी-एक्सिस स्लाइस को स्थानीयकृत वॉल्यूमेट्रिक टोकन में एकत्रित करके 2D फाउंडेशन मॉडल को 3D ब्रेन एमआरआई (MRI) तक विस्तारित करता है, जिससे बिना किसी फाइन-ट्यूनिंग या पर्यवेक्षण के 3D स्थानिक संदर्भ को पुनर्स्थापित किया जाता है।

Tai Le-Gia, Jaehyun Ahn2026-06-23
💻 computer science

DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

यह शोध पत्र DamageArbiter प्रस्तुत करता है, जो एक मल्टीमॉडल मध्यस्थता ढांचा (multimodal arbitration framework) है जो अनिमॉडल और मल्टीमॉडल मॉडलों के बीच असहमति को सुलझाने के लिए एक लॉजिस्टिक रिग्रेशन मेटा-क्लासिफायर का लाभ उठाता है, जिससे स्ट्रीट-व्यू-आधारित आपदा क्षति मूल्यांकन में ओवरकॉन्फिडेंस त्रुटियों को काफी हद तक कम करके वर्गीकरण सटीकता और विश्वसनीयता दोनों में महत्वपूर्ण सुधार होता है।

Yifan Yang, Lei Zou, Wenjing Gong, Kani Fu, Zongrong Li, Siqin Wang, Bing Zhou, Heng Cai, Hao Tian2026-06-23
💻 computer science

A Physics-Informed, Behavior-Aware Digital Twin for Robust Multimodal Forecasting of Core Body Temperature in Precision Livestock Farming

यह अध्ययन सटीक पशुधन खेती में हीट स्ट्रेस (ताप तनाव) के शीघ्र पता लगाने के लिए डेयरी मवेशियों के कोर बॉडी टेम्परेचर (शरीर के आंतरिक तापमान) के सटीक मल्टीमॉडल पूर्वानुमान हेतु एक अनिश्चितता-जागरूक, विशेषज्ञ-भारित स्टैक्ड एन्सेम्बल के साथ एकीकृत एक सुदृढ़, भौतिकी-सूचित डिजिटल ट्विन फ्रेमवर्क प्रस्तावित करता है।

Riasad Alvi, Mohaimenul Azam Khan Raiaan, Sadia Sultana Chowa, Arefin Ittesafun Abian, Reem E Mohamed, Md Rafiqul Islam (…)2026-06-23
💻 computer science

HRDexDB: A Paired Human-Robot Dataset for Cross-Embodiment Dexterous Grasping

यह शोध पत्र HRDexDB को प्रस्तुत करता है, जो 100 विविध वस्तुओं में 2,100 सिंक्रोनाइज़्ड (तुल्यकालिक) मानव और रोबोटिक डेक्सट्रस ग्रैस्पिंग ट्रायल्स वाला एक व्यापक डेटासेट है, जो क्रॉस-एम्बॉडिमेंट मैनिपुलेशन अनुसंधान के लिए एक आधारभूत बेंचमार्क के रूप में कार्य करने हेतु उच्च-सटीक स्पैटियोटेम्पोरल ग्राउंड ट्रुथ प्रदान करता है।

Jongbin Lim, Taeyun Ha, Mingi Choi, Jisoo Kim, Byungjun Kim, Subin Jeon, Hanbyul Joo2026-06-23
💻 computer science

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

यह शोध पत्र CT-SpatialVQA प्रस्तुत करता है, जो CT स्कैन और रेडियोलॉजी रिपोर्ट से प्राप्त लगभग 9,000 नैदानिक रूप से प्रमाणित QA युग्मों वाला एक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान 3D मेडिकल विजन-लैंग्वेज मॉडल सिमेंटिक-स्पेशियल रीजनिंग (अर्थगत-स्थानिक तर्क) के साथ गंभीर रूप से संघर्ष करते हैं, जो अक्सर रैंडम चांस (यादृच्छिक संभावना) से भी नीचे प्रदर्शन करते हैं और विश्वसनीय नैदानिक निर्णय सहायता के लिए बेहतर वॉल्यूमेट्रिक साक्ष्य एकीकरण की महत्वपूर्ण आवश्यकता को रेखांकित करते हैं।

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub2026-06-23