💻 computer science

AEF-Econ: Toward Plug-and-Play Socioeconomic Foundation Embeddings from AlphaEarth for Urban Remote Sensing

यह शोध पत्र AEF-Econ को प्रस्तुत करता है, जो शहरी रिमोट सेंसिंग के लिए एक प्लग-एंड-प्ले सामाजिक-आर्थिक फाउंडेशन एम्बेडिंग है, जो सात विषम डेटा स्ट्रीम्स को एकीकृत करके और विविध क्षेत्रों एवं शहर के स्तरों में सामाजिक-आर्थिक भविष्यवाणी की सटीकता में उल्लेखनीय सुधार करने के लिए एक नवीन कैपेसिटी-एडेप्टिव रिकंस्ट्रक्शन (CAR) तंत्र का उपयोग करके भौतिक-केंद्रित अल्फाअर्थ मॉडल्स की सीमाओं को दूर करता है।

Shuyang Hou, Ziqi Liu, Haoyue Jiao, Lutong Xie, Yaxian Qing, Xiaopu Zhang, Qingyang Xu, Zhangyan Xu, Xuefeng Guan, Huayi (…)2026-06-23
🤖 AI

GEOPHYS: The Geometry of Physical Plausibility

यह शोध पत्र GEOPHYS को प्रस्तुत करता है, जो फ्रोजन इमेज एनकोडर्स के प्रति-फ्रेम एम्बेडिंग्स के पांच ज्यामितीय गुणों का लाभ उठाकर वीडियो में भौतिक अस्वाभाविकता का कुशलतापूर्वक और सटीक रूप से पता लगाने के लिए, अत्याधुनिक मल्टीमॉडल मॉडलों से बेहतर प्रदर्शन करता है और कम कम्प्यूटेशनल लागत के साथ वीडियो जेनरेशन में भौतिक संरेखण में महत्वपूर्ण सुधार करता है।

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip T (…)2026-06-23
💻 computer science

TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation

यह शोध पत्र TeleStyle V2 प्रस्तुत करता है, जो एक उन्नत स्टाइल ट्रांसफर मॉडल है जो विविध कंटेंट-स्टाइल संदर्भ संयोजनों के लिए सेल्फ-डिस्टिलेशन (Self-Distillation) और सामान्य इमेज एडिटिंग क्षमताओं को बनाए रखने के लिए डिस्ट्रीब्यूशन-मैचिंग डिस्टिलेशन (Distribution-Matching Distillation) का उपयोग करके अपने पूर्ववर्ती की सीमाओं को दूर करता है, और अंततः अत्याधुनिक वाणिज्यिक मॉडलों के तुलनीय प्रदर्शन प्राप्त करता है।

Shiwen Zhang, Yifan Xu, Haibin Huang, Chi Zhang, Xuelong Li2026-06-23
🤖 AI

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

Video2Code एक एक्शन-अवेयर फ्रेमवर्क है जो महत्वपूर्ण एक्शन क्षेत्रों को उच्च टेम्पोरल रेजोल्यूशन पर पहचानने और उन्हें पुनरावृत्ति करने के माध्यम से UI वीडियो-टू-कोड जनरेशन को बेहतर बनाता है ताकि निष्पादन योग्य स्टेट ट्रांजिशन को सटीक रूप से रिकवर किया जा सके, जिससे जटिल इंटरैक्टिव वेबपेजों में कार्यात्मक शुद्धता में महत्वपूर्ण सुधार होता है।

Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang2026-06-23
💬 NLP

Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation

यह शोध पत्र यू-नेट (U-Net) और स्टेबल डिफ्यूजन 1.5 (Stable Diffusion 1.5) दोनों आर्किटेक्चर में CLIP मार्गदर्शन को एकीकृत करके यह प्रदर्शित करते हुए ग्रेस्केल-से-रंग अनुवाद (grayscale-to-color translation) पर टेक्स्ट कंडीशनिंग के प्रभाव को परिमाणित करता है कि यह बिना टेक्स्ट इनपुट वाले मॉडलों की तुलना में पिक्सेल-स्तरीय सटीकता, संवेदी समानता और रंगत में निरंतर सुधार करता है।

Colten Reissmann, Hugo Garrido-Lestache Belinchon2026-06-23
💻 computer science

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

यह अध्ययन वास्तविक घाव की छवियों पर छह विजन-लैंग्वेज मॉडलों का मूल्यांकन करता है और पाता है कि चैटजीपीटी (ChatGPT) और क्लॉड (Claude) जैसे सामान्य-उद्देश्य वाले सिस्टम नैदानिक घाव मूल्यांकन में चिकित्सकीय रूप से विशिष्ट मॉडलों से काफी बेहतर प्रदर्शन करते हैं, हालांकि सभी मॉडल अभी भी स्वायत्त विश्वसनीयता में पर्याप्त सीमाओं का सामना करते हैं।

Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan2026-06-23
🤖 AI

TriMotion: Modality-Agnostic Camera Control for Video Generation

ट्रिमोटion (TriMotion) एक मोडैलिटी-अज्ञेय (modality-agnostic) फ्रेमवर्क है जो एक नए डेटासेट और लेटेंट कंसिस्टेंसी ऑब्जेक्टिव के माध्यम से वीडियो, पोज़ और टेक्स्ट इनपुट्स को एक साझा मोशन एम्बेडिंग स्पेस में एकीकृत करता है, जिससे विषम उपयोगकर्ता इनपुट्स के माध्यम से उच्च-गुणवत्ता वाले, लचीले कैमरा-नियंत्रित वीडियो जनरेशन को सक्षम बनाया जा सके।

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng2026-06-23
🤖 AI

GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling

ग्राउंडशॉट (GroundShot) एक प्रशिक्षण-मुक्त (training-free), मॉडल-अज्ञेय (model-agnostic) फ्रेमवर्क है जो शॉट क्रम को गतिशील रूप से शेड्यूल करके और एंटिटी संदर्भों को ग्राउंड और सत्यापित करने के लिए एक ऑनलाइन एंटिटी-स्तरीय विजुअल मेमोरी बनाए रखकर, दृश्य रूप से सुसंगत मल्टी-शॉट लॉन्ग वीडियो जनरेशन को बढ़ाता है, जिससे शॉट्स के बीच विजुअल ड्रिफ्ट (visual drift) को रोका जा सके।

Yixuan Lai, Tianjia Shao, Kun Zhou, Weijia Dou, Siyu Zhu, Jingdong Wang2026-06-23
💻 computer science

From Uncertainty to Stability and Fidelity: Guiding Sparse-View 3D Gaussian Splatting with Fisher Information

यह शोध पत्र एक नवीन स्पार्स-व्यू 3D गॉसियन स्प्लेटिंग विधि प्रस्तावित करता है जो स्टीरियो ऑग्मेंटेशन को सक्रिय रूप से निर्देशित करने और अनिश्चितता-जागरूक नियमितीकरण (uncertainty-aware regularization) को अनुकूल रूप से विनियमित करने के लिए फिशर इंफॉर्मेशन का लाभ उठाता है, जिससे ओवरफिटिंग को कम किया जा सके और रेंडरिंग स्थिरता एवं फिडेलिटी में महत्वपूर्ण सुधार किया जा सके।

Junbao Zhou, Qingshan Xu, Yuan Zhou, Xiaolong Shen, Beier Zhu, Kesen Zhao, Yiming Zeng, Chen Bai, Cheng Lu, Hanwang Zhan (…)2026-06-23
🤖 machine learning

Stochastic Signed Distance Processes

यह शोध पत्र स्टोकेस्टिक साइन्ड डिस्टेंस प्रोसेस (SSDP) को प्रस्तुत करता है, जो एक संभाव्य ढांचा है जो सतह रेंडरिंग के लिए फर्स्ट-पासेज-टाइम वितरण प्राप्त करने हेतु किरणों के साथ साइन्ड डिस्टेंस फील्ड्स को स्टोकेस्टिक प्रक्रियाओं के रूप में मॉडल करता है, जिससे NeuS जैसे मौजूदा तरीकों को एकीकृत किया जा सके और मल्टी-व्यू सरफेस रिकंस्ट्रक्शन एवं अनिश्चितता परिमाणीकरण में बेहतर प्रदर्शन प्राप्त किया जा सके।

Hiroki Sakuma, Masatoshi Okutomi2026-06-23