💻 computer science

A Vision Based System for Guided and Collaborative Reconstruction of Fragmented Documents

यह शोध पत्र एक सहयोगात्मक विज़न-आधारित प्रणाली प्रस्तुत करता है जो खंडित सांस्कृतिक विरासत दस्तावेजों के लचीले, वास्तविक समय और सटीक पुनर्निर्माण को सक्षम करने के लिए एक विशेष सक्शन अटैचमेंट वाले कोबोट (cobot) को AI-संचालित SE2-LoFTR मिलान के साथ एकीकृत करता है।

Oliver Krumpek, Diana Leo2026-07-07
🤖 AI

RADIO1D: Elastic Representations for Condensed Vision Modeling

यह शोध पत्र RADIO1D को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो फिक्स्ड 2D पैच-आधारित फीचर्स पर निर्भरता को चुनौती देता है, और नॉलेज डिस्टिलेशन एवं ऑटोएनकोडिंग के माध्यम से छवियों को कॉम्पैक्ट, परिवर्तनीय-लंबाई वाले 1D टोकन अनुक्रमों में संकुचित करता है, जिससे लचीले सटीकता-दक्षता ट्रेड-ऑफ और विजन-लैंग्वेज मॉडल्स में श्रेष्ठ प्रदर्शन सक्षम होता है।

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao (…)2026-07-07
💻 computer science

Probing Identity-Specific Motion Signatures: A Controlled Diagnostic Study

यह अध्ययन BALLER120 बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि जबकि आधुनिक वीडियो मॉडल पहचान-विशिष्ट गति हस्ताक्षरों (identity-specific motion signatures) को सीख सकते हैं, वे मुख्य रूप से स्थिर उपस्थिति संकेतों (static appearance cues) पर निर्भर करते हैं, जब तक कि उन संकेतों को स्पष्ट रूप से दबाया न जाए, जिस स्थिति में मॉडल पहचान के लिए सुदृढ़ गतिक पैटर्न (kinematic patterns) का प्रभावी ढंग से उपयोग करते हैं।

Yingtie Lei, Fangxun Liu, Baicheng Wu, Colin Lee, Ziheng Zhang, Junke Yang, Zhiyuan Tao, Xuyan Huang, Shuheng Wang, Will (…)2026-07-07
🤖 AI

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

यह शोध पत्र मूनस्टोन (Moonstone) को प्रस्तुत करता है, जो चंद्र रिमोट सेंसिंग के लिए पहला मल्टीमॉडल फाउंडेशन मॉडल बेंचमार्क है, जिसमें एक व्यापक 28-चैनल वैश्विक डेटासेट और एक नवीन मोडैलिटी-ग्रुपड मास्क ऑटोएनकोडर (MG-MAE) शामिल है जो छह डाउनस्ट्रीम कार्यों में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Ayush Prasad, Swarnalee Mazumder2026-07-07
🤖 AI

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

यह शोध पत्र ViPo-MLLM प्रस्तुत करता है, जो एक नवीन ढांचा है जो PHOENIX14T और CSL-Daily डेटासेट पर अत्याधुनिक ग्लॉस-मुक्त संकेत भाषा अनुवाद (Sign Language Translation) प्राप्त करने के लिए एक लार्ज लैंग्वेज मॉडल के साथ स्थानिक-कालिक (spatio-temporal) RGB और मानव मुद्रा (human pose) विशेषताओं को एकीकृत करता है, जो प्रभावी रूप से ग्लॉस-आधारित दृष्टिकोणों को टक्कर देता है।

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman2026-07-07
💬 NLP

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

यह शोध पत्र EmCom-Diffusion को प्रस्तुत करता है, जो एक जनरेटिव मूल्यांकन ढांचा (generative evaluation framework) है जो संदेशों से इनपुट छवियों को पुनर्गठित करने के लिए एक टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल को फाइनट्यून करके उभरती भाषाओं (emergent languages) के दृश्य प्रतिबिंब को सीधे मापता है, जिससे मौजूदा अप्रत्यक्ष मेट्रिक्स की सीमाओं को दूर किया जा सके।

Haruumi Omoto, Tadahiro Taniguchi2026-07-07
💻 computer science

GeoSAM-Lite: A Lightweight Foundation Model for Onboard Remote Sensing Segmentation

GeoSAM-Lite एक हल्का, प्रॉम्प्ट-मुक्त फाउंडेशन मॉडल है जिसे संसाधन-सीमित ऑनबोर्ड रिमोट सेंसिंग के लिए डिज़ाइन किया गया है जो प्रतिस्पर्धी सेगमेंटेशन सटीकता प्राप्त करने के लिए जियोस्पेशियल-डोमेन इनिशियलाइज़ेशन और फीचर फ्यूजन परतों का लाभ उठाता है, जबकि भारी विकल्पों की तुलना में इसके मापदंडों (पैरामीटर्स) में 92.8% की कमी है।

Yongcong Wang, Jie Zhang, Rui Jiang, Xubing Yang, Ting Yun, Li Zhang2026-07-07
⚡ electrical engineering

Deep Learning-Based Characterization of Detonation-Cell Size Distributions in Soot-Foil Records

यह शोध पत्र शोर वाले सोट-फॉइल (soot-foil) रिकॉर्ड से डेटोनेशन सेल आकार वितरण और उच्च-क्रम नियमितता विशेषताओं के सटीक, सुदृढ़ और वस्तुनिष्ठ निष्कर्षण को स्वचालित करने के लिए मास्क आर-सीएनएन (Mask R-CNN) और ट्रांसफर लर्निंग का उपयोग करते हुए एक नवीन डीप लर्निंग-आधारित पद्धति प्रस्तावित करता है, जो पारंपरिक मैनुअल माप और मौजूदा कंप्यूटर विज़न तकनीकों की सीमाओं को दूर करता है।

Mingyang Bu, Robson A. Schneider, Karl P. Chatelain, Mhedine Alicherif, Yingchen Shi, Andrés Z. Mendiburu, Deanna A. Lac (…)2026-07-07
⚡ electrical engineering

GALOSH: Blind, Training-Free Denoising of Raw Bayer and sRGB Images by Parallel-Friendly Local Shrinkage

GALOSH एक तेज़, प्रशिक्षण-मुक्त डीनॉइज़िंग विधि है जो अक्षम ब्लॉक-मैचिंग खोजों को शोर अनुमान (noise estimation), सामान्यीकृत एन्सकोम्ब ट्रांसफ़ॉर्मेशन (generalized Ansomble transformation) और स्थानीयकृत श्रिंकेज (localized shrinkage) के एक पूर्णतः स्थानीय, डेटा-स्वतंत्र पाइपलाइन से बदलकर कच्चे बेयर (raw Bayer) और sRGB दोनों छवियों पर उच्च गुणवत्ता वाले परिणाम प्राप्त करती है, जो इसे CPU और फिक्स्ड-पॉइंट हार्डवेयर पर तैनाती के लिए उपयुक्त बनाती है।

Yoshiro Sato2026-07-07
🤖 AI

Self-Improving Diffusion Classifiers with Minority Preference Optimization

यह शोध पत्र MiPO को प्रस्तुत करता है, जो एक ऐसी विधि है जो अतिरिक्त इमेज डेटा या बाहरी रिवॉर्ड मॉडल की आवश्यकता के बिना, अल्पसंख्यकीय डेटा वितरण के प्रति धारणा में सुधार करने के लिए अल्पसंख्यक प्राथमिकता अनुकूलन (minority preference optimization) के साथ पूर्व-प्रशिक्षित मॉडलों को फाइन-ट्यून करके डिफ्यूजन मॉडल्स के अल्पसंख्यक क्षेत्रों में ज़ीरो-शॉट वर्गीकरण प्रदर्शन को बढ़ाता है।

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim2026-07-07