🤖 AI

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

विज़न-लैंग्वेज-एक्शन मॉडल्स में फ्यू-शॉट परिदृश्यों के दौरान प्रदर्शन में होने वाली तीव्र गिरावट को संबोधित करने के लिए, यह शोध पत्र FOCA पेश करता है, जो एक भविष्योन्मुखी कंडीशनिंग फ्रेमवर्क है जो सिम्युलेटेड और वास्तविक रोबोट दोनों पर अत्याधुनिक डेटा-कुशल अनुकूलन प्राप्त करने के लिए लेटेंट-स्पेस फ्यूचर प्रेडिक्शन और गोल अलाइनमेंट का लाभ उठाता है।

Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Ba (…)2026-06-23
💻 computer science

Fine-grained Human Motion Understanding with Language Models

यह शोध पत्र \methodname को प्रस्तुत करता है, जो एक LLM-आधारित मॉडल है जो स्पष्ट टाइमस्टैम्प के साथ कंकाल संबंधी मुद्राओं (skeletal poses) को प्रदर्शित करके और विविध पोज़- एवं मोशन-स्तर के पर्यवेक्षण का लाभ उठाकर अत्याधुनिक सूक्ष्म मानव गति समझ (fine-grained human motion understanding) प्राप्त करता है, जिससे ग्राउंड-ट्रुथ 3D मोशन कैप्चर पर निर्भर किए बिना 2D और 3D दोनों बेंचमार्क पर उत्कृष्ट प्रदर्शन सक्षम होता है।

Thomas Markhorst, Zhi-Yi Lin, Jouh Yeong Chew, Jan van Gemert, Xucong Zhang2026-06-23
🤖 machine learning

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Go-with-the-Track एक एकीकृत वीडियो जनरेशन फ्रेमवर्क है जो स्थानिक रूप से जागरूक पॉइंट-ट्रैक एम्बेडिंग्स और एक हाइब्रिड ट्रेनिंग स्ट्रैटेजी को पेश करके, एक वीडियो सीक्वेंस के दौरान सटीक मोशन कंट्रोल और हाई-फिडेलिटी कंपोजिटिंग को सक्षम करने के लिए पॉइंट ट्रैकिंग को कई रेफरेंस इमेजेस के साथ जोड़ता है।

Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li (…)2026-06-23
⚡ electrical engineering

BELDE: Building a Large-scale Earth-observation Land-cover Dataset for Europe

यह शोध पत्र BELDE को प्रस्तुत करता है, जो यूरोप के लिए 10 लाख से अधिक इमेज पेयर्स वाला एक सार्वजनिक रूप से उपलब्ध, बड़े पैमाने का RGB लैंड-कवर सेगमेंटेशन डेटासेट है, साथ ही इसमें कोरिया और अमेरिका के लिए पूरक डेटासेट भी शामिल हैं, ताकि विविध भौगोलिक क्षेत्रों में सुदृढ़, हस्तांतरणीय अर्थ अवलोकन (अर्थ ऑब्जर्वेशन) मॉडल विकसित करने और उनका मूल्यांकन करने के लिए एक बेंचमार्क स्थापित किया जा सके।

Ümit Mert Çağlar, Alptekin Temizel2026-06-23
💻 computer science

ELDiff: When Evidential Learning Meets Text-to-Image Diffusion

ELDiff एक नवीन टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल है जो पिक्सेल एविडेंस और टोकन कॉन्फ्लिक्ट लॉस के माध्यम से सेगमेंटेशन मैप बायस और सिमेंटिक संघर्षों को कम करने के लिए एविडेंशियल लर्निंग को एकीकृत करता है, जिससे ऑब्जेक्ट-वाइज कंसिस्टेंसी में वृद्धि होती है और बिना किसी अतिरिक्त इन्फरेंस-टाइम मैनिपुलेशन के कई डिफ्यूजन आर्किटेक्चरों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Qingtao Pan, Kai Ye, Zhihao Dou, Bing Ji, Shuo Li2026-06-23
💬 NLP

Scaling Diverse Language Generation for 3D Visual Grounding

यह शोध पत्र ViGiL3D++ का प्रस्ताव करता है, जो एक स्केलेबल (scalable), सीन-एग्नोस्टिक (scene-agnostic) विधि है जो विविध 3D विजुअल ग्राउंडिंग क्वेरीज़ उत्पन्न करने के लिए सीन ग्राफ कंस्ट्रेंट सैंपलिंग और लार्ज लैंग्वेज मॉडल्स का लाभ उठाती है, जिससे मौजूदा डेटासेट्स की सीमाओं को दूर किया जा सके और कई बेंचमार्क पर मॉडल के प्रदर्शन में सुधार किया जा सके।

Austin T. Wang, Dongchen Yang, Angel X. Chang2026-06-23
💻 computer science

CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

यह शोध पत्र कॉग्नीरूट (CogniRoute) को प्रस्तुत करता है, जो एक स्कीमा-गाइडेड मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क है जिसे रूट-अवेयर रीइन्फोर्समेंट लर्निंग द्वारा उन्नत किया गया है और नए ओम्नीसोशलबेंच (OmniSocialBench) डेटासेट पर प्रशिक्षित किया गया है, जो जेस्चर (gestures), टोन (tone) और टेम्पोरल क्यूज़ (temporal cues) से जुड़े जटिल तर्क कार्यों के लिए मल्टी-मोडल साक्ष्यों को प्रभावी ढंग से रूट करने और समन्वय करने के माध्यम से सोशल वीडियो क्वेश्चन अनswering में महत्वपूर्ण सुधार करता है।

Yifan Shen, Pei Tian, Xinzhuo Li, Bowen Fang, Shujun Xia, Bingxuan Li, Ana Jojic, Wenming Ye, Xu Cao, James Matthew Rehg (…)2026-06-23
🤖 AI

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

यह शोध पत्र लिमा और न्यूयॉर्क शहर के मानव चालकों के प्रदर्शन की तुलना इन दो चुनौतीपूर्ण भौगोलिक क्षेत्रों के विविध ड्राइविंग परिदृश्यों में विजन-लैंग्वेज मॉडल्स (VLMs) के विरुद्ध करने के लिए रोबस्टो-2 (Robusto-2) बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि प्रश्न के प्रकार के आधार पर मानव और VLM की प्रतिक्रियाएं भिन्न होती हैं, लेकिन परिदृश्यों की उच्च आउट-ऑफ-डिस्ट्रीब्यूशन प्रकृति के कारण दोनों समूहों में विशिष्ट शहर के कारण प्रदर्शन में कोई महत्वपूर्ण भिन्नता नहीं दिखाई देती है।

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza2026-06-23
🤖 AI

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

यह शोधपत्र CheXpercept को प्रस्तुत करता है, जो चेस्ट एक्स-रे में बहु-स्तरीय घाव धारणा (lesion perception) कार्यों पर विजन-लैंग्वेज मॉडल का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बड़े पैमाने का, विशेषज्ञ-एनोटेटेड बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल सूक्ष्म-स्तरीय विजुअल ग्राउंडिंग में संघर्ष करते हैं और चिकित्सा-विशिष्ट मॉडल अपने सामान्य-डोमेन समकक्षों की तुलना में बहुत कम लाभ प्रदान करते हैं।

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi2026-06-23
⚡ electrical engineering

MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts

MoECodec एक टोकन-जागरूक इमेज कंप्रेशन फ्रेमवर्क है जो इनपुट कंटेंट और टास्क उद्देश्यों के आधार पर गणना को गतिशील रूप से अनुकूलित करने के लिए एक स्टेबल रूटिंग स्ट्रैटेजी और लाइटवेट ग्रुप शफल MLP के साथ एक मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर को एकीकृत करता है, जिससे एक ही एकीकृत मॉडल के भीतर मानव और मशीन धारणा कार्यों दोनों में उत्कृष्ट प्रदर्शन प्राप्त होता है।

Jiancheng Zhao, Xiang Ji, Yifan Zhan, Zunian Wan, Yinqiang Zheng2026-06-23