💻 computer science

PCFootprint: A Large-Scale Dataset and Benchmark for Vectorized Building Footprint Extraction from Aerial LiDAR Point Clouds

यह शोध पत्र PCFootprint को प्रस्तुत करता है, जो हवाई LiDAR पॉइंट क्लाउड्स से वेक्टरकृत बिल्डिंग फुटप्रिंट्स निकालने के लिए पहला बड़े पैमाने का सार्वजनिक डेटासेट और बेंचमार्क है, जिसमें ऑप्टिकल इमेजरी की सीमाओं को दूर करने और बिल्डिंग मॉडलिंग एवं भू-स्थानिक विश्लेषण में अनुसंधान को आगे बढ़ाने के लिए व्यवस्थित रूप से संरेखित ग्राउंड ट्रुथ के साथ 33,000 टाइल्स शामिल हैं।

Haoyuan Shen, Kuihao Wang, Ruisheng Wang, Yujun Liu2026-06-19
🤖 AI

SARLO-80: Worldwide Slant SAR Language Optic Dataset 80cm

यह शोध पत्र SARLO-80 को प्रस्तुत करता है, जो कि 72 देशों के अत्यंत-उच्च-रिज़ॉल्यूशन वाले कॉम्प्लेक्स-वैल्यूड स्लैंट-रेंज SAR इमेजरी, संरेखित ऑप्टिकल टाइल्स और प्राकृतिक-भाषा विवरणों के 119,566 ट्रिपलेट्स से बना एक बड़े पैमाने का, सार्वजनिक रूप से उपलब्ध मल्टीमॉडल डेटासेट है, जिसे भौतिक रूप से आधारित SAR-ऑप्टिकल-टेक्स्ट फाउंडेशन मॉडल्स को आगे बढ़ाने के लिए डिज़ाइन किया गया है।

Solène Debuysère, Nicolas Trouvé, Nathan Letheule, Elise Colin, Georgia Channing2026-06-19
💬 NLP

StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

यह शोधपत्र StylisticBias को प्रस्तुत करता है, जो 25,000 फोटोरियलिस्टिक छवियों के साथ एक नियंत्रित बेंचमार्क है जिसमें पृथक विशेषता परिवर्तन शामिल हैं, ताकि यह प्रकट किया जा सके कि संकेतों का एक छोटा समूह, विशेष रूप से फैशन शैली और शरीर के प्रकार, मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सामाजिक पूर्वाग्रहों के अधिकांश हिस्से को संचालित करते हैं।

Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal, Samantha Dalal, Jana Diesner2026-06-19
💻 computer science

VisDom: Sparse Novel View Synthesis with Visible Domain Constraint

VisDom एक लर्निंग-फ्री ज्यामितीय बाधा (geometric constraint) पेश करता है जो सिलौट-आधारित विजुअल हल (silhouette-based visual hulls) को परिष्कृत करने के लिए एक न्यूनतम मल्टी-व्यू विजिबिलिटी आवश्यकता को लागू करता है, जो प्रभावी रूप से बिना किसी अतिरिक्त सीखे गए पैरामीटर्स की आवश्यकता के, NeRF और Gaussian Splatting पाइपलाइनों दोनों के लिए स्पार्स नोवेल व्यू सिंथेसिस में ओवरफिटिंग और आर्टिफैक्ट्स को कम करता है।

Mariia Gladkova*, Tarun Yenamandra*, Edmond Boyer, Robert Maier, Tony Tung, Daniel Cremers2026-06-19
💻 computer science

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

यह शोध पत्र प्रकट करता है कि फ्रैचेट इनसेप्शन डिस्टेंस (FID) में महत्वपूर्ण छिपा हुआ यादृच्छिकता (randomness) है जो मुख्य रूप से सैंपलिंग विविधताओं के बजाय प्रशिक्षण बीजों (training seeds) द्वारा संचालित होता है, जो FID को एरर बार के साथ रिपोर्ट करने और प्रदर्शन के छोटे अंतरों को सांख्यिकीय रूप से अनिर्णायक मानने की सिफारिश करता है।

Nicolas Dufour, Alexei A. Efros, Patrick Pérez2026-06-19
💻 computer science

CalTennis: Large Multi-View Tennis Video Dataset and Benchmark of Monocular-to-3D Pose Estimation

यह शोधपत्र CalTennis को प्रस्तुत करता है, जो एक बड़े पैमाने का मल्टी-व्यू टेनिस वीडियो डेटासेट है जो मोनोकुलर-टू-3D पोज़ एस्टीमेशन के लेबल-मुक्त मूल्यांकन को सक्षम बनाता है, जिससे यह पता चलता है कि जबकि वर्तमान मॉडल जोड़ों के कोणों (joint angles) को सटीक रूप से रिकवर करते हैं, वे गहराई अनुमान (depth estimation) और फुट कॉन्टैक्ट कंसिस्टेंसी (foot contact consistency) में संघर्ष करते हैं।

Ilona Demler, Xinran Xie, Blake Werner, Anna Szczuka, Pietro Perona2026-06-19
💻 computer science

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

यह शोध पत्र स्पैटियली स्पेकुलेटिव डिकोडिंग (SSD) प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो छवियों के अंतर्निहित 2D स्थानिक सहसंबंधों (spatial correlations) का लाभ उठाकर एक साथ कई टोकन की भविष्यवाणी करता है, जिससे उच्च निष्ठा (fidelity) बनाए रखते हुए ऑटोरेग्रेसिव इमेज जनरेशन को 13.3x तक त्वरित किया जा सकता है।

Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao2026-06-19
🤖 machine learning

UNIEGO: Proxies as Mediators for Unified Egocentric Video Representation Learning

UNIEGO एक पदानुक्रमित मल्टी-टीचर डिस्टिलेशन फ्रेमवर्क पेश करता है जो विविध दृष्टिकोणों, मोडैलिटीज़ और फाउंडेशन मॉडल्स से विविध ज्ञान को एक एकल, अत्याधुनिक एगोसेंट्रिक वीडियो एनकोडर में एकीकृत करने के लिए रिप्रेजेंटेशन-विशिष्ट प्रॉक्सी मॉडल्स और एक सिलेक्टिव प्रॉक्सी डिस्टिलेशन रणनीति का उपयोग करता है।

Wenhao Chi, Arkaprava Sinha, Dominick Reilly, Hieu Le, Srijan Das2026-06-19
💻 computer science

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

यह शोधपत्र TimeProVe को प्रस्तुत करता है, जो एक लागत-कुशल हाइब्रिड फ्रेमवर्क है जो लंबे वीडियो में अत्याधुनिक टेम्पोरल रीजनिंग (temporal reasoning) प्राप्त करने के लिए हल्के एक्शन-ग्राउंडेड परिकल्पना निर्माण (action-grounded hypothesis generation) को लक्षित VLM सत्यापन (VLM verification) के साथ जोड़ता है और साथ ही कंप्यूटिंग लागतों को काफी कम करता है, साथ ही दैनिक जीवन की गतिविधियों (Activities of Daily Living) के परिदृश्यों के मूल्यांकन के लिए OpenTSUBench बेंचमार्क का प्रस्ताव देता है।

Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das2026-06-19
💻 computer science

JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

JanusMesh एक तेज़, प्रशिक्षण-मुक्त ढांचा है जो निर्बाध ज्यामितीय संलयन के लिए एक क्रॉस-स्पेस डुअल-ब्रांच डिनोइज़िंग प्रक्रिया और यथार्थवादी रेंडरिंग के लिए एक व्यू-कंडीशन्ड टेक्सचर सिंथेसिस मॉड्यूल का उपयोग करके विभिन्न देखने के कोणों से अलग अर्थ वाले उच्च-गुणवत्ता वाले 3D दृश्य भ्रम उत्पन्न करता है।

Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang, Yu-Lun Liu2026-06-19