💻 computer science

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

Flux-GS एक रियल-टाइम मोबाइल 3D गॉसियन स्प्लेटिंग विधि है जो संसाधन-सीमित प्लेटफार्मों पर उच्च-सटीकता वाले रेंडरिंग को बनाए रखने के लिए एक मोंटे कार्लो स्पेकुलर एनर्जी एग्रीगेटर, एक एट्रिब्यूट-कंडीशन्ड SH एन्हांसमेंट मॉड्यूल और एक मल्टी-व्यू अल्फा-आधारित डेंसिफिकेशन और प्रूनिंग रणनीति का उपयोग करके इन्फरेंस और स्टोरेज ओवरहेड को महत्वपूर्ण रूप से कम करती है।

Xiaobiao Du, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Xin Yu2026-06-30
💻 computer science

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

यह शोध पत्र OmniDance को प्रस्तुत करता है, जो एक रूपरेखा (framework) है जो उच्च दृश्य निष्ठा (visual fidelity) और नियंत्रणीयता को बनाए रखते हुए अत्याधुनिक संगीत-संचालित, टेक्स्ट-संचालित और मल्टीमॉडल डांस वीडियो जनरेशन प्राप्त करने के लिए नव-निर्मित बड़े पैमाने के CIPE-Dance डेटासेट और एक विशिष्ट आर्किटेक्चर का लाभ उठाता है।

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu (…)2026-06-30
💻 computer science

Uncertainty Estimation in Pathology Foundation Models via Deep Mutual Learning

यह शोध पत्र DICE\mathtt{DICE} प्रस्तुत करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो फ्रोजन पैथोलॉजी फाउंडेशन मॉडल्स के एक एनसेम्बल को संरेखित करने के लिए डीप म्यूचुअल लर्निंग का लाभ उठाता है, जिससे होल-स्लाइड इमेज विश्लेषण की नैदानिक विश्वसनीयता बढ़ाने के लिए विश्वसनीय अनिश्चितता अनुमान और अनसुपरवाइज्ड एब्नार्मैलिटी लोकलाइजेशन उत्पन्न होता है।

Gbègninougbo Aurel Davy Tchokponhoue, Sevda Öğüt, Ali Idri, Dorina Thanou, Pascal Frossard2026-06-30
💻 computer science

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

यह शोध पत्र MuseBench को प्रस्तुत करता है, जो विविध दृश्य-श्रव्य कलाओं में 4,000 से अधिक विशेषज्ञ-सत्यापित प्रश्नों वाला एक व्यापक बेंचमार्क है, जिसे मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की इरादा-स्तर (intent-level) की तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है और जो रचनात्मक कलात्मक इरादे को समझने में वर्तमान एआई प्रणालियों और मानव विशेषज्ञों के बीच प्रदर्शन के एक महत्वपूर्ण अंतर को प्रकट करता है।

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon2026-06-30
💻 computer science

Cross-Modal Iteration Distillation for Robust IHD Screening: The IDNet Framework and A New Benchmark

यह शोध पत्र IDNet प्रस्तुत करता है, जो एक क्रॉस-मोडल डिस्टिलेशन एग्रीगेटर (Cross-Modal Distillation Aggregator) वाला एक मल्टीमॉडल फ्रेमवर्क है जो इस्केमिक हृदय रोग की स्क्रीनिंग में सुधार के लिए फंडस छवियों को नैदानिक डेटा के साथ प्रभावी ढंग से फ्यूज करता है, साथ ही एक नए बड़े पैमाने के, पुनरुत्पादक UK बायोबैंक बेंचमार्क का विमोचन भी करता है जो मौजूदा बेसलाइनों पर इसके बेहतर प्रदर्शन को प्रदर्शित करता है।

Yongchang Gao, Junjie Pang, Shuaiyu Yang, Yusheng Yang, Xichao Jia, Shaojie Li, Hongfei Zhang, Jia Mu2026-06-30
🤖 machine learning

Consensus Clustering of Free-Viewing Gaze Data: New Insights into Human-Information Interaction

यह शोधपत्र EnsembleGaze प्रस्तुत करता है, जो एक नवीन अनसुपरवाइज्ड एन्सेम्बल लर्निंग सिस्टम है जो फ्री-व्यूइंग गेज़ डेटा पर कंसेंसस क्लस्टरिंग लागू करता है, जो उद्दीपकों (stimuli) के लिए एम्बिएंट बनाम फोकल व्यूइंग मोड में सुदृढ़ अंतर को प्रकट करता है और यह प्रदर्शित करता है कि उपयोगकर्ता व्यवहार पैटर्न संदर्भ-निर्भर होते हैं और उन्हें बाइसक्लस्टरिंग रणनीतियों के माध्यम से सर्वोत्तम रूप से कैप्चर किया जा सकता है।

Beryl Gnanaraj, Jaya Sreevalsan-Nair, Saqib Alam Ansari, Maanasa Rajaraman2026-06-30
💻 computer science

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

यह शोध पत्र ILLUME-X को प्रस्तुत करता है, जो एक एकीकृत मल्टीमॉडल मॉडल है जो एक अनुकूलित डेटा पाइपलाइन, स्व-अनुकूली उद्देश्यों के साथ एक प्रगतिशील प्रशिक्षण रणनीति और ILScore नामक एक नवीन मूल्यांकन मीट्रिक के माध्यम से उच्च-गुणवत्ता वाले, मुक्त-रूप इंटरलीव्ड टेक्स्ट-इमेज जनरेशन को प्राप्त करता है, जो विभिन्न कार्यों में पिछले मॉडलों से बेहतर प्रदर्शन करता है।

Chonghuinan Wang, Zhikai Chen, Chunwei Wang, Yecong Wan, Junwei Yang, Zhixin Wang, Wei Zhang, Jiaqi Xu, Renjing Pei, Xia (…)2026-06-30
💻 computer science

Emergence of a Shared Canonical Object Frame from In-the-Wild Videos

यह शोध पत्र यह प्रदर्शित करता है कि प्रशिक्षण अनुक्रमों को एक मोटे ज्यामितीय बॉटलनेक (coarse geometric bottleneck) के माध्यम से रूट करके, इन-द-वाइल्ड वीडियो से स्व-पर्यवेक्षित (self-supervised) तरीके से एक साझा कैनोनिकल ऑब्जेक्ट फ्रेम सीखा जा सकता है, जिससे मैनुअल कैनोनिकल पोज़ एनोटेशन की आवश्यकता समाप्त हो जाती है और श्रेणी-स्तरीय पोज़ अनुमान बेंचमार्क पर प्रतिस्पर्धी सटीकता प्राप्त होती है।

Tom Fischer, Martin Sundermeyer, Adam Kortylewski, Eddy Ilg2026-06-30
🤖 machine learning

Neural Subspace Reallocation: Continual Learning as Retrieval-Based Subspace Memory Management

यह शोध पत्र न्यूरल सबस्पेस रीएलोकेशन (NSR) को प्रस्तुत करता है, जो एक निरंतर सीखने (continual learning) का ढांचा है जो LoRA मॉड्यूल को एक फ्रीज्ड बैकबोन पर संपीड़ित (compressible), प्रतिग्रहित (retrievable) मेमोरी यूनिट के रूप में मानता है, और यह प्रदर्शित करता है कि टास्कनॉलेजबैंक (TaskKnowledgeBank) से सरल समानता-आधारित रिट्रीवल, भूलने की प्रक्रिया (forgetting) को कम करने और कार्य रिकवरी को तेज करने के साथ-साथ न्यूनतम मेमोरी फुटप्रिंट बनाए रखते हुए जटिल सीखे गए एलोकेशन पॉलिसियों की तुलना में काफी बेहतर प्रदर्शन करता है।

Byeong Hoon Yoon2026-06-30
💻 computer science

SIR: Structured Image Representations for Explainable Robot Learning

यह शोध पत्र स्ट्रक्चर्ड इमेज रिप्रेजेंटेशन्स (SIR) को प्रस्तुत करता है, जो रोबोटिक पॉलिसियों के प्रदर्शन और अंतर्निहित व्याख्यात्मकता को बढ़ाने के लिए मध्यवर्ती निरूपण के रूप में सीखने योग्य, स्पार्स सीन ग्राफ का उपयोग करने वाली एक विधि है, जो ग्राफ विश्लेषण के माध्यम से डेटासेट पूर्वाग्रहों का पता लगाने में सक्षम बनाती है।

Paul Mattes, Jan Schwab, Jens Bosch, Nils Blank, Maximilian Xiling Li, Minh-Trung Tang, Moritz Haberland, Rudolf Lioutik (…)2026-06-30