🤖 machine learning

Graph Alignment via Dual-Pass Spectral Encoding and Latent Space Communication

यह शोध पत्र एक नवीन अनसुपरवाइज्ड ग्राफ अलाइनमेंट फ्रेमवर्क प्रस्तावित करता है जो उच्च-आवृत्ति विभेद्यता (high-frequency discriminability) को इंजेक्ट करने के लिए एक ड्यूल-पास एनकोडर को एक ज्योमेट्री-अवेयर फंक्शनल मैप मॉड्यूल के साथ जोड़ता है ताकि लेटेंट स्पेस को अलाइन किया जा सके, जो ओवरस्मूथिंग और स्ट्रक्चरल नॉइज़ की सीमाओं को प्रभावी ढंग से दूर करते हुए बेहतर सुदृढ़ता और सटीकता प्राप्त करता है।

Maysam Behmanesh, Erkan Turan, Maks Ovsjanikov2026-06-23
🤖 AI

HERMAN: Hierarchical Representation Matching for CLIP-based Class-Incremental Learning

HERMAN एक नवीन Class-Incremental Learning फ्रेमवर्क है जो CLIP के लिए, LLMs का उपयोग करके पदानुक्रमित (hierarchical) टेक्स्ट विवरण उत्पन्न करने और उन्हें बहु-स्तरीय दृश्य निरूपणों (multi-level visual representations) के साथ अनुकूल रूप से मिलाने के लिए किया जाता है, जिससे सूक्ष्म अंतरों को बेहतर ढंग से पकड़ने और कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करने द्वारा अत्याधुनिक प्रदर्शन प्राप्त होता है।

Zhen-Hao Xie, Yan Wang, Lan Li, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou2026-06-23
🤖 machine learning

Bayesian Transformer for Pan-Arctic Sea Ice Concentration Mapping and Uncertainty Estimation using Sentinel-1, RCM, and AMSR2 Data

यह शोध पत्र एक नवीन बेयसियन ट्रांसफार्मर मॉडल प्रस्तुत करता है जो वैश्विक-स्थानीय विशेषता निष्कर्षण और संभाव्यता पैरामीटर अनुमान का लाभ उठाकर, सेंटिनल-1, RCM और AMSR2 डेटा को संलयित करता है ताकि मजबूत अनिश्चितता परिमाणीकरण के साथ उच्च-रिज़ॉल्यूशन वाले पैन-आर्कटिक समुद्री बर्फ सांद्रता मानचित्र उत्पन्न किए जा सकें।

Mabel Heffring, Lincoln Linlin Xu2026-06-23
💻 computer science

Predicting Penalty Kick Direction Using Multi-Modal Deep Learning with Pose-Guided Attention

यह अध्ययन एक वास्तविक समय (रियल-टाइम), बहु-मोडल डीप लर्निंग फ्रेमवर्क प्रस्तुत करता है जो पेनल्टी किक की दिशा की भविष्यवाणी करने के लिए पोज-गाइडेड अटेंशन के साथ RGB फ्रेम विश्लेषण को जोड़ता है, जो 89% सटीकता के साथ एकल-मोडलिटी बेसलाइन से काफी बेहतर प्रदर्शन करता है और गोलकीपर प्रशिक्षण एवं सामरिक विश्लेषण के लिए व्यावहारिक अनुप्रयोग प्रदान करता है।

Pasindu Ranasinghe, Pamudu Ranasinghe2026-06-23
💬 NLP

SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation

यह शोध पत्र SIMSplat को प्रस्तुत करता है, जो एक भाषा-संरेखित (language-aligned) 4D गॉसियन स्प्लेटिंग फ्रेमवर्क है जो वास्तविक दुनिया के सेंसर डेटा से स्केलेबल, प्रतिक्रियाशील और भौतिक रूप से सुसंगत ड्राइविंग परिदृश्य निर्माण को सक्षम करने के लिए सीन ग्राउंडिंग, प्राकृतिक भाषा-संचालित संपादन और मल्टी-एजेंट सिमुलेशन को एकीकृत करता है।

Sung-Yeon Park, Adam Lee, Juanwu Lu, Can Cui, Luyang Jiang, Rohit Gupta, Kyungtae Han, Ahmadreza Moradipari, Ziran Wang2026-06-23
🤖 AI

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

यह शोध पत्र Oracle-RLAIF का प्रस्ताव करता है, जो बड़े वीडियो-भाषा मॉडलों के लिए एक लागत प्रभावी फाइन-ट्यूनिंग फ्रेमवर्क है, जो रैंकिंग फीडबैक से सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके बेहतर वीडियो समझ प्रदर्शन प्राप्त करने के लिए विशिष्ट रिवॉर्ड मॉडलों को एक सामान्य ऑरेकल रेंकर और एक नवीन रैंक-आधारित लॉस फंक्शन (GRPOrankGRPO_{rank}) से बदल देता है।

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Sil (…)2026-06-23
🤖 machine learning

Spatially Grounded Concept-Based Image Classification

यह शोध पत्र SEG-MIL-CBM का प्रस्ताव करता है, जो एक स्थानिक रूप से आधारित (spatially grounded) कॉन्सेप्ट बॉटलनेक मॉडल है जो छवियों को कॉन्सेप्ट-निर्देशित क्षेत्रों में विभाजित करता है और वर्गीकरण सटीकता में सुधार करने तथा अलग से पोस्ट-हॉक एट्रिब्यूशन मॉड्यूल की आवश्यकता के बिना आंतरिक, मानव-व्याख्या योग्य स्पष्टीकरण प्रदान करने के लिए अटेंशन के माध्यम से सेगमेंट-स्तरीय साक्ष्य को एकत्रित करता है।

Ran Eisenberg, Amit Rozner, Ethan Fetaya, Ofir Lindenbaum2026-06-23
💻 computer science

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM एक एकीकृत संभाव्य विश्व मॉडल (probabilistic world model) पेश करता है जो संरेखित पैनोरमिक बहु-मोडल वीडियो उत्पन्न करके अवस्था (state), क्रिया (action) और पुरस्कार (reward) आयामों को एक साथ संबोधित करता है, जो ज्यामितीय क्रिया एन्कोडिंग (geometric action encoding) के माध्यम से सटीक ज़ीरो-शॉट प्रक्षेपवक्र नियंत्रण (zero-shot trajectory control) को सक्षम बनाता है, और सुदृढ़ क्लोज्ड-लूप योजना मूल्यांकन के लिए 3D ऑक्यूपेंसी से आंतरिक सघन पुरस्कार (intrinsic dense rewards) प्राप्त करता है।

Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, X (…)2026-06-23
💻 computer science

GenTrack: A New Generation of Multi-Object Tracking

यह शोध पत्र GenTrack प्रस्तुत करता है, जो एक नवीन मल्टी-ऑब्जेक्ट ट्रैकिंग विधि है जो अज्ञात लक्ष्यों की संख्या, नॉनलीनियर डायनामिक्स और ऑक्लूजन को मजबूती से संभालने के लिए पार्टिकल स्वार्म ऑप्टिमाइज़ेशन और सोशल इंटरेक्शन मॉडलिंग के साथ स्टोकेस्टिक और डिटर्मिनिस्टिक दृष्टिकोणों को जोड़ता है, जिससे कई वेरिएंट्स के साथ पहला सार्वजनिक रूप से उपलब्ध, न्यूनतम-डिपेंडेंसी वाला संदर्भ कार्यान्वयन प्रदान करते हुए मानक बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Toan Van Nguyen, Rasmus G. K. Christiansen, Dirk Kraft, Leon Bodenhagen2026-06-23
🤖 AI

Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

यह शोध पत्र नुल-टेक्स्ट टेस्ट-टाइम अलाइनमेंट (Null-TTA) का प्रस्ताव करता है, जो एक नवीन प्रतिमान है कि क्लासिफायर-फ्री गाइडेंस में अनकंडीशनल एम्बेडिंग को अनुकूलित करने के लिए इन्फरेंस के दौरान टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल को लक्षित रिवॉर्ड्स के साथ संरेखित करता है, जिससे मॉडल पैरामीटर्स को अपडेट किए बिना रिवॉर्ड हैकिंग को रोकने और क्रॉस-रिवॉर्ड जनरलाइजेशन बनाए रखते हुए अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

Taehoon Kim, Henry Gouk, Timothy Hospedales2026-06-23