💻 computer science

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

OmniX एक फीड-फॉरवर्ड 4D पुनर्निर्माण ढांचा (framework) है जो कॉम्पैक्ट डायनेमिक टोकन का उपयोग करके डायनेमिक मोशन मॉडलिंग को स्टैटिक ज्योमेट्री से अलग करके, एक नए पेश किए गए बड़े पैमाने के सिंथेटिक डेटासेट द्वारा समर्थित, बड़े कैमरा मोशन वाले वीडियो के लिए डेंस 3D पॉइंट ट्रैजेक्टरीज की भविष्यवाणी करता है।

Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo2026-07-14
💻 computer science

Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels

यह शोध पत्र "अलाइन एंड सेगमेंट" (AnS) का प्रस्ताव करता है, जो एक नवीन अनसुपरवाइज्ड लर्निंग फ्रेमवर्क है जो बिना किसी ग्राउंड-ट्रुथ लेबल की आवश्यकता के, एफ़िन ट्रांसफॉर्मेशन के माध्यम से मिसअलाइन्ड इमेज-लेबल पेयर्स को अलाइन करना और उच्च-गुणवत्ता वाला बिल्डिंग सेगमेंटेशन करना एक साथ सीखता है।

Venkanna Babu Guthula, Oswin Krause, Dimitri Gominski, Hui Zhang, Johan Mottelson, Ankit Kariryaa, Nico Lang, Christian (…)2026-07-14
💻 computer science

Learning To Focus: Anatomy-Guided Attention Regularization for Medical Image Classification

यह शोध पत्र Locus का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो प्री-ट्रेन्ड सेगमेंटेशन फाउंडेशन मॉडल्स का लाभ उठाकर एक एडेप्टिव अटेंशन रेगुलराइजेशन टर्म पेश करता है, जो मेडिकल इमेज क्लासिफायर को बिना किसी मैनुअल सेगमेंटेशन एनोटेशन की आवश्यकता के नैदानिक रूप से प्रासंगिक शारीरिक क्षेत्रों की ओर निर्देशित करता है।

Tonmoy Hossain, Atiqur Rahman, Farhana Hossain Swarnali, Miaomiao Zhang2026-07-14
🤖 machine learning

Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting

यह शोध पत्र 'वैरिएंस-करेक्टिव टाइम शिफ्टिंग' नामक एक प्रशिक्षण-मुक्त विधि प्रस्तुत करता है जो प्रभावी तापमान सैंपलिंग (टेम्परेचर सैंपलिंग) को सक्षम करने के लिए डिफ्यूजन मॉडल्स का उपयोग करती है ताकि वेरिएंस को बढ़ाए बिना प्रमुख मोड्स को सपाट करके विविधता को बढ़ाया जा सके, जिससे उच्च गुणवत्ता और कंडीशन फिडेलिटी बनाए रखते हुए विभिन्न आर्किटेक्चर में सैंपल विविधता में सुधार किया जा सके।

Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung2026-07-14
🔢 mathematics

Design Choices in Splitting-Based Self-Supervised Sparse-View CT Reconstruction

यह शोधपत्र स्प्लिटिंग-आधारित सेल्फ-सुपरवाइज्ड स्पार्स-व्यू सीटी पुनर्निर्माण में डिज़ाइन विकल्पों का विश्लेषण करने के लिए एक एकीकृत ढांचे को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इष्टतम विभाजन रणनीतियाँ शोर की संरचना पर निर्भर करती हैं और पूरक मेट्रिक्स के साथ मल्टी-पार्टिशन स्प्लिटिंग सिमुलेटेड और वास्तविक दुनिया के डेटासेट में बेहतर प्रदर्शन प्रदान करती है।

Nadja Gruber, Lukas Neumann, Ander Biguri, Gyeongha Hwang, Markus Haltmeier, Johannes Schwab2026-07-14
🤖 AI

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

EquiFusion एक परम्यूटेशन इक्विवैरिएंट लेटेंट डिफ्यूजन आर्किटेक्चर का उपयोग करने वाला पहला किनेमैटिक्स-अज्ञेय मानव गति भविष्यवाणी मॉडल पेश करता है जो कंकाल की कनेक्टिविटी को एक स्पष्ट इनपुट के रूप में मानता है, जिससे उत्कृष्ट क्रॉस-डेटासेट सामान्यीकरण, ज़ीरो-शॉट क्षमताएं, और पिछले तरीकों की तुलना में काफी अधिक दक्षता के साथ अत्याधुनिक प्रदर्शन सक्षम होता है।

Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers2026-07-14
💻 computer science

MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration

यह शोध पत्र MED-DSLC का प्रस्ताव करता है, जो एक हल्का ढांचा (lightweight framework) है जो मल्टी-एक्सपर्ट विजन-लैंग्वेज मॉडल्स में ग्लोबल लॉजिट कंपैरेबिलिटी (global logit comparability) को बहाल करने के लिए डोमेन-सुपरवाइज्ड ट्रेनिंग और लॉजिट स्केलिंग को जोड़ता है, जिससे क्रॉस-डोमेन इंटरफेरेंस को हल किया जाता है और फाइन-ग्रेन्ड मल्टी-डोमेन ज़ीरो-शॉट क्लासिफिकेशन में सटीकता और स्केलेबिलिटी में महत्वपूर्ण सुधार होता है।

Zheng Zeng, Deepak Sridhar, Nuno Vasconcelos2026-07-14
💻 computer science

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc एक नवीन ढांचा है जो प्रश्नोत्तर को डायनेमिक डेप्थ-फर्स्ट सर्च और एडेप्टिव टूल इंटीग्रेशन का उपयोग करके एक पदानुक्रमित खोज समस्या के रूप में पुनर्गठित करके सॉकर वीडियो की समझ को बढ़ाता है, जिससे SoccerBench पर अत्याधुनिक प्रदर्शन प्राप्त होता है और मजबूत क्रॉस-डोमेन सामान्यीकरण प्रदर्शित होता है।

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran2026-07-14
🤖 AI

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

यह शोध पत्र HUMA को प्रस्तुत करता है, जो एक हाइब्रिड आर्किटेक्चर है जो वास्तविक समय में, सामाजिक रूप से जागरूक मोबाइल रोबोट नेविगेशन को सक्षम करने के लिए कुशल सुदृढीकरण शिक्षण (reinforcement learning) नीतियों को सशर्त विजन-लैंग्वेज मॉडल तर्क के साथ गतिशील रूप से संयोजित करता है, जो कार्य सफलता में महत्वपूर्ण सुधार करता है और मानव टकरावों को कम करता है।

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani2026-07-14
💻 computer science

Temporal Feature Distillation for Label-Efficient Precise Event Spotting in Sports Videos

यह शोध पत्र टेम्पोरल फीचर डिस्टिलेशन (Temporal Feature Distillation) का प्रस्ताव करता है, जो एक अर्ध-पर्यवेक्षित (semi-supervised) ढांचा है जो स्पोर्ट्स वीडियो में सटीक इवेंट स्पोटिंग के लिए मोशन-सेंसिटिव संकेतों को संरक्षित करने हेतु सुपरवाइज्ड वॉर्म-अप और एक ट्रांसफॉर्मर गेट शिफ्ट मॉड्यूल को जोड़ता है, जिससे पूरी तरह से सुपरवाइज्ड बेसलाइन की तुलना में काफी कम लेबल किए गए डेटा के साथ बेहतर प्रदर्शन प्राप्त होता है।

Hao Xu, Xinyu Wei, Sam Wells, Sunil Aryal2026-07-14