🤖 machine learning

KAGE-Bench: Fast Known-Axis Visual Generalization Evaluation for Reinforcement Learning

यह शोध पत्र KAGE-Bench प्रस्तुत करता है, जो KAGE-Env प्लेटफॉर्म पर निर्मित एक उच्च-गति वाला JAX-नेटिव बेंचमार्क है जो सुव्यवस्थित रूप से सुदृढीकरण लर्निंग (reinforcement learning) एजेंटों पर विशिष्ट दृश्य वितरण परिवर्तनों (visual distribution shifts) के प्रभाव को अलग करता और उनका मूल्यांकन करता है, यह प्रकट करते हुए कि बैकग्राउंड और फोटोमेट्रिक परिवर्तन अक्सर विनाशकारी विफलता का कारण बनते हैं जबकि एजेंट-उपस्थिति में बदलाव अधिक सौम्य होते हैं।

Egor Cherepanov, Daniil Zelezetsky, Alexey K. Kovalev, Aleksandr I. Panov2026-07-02
💻 computer science

Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection

यह शोध पत्र इमेज इम्यूनाइजेशन (image immunization) के लिए पहले यूनिवर्सल एडवर्सरियल परटर्बेशन फ्रेमवर्क का प्रस्ताव करता है जो एक एकल, इमेज-अग्नोस्टिक परटर्बेशन उत्पन्न करता है ताकि मूल सिमेंटिक्स को एक लक्षित सिमेंटिक के साथ ओवरराइट करके अनधिकृत डिफ्यूजन-आधारित इमेज एडिटिंग को प्रभावी ढंग से रोका जा सके, जो मौजूदा इमेज-विशिष्ट विधियों की तुलना में बेहतर प्रदर्शन और ब्लैक-बॉक्स ट्रांसफरेबिलिटी प्राप्त करता है।

Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son2026-07-02
💻 computer science

AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware

AFFMAE एक स्केलेबल, मास्किंग-फ्रेंडली प्री-ट्रेनिंग फ्रेमवर्क है जो एडेप्टिव ऑफ-ग्रिड टोकन मर्जिंग और ऑप्टिमाइज्ड कर्नेल्स पर आधारित है, जो मानक MAE के समान प्रदर्शन प्राप्त करते हुए डेस्कटॉप हार्डवेयर पर हाई-रिज़ॉल्यूशन माइक्रोस्कोपी सेगमेंटेशन को सक्षम बनाता है और प्री-ट्रेनिंग समय, मेमोरी उपयोग और फाइन-ट्यूनिंग लेटेंसी को काफी कम करता है।

David Smerkous, Zian Wang, Behzad Najafian2026-07-02
🤖 machine learning

MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation

MMLoP एक अत्यधिक पैरामीटर-कुशल मल्टी-मोडल प्रॉम्प्टिंग फ्रेमवर्क पेश करता है जो लो-रैंक फैक्टराइजेशन और गहरे क्रॉस-मोडल संरेखण एवं प्रतिनिधित्व स्थिरता को सुनिश्चित करने के लिए तीन नवीन रेगुलाइजेशन घटकों का लाभ उठाकर केवल 11.5K प्रशिक्षण योग्य पैरामीटर के साथ स्टेट-ऑफ-द-आर्ट विजन-लैंग्वेज एडाप्टेशन प्रदर्शन प्राप्त करता है।

Sajjad Ghiasvand, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani2026-07-02
💻 computer science

Towards an automated AI-based framework for floor plan compliance checks for residential buildings

यह शोध पत्र एक स्केलेबल, एआई-संचालित वैचारिक ढांचे का प्रस्ताव करता है जो आवासीय फ्लोर प्लान के विकसित होते ऑस्ट्रेलियाई भवन नियमों के विरुद्ध ज्यामितीय और स्थानिक अनुपालन की जांच को स्वचालित करने के लिए लार्ज लैंग्वेज मॉडल्स और कंप्यूटर विजन को एकीकृत करता है, जिससे मैनुअल, समय-गहन मूल्यांकन विधियों की सीमाओं को संबोधित किया जा सके।

Subash Gautam, Debaditya Acharya, Alexandra Kleeman, Sarah Foster2026-07-02
💻 computer science

Learning Dexterous Manipulation Using Contact Wrench Guidance From Human Demonstration

यह शोध पत्र CHORD को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो लंबी अवधि के डेक्सट्रस मैनिपुलेशन (dexterous manipulation) के लिए स्केलेबल सुदृढीकरण लर्निंग (reinforcement learning) को सक्षम करने हेतु मानव प्रदर्शनों से प्राप्त ऑब्जेक्ट-सेंट्रिक कॉन्टैक्ट रेंच गाइडेंस (object-centric contact wrench guidance) का लाभ उठाता है, जो एक बड़े पैमाने के सिमुलेशन बेंचमार्क में उच्च सफलता दर प्राप्त करता है और मजबूत सामान्यीकरण (generalization) तथा वास्तविक दुनिया में स्थानांतरण (real-world transfer) प्रदर्शित करता है।

Xinghao Zhu, Zixi Liu, Shalin Jain, Chenran Li, Milad Noori, Huihua Zhao, John Welsh, Michael Andres Lin, Wei Liu, Tingw (…)2026-07-02
💻 computer science

Enhancing Oracle Bone Inscription Recognition via Multi-Scale Layer Attention

यह शोध पत्र मल्टी-स्केल लेयर अटेंशन (MSLA) का प्रस्ताव करता है, जो एक नया प्रतिमान (पैराडाइम) है जो ऑरेकल बोन इनस्क्रिप्शन (ओरलकल बोन इनस्क्रिप्शन) पहचान में जटिल आकृतियों और क्षीण विवरणों की चुनौतियों को दूर करने के लिए मल्टी-स्केल और क्रॉस-लेयर फीचर इंटरैक्शन को स्पष्ट रूप से मॉडल करता है, जिससे मौजूदा विधियों की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Chaowen Yan, Kaishen Wang, Yong Wang, Jianlong Xiong, Tao He2026-07-02
💻 computer science

Joint Medical Image Enhancement and Segmentation with Diffusion-based Symbiotic Information Interaction

यह शोध पत्र DiSIINet का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो डिनोइजिंग डिफ्यूजन इम्प्लिसिट मॉडल्स और एक नवीन सिम्बायोटिक इंफॉर्मेशन इंटरेक्शन मॉड्यूल का लाभ उठाकर चिकित्सा छवियों के संवर्धन (एन्हांसमेंट) और विखंडन (सेगमेंटेशन) को परस्पर सुदृढ़ बनाता है, जिससे पारंपरिक अनुक्रमिक दृष्टिकोणों की तुलना में मल्टी-मोडल डेटासेट पर बेहतर प्रदर्शन प्राप्त होता है।

Ying Chen, Jinyue Li, Qiankun Li2026-07-02
💻 computer science

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

यह शोध पत्र सिनर्जिस्टिक परसेप्शन-रीजनिंग गवर्नेंस (SPRG) का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री फ्रेमवर्क है जो ROI-गाइडेड विजुअल मॉड्यूलेशन और कोऑर्डिनेट-टू-टोकन सिमेंटिक एंकरिंग के माध्यम से सत्यापन योग्य शारीरिक साक्ष्य इंजेक्ट करके मेडिकल मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जिससे विविध बेंचमार्क पर सटीकता में महत्वपूर्ण सुधार और मतिभ्रम में कमी आती है।

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng2026-07-02
💻 computer science

Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition

यह शोध पत्र डिस्ट्रीब्यूशन-अवेयर प्लेस रिकग्निशन (DAPR) को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय प्लग-इन फ्रेमवर्क है जो ग्रेडिएंट योगदान को पुनर्संतुलित करके और मल्टी-स्केल डिस्टेंस सर्च को अनुकूलित करके शहरी विजुअल प्लेस रिकग्निशन में लॉन्ग-टेल्डेड भौगोलिक असंतुलन को संबोधित करता है, जिससे विविध बेंचमार्क और विधियों में प्रदर्शन में महत्वपूर्ण सुधार होता है।

Zhiyao Shu, Jiacheng Yang, Yang Lu, Waishan Qiu, Chuan Li, Da Chen2026-07-02