🤖 AI

SWITi: Quantifying and Reducing Tiling Artifacts with Sliding Window Inner Tiling

SWITi एक टेस्ट-टाइम विधि है जो ओवरलैपिंग स्लाइडिंग-विंडो सैंपल्स को शिफ्ट किए गए स्थानों पर विसंगतियों को वितरित करने के लिए औसत निकालकर बड़े पैमाने पर इमेज प्रेडिक्शन्स में टाइलिंग आर्टिफैक्ट्स को कम करती है, जिससे अतिरिक्त फॉरवर्ड पासेस की आवश्यकता के बिना पुनर्निर्माण निष्ठा (reconstruction fidelity) में सुधार होता है और गलत जैविक व्याख्याओं को रोका जाता है।

Federico Carrara, Aman Kukde, Melisande Croft, Joran Deschamps, Florian Jug2026-07-22
🤖 AI

Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions

यह शोध पत्र एडेप्टिव व्यू रिट्रीवल (Adaptive View Retrieval) को प्रस्तुत करता है, जो एक नया ढांचा है जो छिपे हुए घृणास्पद भ्रमों (hateful illusions) का पता लगाने में मौजूदा मल्टीमॉडल सुरक्षा प्रणालियों से काफी बेहतर प्रदर्शन करता है, क्योंकि यह इस कार्य को एक संवेदी पुनर्प्राप्ति समस्या (perceptual retrieval problem) के रूप में तैयार करता है जो हानिकारकता का आकलन करने से पहले अस्पष्ट अर्थों को पुनः प्राप्त करता है।

Qianpu Chen, Derya Soydaner2026-07-22
⚡ electrical engineering

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Mage-Flow एक कॉम्पैक्ट 4B-स्केल फाउंडेशन मॉडल परिवार है जो एक हल्के उच्च-निष्ठा वाले VAE, एक नेटिव-रिज़ॉल्यूशन डिफ्यूजन ट्रांसफार्मर और सिस्टम-स्तरीय अनुकूलन के सह-डिज़ाइन के माध्यम से कुशल, उच्च-रिज़ॉल्यूशन टेक्स्ट-टू-इमेज जनरेशन और निर्देश-आधारित संपादन प्राप्त करता है, जो एक सिंगल GPU पर अल्ट्रा-लो लेटेंसी के साथ प्रतिस्पर्धी प्रदर्शन प्रदान करता है।

Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan (…)2026-07-22
💻 computer science

Delineate Anything v2: A Global Foundation Model for Field Delineation

डelineate Anything v2 एक वैश्विक स्तर पर स्केलेबल फाउंडेशन मॉडल है जो सटीक कृषि क्षेत्र सीमा मानचित्रण के लिए 73-मिलियन-इंस्टेंस के विशाल डेटासेट और नवीन टोपोलॉजिकल डेटा क्यूरेशन का लाभ उठाता है, जो ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) में मौजूदा अत्याधुनिक तरीकों से काफी बेहतर प्रदर्शन करते हुए तीव्र, बड़े पैमाने पर परिनियोजन को सक्षम बनाता है।

Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov, Yevhenii Salii, Volodymyr Kuzin, Charlotte Julia Li-Xing Wang, Zolt (…)2026-07-22
💻 computer science

GATE-3D: Geometry-Aware Test-time Adaptive Reranking for Open-Set 3D Shape Retrieval

GATE-3D एक हल्का, टेस्ट-टाइम एडेप्टिव रीरैंकिंगिंग विधि है जो क्रॉस-मोडल असहमति के आधार पर रैंकिंग को चुनिंदा रूप से समायोजित करके, ज्यामिति-जागरूक विशेषताओं को उपस्थिति-आधारित रिट्रीवल के साथ गतिशील रूप से एकीकृत करता है, जिससे बैकबोन को पुन: प्रशिक्षित किए बिना ओपन-सेट 3D आकार रिट्रीवल प्रदर्शन और मजबूती में सुधार होता है।

Hao Wu, Heyi Lin, Zilin Wang, Huizai Yao, Hao Wang, Hui Xiong2026-07-22
💻 computer science

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

यह शोध पत्र CR-Refiner प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) रीरैंकर है जो संरचित क्वेरी पार्सिंग के लिए एक फ्रोजन LLM को अनबैलेंस्ड ऑप्टिमल ट्रांसपोर्ट स्कोरिंग और एक LLM वेरीफायर के साथ संयोजित करके एडिट-कंडीशन्ड 3D सीन रिट्रीवल को बेहतर बनाता है, और साथ ही इस कार्य के लिए मौजूदा मूल्यांकन डेटासेट की कमी को दूर करने के लिए 3D-CER बेंचमार्क भी जारी करता है।

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong2026-07-22
💻 computer science

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

यह शोध पत्र डिफ्यूजन ट्रांसफॉर्मर के लिए एक कारणत्मक व्याख्यात्मकता (causal interpretability) ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि संरचनात्मक टेम्पलेट टोकन एक अप्रत्यक्ष रीड-बैक तंत्र के माध्यम से वस्तु की पहचान बनाए रखने वाले निहित अर्थ संबंधी रजिस्टर (implicit semantic registers) के रूप में कार्य करते हैं, जिससे एक प्रशिक्षण-मुक्त प्रूनिंग रणनीति को डिजाइन करना सक्षम होता है जो न्यूनतम प्रदर्शन हानि के साथ कम्प्यूटेशनल लागत को काफी कम कर देती है।

Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao La (…)2026-07-22
💻 computer science

Sarus: Privacy-Preserving Multi-Vendor Perception Fusion via Homomorphic Encryption

सारस (Sarus) एक गोपनीयता-संरक्षण ढांचा है जो होमोमोर्फिक एन्क्रिप्शन के माध्यम से मल्टी-वेंडर स्वायत्त वाहनों को धारणा डेटा (perception data) को संलयित करने में सक्षम बनाता है, जिससे एक सर्वर विविध सेंसरों से एन्क्रिप्टेड गॉसियन मोमेंट वेक्टर्स को एकत्रित कर सकता है, बिना मालिकाना मॉडल आउटपुट को प्रकट किए, जबकि वास्तविक समय के प्रदर्शन को बनाए रखते हुए दृश्य-स्तरीय कवरेज में सुधार करता है।

Munawar Hasan, Apostol Vassilev2026-07-22
💻 computer science

Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding

पॉइंट लैडर ट्यूनिंग (PLT) एक पैरामीटर-कुशल पदानुक्रमित अनुकूलन ढांचा है जो एक मल्टी-रेज़ोल्यूशन स्थानीय फीचर पिरामिड का निर्माण करके और इसे वैश्विक अर्थों (ग्लोबल सेमैंटिक्स) के साथ संलयित करके मौजूदा विधियों में सूक्ष्म स्थानीय ज्यामिति की हानि को दूर करता है, ताकि न्यूनतम प्रशिक्षण योग्य मापदंडों के साथ 3D पॉइंट क्लाउड वर्गीकरण और सघन भविष्यवाणी (डेंस प्रेडिक्शन) में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Junlin Chang, Longhao Zou, Rui Li2026-07-22
🤖 AI

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

यह शोध पत्र PathAgentBench प्रस्तुत करता है, जो पैथोलॉजी में साक्ष्य-खोज (evidence-seeking) क्षमताओं पर विजन-लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए 1,822 होल-स्लाइड इमेजेस और विशेषज्ञ एनोटेशन का उपयोग करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि जहाँ मॉडल्स क्यूरेटेड साक्ष्यों पर तर्क करने में उत्कृष्ट हैं, वहीं वे गीगापिक्सेल इमेजेस से सीधे नैदानिक क्षेत्रों को स्वायत्त रूप से प्राप्त करने और स्थानीयकृत करने में काफी संघर्ष करते हैं।

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin2026-07-22