💻 computer science

Trimming the Long-Tail of Visual World Modeling Evaluation

यह शोधपत्र टेलर-बेंच (Tailor-Bench) का परिचय देता है, जो एक ऐसा बेंचमार्क है जिसे क्रमिक रूप से चुनौतीपूर्ण परिदृश्यों के माध्यम से अनियमित भौतिक अंतःक्रियाओं का अनुकरण करने की विज़ुअल वर्ल्ड मॉडल्स (visual world models) की क्षमता का परीक्षण करके उनकी लॉन्ग-टेल जनरलाइजेशन (long-tail generalization) का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल सतही दृश्य संकेतों (superficial visual cues) पर निर्भरता के कारण सामान्य पैटर्न से परे संघर्ष करते हैं।

Bingxuan Li, Yining Hong, Cheng Qian, Hyeonjeong Ha, Jiateng Liu, Zhenhailong Wang, Yue Guo, Yunzhu Li, Heng Ji2026-06-24
💬 NLP

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

यह शोध पत्र AVOC का प्रस्ताव करता है, जो एक रिट्रीवल-प्रेरित (retrieval-inspired) टोकन कंप्रेशन फ्रेमवर्क है जो प्रासंगिकता, महत्व और विविधता के आधार पर टोकन चयन को एक टॉप-KK रिट्रीवल समस्या के रूप में पुनर्गठित करके ओम्नी-मोडल LLMs में घंटे-स्तर की ऑडियो-वीडियो समझ को बढ़ाता है, जिससे लंबे समय के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और घंटे-लंबे संदर्भों में मजबूती बनाए रखी जाती है।

Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song2026-06-24
💻 computer science

TrOCR for Medieval HTR: A Systematic Ablation Study with Cross-Dataset Validation

यह शोधपत्र एक व्यवस्थित एब्लेशन अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि कैसे विशिष्ट फाइन-ट्यूनिंग रणनीतियाँ, जिनमें लेयर फ्रीजिंग और कंट्रास्ट नॉर्मलाइजेशन शामिल हैं, मध्यकालीन पांडुलिपियों पर TrOCR के प्रदर्शन को प्रभावित करती हैं, जिससे यह पता चलता है कि विशिष्ट डिकोडर परतों को फ्रीज़ करने और प्रीप्रोसेसिंग को छोड़ने से प्रतिस्पर्धी सटीकता प्राप्त की जा सकती है, साथ ही क्रॉस-डेटासेट सत्यापन और त्रुटि विश्लेषण भी प्रदान किया जा सकता है।

Sachin Sharma, Michele Flammini, Federico Simonetta2026-06-24
💻 computer science

Ill-Posed by Design: Probing Evidence Use in VLMs

यह शोधपत्र 'मेट्रिक वीक्यूए' (Metric VQA) का परिचय देता है, जो एक इल-पोज़्ड (ill-posed) वस्तु-आकार अनुमान बेंचमार्क है, यह प्रकट करने के लिए कि बड़े विजन-लैंग्वेज मॉडल भी मेट्रिक रीजनिंग के लिए दृश्य ज्यामिति (scene geometry) का प्रभावी ढंग से लाभ उठाने में विफल रहते हैं और वे सुदृढ़ साक्ष्य एकीकरण के बजाय लक्ष्य की पहचान पर अत्यधिक निर्भर रहते हैं, एक ऐसी सीमा जो काउंटरफैक्चुअल विश्लेषण और फाइन-ट्यूनिंग के बावजूद बनी रहती है।

Boaz Meivar, Shaked Perek, Shani Shvartzman, Eli Schwartz, Shai Avidan2026-06-24
🤖 machine learning

Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints

यह शोध पत्र OVBEVSeg को प्रस्तुत करता है, जो एक ज्यामिति-जागरूक (geometry-aware) ओपन-वोकैबुलरी BEV सेगमेंटेशन फ्रेमवर्क है, जो अनदेखी श्रेणियों पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए विजन-लैंग्वेज मॉडल और प्रगतिशील 3D ज्यामितीय बाधाओं का लाभ उठाता है, जबकि वास्तविक समय की दक्षता और कम मेमोरी खपत को बनाए रखता है।

Hojun Choi, Seulbin Hwang, Dae Jung Kim, Kisung Kim, Hyunjung Shim, Jinhan Lee2026-06-24
⚡ electrical engineering

Female-RHINO: A Real-Time Scanner-Integrated Framework for Automated Quantitative Uterine MRI Analysis and Structured Reporting

फीमेल-RHINO (Female-RHINO) एक रियल-टाइम, स्कैनर-एकीकृत AI फ्रेमवर्क है जो गर्भाशय के MRI के मात्रात्मक विश्लेषण और संरचित रिपोर्टिंग को स्वचालित करता है, जो शारीरिक संरचनाओं को सेगमेंट करने, फाइब्रॉइड जैसी विकृतियों का पता लगाने और 70 सेकंड के भीतर बायोमार्कर निकालने के लिए डीप लर्निंग का लाभ उठाता है, जिससे पेल्विक इमेजिंग में मानकीकरण और वर्कफ़्लो दक्षता में वृद्धि होती है।

Deepak Bhatia, Saad Ahmad, Smiti Tripathy, Maria Camila Bustos Vivas, Lieselotte Kratzsch, Anika Knupfer, Jordina Aviles (…)2026-06-24
🤖 AI

Transformation Behavior of Images in Latent Space

यह शोध पत्र इस बात का मूल्यांकन करता है कि शास्त्रीय इमेज ट्रांसफॉर्मेशन हिस्टोपैथोलॉजी एनकोडर नेटवर्क के लेटेंट स्पेस एम्बेडिंग्स को कैसे प्रभावित करते हैं, यह पाते हुए कि हालांकि एम्बेडिंग्स अपने मूल समकक्षों की तुलना में यादृच्छिक (रैंडम) एम्बेडिंग्स की तुलना में अधिक निकट रहते हैं, फिर भी वे पूरी तरह से इनवेरिएंट (अपरिवर्तनीय) नहीं हैं, जो ट्रांसफॉर्मेशन-आधारित डेटा ऑग्मेंटेशन के प्रदर्शन लाभों की व्याख्या करता है और सामान्य एवं पैथोलॉजी-विशिष्ट मॉडलों के बीच महत्वपूर्ण अंतरों को उजागर करता है।

Christian Zöllner (Department of Applied Tumor Biology Institute of Pathology Heidelberg University Hospital), Mozzam Mo (…)2026-06-24
💻 computer science

SENTRY: SAM2-Enhanced Neighbor-Aware and Temporally Reasoned Memory for Visual Tracking

SENTRY एक प्रशिक्षण-मुक्त (training-free), प्लग-एंड-प्ले मॉड्यूल है जो आत्मविश्वास-संचालित मेमोरी अपडेट को पड़ोसी-जागरूक, चक्र-सुसंगत सत्यापन (neighbor-aware, cycle-consistent validation) से बदलकर SAM2-आधारित विज़ुअल ट्रैकर्स को बेहतर बनाता है ताकि ड्रिफ्ट को रोका जा सके और बिना पुन: प्रशिक्षण के कई बेंचमार्क पर नया स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

Mohamad Alansari, Yonathan Michael, Hasan AlMarzouqi, Muzammal Naseer, Naoufel Werghi, Sajid Javed2026-06-24
💻 computer science

Lite Any Stereo V2: Faster and Stronger Efficient Zero-Shot Stereo Matching

यह शोध पत्र लाइट एनी स्टीरियो V2 (LAS2) का परिचय देता है, जो एक अल्ट्रा-फास्ट स्टीरियो मैचिंग मॉडल श्रृंखला है जो एक विलंबता-अनुकूलित (latency-optimized) 2D-केवल कॉस्ट एग्रीगेशन आर्किटेक्चर और एक नवीन तीन-चरणीय प्रशिक्षण रणनीति का उपयोग करके दक्षता और ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) के बीच के समझौते को चुनौती देती है, ताकि संसाधन-बाधित प्लेटफार्मों पर काफी कम इन्फरेंस लेटेंसी के साथ अत्याधुनिक सटीकता प्राप्त की जा सके।

Junpeng Jing, Ronglai Zuo, Zhelun Shen, Shangchen Zhou, Rolandos Alexandros Potamias, Stefanos Zafeiriou, Krystian Mikol (…)2026-06-24
💻 computer science

MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction

MambaRaw एक कुशल, JPEG-निर्देशित रॉ इमेज पुनर्निर्माण ढांचा है जो स्टेट स्पेस मॉडल्स और एक नवीन स्पेशियल-एनर्जी कपल्ड कॉन्टेक्स्ट मॉडलिंग तंत्र का लाभ उठाता है ताकि मौजूदा अटेंशन-आधारित विधियों की तुलना में कंप्यूटेशनल लागत और विलंबता को काफी कम करते हुए 4K छवियों पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Peize Li, Fanhu Zeng, Tongda Xu, Xingguo Xu, Xinjie Zhang, Xingtong Ge, Haotian Zhang, Yan Wang2026-06-24