💬 NLP

Automated sign detection across the Electronic Babylonian Library: A large-scale dataset and end-to-end cuneiform OCR pipeline

यह शोध पत्र एक डिफॉर्मेबल डिटेक्शन ट्रांसफॉर्मर (DETR) पर आधारित एक स्केलेबल, एंड-टू-एंड क्यूनीफॉर्म (cuneiform) OCR पाइपलाइन प्रस्तुत करता है जो अब तक के सबसे बड़े एनोटेटेड साइन डेटासेट का लाभ उठाता है, जिससे महत्वपूर्ण मीट्रिक सुधार प्राप्त हुए हैं और 87,688 इलेक्ट्रॉनिक बेबीलोनियन लाइब्रेरी खंडों में लगभग 2.9 मिलियन संकेतों का सफलतापूर्वक पता लगाया गया है ताकि प्राचीन टैबलेट्स के बड़े पैमाने पर स्वचालित विश्लेषण को सक्षम बनाया जा सके।

Wentao Che, Esteban Garcés Arias, Asim Niaz, Andreas Bender, Enrique Jiménez2026-06-23
💻 computer science

OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs

OmniSpace एक प्लग-एंड-प्ले प्रतिमान (paradigm) है जो कैमरा पोज इंजेक्टर (Camera Pose Injector), मल्टी-व्यू एपिपोलर अटेंशन (Multi-view Epipolar Attention), और 3D ज्यामितीय डिस्टिलेशन (3D Geometric Distillation) को एकीकृत करके स्वायत्त ड्राइविंग के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की स्थानिक बुद्धिमत्ता को बढ़ाता है, ताकि किसी भी सहायक 3D मॉडल पर निर्भर रहे बिना विशुद्ध रूप से 2D अवलोकनों से सुदृढ़ ज्यामिति-जागरूक तर्क प्राप्त किया जा सके।

Hao Vo, Phu Loc Nguyen, Khoa Vo, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Ngu (…)2026-06-23
💻 computer science

4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking

यह शोध पत्र 4DVLT प्रस्तुत करता है, जो निर्देश-आधारित 4D गतिशील दृश्य समझ के लिए एक वर्ल्डलाइन-केंद्रित ढांचा है, साथ ही Instruct-4D बेंचमार्क और 4DTrack मॉडल भी, जो ग्राफ-कंडीशन्ड वर्ल्डलाइन इन्फरेंस के माध्यम से भाषा को निरंतर 3D गति और मल्टी-व्यू प्रोजेक्शन के साथ प्रभावी ढंग से ग्राउंड करके मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Chaoyue Li, Boxue Yang, Shengyao Zhou, Haoyang Wu, Rui Qian, Linfeng Zhang2026-06-23
⚡ electrical engineering

MaRS: Robust Out-of-Distribution Detection via Mahalanobis Residual Scoring

यह शोध पत्र MaRS को प्रस्तुत करता है, जो एक लेबल-मुक्त, पोस्ट-हॉक आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्टर है जो विभिन्न मेडिकल इमेजिंग मोडैलिटीज़ और डिस्ट्रीब्यूशन शिफ्ट्स के बीच बेहतर प्रदर्शन प्राप्त करने के लिए रिकंस्ट्रक्शन रेसिडुअल्स पर महालानोबिस डिस्टेंस का उपयोग करके वेरिएंस-अवेयर विचलन (variance-aware deviations) को कैप्चर करता है, जिससे यह मानक रिकंस्ट्रक्शन-आधारित विधियों की सीमाओं को दूर करता है।

Francesco Di Salvo, Sebastian Doerrich, Christian Ledig2026-06-23
💻 computer science

SATURN: Symbolic Spatial Reasoning for Multi-Perspective Grounding

SATURN एक न्यूरो-सिम्बोलिक फ्रेमवर्क है जो अनुमानित 3D दृश्यों को पुनर्गठित करके और एक प्रशिक्षण-मुक्त सिम्बोलिक एक्सेक्यूटर के माध्यम से सॉफ्ट, पर्सपेक्टिव-अवेयर प्रेडिकेट्स को संयोजित करके मजबूत बहु-परिप्रेक्ष्य स्थानिक तर्क (multi-perspective spatial reasoning) प्राप्त करता है, जो नए 3D FORCE डायग्नोस्टिक बेंचमार्क और वास्तविक दुनिया के MindCube डेटासेट दोनों पर मौजूदा विजन-लैंग्वेज मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करता है।

Danial Kamali, Tanawan Premsri, Shreya Rajpal, Amir Zadeh, Chuan Li, Parisa Kordjamshidi2026-06-23
💻 computer science

NullFlow: One-Step Generative Reconstruction

NullFlow इमेज पुनर्निर्माण के लिए एक सिद्धांत-आधारित वन-स्टेप जेनेरेटिव फ्रेमवर्क है जो जेनेरेटिव फ्लो को एक मेजरमेंट-कंसिस्टेंट सबस्पेस तक सीमित करता है, जिससे पुनरावृत्ति डेटा-फिडेलिटी सुधारों की आवश्यकता समाप्त हो जाती है और इन्फरेंस को सैकड़ों नेटवर्क इवैल्यूएशन से घटाकर एक सिंगल स्टेप में बदल दिया जाता है, जबकि यह अत्याधुनिक प्रदर्शन के साथ मेल खाता है।

Xiao Shi, Edward P. Chandler, Chicago Y. Park, Shirin Shoushtari, Ulugbek S. Kamilov2026-06-23
💻 computer science

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

RaysUp एक अल्ट्रा-लाइटवेट, टास्क-अग्नोस्टिक फ्रेमवर्क है जो ज्यामिति-जागरूक रे (ray) निरूपण और 6D प्लकर (Plücker) निर्देशांकों का लाभ उठाकर प्री-ट्रेन्ड विजन फाउंडेशन मॉडल्स से हाई-रिज़ॉल्यूशन फीचर मैप्स को पुनर्गठित करता है ताकि मौजूदा तरीकों की तुलना में काफी बेहतर दक्षता के साथ अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Yuchuan Ding, Linfei Li, Lin Zhang, Ying Shen2026-06-23
💻 computer science

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

यह शोध पत्र READ को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो संदर्भ-मिलान, लंबाई, प्रारूप और सुसंगतता पुरस्कारों का उपयोग करके अनुक्रम स्तर पर ऑडियो विवरण निर्माण को अनुकूलित करता है ताकि सटीकता और कथात्मक सुसंगतता में मौजूदा विधियों से काफी बेहतर प्रदर्शन किया जा सके।

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan2026-06-23
💻 computer science

CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams

CoVStream एक नवीन एज-क्लाउड सहयोगात्मक ढांचा है जो संसाधन-सीमित एज उपकरणों से क्लाउड सर्वर तक संकुचित (distilled) दृश्य विशेषताओं और सिमेंटिक कैप्शन को प्रसारित करके बैंडविड्थ की खपत को कम करता है, जिससे एंटिटी ग्राफ एकीकरण और ऑन-डिमांड भारी तर्क (heavy reasoning) के लिए बैंडविड्थ का उपयोग कम होता है, और लंबी वीडियो स्ट्रीम समझ के लिए बेसलाइन सटीकता के करीब 87.6% बैंडविड्थ की कमी प्राप्त करता है।

Xu Liu, Guikun Chen, Zihao Yan, Kanzhi Wu, Wenguan Wang2026-06-23
💻 computer science

Homographic Navigation: Geometry-Driven Camera Guidance for Deterministic Planar Capture

यह शोध पत्र होमोग्राफिक नेविगेशन (Homographic Navigation) प्रस्तुत करता है, जो एक ज्यामिति-संचालित ढांचा है जो सिंथेटिक डेटा ऑग्मेंटेशन और एक टू-पास इन्फरेंस स्कीम के माध्यम से सटीक, कॉन्फिडेंस-अवेयर कैमरा मार्गदर्शन और प्लेनर कैप्चर के लिए सिंगल-शॉट मॉडल को प्रशिक्षित करने हेतु होमोग्राफी को एक केंद्रीय संगठित चर के रूप में उपयोग करता है।

Dominik Kroupa, Marek Vaško, Muh Yuzril Ihza Baharuddin, Adam Herout2026-06-23