💻 computer science

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2 एक विजुअल-टेक्स्ट फाउंडेशन मॉडल है जिसे इमेज-टू-टेक्स्ट जनरेशन और पिक्सेल-लेवल रिकंस्ट्रक्शन की दोहरी रणनीति का उपयोग करके 113-मिलियन-इमेज के विशाल डॉक्यूमेंट कॉर्पस पर प्रीट्रेन किया गया है, जो डॉक्यूमेंट एनालिसिस कार्यों में मौजूदा एनकोडर्स से काफी बेहतर प्रदर्शन करता है और मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में एकीकृत होने पर अत्यधिक कुशल, स्टेट-ऑफ-द-आर्ट डॉक्यूमेंट पार्सिंग और अंडरस्टैंडिंग को सक्षम बनाता है।

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu (…)2026-07-14
💻 computer science

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

यह शोधपत्र CycleGRPO को पेश करता है, जो एक एकीकृत सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक स्व-मूल्यांकनकारी "क्षेत्र-से-पाठ-से-क्षेत्र" (region-to-text-to-region) चक्र निरंतरता पुरस्कार का लाभ उठाकर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को क्षेत्र समझ और स्थानीयकरण को संयुक्त रूप से अनुकूलित करने में सक्षम बनाता है, जिससे बिना किसी टेक्स्टुअल ग्राउंड ट्रुथ के विभिन्न पिक्सेल-स्तरीय कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan2026-07-14
💻 computer science

Backbone-Agnostic Perturbation-Induced Uncertainty Learning for End-to-End Real-World Image Dehazing

यह शोध पत्र BPUL का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले अनिश्चितता शिक्षण ढांचा (uncertainty learning framework) है जो सीखने योग्य विक्षोभों (learnable perturbations) के माध्यम से फीचर संवेदनशीलता का अनुमान लगाकर, भौतिक पूर्वग्रहों (physical priors) के साथ क्षरण निरंतरता (degradation consistency) को लागू करके, और एक दोहरी-स्थान कंट्रास्टिव लॉस (dual-space contrastive loss) का उपयोग करके एंड-टू-एंड वास्तविक दुनिया के इमेज डिहेज़िंग को बढ़ाता है, और यह सब मामूली अनुमान ओवरहेड (inference overhead) बनाए रखते हुए करता है।

Bingcai Wei2026-07-14
💻 computer science

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

यह शोध पत्र ABot-3DWorld 0 को प्रस्तुत करता है, जो एक सार्वभौमिक मल्टीमॉडल 3D वर्ल्ड मॉडल है जो टेक्स्ट, इमेज और वीडियो को एक स्पेशियल जनरेटिव प्रिमिटिव में एकीकृत करके, 3D-सुसंगत पैनोरमिक वीडियो जेनरेट करके, और उन्हें फोटोरियलिस्टिक 3D गॉसियन स्प्लेटिंग दृश्यों में पुनर्गठित करके उन्हें उच्च-सटीक, अन्वेषण योग्य 3D वातावरण में परिवर्तित करता है।

Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchan (…)2026-07-14
🤖 machine learning

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception

यह शोध पत्र NeuralActuator प्रस्तुत करता है, जो एक नए एकत्रित डेटासेट पर प्रशिक्षित एक न्यूरल एक्चुएटर मॉडल है जो सिम-टू-रियल त्रुटियों को दूर करने और विविध कम लागत वाले और उच्च-स्तरीय रोबोटिक प्लेटफॉर्म्स में सेंसरलेस फोर्स परसेप्शन को सक्षम करने के लिए सिम्युलेटर-तुल्य टॉर्क सरोगेट्स, बाहरी संपर्क बलों और मोटर स्वास्थ्य स्कोर की संयुक्त रूप से भविष्यवाणी करता है।

Zhiyang Dou, John U. Onyemelukwe, Hangxing Zhang, Heng Zhang, Minghao Guo, Yunsheng Tian, Michal Piotr Lipiec, Joshua Ja (…)2026-07-14
🤖 AI

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents

यह शोधपत्र MM-ToolSandBox प्रस्तुत करता है, जो एक एकीकृत ढांचा और बेंचमार्क है जिसमें विजुअल टूल-कॉलिंग एजेंटों का मूल्यांकन करने के लिए 500+ टूल्स और 258 मानव-सत्यापित परिदृश्यों वाला एक स्टेटफुल वातावरण शामिल है, जो यह प्रकट करता है कि वर्तमान मॉडल विजुअल सटीकता के साथ काफी संघर्ष करते हैं और विफलता के मोड छोटे मॉडलों में योजना संबंधी कमियों से बड़े मॉडलों में धारणा संबंधी त्रुटियों की ओर स्थानांतरित हो जाते हैं।

Kaixin Ma, Di Feng, Alexander Metz, Jiarui Lu, Eshan Verma, Afshin Dehghan2026-07-14
💻 computer science

MicroCharNet: Less is More for License Plate Character Detection

यह शोध पत्र MicroCharNet को प्रस्तुत करता है, जो एक अल्ट्रा-लाइटवेट डीप लर्निंग मॉडल है जिसमें C2f-आधारित बैकबोन, CoordAtt मॉड्यूल और एंकर-फ्री हेड है, जो एज डिवाइसेस पर न्यूनतम कंप्यूटेशनल संसाधनों (0.08M पैरामीटर्स और 0.096 GFLOPs) के साथ उच्च-सटीक, रियल-टाइम लाइसेंस प्लेट कैरेक्टर डिटेक्शन प्राप्त करता है।

Huy Che, Dinh-Duy Phan, Duc-Lung Vu2026-07-14
💻 computer science

HASTE: A Platform for Rapid Post-Disaster Building Damage Assessment

HASTE एक ओपन-सोर्स, नो-कोड वेब प्लेटफॉर्म है जो गैर-विशेषज्ञ विश्लेषकों को सिंगल-सीन सिमेंटिक सेगमेंटेशन या फ्यू-शॉट फाउंडेशन मॉडल एम्बेडिंग्स का उपयोग करके आपदा के बाद की सैटेलाइट इमेजरी से तेजी से प्रति-भवन क्षति मानचित्र (पर-बिल्डिंग डैमेज मैप्स) उत्पन्न करने में सक्षम बनाता है, जिसने 2023 से तीस से अधिक वास्तविक आपदा प्रतिक्रियाओं को सफलतापूर्वक समर्थन दिया है।

Caleb Robinson, Anthony Ortiz, Simone Fobi Nsutezo, Cameron Birge, Meygha Machado, Marcelo Duarte, Joaquin Rivero Rodrig (…)2026-07-14
🤖 AI

LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments

यह शोध पत्र एक पैरामीटर-कुशल, कैस्केडेड लो-रैंक एडेप्टेशन (LoRA) फ्रेमवर्क प्रस्तावित करता है जो चिकित्सा प्रशिक्षण वातावरण में क्रिया पहचान (action recognition) के लिए विषम मोडालिटीज़ को क्रमिक रूप से एकीकृत करता है, जो NurViD और नर्स ट्रेनिंग जैसे स्वास्थ्य देखभाल डेटासेट पर व्यक्तिगत मोडालिटी मॉडलों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Divya Mereddy, Jeevan Beedareddy2026-07-14
💻 computer science

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

यह शोध पत्र मल्टी-व्यू स्पोर्ट्स वीडियो अंडरस्टैंडिंग के लिए एक नया बेंचमार्क, SportMV-Bench पेश करता है, और SportMV-Agent प्रस्तावित करता है, जो एक एजेंटिक फ्रेमवर्क है जो वर्तमान सिंगल-व्यू मॉडल्स की सीमाओं को दूर करने के लिए प्रासंगिक कैमरा व्यूज़ को पुनरावृत्ति से चुनने और मल्टी-व्यू साक्ष्यों में तर्क को ग्राउंड करने के माध्यम से प्रदर्शन में महत्वपूर्ण सुधार करता है।

Kerui Chen, Jinglu Wang, Xiaoyi Zhang, Yan Lu2026-07-14