💻 computer science

HyperGS: Fast and Generalizable Gaussian Video Representation

HyperGS एक तेज़, फीडफॉरवर्ड और सामान्यीकरण योग्य फ्रेमवर्क पेश करता है जो एकल फॉरवर्ड पास में वीडियो फ्रेम से सीधे 3D गॉसियन रिप्रजेंटेशन की भविष्यवाणी करता है, जो पारंपरिक प्रति-वीडियो अनुकूलन विधियों की तुलना में क्रम-परिमाण (orders-of-magnitude) अधिक तेज़ एन्कोडिंग और ज़ीरो-शॉट उच्च-रिज़ॉल्यूशन रेंडरिंग प्राप्त करते हुए भी बेहतर पुनर्निर्माण गुणवत्ता बनाए रखता है।

Fatimah Zohra, Chen Zhao, Shuming Liu, Yahya Al Malallah, Bernard Ghanem2026-07-14
🤖 machine learning

Training-Free Off-Screen Player Imputation for Broadcast-Based Spatial Football Analytics

यह शोध पत्र रोल-एंकोर्ड सेंट्रॉइड वोटिंग (role-anchored centroid voting) नामक एक प्रशिक्षण-मुक्त, ऑनलाइन विधि प्रस्तुत करता है जो ब्रॉडकास्ट फुटेज से ऑफ-स्क्रीन खिलाड़ियों की स्थितियों को इम्प्यूट (impute) करने के लिए है, जो अतिरिक्त प्रशिक्षण डेटा की आवश्यकता के बिना स्थानिक फुटबॉल मेट्रिक्स त्रुटियों को काफी कम करता है और पजेशन-क्वालिटी स्कोर जैसे डाउनस्ट्रीम एनालिटिक्स में सुधार करता है, और दो वास्तविक विश्व कप विंडो के लिए, इम्प्यूटेड स्कोर को 'सत्य' मानों के रूप में दावा नहीं किया गया है, बल्कि वे एक संवेदनशीलता परिणाम का प्रतिनिधित्व करते हैं जो यह दर्शाता है कि ब्रॉडकास्ट क्लिप्स पर फुल-पिच ग्राउंड ट्रुथ की कमी को देखते हुए, जब ऑफ-स्क्रीन खिलाड़ियों को इम्प्यूट किया जाता है तो निर्णय कैसे बदल सकते हैं।

Seongjin Choi2026-07-14✓ Author reviewed
💻 computer science

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2 एक विजुअल-टेक्स्ट फाउंडेशन मॉडल है जिसे इमेज-टू-टेक्स्ट जनरेशन और पिक्सेल-लेवल रिकंस्ट्रक्शन की दोहरी रणनीति का उपयोग करके 113-मिलियन-इमेज के विशाल डॉक्यूमेंट कॉर्पस पर प्रीट्रेन किया गया है, जो डॉक्यूमेंट एनालिसिस कार्यों में मौजूदा एनकोडर्स से काफी बेहतर प्रदर्शन करता है और मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में एकीकृत होने पर अत्यधिक कुशल, स्टेट-ऑफ-द-आर्ट डॉक्यूमेंट पार्सिंग और अंडरस्टैंडिंग को सक्षम बनाता है।

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu (…)2026-07-14
💻 computer science

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

यह शोधपत्र CycleGRPO को पेश करता है, जो एक एकीकृत सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक स्व-मूल्यांकनकारी "क्षेत्र-से-पाठ-से-क्षेत्र" (region-to-text-to-region) चक्र निरंतरता पुरस्कार का लाभ उठाकर मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को क्षेत्र समझ और स्थानीयकरण को संयुक्त रूप से अनुकूलित करने में सक्षम बनाता है, जिससे बिना किसी टेक्स्टुअल ग्राउंड ट्रुथ के विभिन्न पिक्सेल-स्तरीय कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan2026-07-14
💻 computer science

Backbone-Agnostic Perturbation-Induced Uncertainty Learning for End-to-End Real-World Image Dehazing

यह शोध पत्र BPUL का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले अनिश्चितता शिक्षण ढांचा (uncertainty learning framework) है जो सीखने योग्य विक्षोभों (learnable perturbations) के माध्यम से फीचर संवेदनशीलता का अनुमान लगाकर, भौतिक पूर्वग्रहों (physical priors) के साथ क्षरण निरंतरता (degradation consistency) को लागू करके, और एक दोहरी-स्थान कंट्रास्टिव लॉस (dual-space contrastive loss) का उपयोग करके एंड-टू-एंड वास्तविक दुनिया के इमेज डिहेज़िंग को बढ़ाता है, और यह सब मामूली अनुमान ओवरहेड (inference overhead) बनाए रखते हुए करता है।

Bingcai Wei2026-07-14
💻 computer science

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

यह शोध पत्र ABot-3DWorld 0 को प्रस्तुत करता है, जो एक सार्वभौमिक मल्टीमॉडल 3D वर्ल्ड मॉडल है जो टेक्स्ट, इमेज और वीडियो को एक स्पेशियल जनरेटिव प्रिमिटिव में एकीकृत करके, 3D-सुसंगत पैनोरमिक वीडियो जेनरेट करके, और उन्हें फोटोरियलिस्टिक 3D गॉसियन स्प्लेटिंग दृश्यों में पुनर्गठित करके उन्हें उच्च-सटीक, अन्वेषण योग्य 3D वातावरण में परिवर्तित करता है।

Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchan (…)2026-07-14
🤖 machine learning

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception

यह शोध पत्र NeuralActuator प्रस्तुत करता है, जो एक नए एकत्रित डेटासेट पर प्रशिक्षित एक न्यूरल एक्चुएटर मॉडल है जो सिम-टू-रियल त्रुटियों को दूर करने और विविध कम लागत वाले और उच्च-स्तरीय रोबोटिक प्लेटफॉर्म्स में सेंसरलेस फोर्स परसेप्शन को सक्षम करने के लिए सिम्युलेटर-तुल्य टॉर्क सरोगेट्स, बाहरी संपर्क बलों और मोटर स्वास्थ्य स्कोर की संयुक्त रूप से भविष्यवाणी करता है।

Zhiyang Dou, John U. Onyemelukwe, Hangxing Zhang, Heng Zhang, Minghao Guo, Yunsheng Tian, Michal Piotr Lipiec, Joshua Ja (…)2026-07-14
🤖 AI

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents

यह शोधपत्र MM-ToolSandBox प्रस्तुत करता है, जो एक एकीकृत ढांचा और बेंचमार्क है जिसमें विजुअल टूल-कॉलिंग एजेंटों का मूल्यांकन करने के लिए 500+ टूल्स और 258 मानव-सत्यापित परिदृश्यों वाला एक स्टेटफुल वातावरण शामिल है, जो यह प्रकट करता है कि वर्तमान मॉडल विजुअल सटीकता के साथ काफी संघर्ष करते हैं और विफलता के मोड छोटे मॉडलों में योजना संबंधी कमियों से बड़े मॉडलों में धारणा संबंधी त्रुटियों की ओर स्थानांतरित हो जाते हैं।

Kaixin Ma, Di Feng, Alexander Metz, Jiarui Lu, Eshan Verma, Afshin Dehghan2026-07-14
💻 computer science

MicroCharNet: Less is More for License Plate Character Detection

यह शोध पत्र MicroCharNet को प्रस्तुत करता है, जो एक अल्ट्रा-लाइटवेट डीप लर्निंग मॉडल है जिसमें C2f-आधारित बैकबोन, CoordAtt मॉड्यूल और एंकर-फ्री हेड है, जो एज डिवाइसेस पर न्यूनतम कंप्यूटेशनल संसाधनों (0.08M पैरामीटर्स और 0.096 GFLOPs) के साथ उच्च-सटीक, रियल-टाइम लाइसेंस प्लेट कैरेक्टर डिटेक्शन प्राप्त करता है।

Huy Che, Dinh-Duy Phan, Duc-Lung Vu2026-07-14
💻 computer science

HASTE: A Platform for Rapid Post-Disaster Building Damage Assessment

HASTE एक ओपन-सोर्स, नो-कोड वेब प्लेटफॉर्म है जो गैर-विशेषज्ञ विश्लेषकों को सिंगल-सीन सिमेंटिक सेगमेंटेशन या फ्यू-शॉट फाउंडेशन मॉडल एम्बेडिंग्स का उपयोग करके आपदा के बाद की सैटेलाइट इमेजरी से तेजी से प्रति-भवन क्षति मानचित्र (पर-बिल्डिंग डैमेज मैप्स) उत्पन्न करने में सक्षम बनाता है, जिसने 2023 से तीस से अधिक वास्तविक आपदा प्रतिक्रियाओं को सफलतापूर्वक समर्थन दिया है।

Caleb Robinson, Anthony Ortiz, Simone Fobi Nsutezo, Cameron Birge, Meygha Machado, Marcelo Duarte, Joaquin Rivero Rodrig (…)2026-07-14