💻 computer science

Dot-Flik: A Scalable Edge AI Architecture for Distributed Insect Monitoring

यह शोध पत्र डॉट-फ्लिक (Dot-Flik) प्रस्तुत करता है, जो वितरित कीट निगरानी के लिए एक स्केलेबल एज एआई आर्किटेक्चर है, जो डेटा ट्रांसमिशन और ऊर्जा खपत को कम करने के लिए मोशन-इन्फॉर्म्ड फ्रेम फ़िल्टरिंग का उपयोग करता है, जिससे केंद्रीकृत प्रसंस्करण पर निर्भर रहे बिना कम लागत वाले हार्डवेयर पर लागत प्रभावी, वास्तविक समय की जैव विविधता ट्रैकिंग सक्षम होती है।

Mattia Consani, Denisa-Andreea Constantinescu, Åse Håtveit, Titus Venverloo, Fabio Duarte, Carlo Ratti, David Atienza2026-06-26
💻 computer science

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

यह शोध पत्र लॉन्ग-कॉन्टेक्स्ट जनरेशन (LCG) का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो लंबे दृश्य आख्यानों (विजुअल नैरेटिव्स) के लिए सुसंगत, स्केलेबल मल्टी-इमेज सिंथेसिस प्राप्त करने हेतु स्पार्स रिलेशनल अटेंशन और एक रूटिंग कंसिस्टेंसी कंस्ट्रेंट का उपयोग करता है, जिसे एक नए बड़े पैमाने के डेटासेट द्वारा मान्य किया गया है और चरित्र एवं अर्थ संबंधी निरंतरता में बेसलाइन्स पर बेहतर प्रदर्शन के साथ सिद्ध किया गया है।

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang2026-06-26
⚡ electrical engineering

Self-Supervised Tree-level Biomass Estimation in Urban Environments From Airborne LiDAR and Optical Observations

यह शोध पत्र एक स्व-पर्यवेक्षित (self-supervised) डीप लर्निंग फ्रेमवर्क प्रस्तुत करता है जो ओंटारियो के 810 वर्ग किमी के परिदृश्य में व्यक्तिगत शहरी वृक्ष बायोमास का एक उच्च-रिज़ॉल्यूशन, द्विकालिक (bitemporal) डेटाबेस उत्पन्न करने के लिए हवाई LiDAR और ऑप्टिकल इमेजरी को एकीकृत करता है, जो बिना किसी मैनुअल एनोटेशन के सटीक क्राउन-स्तरीय अनुमान प्राप्त करता है और पांच वर्षों में 39 Gg C का शुद्ध कार्बन लाभ प्रकट करता है।

Jose Bermudez (McMaster University, Hamilton, Ontario, Canada), Zilong Zhong (McMaster University, Hamilton, Ontario, Ca (…)2026-06-26
💬 NLP

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

यह शोध पत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) में एकीकृत विजन-लैंग्वेज परसेप्शन का पहला व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जो धारणा (परसेप्शन) को एक अंतर्निहित क्षमता के रूप में औपचारिक रूप देता है, इसके प्रतिमान विकास के पांच-चरणीय वर्गीकरण का प्रस्ताव करता है, और आर्टिफिशियल जनरल इंटेलिजेंस की ओर भविष्य के अनुसंधान दिशाओं को रेखांकित करता है।

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv2026-06-26
🤖 machine learning

Fast LeWorldModel

यह शोध पत्र Fast-LeWorldModel को प्रस्तुत करता है, जो एक पुनर्निर्माण-मुक्त (reconstruction-free) विजुअल वर्ल्ड मॉडल है जो ऑटोरिग्रेसिव वन-स्टेप रोलआउट्स के स्थान पर एक पैरेलल एक्शन-प्रिफिक्स प्रेडिक्शन मैकेनिज्म का उपयोग करके प्लानिंग को तेज़ करता है और त्रुटि संचय (error accumulation) को कम करता है, जो उम्मीदवार एक्शन सीक्वेंस के लिए भविष्य के लेटेंट्स (latents) का सीधे पूर्वानुमान लगाता है।

Yuntian Gao, Xiangyu Xu2026-06-26
💻 computer science

Beyond Aesthetics: Quantifying Information Loss in Turbid Scenes

यह शोध पत्र टर्बिड (अस्पष्ट) अंतर्जलीय वातावरण में सूचना की हानि की समझ में मौजूद अंतराल को संबोधित करने के लिए टर्बिड अंडरवॉटर बेसलाइन (TUB) डेटासेट पेश करता है और PCD का प्रस्ताव देता है, जो एक फेज़ कॉन्ग्रुएंसी-आधारित मीट्रिक है जो प्रभावी रूप से कंप्यूटर विज़न मॉडल के प्रदर्शन के साथ सह-संबंध स्थापित करता है जहाँ मौजूदा मीट्रिक्स विफल हो जाते हैं।

Vasiliki Ismiroglou, Stefan H. Bengtson, Tasos Benos, Thomas B. Moeslund, Malte Pedersen2026-06-26
💻 computer science

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

यह शोध पत्र विजन ट्रांसफॉर्मर्स के लिए इष्टतम लेयर-विशिष्ट प्रॉम्प्ट फ्यूजन स्कीम्स खोजने हेतु एक डिफरेंशिएबल आर्किटेक्चर सर्च विधि प्रस्तावित करता है, जो यह प्रदर्शित करता है कि कॉनकैटिनेशन (concatenation), एडिशन (addition), एफाइन ट्रांसफॉर्मेशन (affine transformation) और क्रॉस-अटेंशन (cross-attention) को संयोजित करने वाला एक हाइब्रिड फ्यूजन दृष्टिकोण विविध डेटासेट्स पर मौजूदा प्रॉम्प्ट-ट्यूनिंग बेसलाइन्स की तुलना में प्रदर्शन और दक्षता में महत्वपूर्ण सुधार करता है।

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu2026-06-26
💻 computer science

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection

यह शोधपत्र एक स्व-पर्यवेक्षित (self-supervised) ढांचे को प्रस्तुत करता है जो वीडियो फीचर्स को एक वॉल्यूमेट्रिक लेटेंट स्पेस में अनप्रोजेक्ट करके और उन्हें एक्शन-कंडीशन्ड एडवेक्शन के रूप में मॉडल करके निहित 3D भौतिक गतिकी (physical dynamics) को सीखता है, जिससे स्पष्ट भौतिक सिम्युलेटरों पर निर्भर किए बिना मोनोक्यूलर वीडियो से भौतिक रूप से सुसंगत, दीर्घकालिक 3D वर्ल्ड मॉडल का उद्भव संभव होता है।

Zican Wang, Niloy Mitra2026-06-26
🤖 machine learning

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs

यह शोध पत्र स्वायत्त ड्राइविंग प्रक्षेपवक्र पूर्वानुमान (autonomous driving trajectory forecasting) में एक मॉडलिंग-प्रशिक्षण बेमेल (modeling-training mismatch) की पहचान करता है, जहाँ गॉसियन मिश्रण मॉडल (Gaussian mixture models) पर लागू 'विजेता-सब-लेता-है' (winner-take-all) नुकसान अनुinformative पोस्टीरियर्स (uninformative posteriors) का कारण बनते हैं, और हल्के पोस्ट-हॉक अनुमान सुधारों—विशेष रूप से पोस्टीरियर-वेटेड मर्जिंग (posterior-weighted merging) और एक-चरण EM अपडेट (one-step EM update)—का प्रस्ताव देता है ताकि बिना पुनरप्रशिक्षण के सॉफ्ट मोड असाइनमेंट (soft mode assignments) को पुनः प्राप्त किया जा सके और पूर्वानुमान सटीकता में सुधार किया जा सके।

Qiyuan Wu, Katie Z Luo, Bharath Hariharan, Wei-Lun Chao, Mark Campbell2026-06-26
🤖 AI

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

यह शोधपत्र WatchAct प्रस्तुत करता है, जो 3,000 लॉन्ग-होराइजन इंस्टेंस वाला एक व्यापक बेंचमार्क है जो वीडियो के माध्यम से देखे गए मानवीय व्यवहार के बारे में तर्क करने की रोबोटिक मैनिपुलेशन प्रणालियों की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान अत्याधुनिक मॉडल उन कार्यों के लिए काफी संघर्ष करते हैं जिनमें इवेंट ग्राउंडिंग, प्रक्रियात्मक तर्क, इरादा अनुमान और एपिसोडिक ट्रैकिंग की आवश्यकता होती है।

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius2026-06-26