💻 computer science

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISP एक प्री-LLM, टेक्स्ट-ड्रिवन विजुअल टोकन प्रूनिंग फ्रेमवर्क है जो निर्देश-प्रासंगिक टोकन की पहचान करने और सिमेंटिक विविधता को बढ़ाने के लिए एक दो-चरणीय पाइपलाइन का उपयोग करता है, जिससे लार्ज विजन-लैंग्वेज मॉडल्स के लिए 99.5% से अधिक सटीकता प्रतिधारण (accuracy retention) प्राप्त होता है और इन्फरेंस लेटेंसी में 2 गुना से अधिक की कमी आती है।

Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo2026-07-21
💻 computer science

DMFNet: Dual-Backbone Multiscale Fusion Network for Urban Scene Classification

यह शोध पत्र DMFNet को प्रस्तुत करता है, जो रेसिडुअल प्रोपेगेशन और स्पेशियल अटेंशन द्वारा संवर्धित एक डुअल-बैकबोन मल्टीस्केल फ्यूजन नेटवर्क है, जो शहरी दृश्य वर्गीकरण में इंट्रा-क्लास वेरिएबिलिटी और इंटर-क्लास सिमिलैरिटी की चुनौतियों को प्रभावी ढंग से संबोधित करके AID डेटासेट पर अत्याधुनिक सटीकता प्राप्त करता है।

Anamitra Ghosh, Abhiroop Chatterjee, Susmita Ghosh2026-07-21
💻 computer science

Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection

यह शोध पत्र सिंथसाइट (SynthSite) को पेश करता है, जो निलंबित भार (suspended loads) के नीचे श्रमिकों का पता लगाने के लिए एक गोपनीयता-जागरूक सिंथेटिक वीडियो बेंचमार्क है, जो यह प्रदर्शित करता है कि संरचना-संरक्षण करने वाली अस्पष्टता (structure-preserving obfuscation) विधियाँ उपस्थिति-सुचारू बनाने वाली (appearance-smoothing) तकनीकों की तुलना में खतरे की पहचान के लिए आवश्यक ज्यामितीय संकेतों को बेहतर बनाए रखती हैं।

Anshu Singh, Alejandro Seif2026-07-21
💻 computer science

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent एक रिफ्लेक्टिव एजेंटिक फ्रेमवर्क पेश करता है जो वन-शॉट प्रेडिक्शन की सीमाओं को दूर करने के लिए भौतिकी कार्यक्रमों (physics programs) को पुनरावृत्ति के साथ जेनरेट, सिम्युलेट, वेरिफाई और रिपेयर करता है, जिससे जटिल डायनेमिक्स और इंटरैक्शन वाले अधिक भौतिक रूप से विश्वसनीय और प्रॉम्प्ट-अलाइन्ड वीडियो का निर्माण सक्षम होता है।

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai2026-07-21
💻 computer science

Disentangling Model and Human Data Uncertainty in Apparent Facial Age Estimation

यह शोधपत्र यह प्रदर्शित करता है कि APPA-REAL डेटासेट पर प्रशिक्षित बेयसियन न्यूरल नेटवर्क चेहरे की आयु अनुमान में एलियटोरिक (aleatoric) और एपिस्टेमिक (epistemic) अनिश्चितताओं को प्रभावी ढंग से अलग और परिमाणित कर सकते हैं, जिससे यह स्पष्ट होता है कि एलियटोरिक अनिश्चितता डेटासेट के आकार के बावजूद स्थिर रहती है जबकि एपिस्टेमिक अनिश्चितता प्रशिक्षण डेटा घटने के साथ बढ़ती है।

Andrei Foitos, Ivo Pascal de Jong, Matias Valdenegro-Toro2026-07-21
💻 computer science

DS@GT ARC at AnimalCLEF 2026: Species-Aware Graph Construction for Multi-Species Animal Re-Identification

DS@GT ARC टीम ने एक प्रजाति-जागरूक ग्राफ निर्माण पाइपलाइन विकसित करके AnimalCLEF 2026 में पांचवां स्थान प्राप्त किया, जो चार अलग-अलग पशु प्रजातियों में व्यक्तियों को मजबूती से पुन: पहचानने के लिए ग्लोबल रिट्रीवल, LightGlue-आधारित लोकल वेरिफिकेशन और लीडेन कम्युनिटी डिटेक्शन को एकीकृत करता है ताकि ट्रांजिटिव क्लोजर के कारण होने वाले फॉल्स मर्ज को कम किया जा सके।

Evan Sinclair Smith, Anthony Miyaguchi, Snigdha Palamari, Danté Evangelista2026-07-21
💻 computer science

WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

WeedExpert-R1 एक मल्टीमॉडल मॉडल है जिसे सुदृढीकरण शिक्षण (reinforcement learning) और एक डोमेन-विशिष्ट तर्क पाइपलाइन के साथ उन्नत किया गया है जो विविध प्रजातियों और क्षेत्रों में बेहतर परिशुद्धता के साथ खरपतवार की पहचान और स्थानीयकरण प्राप्त करता है, जो सत्यापन योग्य वानस्पतिक तर्क के माध्यम से मतिभ्रम (hallucinations) को कम करते हुए प्रोप्रायटरी और बड़े ओपन-सोर्स मॉडलों दोनों से बेहतर प्रदर्शन करता है।

Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence, Xin Qiao, Benjamin Riggan, Chi-En Chiang, Fuchen Li2026-07-21
💻 computer science

Do Vision Encoders Exhibit Human-like Color Thresholds?

यह बड़े पैमाने पर किया गया अध्ययन प्रकट करता है कि 50 से अधिक प्रीट्रेंड विजन एनकोडर, जिनमें कनवल्शनल नेटवर्क और ट्रांसफॉर्मर दोनों शामिल हैं, आम तौर पर मानव जैसे रंग भेदभाव थ्रेशोल्ड प्रदर्शित करने में विफल रहते हैं, जिसमें सेल्फ-सुपरवाइज्ड मॉडल सबसे अच्छा प्रदर्शन करते हैं फिर भी मानवीय संवेदी संवेदनशीलता के साथ कमजोर संरेखण दिखाते हैं।

Engy Ehab, Pablo Hernández-Cámara, Nahla Belal, Jesús Malo, Javier Vazquez-Corral, Alexandra Gomez-Villa2026-07-21
🤖 AI

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence

यह शोध पत्र एक भाषा-केंद्रित ढांचे को प्रस्तुत करता है जो एक वैश्विक अर्थ संबंधी कोडबुक (global semantic codebook) के माध्यम से विविध बहुविध डेटा (multimodal data) को परमाणु प्रस्थापनाओं (atomic propositions) के एक व्याख्या योग्य स्थान में एकीकृत करता है, जिससे स्वायत्त ड्राइविंग जैसे अनुप्रयोगों के लिए उन्नत तर्क, क्रॉस-मोडल रिट्रीवल और जटिल संयोजन सक्षम होता है।

Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose (…)2026-07-21
🤖 AI

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

यह शोध पत्र एक वीआर-आधारित मानव-रोबोट इंटरेक्शन फ्रेमवर्क प्रस्तुत करता है जो सिम्युलेटेड खतरनाक वातावरण में खतरों की पहचान करने और उन्हें एनोटेट करने के लिए विजन लैंग्वेज मॉडल्स का लाभ उठाता है, यह प्रदर्शित करते हुए कि यह दृष्टिकोण बिना एनोटेशन वाले बेसलाइन की तुलना में ऑपरेटर की स्थितिजन्य जागरूकता, स्पष्टता और सहजता को महत्वपूर्ण रूप से बढ़ाता है।

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek2026-07-21