🤖 AI

ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency

ESTANet एक हल्का, रियल-टाइम फ्रेमवर्क है जो प्रोसीजरल वीडियो में ऑनलाइन एरर डिटेक्शन के लिए, जटिल आर्किटेक्चरल डिजाइनों के बिना अत्याधुनिक प्रदर्शन प्राप्त करने हेतु विभिन्न टेम्पोरल कॉन्टेक्स्ट वाले मानक और एरर-सेंसिटिव एक्शन डिटेक्टर्स के बीच प्रेडिक्शन इनकंसिस्टेंसी का लाभ उठाता है।

Shih-Po Lee, Reza Ghoddoosian, Faizan Siddiqui, Enna Sachdeva, Behzad Dariush2026-06-25
🤖 AI

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

यह शोध पत्र OPPO को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक विशेष पुरस्कार प्रणाली और क्रॉस-मोडल मतिभ्रम (cross-modal hallucinations) को कम करने के लिए डिज़ाइन किए गए लॉस फंक्शन के माध्यम से विश्वसनीय ओम्नी-मोडल धारणा के लिए अनुकूलित करके मल्टीमॉडल इमोशन रीजनिंग को बढ़ाता है, जिसे नए MEP-Bench डायग्नोस्टिक बेंचमार्क द्वारा मान्य किया गया है।

Zhiyuan Han, Beier Zhu, Wenwen Tong, Pengyang Shao, Peipei Song, Xinyi Wang, Jiangnan Chen, Lewei Lu, Xun Yang2026-06-25
🤖 AI

Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing

यह शोध पत्र एक दो-चरणीय पृथक मूल्यांकन ढांचे का प्रस्ताव करता है जो ज्ञात कमजोरियों को निष्पादित करने में LLM-आधारित एजेंटों द्वारा 90% तक सफलता प्राप्त करने के जबकि उनकी स्वायत्त खोज क्षमताएं पार्सिंग विफलताओं के कारण लगभग 50% तक सीमित हैं, और विभिन्न प्रकार की कमजोरियों के बीच विशिष्ट वास्तुशिल्प सामर्थ्य उभरने के तथ्य को उजागर करने के लिए टोही (रेकनाइसेंस) को शोषण (एक्सप्लॉइटेशन) से अलग करता है।

Liwei Yu, Shuo Li, Ming Zhou, Ge Chu, Yan Guo2026-06-25
🤖 AI

Offline Multi-agent Continual Cooperation via Skill Partition and Reuse

यह शोध पत्र COMAD का प्रस्ताव करता है, जो निरंतर ऑफलाइन मल्टी-एजेंट स्किल डिस्कवरी के लिए एक सिद्धांत-आधारित ढांचा है जो कैटास्ट्रोफिक फॉरगेटिंग और डिस्ट्रीब्यूशनल शिफ्ट से उबरने के लिए स्किल पार्टीशन और पुन: उपयोग का लाभ उठाता है, जिससे एजेंट क्रमिक कार्यों में समन्वय कौशल को कुशलतापूर्वक सीखने और विस्तार करने में सक्षम होते हैं।

Yuchen Xiao, Lei Yuan, Ruiqi Xue, Tieyue Yin, Yang Yu2026-06-25
🤖 AI

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

यह शोध पत्र CASU बेंचमार्क और एक स्केलेबल डेटा निर्माण पाइपलाइन प्रस्तुत करता है ताकि स्पीच, साउंड इवेंट्स और बैकग्राउंड एनवायरनमेंट्स को एकीकृत करके, जटिल, बहु-स्तरीय वास्तविक दुनिया के श्रव्य दृश्यों को समग्र रूप से समझने और उन पर तर्क करने की लार्ज ऑडियो लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन और उन्नति की जा सके।

Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif, Yutong Song, Wenjun Huang, Henry Peng Zou, Pinxin Liu, Honghui Xu (…)2026-06-25
🤖 AI

Lightweight PCGAE-Net: Parallel CrossGate Attention and Bottleneck AutoEncoder for Efficient 5G Channel Prediction

यह शोध पत्र लाइटवेट PCGAE-Net का प्रस्ताव देता है, जो एक कुशल 5G चैनल प्रेडिक्शन मॉडल है जो अनुक्रमिक पूर्वाग्रह (sequential bias) को समाप्त करने के लिए एक समानांतर क्रॉसगेट अटेंशन मैकेनिज्म और कम्प्यूटेशनल जटिलता को कम करने के लिए एक बॉटलनेक ऑटोएनकोडर पेश करके CS3T-UNet बेसलाइन की तुलना में 58% कम मापदंडों के साथ बेहतर सटीकता प्राप्त करता है।

Uma Kishore Godavarti, K. Giridhar, Vanani Prince Dharmendrabhai, Anchit Panday, Madhan Raj Kanagarathinam2026-06-25
🤖 AI

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

यह शोध पत्र LibEvoBench, एक मल्टी-टास्क बेंचमार्क और सॉफ्टवेयर इवोल्यूशन अंडरस्टैंडिंग स्कोर (SEUS) मेट्रिक प्रस्तुत करता है जो विकसित होती लाइब्रेरी API को संभालने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल काफी हद तक वर्ज़न-विस्मृत (version-oblivious) हैं और स्पष्ट वर्ज़न विशिष्टताओं के बावजूद कालभ्रमित त्रुटियों (anachronistic errors) के प्रति संवेदनशील हैं।

Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen2026-06-25
🤖 machine learning

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation

यह शोध पत्र तर्क देता है कि संक्षिप्तता उत्पन्न करने के लिए डेटा क्यूरेशन (data curation) VLM इन्फरेंस दक्षता में सुधार के लिए एक महत्वपूर्ण लीवर है, जो यह प्रदर्शित करता है कि संक्षिप्त और सटीक डेटा पर प्रशिक्षण, सटीकता से समझौता किए बिना, प्रति सही उत्तर की कम्प्यूटेशनल लागत (Cost-of-Pass) को काफी कम कर देता है, और अक्सर आउटपुट की लंबाई स्थिर होने पर भी प्रदर्शन में सुधार करता है।

DatologyAI, :, Matthew L. Leavitt, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, David Schwab (…)2026-06-25
💬 NLP

Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One

यह शोध पत्र "रिक्लैम इवैल्यूएशन" (reclaim evaluation) प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि भाषा मॉडल की स्मृति में उनके सहायक तर्क के बिना गलत निष्कर्षों को बनाए रखना, बिल्कुल भी स्मृति न होने की तुलना में अधिक हानिकारक है, और एक "सोर्स-फर्स्ट" (source-first) नीति का प्रस्ताव करता है जो गणना योग्य स्रोतों को सुरक्षित रखती है जबकि व्युत्पन्न निष्कर्षों को त्याग देती है ताकि सुधार क्षमता को बहाल किया जा सके और मेमोरी लूप्स में त्रुटि प्रसार को रोका जा सके।

Alex Kwon2026-06-25
🤖 AI

EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis

EchoStyle एक स्केलेबल टेक्स्ट-ड्रिवन फ्रेमवर्क है जो एक वीडियो-टू-वीडियो आर्किटेक्चर, बड़े पैमाने पर V-Style20k डेटासेट बनाने के लिए एक रिवर्स-सिंथेसिस पाइपलाइन और टेम्पोरल कंसिस्टेंसी (सामयिक निरंतरता) के लिए विशेष तंत्र पेश करके उच्च-फिडेलिटी, लंबी-वीडियो स्टाइलइज़ेशन प्राप्त करता है।

Huaqiu Li, Jiahao Wang, Sijia Cai, Hualian Sheng, Bing Deng, Jieping Ye, Wenhan Luo2026-06-25