💻 computer science

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

यह शोध पत्र PS4 को प्रस्तुत करता है, जो एक प्रॉक्सी-सुपरवाइज्ड जॉइंट ट्रेनिंग फ्रेमवर्क है जो वास्तविक लक्ष्य वक्ता (टारगेट स्पीकर) के निष्कर्षण में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक बड़े पैमाने के द्विभाषी कॉर्पस और एक मल्टी-ऑब्जेक्टिव फाइन-ट्यूनिंग रणनीति का लाभ उठाता है, जिसमें स्वच्छ लक्ष्य भाषण पर्यवेक्षण की आवश्यकता नहीं होती है।

Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo, Haitao Qian, Yiming Cheng2026-07-10
💬 NLP

ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents

ICDAR 2026 में HIPE-OCRepair-2026 प्रतियोगिता ने बहुभाषी ऐतिहासिक दस्तावेजों के लिए LLM-सहायता प्राप्त OCR पोस्ट-करेक्शन की प्रभावशीलता का मूल्यांकन किया, जिससे यह पता चला कि जबकि आधुनिक प्रणालियाँ पाठ की गुणवत्ता में महत्वपूर्ण सुधार करती हैं, वे कम-शोर वाले इनपुट पर ओवर-करेक्शन (अति-सुधार) की चुनौतियों का सामना करती हैं और उन्हें ऐसे मूल्यांकन ढांचों की आवश्यकता है जो सख्त राजनयिक सटीकता के बजाय पुनर्प्राप्ति उपयोगिता (रिट्रीवल यूटिलिटी) को प्राथमिकता देते हैं।

Maud Ehrmann, Emanuela Boros, Juri Opitz, Andrianos Michail, Florian Wagner, Simon Clematide2026-07-10
💻 computer science

Prismata: Confining Cross-Site Prompt Injection in Web Agents

प्रिज्मटा (Prismata) स्वायत्त वेब एजेंटों के लिए एक रक्षा तंत्र है जो गतिशील रूप से प्रासंगिक विश्वास लेबल (contextual trust labels) व्युत्पन्न करके संरचनात्मक परिसीमन को लागू करने और अविश्वसनीय सामग्री को रेडैक्ट करने के माध्यम से क्रॉस-साइट प्रॉम्प्ट इंजेक्शन हमलों को कम करता है, जिससे डेवलपर एनोटेशन की आवश्यकता के बिना कार्य उपयोगिता को बनाए रखते हुए एजेंट को सुरक्षित किया जाता है।

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa2026-07-10
💻 computer science

Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets

यह शोध पत्र "ओवरथिंकिंग" (overthinking) को प्रस्तुत करता है, जो एक ऐसी तकनीक है जो डिस्टिल्ड रीजनिंग वेट्स (distilled reasoning weights) से परे जाकर एक्सट्रपलेशन के माध्यम से भाषा मॉडलों की तर्क क्षमताओं को बढ़ाती है, जिससे ब्लैक-बॉक्स ऑडिटिंग के दौरान छिपी हुई जानकारी और अनपेक्षित व्यवहारों को प्रकट करने की संभावना काफी बढ़ जाती है।

Jack Hopkins, Dipika Khullar, Fabien Roger2026-07-10
💻 computer science

Out of Sight: Compression-Aware Content Protection against Agentic Crawlers

यह शोध पत्र CAPE प्रस्तुत करता है, जो एक कंटेंट प्रोटेक्शन फ्रेमवर्क है जो LLM-आधारित एजेंट पाइपलाइनों में कॉन्टेक्स्ट कंप्रेशन स्टेप का लाभ उठाकर अदृश्य गड़बड़ी (perturbations) इंजेक्ट करता है जो मानव पाठकों के लिए दृष्टिगत रूप से अविभेद्य रहते हुए भी कंप्रेशन के दौरान सूचना प्रतिधारण (information retention) को गंभीर रूप से कम कर देते हैं।

Xuefei Wang2026-07-10
💻 computer science

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

यह शोध पत्र LEEVLA का प्रस्ताव करता है, जो एक विजन-लैंग्वेज-एक्शन आर्किटेक्चर है जो ड्रिफ्ट-गाइडेड डायनेमिक प्रायोरिटाइजेशन के माध्यम से प्रमुख क्षेत्रों की पहचान करने और उनके लेटेंट इवोल्यूशन को मॉडल करने के लिए स्ट्रक्चर्ड फीचर फ्लो जनरेशन को शामिल करते हुए एक टास्क-अवेयर "व्हेयर-हाउ" ट्रेनिंग फ्रेमवर्क के माध्यम से जटिल गतिशील परिदृश्यों में रोबोट के प्रदर्शन को बढ़ाता है।

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han2026-07-10
💻 computer science

Leveraging Color Naming for Image Enhancement

यह शोध पत्र NamedCurves+ का परिचय देता है, जो एक व्याख्यात्मक और संवादात्मक इमेज एन्हांसमेंट फ्रेमवर्क है जो उपयोगकर्ता द्वारा अनुकूलन योग्य टोन कर्व समायोजन को सक्षम करने के लिए सार्वभौमिक रंग नामों और ट्रांसफार्मर-आधारित स्थानिक निर्भरताओं (spatial dependencies) का लाभ उठाता है, जो रिटचिंग और एक्सपोज़र सुधार जैसे कार्यों में मौजूदा अत्याधुनिक विधियों से बेहतर प्रदर्शन करता है।

David Serrano-Lozano, Luis Herranz, Michael S. Brown, Javier Vazquez-Corral2026-07-10
🤖 machine learning

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

यह शोध पत्र विजुअल इंस्पेक्शन ऑफ पॉलिसीज (VIP) को प्रस्तुत करता है, जो एक नवीन ओपन-एंडेड मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो पॉलिसी वीडियो का विश्लेषण करने और प्रभावी करिकुलम उत्पन्न करने के लिए एक वीडियो लैंग्वेज मॉडल का लाभ उठाता है, जो स्टारक्राफ्ट मल्टी-एजेंट चैलेंज पर टेक्स्ट-आधारित और स्केलर-स्कोर-आधारित दोनों विधियों से बेहतर प्रदर्शन करता है।

Lorenzo Pantè, Andrea Fanti, Roberto Capobianco2026-07-10
💻 computer science

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

यह शोधपत्र ZendoWorld प्रस्तुत करता है, जो सक्रिय प्रयोग के माध्यम से छिपे हुए दृश्य नियमों (visual rules) को अनुमान लगाने की एजेंटों की क्षमता का मूल्यांकन करने के लिए एक संवादात्मक वातावरण है, जो यह प्रकट करता है कि वर्तमान AI मॉडल देखे गए डेटा पर उच्च भविष्यवाणी सटीकता के बावजूद वास्तविक आगमनात्मक तर्क (inductive reasoning) और परिकल्पना परिशोधन (hypothesis refinement) में संघर्ष करते हैं।

Sophia Koehler, Antonia Wüst, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Krist (…)2026-07-10
🤖 machine learning

RhyMix: A Lightweight Adaptive Multi-Rhythm Network for Long-Term Time Series Forecasting

RhyMix एक हल्का, अनुकूलनशील हाइब्रिड न्यूरल नेटवर्क है जो एक चक्रीय एम्बेडिंग पथ और एक मल्टी-स्केल कनवल्शनल पथ को डायनेमिक गेटिंग मैकेनिज्म के साथ जोड़ता है ताकि एज डिप्लॉयमेंट के लिए उपयुक्त लीनियर कॉम्प्लेक्सिटी और कम लेटेंसी बनाए रखते हुए स्टेट-ऑफ-द-आर्ट लॉन्ग-टर्म टाइम सीरीज़ फोरकास्टिंग प्रदर्शन प्राप्त किया जा सके।

Sumit Satishrao Shevtekar, Chandresh Kumar Maurya2026-07-10