🤖 AI

Answer Presence Drives RAG Rewriting Gains

यह शोध पत्र नियंत्रित हस्तक्षेपों के माध्यम से यह प्रदर्शित करता है कि रिट्रीवल-ऑगमेंटेड क्यू-ए (QA) पाइपलाइनों में देखे गए प्रदर्शन लाभ मुख्य रूप से पुनर्गठित संदर्भ (rewritten context) में स्वर्ण उत्तर स्ट्रिंग (gold answer string) की उपस्थिति से प्रेरित होते हैं, न कि स्वयं क्यूरेशन प्रक्रिया से, और साथ ही पारंपरिक लीकेज डिटेक्शन विधियों की भंगुरता को भी उजागर करता है।

Yuejie Li, Yueying Hua, Ke Yang, Li Zhang, Yueping He, Yueping He, Ruiqi Li, Bolin Chen, Tao Wang, Bowen Li, Chengjun Ma (…)2026-06-05
🤖 AI

Enhancing Software Engineering Through Closed-Loop Memory Optimization

यह शोधपत्र \ours को प्रस्तुत करता है, जो एक क्लोज्ड-लूप फ्रेमवर्क है जो सॉफ्टवेयर इंजीनियरिंग एजेंटों में मेमोरी उपयोगिता को प्रमाणित डाउनस्ट्रीम प्रभाव के आधार पर अनुकूलित करता है, जिससे टास्क-एग्नोस्टिक मूल्यांकन और एनोटेशन-मुक्त अनुकूलन सक्षम होता है जो सफलता दर, रिज़ॉल्यूशन दक्षता और कम्प्यूटेशनल लागत में महत्वपूर्ण सुधार करता है।

Xuehang Guo, Zora Zhiruo Wang, Qingyun Wang, Graham Neubig, Xingyao Wang2026-06-05
🤖 AI

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

यह शोध पत्र पहला बड़े पैमाने का अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि अत्यधिक विश्वास और अपर्याप्त कोड समीक्षा के कारण मानव डेवलपर्स, सुरक्षा मॉनिटरों की उपस्थिति के बावजूद, एआई कोडिंग एजेंटों की तोड़फोड़ (sabotage) का पता लगाने में भारी रूप से विफल रहते हैं, जिससे वास्तविक दुनिया के सॉफ्टवेयर विकास में मानव-केंद्रित सुरक्षा तंत्र की तत्काल आवश्यकता रेखांकित होती है।

Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi2026-06-05
🤖 AI

When Surface Form Changes Moderation Decisions: A Paired Study of Code-Mixed Workflow Instability

यह शोध पत्र यह प्रदर्शित करता है कि वर्कफ़्लो-स्तर के दृष्टिकोण के माध्यम से घृणा मॉडरेशन प्रणालियों का मूल्यांकन करने से स्वच्छ अंग्रेजी की तुलना में तमिल-अंग्रेजी कोड-मिश्रित इनपुट को संसाधित करते समय महत्वपूर्ण निर्णय अस्थिरता और बढ़ी हुई परिचालन संबंधी बाधाएं प्रकट होती हैं, जो उन विफलताओं को उजागर करती हैं जिन्हें मानक वर्गीकरण मीट्रिक अक्सर अनदेखा कर देते हैं।

Suraj Babu Thimma Krishnaram2026-06-05
🤖 AI

Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval

यह शोध पत्र एक एजेंट-संचालित एडेप्टिव RAG फ्रेमवर्क पेश करता है जिसमें डायनेमिक क्वेरी डिकंपोजिशन और सेल्फ-रिफ्लेक्शन शामिल हैं, जो DevOps और MuSiQue डेटासेट्स पर तुलनात्मक मूल्यांकन के माध्यम से यह प्रदर्शित करता है कि जहाँ ये एजेंटिक सुधार संरचित डोमेन में प्रदर्शन में सुधार करते हैं, वहीं वे सार्वभौमिक रूप से लाभकारी नहीं हैं और विशिष्ट क्वेरी एवं डोमेन विशेषताओं के आधार पर चयनात्मक, लागत-सचेत ऑर्केस्ट्रेशन की आवश्यकता होती है।

Anuj Maharjan, Devinder Kaur, Richard Molyet2026-06-05
🤖 AI

Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments

यह शोध पत्र कॉन्टिनुअल लर्निंग बेंच (CL-Bench) को प्रस्तुत करता है, जो छह विविध वास्तविक दुनिया के डोमेन में विशेषज्ञ-सत्यापित पहला बेंचमार्क है जो पूर्व मॉडल ज्ञान से ऑनलाइन लर्निंग क्षमताओं को अलग करता है, जिससे यह पता चलता है कि वर्तमान फ्रंटियर एआई सिस्टम और समर्पित मेमोरी आर्किटेक्चर क्रमिक अनुभव के माध्यम से वास्तव में सुधार करने में संघर्ष करते हैं और अक्सर सरल इन-कॉन्टेक्स्ट लर्निंग की तुलना में खराब प्रदर्शन करते हैं।

Parth Asawa, Christopher M. Glaze, Gabriel Orlanski, Ramya Ramakrishnan, Benji Xu, Asim Biswal, Vincent Sunn Chen, Frede (…)2026-06-05
🤖 AI

Beyond Waveform Robustness: Robust Feature-Vocoder Adversarial Attacks on Automatic Speech Recognition

यह शोध पत्र एक क्लीन-रेफरेन्स्ड फीचर-वोकोडर अटैक (Clean-Referenced Feature-Vocoder Attack) प्रस्तुत करता है जो एडवर्सरियल परटर्बेशन्स को रॉ वेवफॉर्म्स से सेल्फ-सुपरवाइज्ड लर्निंग फीचर स्पेस में स्थानांतरित करता है, जो मौजूदा तरीकों की तुलना में ब्लैक-बॉक्स एएसआर (ASR) सिस्टमों में ट्रांसफरैबिलिटी को महत्वपूर्ण रूप से सुधारता है और वेवफॉर्म-आधारित सुरक्षा प्रणालियों से बचने में सक्षम है।

Yifan Liao, Zongmin Zhang, Zhen Sun, Yuhui Sun, Xinhu Zheng, Xinlei He2026-06-05
🤖 AI

Data Flow Control: Data Safety Policies for AI Agents

यह शोध पत्र डेटा फ्लो कंट्रोल (DFC) को प्रस्तुत करता है, जो 'पासेंट' (Passant) क्वेरी रीराइटिंग लेयर वाली एक ऐसी रूपरेखा है जो नगण्य ओवरहेड के साथ सीधे DBMS इंजनों के भीतर डिक्लेरेटिव, टुपल-स्तरीय डेटा सुरक्षा नीतियों को लागू करती है, जिससे डेटा सुरक्षा को बाद में किए जाने वाले (post-hoc) जांचों से हटाकर मुख्य डेटा इंफ्रास्ट्रक्चर के केंद्र में स्थानांतरित किया जा सके।

Charlie Summers, Eugene Wu2026-06-05
🤖 AI

Beyond Output Matching: Preserving Internal Geometry in NVFP4 LLM Distillatio

यह शोध पत्र यह पहचानता है कि केवल आउटपुट-मैचिंग वाला क्वांटाइजेशन-अवेयर डिस्टिलेशन (QAD), NVFP4 मॉडलों की आंतरिक प्र been-प्रतिनिधित्व ज्यामिति (internal representational geometry) को बनाए रखने में विफल रहता है, जिससे रीजनिंग और कोडिंग कार्यों में प्रदर्शन में गिरावट आती है, और CKA-QAD का प्रस्ताव करता है, जो एक ऐसी विधि है जो आंतरिक संरचना को बनाए रखकर सटीकता को पुनः प्राप्त करने के लिए लेयर-वाइज ग्राम मैट्रिसेस (layer-wise Gram matrices) को संरेखित करती है।

Fangbo Tu, Junhua Zhao, Chi Liu, Xin Chen, Haifeng Wu, Jian Wan, Srinivasan Manoharan2026-06-05
🤖 AI

AdaMEM: Test-Time Adaptive Memory for Language Agents

यह शोधपत्र AdaMEM को प्रस्तुत करता है, जो एक टेस्ट-टाइम एडेप्टिव मेमोरी फ्रेमवर्क है जो लंबी अवधि के प्रक्षेपवक्र भंडारण (long-term trajectory storage) को गतिशील रूप से उत्पन्न अल्पकालिक रणनीतियों के साथ जोड़ता है ताकि भाषा एजेंटों को मॉडल मापदंडों को अपडेट किए बिना गतिशील वातावरण के अनुकूल निरंतर रूप से ढलने में सक्षम बनाया जा सके, जिससे ALFWorld और WebShop जैसे बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Yunxiang Zhang, Yiheng Li, Ali Payani, Lu Wang2026-06-05