💬 NLP

Eywa: Provenance-Grounded Long-Term Memory for AI Agents

एइवा (Eywa) एक स्रोत-आधारित स्मृति वास्तुकला है जो निरंतर एआई एजेंटों के लिए है, जो व्युत्पन्न तथ्यों के बजाय अपरिवर्तनीय स्रोत साक्ष्य को प्राथमिकता देती है और विविध बेंचमार्क में ऑडिट योग्य, अद्यतन करने योग्य और उच्च-प्रदर्शन वाली दीर्घकालिक स्मृति को सक्षम करने के लिए एक नियतात्मक, एलएलएम-मुक्त पुनर्प्राप्ति प्रक्रिया का उपयोग करती है।

Resham Joshi2026-06-01
🤖 AI

On the impact of retrieved content representations in RAG Pipelines

यह शोध पत्र यह प्रदर्शित करता है कि रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) पाइपलाइनों में, प्रश्न-उत्तर की सटीकता का प्राथमिक निर्धारक दस्तावेज़ रूपांतरण के दौरान उत्तर-युक्त सामग्री का संरक्षण (उत्तर प्रतिधारण) है, जो यह सुझाव देता है कि जब प्रतिधारण उच्च होता है, तो शब्दावली या संरचना जैसे अन्य प्रतिनिधित्व कारक सीमित प्रभाव डालते हैं।

Jonathan J Ross, Bevan Koopman, Anton van der Vegt, Guido Zuccon2026-06-01
💬 NLP

Incremental BPE Tokenization

यह शोध पत्र एक नवीन इंक्रीमेंटल बाइट पेयर एनकोडिंग (BPE) टोकनाइजेशन एल्गोरिदम पेश करता है जो O(nlog2t)\mathcal{O}(n \log^2 t) की वर्स्ट-केस टाइम कॉम्प्लेक्सिटी प्राप्त करता है, जो Hugging Face के टोकनाइज़र और tiktoken जैसी मौजूदा लाइब्रेरीज़ की तुलना में 3x तक की गति वृद्धि के साथ कुशल स्ट्रीमिंग प्रोसेसिंग को सक्षम बनाता है।

Shenghu Jiang, Ruihao Gong2026-06-01
💬 NLP

Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation

यह शोध पत्र 'लुकअहेड ग्रुप रिवॉर्ड' (Lookahead Group Reward) प्रस्तावित करके ऑन-पॉलिसी डिस्टिलेशन में 'सुपरविजन फिडेलिटी डिके' (Supervision Fidelity Decay) की महत्वपूर्ण समस्या को संबोधित करता है, जहाँ लंबे रीजनिंग चेन के दौरान शिक्षक का मार्गदर्शन कमजोर हो जाता है, जो जटिल गणित और कोड बेंचमार्क पर छात्र मॉडल के प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए उम्मीदवार टोकन का मूल्यांकन उनके द्वारा प्रेरित भविष्य के शिक्षक विश्वास (future teacher confidence) के आधार पर करता है।

Yanjiang Liu, Jie Lou, Xinyan Guan, Yuqiu Ji, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu2026-06-01
💬 NLP

Fine-Tuning Improves Information Conveyance in Language Models

यह शोध पत्र कैनोपी एंट्रॉपी (CE\mathrm{CE}^\star) प्रस्तुत करता है, जो एक नवीन मीट्रिक है जो आउटपुट की लंबाई को ध्यान में रखता है ताकि यह प्रकट किया जा सके कि फाइन-ट्यूनिंग न केवल भाषा मॉडलों में अनिश्चितता को कम करती है, बल्कि सूचना संप्रेषण और अर्थ संबंधी विविधता को बढ़ाने के लिए इसे मौलिक रूप से पुनर्गठित भी करती है।

Yuwei Cheng, Weiyi Tian, Haifeng Xu2026-06-01
💬 NLP

LLM Anonymization Against Agentic Re-Identificatio

यह शोध पत्र AURA को प्रस्तुत करता है, जो एक LLM-संचालित मास्क-पुनर्निर्माण ढांचा (mask-reconstruct framework) है, जो डाउनस्ट्रीम विश्लेषण के लिए प्रासंगिक उपयोगिता को संरक्षित करते हुए एजेंटिक वेब-सर्च पुन: पहचान हमलों का अनुकूल रूप से प्रतिरोध करके टेक्स्ट अनामीकरण (text anonymization) के लिए गोपनीयता-उपयोगिता सीमा (privacy-utility frontier) को बढ़ाता है।

Ziwen Li, Jianing Wen, Tianshi Li2026-06-01
💬 NLP

dMoE: dLLMs with Learnable Block Experts

यह शोध पत्र dMoE का प्रस्ताव करता है, जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स के लिए एक ब्लॉक-लेवल मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क है, जो प्रतिस्पर्धी प्रदर्शन को बनाए रखते हुए अद्वितीय रूप से सक्रिय विशेषज्ञों को कम करके मेमोरी उपयोग और इन्फरेंस लेटेंसी को महत्वपूर्ण रूप से कम करने के लिए टोकन-लेवल विशेषज्ञ वितरणों को एकत्रित करता है।

Sicheng Feng, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang2026-06-01
💬 NLP

PatchWorld: Gradient-Free Optimization of Executable World Models

PatchWorld एक ग्रेडिएंट-मुक्त (gradient-free) फ्रेमवर्क पेश करता है जो काउंटरएग्जांपल-गाइडेड कोड रिपेयर के माध्यम से ऑफलाइन प्रक्षेपवक्रों (trajectories) को निरीक्षण योग्य, निष्पादन योग्य पायथन वर्ल्ड मॉडल में परिवर्तित करता है, जिससे टेक्स्ट-एजेंट वातावरण में अत्याधुनिक नियोजन प्रदर्शन प्राप्त होता है और अवलोकन निष्ठा (observation fidelity) तथा निर्णय उपयोगिता (decision utility) के बीच एक ट्रेड-ऑफ प्रकट होता है।

Jiaxin Bai, Yue Guo, Yifei Dong, Jiaxuan Xiong, Tianshi Zheng, Yixia Li, Tianqing Fang, Yufei Li, Yisen Gao, Haoyu Huang (…)2026-06-01
💬 NLP

The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement

यह शोध पत्र SAVE को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो वैल्यू-एंकर वाले ऑन-पॉलिसी फीडबैक का लाभ उठाता है ताकि रिवॉर्ड मॉडल को पॉलिसी रिस्पॉन्स को ग्रेड करने और अस्पष्ट नमूनों को फ़िल्टर करने के माध्यम से स्वयं-पर्यवेक्षण (सेल्फ-सुपरवाइज) करने और अपने प्रशिक्षण में सुधार करने में सक्षम बनाया जा सके, जिससे महंगे मानव प्राथमिकता डेटा पर निर्भरता दूर होती है और विविध बेंचमार्क एवं आरएल (RL) एल्गोरिदम पर बेहतर प्रदर्शन प्रदर्शित होता है।

Xiaobo Wang, Tong Wu, Min Tang, Jiaqi Li, Qi Liu, Zilong Zheng2026-06-01
🤖 AI

UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling

यह शोधपत्र UniScale को प्रस्तुत करता है, जो एक ऑनलाइन फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल डिप्लॉयमेंट में बेहतर गुणवत्ता-लागत संतुलन प्राप्त करने के लिए कॉन्टेक्स्टुअल मल्टी-आर्म्ड बैंडिट्स का उपयोग करके मॉडल रूटिंग और टेस्ट-टाइम स्केलिंग को एक एकल अनुकूली अनुकूलन स्थान (adaptive optimization space) में एकीकृत करता है।

Kaiyu Huang, Xingyu Wang, Mingze Kong, Zhubo Shi, Yuqian Hou, Hong Xu, Zhongxiang Dai, Minchen Yu, Qingjiang Shi2026-06-01