💬 NLP

Context Memorization for Efficient Long Context Generation

यह शोध पत्र "अटेंशन-स्टेट मेमोरी" (attention-state memory) का प्रस्ताव करता है, जो पारंपरिक प्रीफिक्स-ऑगमेंटेड इन्फरेंस के प्रभाव के कम होने और रैखिक स्केलिंग की सीमाओं को दूर करने के लिए प्रीकंप्यूटेड अटेंशन स्टेट्स के एक हल्के लुकअप टेबल में प्रीफिक्स जानकारी को बाहरी बनाने की एक ट्रेनिंग-फ्री विधि है, जिससे लॉन्ग-कॉन्टेक्स्ट जनरेशन में सटीकता में सुधार और लेटेंसी में कमी आती है।

Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura, Daichi Fujiki2026-05-19
🤖 machine learning

Are Sparse Autoencoder Benchmarks Reliable?

यह शोध पत्र SAEBench मूल्यांकन सुइट का ऑडिट करता है और पाता है कि उच्च शोर और खराब विभेदन क्षमता के कारण कई प्रमुख मेट्रिक्स अविश्वसनीय हैं, और यह निष्कर्ष निकालता है कि क्षेत्र को स्पार्स ऑटोएनकोडर्स (sparse autoencoders) के लिए अधिक सुदृढ़ बेंचमार्क की तत्काल आवश्यकता है।

David Chanin2026-05-19
💬 NLP

SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark

यह शोध पत्र SomaliWeb v1 को प्रस्तुत करता है, जो लगभग 303 मिलियन टोकन का एक सार्वजनिक रूप से जारी किया गया, गुणवत्ता-फ़िल्टर किया गया सोमाली कॉर्पस है, जिसके साथ एक मैचड BPE-16K टोकेनाइज़र और पहला सार्वजनिक भाषा-पहचान बेंचमार्क भी उपलब्ध है, जो मौजूदा बहुभाषी सोमाली डेटा वितरणों में महत्वपूर्ण गुणवत्ता दोषों को भी उजागर करता है।

Khalid Yusuf Dahir2026-05-19
💬 NLP

Multilingual jailbreaking of LLMs using low-resource languages

यह अध्ययन प्रदर्शित करता है कि जहाँ हानिकारक प्रॉम्प्ट्स का कम-संसाधन वाले अफ्रीकी भाषाओं में एकल-टर्न (single-turn) अनुवाद LLM सुरक्षा बाधाओं को पार करने में विफल रहता है, वहीं बहु-टर्न (multi-turn) वार्तालाप जेलब्रेक सफलता दरों को महत्वपूर्ण रूप से बढ़ा देते हैं, जिसमें मानव रेड-टीमिंग और अनुवाद की गुणवत्ता को इन कमजोरियों का फायदा उठाने वाले महत्वपूर्ण कारकों के रूप में पहचाना गया है।

Dylan Marx, Marcel Dunaiski2026-05-19
💬 NLP

From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG

यह शोध पत्र EPIC को पेश करता है, जो ऑन-डिवाइस रिट्रीवल-ऑगमेंटेड जनरेशन (Retrieval-Augmented Generation) के लिए एक कुशल फ्रेमवर्क है जो इंडेक्सिंग आकार और विलंबता (latency) को नाटकीय रूप से कम करने के साथ-साथ सख्त मेमोरी सीमाओं के तहत व्यक्तिगत एआई प्रतिक्रियाओं की सटीकता में महत्वपूर्ण सुधार करने के लिए प्राथमिकता-संरेखित मेमोरी (preference-aligned memory) का निर्माण करता है।

Changmin Lee, Jaemin Kim, Taesik Gong2026-05-19
💬 NLP

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

SD-Search एक ऑन-पॉलिसी हिंडसाइट सेल्फ-डिस्टिलेशन फ्रेमवर्क पेश करता है जो सर्च-ऑगमेंटेड रीजनिंग एजेंट्स को आंतरिक रूप से स्टेप-लेवल सुपरविजन सिग्नल्स जेनरेट करने में सक्षम बनाता है, जो एक स्टूडेंट मॉडल को हिंडसाइट-कंडीशन्ड टीचर की नकल करने के लिए प्रशिक्षित करके किया जाता है, जिससे बाहरी टीचर्स या अतिरिक्त एनोटेशन की आवश्यकता के बिना आउटकम-रिवॉर्ड रीइन्फोर्समेंट लर्निंग की क्रेडिट असाइनमेंट सीमाओं को दूर किया जा सके।

Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou2026-05-19
🤖 machine learning

Alignment Dynamics in LLM Fine-Tuning

यह शोधपत्र LLM अलाइनमेंट डायनेमिक्स के लिए एक एकीकृत ढांचे को प्रस्तुत करता है जो अलाइनमेंट की भंगुरता (fragility) की व्याख्या करने के लिए फाइन-ट्यूनिंग अपडेट को प्रतिस्पर्धी "रिबाउंड" (Rebound) और "ड्राइविंग" (Driving) बलों में विभाजित करता है और एक "रिहर्सल प्राइमिंग प्रभाव" (Rehearsal Priming Effect) की भविष्यवाणी करता है जहाँ पूर्व अलाइनमेंट पुन: संपर्क होने पर पुनः-अलाइनमेंट को त्वरित करता है।

Yuhan Huang, Huanran Chen, Yinpeng Dong2026-05-19
🤖 machine learning

ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization

यह शोध पत्र ISEP का प्रस्ताव करता है, जो ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक स्टोकेस्टिक पॉलिसी ऑप्टिमाइज़ेशन फ्रेमवर्क है, जो वैल्यू फंक्शन इंटरपोलेशन के माध्यम से व्यवहार्य एक्शन सपोर्ट का निहित रूप से विस्तार करता है और परिणामी मल्टीमॉडल परिदृश्य (multimodal landscape) में नेविगेट करने के लिए कंडीशनल फ्लो मैचिंग का उपयोग करता है, जिससे सख्त बाधाओं की कठोरता को दूर करते हुए मोड कोलैप्स से बचा जा सके।

Yifei Chen, Shaoqin Zhu, Xiaoqiang Ji2026-05-19
📊 statistics

Improved Baselines with Representation Autoencoders

यह शोध पत्र RAEv2 प्रस्तुत करता है, जो एक उन्नत रिप्रेजेंटेशन ऑटोएनकोडर फ्रेमवर्क है जो पोस्ट-ट्रेनिंग की आवश्यकता के बिना ImageNet-256 पर 10x से अधिक तेज़ अभिसरण (convergence) और अत्याधुनिक इमेज जनरेशन गुणवत्ता प्राप्त करने के लिए सामान्यीकृत मल्टी-लेयर रिप्रेजेंटेशन, पूरक REPA तंत्र और पुन: पैरामीटराइज्ड मार्गदर्शन का लाभ उठाता है।

Jaskirat Singh, Boyang Zheng, Zongze Wu, Richard Zhang, Eli Shechtman, Saining Xie2026-05-19
💻 computer science

Causely: A Causal Intelligence Layer for Enterprise AI A Benchmark Study on SRE and Reliability Workflows

यह शोध पत्र Causely को प्रस्तुत करता है, जो एक कॉज़ल इंटेलिजेंस लेयर (causal intelligence layer) है जो कच्चे ऑब्जर्वेबिलिटी डेटा (observability data) को एक संरचित, क्वेरी योग्य मॉडल में बदल देता है, और बेंचमार्क प्रयोगों के माध्यम से यह प्रदर्शित करता है कि यह डायग्नोसिस समय, टोकन खपत और लागत को कम करते हुए और पूर्ण रूट-कॉज़ सटीकता प्राप्त करते हुए SRE वर्कफ़्लो में AI एजेंट के प्रदर्शन में महत्वपूर्ण सुधार करता है।

Dhairya Dalal, Endre Sara, Ben Yemini, Christine Miller, Shmuel Kliger2026-05-19