💬 NLP

Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models

यह शोध पत्र बाउंडेड हाइपरबोलिक टैन (BHyT) का प्रस्ताव करता है, जो प्री-लेयर नॉर्मलाइज़ेशन के लिए एक स्थिर और कुशल ड्रॉप-इन रिप्लेसमेंट है जो डेटा-संचालित इनपुट बाउंडिंग के माध्यम से गहराई-संबंधी अस्थिरता को समाप्त करता है और RMSNorm की तुलना में तेज़ प्रशिक्षण और उच्च थ्रूपुट प्राप्त करता है।

Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song2026-06-04
🤖 AI

Reasoning or Fluency? Dissecting Probabilistic Confidence in Best-of-N Selection

यह शोध पत्र इस धारणा को चुनौती देता है कि 'बेस्ट-ऑफ-एन' (Best-of-N) चयन में संभाव्य आत्मविश्वास मीट्रिक (probabilistic confidence metrics) प्रभावी रूप से तर्क की गुणवत्ता को मापते हैं, यह प्रदर्शित करते हुए कि इंटर-स्टेप कॉज़ैलिटी परटर्बेशन्स (inter-step causality perturbations) के माध्यम से ये मीट्रिक मुख्य रूप से सतही प्रवाह (surface-level fluency) को पकड़ते हैं न कि तार्किक संरचना को, और आउटपुट चयन के लिए एक अधिक विश्वसनीय विकल्प के रूप में एक कंट्रास्टिव कॉज़ैलिटी मीट्रिक (contrastive causality metric) का प्रस्ताव करता है।

Hojin Kim, Jaehyung Kim2026-06-04
🤖 AI

Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success

यह शोध पत्र सिद्ध करता है कि सफलता अनुकूलन (success conditioning), जो सफल प्रक्षेप पथों (trajectories) की नकल करके नीतियों को सुधारने के लिए उपयोग की जाने वाली एक व्यापक तकनीक है, गणितीय रूप से एक रूढ़िवादी ट्रस्ट-रीजन अनुकूलन समस्या के समान है जो वितरण विस्थापन (distribution shift) को स्वतः नियंत्रित करते हुए नीति सुधार को अधिकतम करती है, जिससे यह गारंटी मिलती है कि प्रदर्शन में गिरावट नहीं आएगी।

Daniel Russo2026-06-04
🤖 AI

Conditional PED-ANOVA: Hyperparameter Importance in Hierarchical & Dynamic Search Spaces

यह शोध पत्र condPED-ANOVA का प्रस्ताव करता है, जो एक सिद्धांतिक ढांचा है जिसमें कंडीशनल सर्च स्पेस में हाइपरपैरामीटर महत्व को सटीक रूप से अनुमानित करने के लिए एक क्लोज्ड-फॉर्म एस्टिमेटर दिया गया है, जो उन मौजूदा विधियों की सीमाओं को संबोधित करता है जो स्थिर, अनकंडीशनल संरचनाओं को मानती हैं।

Kaito Baba, Yoshihiko Ozaki, Shuhei Watanabe2026-06-04
🤖 AI

L3^3: Large Lookup Layers

यह शोध पत्र लार्ज लुकअप लेयर्स (L3^3) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो डिकोडर परतों के लिए स्थिर, टोकन-आधारित रूटिंग को सक्षम करने हेतु एम्बेडिंग टेबल्स का सामान्यीकरण करता है, जिससे मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल्स का एक अधिक हार्डवेयर-कुशल और स्थिर विकल्प मिलता है और साथ ही भाषा मॉडलिंग एवं डाउनस्ट्रीम कार्यों में बेहतर प्रदर्शन प्राप्त होता है।

Albert Tseng, Christopher De Sa2026-06-04
🤖 AI

Tuning the Implicit Regularizer of Masked Diffusion Language Models: Enhancing Generalization via Insights from kk-Parity

यह शोध पत्र kk-parity समस्या पर मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स के सामान्यीकरण गुणों की जांच करता है, जो सैद्धांतिक रूप से उनके उद्देश्य को सिग्नल और नॉइज़ रिजीम में विभाजित करके यह प्रदर्शित करता है कि वे ग्रोकिंग (grokking) को कैसे समाप्त करते हैं और एक अनुकूलित मास्क संभाव्यता वितरण का प्रस्ताव करता है जो छोटे और बड़े दोनों पैमाने के मॉडल्स में परप्लेक्सिटी और प्रदर्शन में महत्वपूर्ण सुधार करता है।

Jianhao Huang, Baharan Mirzasoleiman2026-06-04
🤖 AI

PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?

यह शोधपत्र PersistBench प्रस्तुत करता है, जो दीर्घकालिक स्मृति वाले LLMs में सुरक्षा जोखिमों का मूल्यांकन करने वाला एक बेंचमार्क है, जो 18 परीक्षण किए गए मॉडलों में क्रॉस-डोमेन सूचना रिसाव और मेमोरी-प्रेरित चापलूसी (sycophancy) को रोकने में उच्च विफलता दर को प्रकट करता है।

Sidharth Pulipaka, Oliver Chen, Manas Sharma, Taaha S Bajwa, Vyas Raina, Ivaxi Sheth2026-06-04
🤖 AI

Making Expert Reasoning Learnable with Self-Distillation

यह शोध पत्र डिस्ट्रीब्यूशन अलाइन्ड इमिटेशन लर्निंग (DAIL) का प्रस्ताव करता है, जो एक सेल्फ-डिस्टिलेशन विधि है जो न्यूनतम डेटा के साथ LLM की रीजनिंग क्षमताओं और सामान्यीकरण को कुशलतापूर्वक बढ़ाने के लिए उपदेशात्मक विशेषज्ञ समाधानों (didactic expert solutions) को इन-डिस्ट्रीब्यूशन रीजनिंग ट्रेसेस में परिवर्तित करती है।

Ethan Mendes, Jungsoo Park, Alan Ritter2026-06-04
📊 statistics

Fixed Budget is No Harder Than Fixed Confidence in Best-Arm Identification up to Logarithmic Factors

यह शोध पत्र FC2FB को प्रस्तुत करता है, जो एक नवीन मेटा-एल्गोरिदम है जो किसी भी फिक्स्ड-कॉन्फिडेंस बेस्ट-आर्म आइडेंटिफिकेशन एल्गोरिदम को फिक्स्ड-बजट एल्गोरिदम में परिवर्तित करता है, और यह सिद्ध करता है कि फिक्स्ड-बजट सेटिंग, लॉगरिदमिक कारकों तक, फिक्स्ड-कॉन्फिडेंस सेटिंग से अधिक कठिन नहीं है।

Kapilan Balagopalan, Yinan Li, Yao Zhao, Tuan Nguyen, Anton Daitche, Houssam Nassif, Kwang-Sung Jun2026-06-04
🤖 AI

TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering

यह शोध पत्र TamperBench प्रस्तुत करता है, जो विविध हमलों और सुरक्षा उपायों को क्यूरेट करके, कठोर हाइपरपैरामीटर स्वीप आयोजित करके, और 21 ओपन-वेट मॉडलों का बेंचमार्किंग करके बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की टेंपर रेजिस्टेंस (छेड़छाड़ के प्रति प्रतिरोधक क्षमता) का व्यवस्थित रूप से मूल्यांकन करने के लिए पहला एकीकृत ढांचा है, जो वर्तमान सुरक्षा संरेखण विधियों में महत्वपूर्ण कमजोरियों को उजागर करता है।

Saad Hossain, Tom Tseng, Punya Syon Pandey, Samanvay Vajpayee, Matthew Kowal, Nayeema Nonta, Samuel Simko, Stephen Caspe (…)2026-06-04