💬 NLP

DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs

यह शोध पत्र DSL-LLaDA को प्रस्तुत करता है, जो एक 8B-पैरामीटर वाला मास्क्ड डिफ्यूजन लैंग्वेज मॉडल है, जो एम्बेडिंग स्पेस में कुशल, उच्च-गुणवत्ता वाले निरंतर डिनोइजिंग (denoising) को सक्षम करने के लिए एक प्रीट्रेन्ड LLaDA मॉडल को डिस्क्रीट स्टोकेस्टिक लोकलाइजेशन (Discrete Stochastic Localization) के साथ हल्के से अनुकूलित करके डिस्क्रीट डिकोडिंग के लंबाई-गुणवत्ता ट्रेड-ऑफ (length-quality tradeoff) पर विजय प्राप्त करता है।

Longxuan Yu, Yunshu Wu, Yu Fu, Siheng Xiong, Rob Brekelmans, Hui Liu, Yue Dong, Greg Ver Steeg2026-06-02
💬 NLP

Revise, Don't Freeze: Sampler-Matched Training for Self-Correcting Masked Diffusion Language Models

यह शोध पत्र D3IM को प्रस्तुत करता है, जो मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल्स में सीधे टोकन संशोधन को सक्षम करने वाला एक पैरामीटर-मुक्त सैंपलर है, और SCOPE को, जो परिणामी प्रिजर्वेशन बायस (preservation bias) को कम करने के लिए एक पोस्ट-ट्रेनिंग विधि है, जो सामूहिक रूप से रीजनिंग और कोडिंग बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करते हैं।

Longxuan Yu, Shaorong Zhang, Yu Fu, Hui Liu, Yue Dong, Greg Ver Steeg2026-06-02
💬 NLP

A Finite-Calibration Regime Map for LLM Judge Panels

यह शोध पत्र एक 'फाइनाइट-कैलिब्रेशन रिजीम मैप' (Finite-Calibration Regime Map) प्रस्तुत करता है जो यह निर्धारित करके LLM जज पैनलों के लिए लो-डायमेंशनल स्केलर एग्रीगेटर्स और हाई-डायमेंशनल जॉइंट-टेबल कैलिब्रेटर्स के बीच चयन करने में मार्गदर्शन करता है कि क्या उपलब्ध मानव-लेबल बजट जटिल जज इंटरैक्शन का अनुमान लगाने में सक्षम है, यह पाते हुए कि स्केलर विधियाँ अक्सर वर्तमान डेटासेट्स के लिए पर्याप्त होती हैं जबकि जॉइंट टेबल्स केवल तभी आवश्यक हो जाते हैं जब विशिष्ट उच्च-क्रम के इंटरैक्शन मौजूद हों और अनुमान योग्य हों।

Bin Zhu, Yanghui Rao2026-06-02
💬 NLP

ExpWeaver: LLM Agents Learn from Experience via Latent RAG

ExpWeaver एक एंड-टू-एंड अनुकूलित फ्रेमवर्क है जो LLM एजेंटों को लेटेंट रिट्रीवल-ऑगमेंटेड जनरेशन के माध्यम से अनुभव से सीखने में सक्षम बनाता है, जिससे विविध कार्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है और पारंपरिक टेक्स्ट-आधारित रिट्रीवल विधियों की तुलना में टोकन ओवरहेड काफी कम हो जाता है और क्रॉस-डोमेन सामान्यीकरण में सुधार होता है।

Tao Feng, Tianyang Luo, Jingjun Xu, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You2026-06-02
💻 computer science

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

यह शोधपत्र MENTIS को प्रस्तुत करता है, जो एक ज्यामिति-प्रथम (geometry-first) ढांचा है जो यह प्रकट करता है कि प्राथमिकता संरेखण (preference alignment), भाषा मॉडलों में चयनात्मक, गहराई-स्थानीयकृत ज्यामितीय पुनर्गठन को प्रेरित करता है, जो समान आंतरिक परिवर्तनों के बजाय मानदण्डिक अवधारणाओं (normative concepts) में बड़े टॉर्शन शिफ्ट और प्रासंगिक एंट्रॉपी के साथ नकारात्मक सहसंबंधों द्वारा अभिलक्षित है।

Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das2026-06-02
💻 computer science

When Is 0.1% Enough? Analyzing the Combined Effects of Dimensionality Reduction and Quantization on Text Embedding Compression

यह शोध पत्र यह प्रदर्शित करता है कि आयामी कमी (dimensionality reduction) और परिमाणीकरण (quantization) को संयोजित करके टेक्स्ट एम्बेडिंग्स को उनके मूल आकार के 0.1% तक नगण्य प्रदर्शन हानि के साथ संकुचित किया जा सकता है, जबकि यह भी प्रकट करता है कि इष्टतम संपीड़न रणनीति विशिष्ट कार्य के आधार पर भिन्न होती है।

Riku Kisako, Hayato Tsukagoshi, Ryohei Sasano2026-06-02
💻 computer science

On the Generalization Gap in Self-Evolving Language Model Reasoning

यह शोध पत्र क्लोज्ड-लूप सेल्फ-इवॉल्विंग लैंग्वेज मॉडल्स में जनरलाइजेशन गैप की जांच करता है, जिसमें यह पाया गया है कि हालांकि सेल्फ-जेनरेटेड सुपरविजन बेस मॉडल्स की तुलना में रीजनिंग परफॉरमेंस को बेहतर बनाता है, लेकिन यह उन्नत मल्टी-टर्न रिवीज़न रणनीतियों के साथ भी ओरैकल-सुपरवाइज्ड ट्रेनिंग की प्रभावशीलता से पूरी तरह मेल बिठाने में लगातार विफल रहता है।

Zhenting Qi, Susanna Maria Baby, Stefanie Anna Baby, Kan Yuan, Andrew Tomkins, Tu Vu, Da-Cheng Juan, Cyrus Rashtchian2026-06-02
💻 computer science

MiCU: End-to-End Smart Home Command Understanding with Large Language Model

यह शोध पत्र MiCU को प्रस्तुत करता है, जो स्मार्ट होम कमांड समझने के लिए एक डोमेन-विशिष्ट लार्ज लैंग्वेज मॉडल है, जो स्वचालित डेटा संश्लेषण, करिकुलम लर्निंग, रीइन्फोर्समेंट लर्निंग और टोकन संपीड़न का लाभ उठाकर सटीकता और दक्षता में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है, और सफलतापूर्वक Xiaomi Home ऐप में तैनात होकर यूजर करेक्शन रेट को कम करने और कमांड रिकग्निशन में सुधार करने में सफल होता है।

Haowei Han, Kexin Hu, Weiwei Cai, Debiao Zhang, Bin Qin, Yuxiang Wang, Jiawei Jiang, Xiao Yan, Bo Du2026-06-02
💻 computer science

Digging Up Citations: FOSSIL, a Dataset and Workflow for Reference Extraction in Law and the Humanities

यह शोधपत्र FOSSIL प्रस्तुत करता है, जो एक बहुभाषी डेटासेट और उसके साथ संलग्न वर्कफ़्लो है जिसे कानून और मानविकी विद्वत्ता में पादटिप्पणी-आधारित उद्धरणों (footnote-based citations) के निष्कर्षण को बेहतर बनाने के लिए डिज़ाइन किया गया है, जो यह प्रदर्शित करता है कि एक विशिष्ट पाइपलाइन मानक उपकरणों की तुलना में निष्कर्षण गुणवत्ता को लगभग दोगुना कर देती है, जबकि क्रॉस-रेफरेंस और मिश्रित-सामग्री वाली पादटिप्पणियों को संभालने में शेष चुनौतियों पर भी प्रकाश डालती है।

Luca Foppiano, Christian Boulanger2026-06-02
💻 computer science

Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales

यह शोध पत्र प्रश्नोत्तर मॉडलों के लिए मौखिक रूप से व्यक्त किए गए फीचर एट्रिब्यूशन (feature attributions) और स्व-निर्मित तर्कों (self-generated rationales) की सिमुलेटिबिलिटी (simulatability) का मूल्यांकन और तुलना करता है, यह प्रदर्शित करते हुए कि स्पष्टीकरण का प्रारूप, सूक्ष्मता (granularity) और स्रोत, काउंटरफैक्चुअल (counterfactual) परिवेश में मॉडल के व्यवहार की भविष्यवाणी करने की एक एलएलएम (LLM) जज की क्षमता को महत्वपूर्ण रूप से प्रभावित करते हैं।

Pingjun Hong, Benjamin Roth2026-06-02