💬 NLP

SimSD: Simple Speculative Decoding in Diffusion Language Models

यह शोध पत्र SimSD को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त स्पेक्युलेटिव डिकोडिंग एल्गोरिदम है जो डिफ्यूजन लैंग्वेज मॉडल्स को एक नवीन मास्किंग रणनीति का उपयोग करके 7.46x तक तेज़ इन्फरेंस थ्रूपुट प्राप्त करने में सक्षम बनाता है, जो आमतौर पर द्विदिशीय अटेंशन (bidirectional attention) के साथ असंगत टोकन-स्तरीय सत्यापन क्षमताओं को बहाल करता है।

Junxia Cui, Haotian Ye, Runchu Tian, Hongcan Guo, Jinya Jiang, Haoru Li, Chaojie Ren, Yiming Huang, Kaijie Zhu, Zhongkai (…)2026-06-02
🤖 AI

Modeling Depth Ambiguity: A Mixture-Density Representation for Flying-Point-Free Depth Estimation

यह शोध पत्र MDA को प्रस्तुत करता है, जो एक मिश्रण-घनत्व (mixture-density) प्रतिनिधित्व है जो प्रति पिक्सेल कई गहराई परिकल्पनाओं (depth hypotheses) को मॉडल करके 'फ्लाइंग पॉइंट्स' जैसे डेप्थ एस्टीमेशन आर्टिफैक्ट्स को हल करता है, जिससे बिना किसी महत्वपूर्ण रनटाइम ओवरहेड के अस्पष्ट सीमाओं, पारदर्शी वस्तुओं और आकाश के क्षेत्रों को सटीक रूप से कैप्चर किया जा सकता है।

Siyuan Bian, Congrong Xu, Jun Gao2026-06-02
💬 NLP

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

यह शोधपत्र SubFit को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग एलएलएम (LLM) संपीड़न विधि है जो व्यक्तिगत रूप से फिट किए गए रेसिडुअल बायपास के साथ अटेंशन (Attention) और फीडफॉरवर्ड (FeedForward) घटकों के गैर-निरंतर, सबमॉड्यूल-स्तर के चयन को सक्षम करके मौजूदा लेयर-आधारित दृष्टिकोणों की सीमाओं को दूर करता है, जिससे विभिन्न मॉडलों और स्पर्सिटी (sparsity) स्तरों में बेहतर सटीकता-परप्लेक्सिटी (accuracy-perplexity) ट्रेड-ऑफ और इन्फरेंस दक्षता प्राप्त होती है।

Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca2026-06-02
🤖 AI

LLM Bias Evaluation: Gender, Racial, and Age Disparities in Occupational and Crime Scenarios

यह शोध पत्र चार प्रमुख 2024 लार्ज लैंग्वेज मॉडल्स में व्यावसायिक और अपराध परिदृश्यों के माध्यम से लिंग, नस्लीय और आयु संबंधी पूर्वाग्रहों का मूल्यांकन करता है, जो वास्तविक दुनिया के डेटा से महत्वपूर्ण विचलन को प्रकट करता है और यह दर्शाता है कि वर्तमान डीबायसिंगिंग (पूर्वाग्रह निवारण) प्रयास अक्सर नए निष्पक्षता व्यापार-समझौतों को जन्म देते हैं जिन्हें "डीबायसिंगिंग विरोधाभास" के रूप में जाना जाता है।

Vishal Mirza, Rahul Kulkarni, Aakanksha Jadhav2026-06-01
💬 NLP

Breaking Information Cocoons: A Hyperbolic Framework for Balancing Exploration and Exploitation in Recommender Systems

यह शोध पत्र HERec का प्रस्ताव करता है, जो एक हाइपरबोलिक फ्रेमवर्क है जो अनुशंसा प्रणालियों (recommender systems) में सूचनात्मक कोकून (information cocoons) को कम करने के लिए अन्वेषण (exploration) और दोहन (exploitation) को प्रभावी ढंग से संतुलित करने हेतु स्वचालित क्लस्टरिंग के साथ अर्थ-संवर्धित पदानुक्रमित मॉडलिंग (semantic-enhanced hierarchical modeling) को जोड़ता है, जिससे यह मौजूदा यूक्लिडियन और हाइपरबोलिक बेसलाइन से बेहतर प्रदर्शन करता है।

Qiyao Ma, Menglin Yang, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying2026-06-01
💬 NLP

Beyond Memorization: Assessing Semantic Generalization in Large Language Models Using Phrasal Constructions

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) की अर्थ संबंधी सामान्यीकरण क्षमताओं का आकलन करने के लिए कंस्ट्रक्शन ग्रामर पर आधारित एक नवीन मूल्यांकन डेटासेट प्रस्तुत करता है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी भिन्न अर्थों वाले वाक्यात्मक रूप से समान वाक्यांश संरचनाओं के बीच अंतर करने में संघर्ष करते हैं, और मानव अंतर्ज्ञान की तुलना में 40% से अधिक की प्रदर्शन गिरावट प्रदर्शित करते हैं।

Wesley Scivetti, Melissa Torgbi, Austin Blodgett, Mollie Shichman, Taylor Hudson, Claire Bonial, Harish Tayyar Madabushi2026-06-01
🤖 AI

Unifying and Optimizing Data Values for Selection via Sequential Decision-Making

यह शोध पत्र डेटा चयन और मूल्यांकन को एक अनुक्रमिक निर्णय लेने वाले कार्य के रूप में पुनर्गठित करके उन्हें एकीकृत करता है जिसे डायनेमिक प्रोग्रामिंग के माध्यम से हल किया जा सकता है, जिससे यह पता चलता है कि डेटा शैपली (Data Shapley) जैसे मौजूदा तरीके मायोपिक (myopic) सन्निकटन हैं, और एक स्केलेबल द्विपक्षीय ग्राफ-आधारित सरोगेट का प्रस्ताव देता है जो शास्त्रीय एमएल (ML) और बड़े पैमाने पर एलएलएम (LLM) फाइन-ट्यूनिंग दोनों में प्रमाणित प्रदर्शन लाभ प्राप्त करता है।

Hongliang Chi, Qiong Wu, Zhengyi Zhou, Jonathan Light, Emily Dodwell, Yao Ma2026-06-01
🤖 AI

ProofWala: A Framework for Multilingual Proof Data Synthesis and Theorem-Proving

यह शोधपत्र ProofWala को प्रस्तुत करता है, जो एक पुन: प्रयोज्य लाइब्रेरी पर आधारित एक बहुभाषी ढांचा है जो इंटरैक्टिव थ्योरम प्रूवर्स के साथ प्रोग्रामेटिक इंटरेक्शन के लिए सक्षम बनाता है, जो स्केलेबल, सिमेंटिक रूप से निष्ठावान प्रमाण डेटा निष्कर्षण और समानांतर खोज को सक्षम करता है, और यह प्रदर्शित करता है कि Lean और Rocq में क्रॉस-लिंगुअल प्रशिक्षण थ्योरम-प्रूविंग प्रदर्शन और डोमेन अनुकूलन को महत्वपूर्ण रूप से सुधारता है।

Amitayush Thakur, George Tsoukalas, Greg Durrett, Swarat Chaudhuri2026-06-01
💬 NLP

MeMo: Towards Language Models with Associative Memory Mechanisms

यह शोध पत्र MeMo को प्रस्तुत करता है, जो एक नवीन लैंग्वेज मॉडलिंग आर्किटेक्चर है जो पारदर्शिता, मॉडल एडिटिंग और विशिष्ट टेक्स्ट को भूलने की क्षमता को सक्षम करने के लिए लेयर्ड एसोसिएटिव मेमोरीज में टोकन अनुक्रमों को स्पष्ट रूप से याद रखता है।

Fabio Massimo Zanzotto, Elena Sofia Ruzzetti, Giancarlo A. Xompero, Leonardo Ranaldi, Davide Venditti, Federico Ranaldi (…)2026-06-01
🤖 AI

Auto-Discovery-Bench: Diagnosing Structured State Tracking in Oracle-Guided Discovery

यह शोध पत्र Auto-Discovery-Bench को प्रस्तुत करता है, जो एक नियतात्मक ओरेकल-निर्देशित नैदानिक बेंचमार्क (deterministic oracle-guided diagnostic benchmark) है, जिसे इंटरैक्टिव डिस्कवरी प्रक्रियाओं के दौरान संरचित विश्वासों (structured beliefs) को बनाए रखने और उन्हें अपडेट करने की एजेंटों की क्षमता को अलग करने और मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Tingting Chen, Beibei Lin, Srinivas Anumasa, Vedant Shah, Zifeng Yuan, Qiran Zou, Anirudh Goyal, Dianbo Liu2026-06-01