💬 NLP

SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction

यह शोधपत्र SkillHarm को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और स्वचालित निर्माण पाइपलाइन है जो जीवनचक्र-जागरूक कौशल-आधारित हमलों (skill-based attacks) के प्रति AI एजेंटों की भेद्यता का व्यवस्थित रूप से मूल्यांकन करता है, जो निश्चित और स्व-उत्परिवर्तित (self-mutating) दोनों विषाक्तता रणनीतियों के लिए उच्च सफलता दर को प्रकट करता है और वर्तमान सुरक्षा प्रणालियों में महत्वपूर्ण कमियों को उजागर करता है।

Yuting Ning, Zhehao Zhang, Yash Kumar Lal, Boyu Gou, Junyi Li, Weitong Ruan, Chentao Ye, Rahul Gupta, Diyi Yang, Yu Su (…)2026-06-02
💬 NLP

SimSD: Simple Speculative Decoding in Diffusion Language Models

यह शोध पत्र SimSD को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त स्पेक्युलेटिव डिकोडिंग एल्गोरिदम है जो डिफ्यूजन लैंग्वेज मॉडल्स को एक नवीन मास्किंग रणनीति का उपयोग करके 7.46x तक तेज़ इन्फरेंस थ्रूपुट प्राप्त करने में सक्षम बनाता है, जो आमतौर पर द्विदिशीय अटेंशन (bidirectional attention) के साथ असंगत टोकन-स्तरीय सत्यापन क्षमताओं को बहाल करता है।

Junxia Cui, Haotian Ye, Runchu Tian, Hongcan Guo, Jinya Jiang, Haoru Li, Chaojie Ren, Yiming Huang, Kaijie Zhu, Zhongkai (…)2026-06-02
💬 NLP

SN-WER: Script-Normalized WER for Multi-Script Indic ASR Evaluation

यह शोध पत्र स्क्रिप्ट-नॉर्मलाइज्ड WER (SN-WER) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त मूल्यांकन मीट्रिक है जो स्कोर करने से पहले टेक्स्ट को एक मानक लिपि में लिप्यंतरित करता है, जिससे इंडिक बहुभाषी एएसआर (ASR) प्रणालियों में स्क्रिप्ट के बेमेल होने के कारण होने वाले कृत्रिम त्रुटि विस्तार को प्रभावी रूप से कम किया जा सकता है और साथ ही वास्तविक पहचान त्रुटियों के प्रति संवेदनशीलता भी बनी रहती है।

Priyaranjan Pattnayak2026-06-02
💬 NLP

HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

यह शोध पत्र HERO'S JOURNEY को प्रस्तुत करता है, जो लक्ष्य-निर्देशित टेक्स्ट गेम्स में नियम प्रेरण (rule induction) के मूल्यांकन के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि अत्याधुनिक LLMs छिपे हुए नियमों को अनुमान लगाने की कुछ क्षमता प्रदर्शित करते हैं, लेकिन उनका प्रदर्शन सीमित और असमान बना हुआ है, विशेष रूप से प्रक्रियात्मक प्रेरण (procedural induction) और बहु-चरणीय निष्पादन (multi-step execution) के संबंध में।

Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li2026-06-02
💬 NLP

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

यह शोधपत्र SubFit को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग एलएलएम (LLM) संपीड़न विधि है जो व्यक्तिगत रूप से फिट किए गए रेसिडुअल बायपास के साथ अटेंशन (Attention) और फीडफॉरवर्ड (FeedForward) घटकों के गैर-निरंतर, सबमॉड्यूल-स्तर के चयन को सक्षम करके मौजूदा लेयर-आधारित दृष्टिकोणों की सीमाओं को दूर करता है, जिससे विभिन्न मॉडलों और स्पर्सिटी (sparsity) स्तरों में बेहतर सटीकता-परप्लेक्सिटी (accuracy-perplexity) ट्रेड-ऑफ और इन्फरेंस दक्षता प्राप्त होती है।

Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca2026-06-02
💬 NLP

Breaking Information Cocoons: A Hyperbolic Framework for Balancing Exploration and Exploitation in Recommender Systems

यह शोध पत्र HERec का प्रस्ताव करता है, जो एक हाइपरबोलिक फ्रेमवर्क है जो अनुशंसा प्रणालियों (recommender systems) में सूचनात्मक कोकून (information cocoons) को कम करने के लिए अन्वेषण (exploration) और दोहन (exploitation) को प्रभावी ढंग से संतुलित करने हेतु स्वचालित क्लस्टरिंग के साथ अर्थ-संवर्धित पदानुक्रमित मॉडलिंग (semantic-enhanced hierarchical modeling) को जोड़ता है, जिससे यह मौजूदा यूक्लिडियन और हाइपरबोलिक बेसलाइन से बेहतर प्रदर्शन करता है।

Qiyao Ma, Menglin Yang, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying2026-06-01
💬 NLP

Beyond Memorization: Assessing Semantic Generalization in Large Language Models Using Phrasal Constructions

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) की अर्थ संबंधी सामान्यीकरण क्षमताओं का आकलन करने के लिए कंस्ट्रक्शन ग्रामर पर आधारित एक नवीन मूल्यांकन डेटासेट प्रस्तुत करता है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी भिन्न अर्थों वाले वाक्यात्मक रूप से समान वाक्यांश संरचनाओं के बीच अंतर करने में संघर्ष करते हैं, और मानव अंतर्ज्ञान की तुलना में 40% से अधिक की प्रदर्शन गिरावट प्रदर्शित करते हैं।

Wesley Scivetti, Melissa Torgbi, Austin Blodgett, Mollie Shichman, Taylor Hudson, Claire Bonial, Harish Tayyar Madabushi2026-06-01
💬 NLP

MeMo: Towards Language Models with Associative Memory Mechanisms

यह शोध पत्र MeMo को प्रस्तुत करता है, जो एक नवीन लैंग्वेज मॉडलिंग आर्किटेक्चर है जो पारदर्शिता, मॉडल एडिटिंग और विशिष्ट टेक्स्ट को भूलने की क्षमता को सक्षम करने के लिए लेयर्ड एसोसिएटिव मेमोरीज में टोकन अनुक्रमों को स्पष्ट रूप से याद रखता है।

Fabio Massimo Zanzotto, Elena Sofia Ruzzetti, Giancarlo A. Xompero, Leonardo Ranaldi, Davide Venditti, Federico Ranaldi (…)2026-06-01
💬 NLP

Chain-of-Thought Reasoning In The Wild Is Not Always Faithful

यह शोध पत्र यह प्रदर्शित करता है कि बड़े भाषा मॉडलों (large language models) में चेन-ऑफ-थॉट (Chain-of-Thought) तर्क अक्सर स्वाभाविक, गैर-प्रतिरोधी प्रॉम्प्ट्स पर भी अविश्वसनीय होता है, क्योंकि मॉडल अक्सर अंतर्निहित पूर्वाग्रहों या अतार्किक शॉर्टकट्स द्वारा संचालित सुसंगत लेकिन विरोधाभासी औचित्य उत्पन्न करते हैं, जो यह प्रकट करता है कि मौखिक तर्क आंतरिक निर्णय लेने की प्रक्रिया को सटीक रूप से प्रतिबिंबित नहीं करता है।

Iván Arcuschin, Jett Janiak, Robert Krzyzanowski, Senthooran Rajamanoharan, Neel Nanda, Arthur Conmy2026-06-01
💬 NLP

Reassessing Extractive QA Datasets at Scale: LLM-as-a-Judge and In-Depth Analyses

यह शोध पत्र एक व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि LLM-as-a-judge, एक्सट्रैक्टिव QA (extractive QA) के मूल्यांकन में पारंपरिक 'Exact Match' और 'F1' मेट्रिक्स की तुलना में काफी बेहतर प्रदर्शन करता है, क्योंकि यह मानव आकलन के साथ उच्च सहसंबंध प्राप्त करता है, जबकि संख्या-आधारित उत्तरों को संभालने, आत्म-वरीयता पूर्वाग्रह (self-preference bias) की कमी और प्रॉम्प्ट विविधताओं के प्रति न्यूनतम संवेदनशीलता में अपनी विशिष्ट शक्तियों को प्रकट करता है।

Xanh Ho, Jiahao Huang, Florian Boudin, Akiko Aizawa2026-06-01